Which loss function would fit best in a categorical (discrete) supervised learning?
Mean Squared Error (MSE)
kullback-leibler (KL) loss
Any L2 loss
Binary Crossentropy