ReLU przewyższa Softplus
Oct 17 2020
Zauważyłem, że modele PyTorch działają znacznie lepiej, gdy używa się ReLU zamiast Softplus z Adamem jako optymalizatorem.
Jak to się dzieje, że funkcja nieróżniczkowalna jest łatwiejsza do optymalizacji niż funkcja analityczna? Czy to prawda, że nie ma optymalizacji gradientu poza nazwą, a pod maską używa się jakiejś kombinatoryki?
Odpowiedzi
1 Tim Oct 17 2020 at 17:59
Ogólnie wiadomo, że ReLU przewyższa wiele płynniejszych funkcji aktywacji. Jest łatwa do optymalizacji, ponieważ jest półliniowa. Zaletą korzystania z niego jest zwykle szybkość, więc może się zdarzyć, że jeśli będziesz czekać na więcej iteracji, używałeś innego tempa uczenia się, wielkości partii lub innych hiperparametrów itp., Otrzymasz podobne wyniki.