ReLU przewyższa Softplus

Oct 17 2020

Zauważyłem, że modele PyTorch działają znacznie lepiej, gdy używa się ReLU zamiast Softplus z Adamem jako optymalizatorem.

Jak to się dzieje, że funkcja nieróżniczkowalna jest łatwiejsza do optymalizacji niż funkcja analityczna? Czy to prawda, że ​​nie ma optymalizacji gradientu poza nazwą, a pod maską używa się jakiejś kombinatoryki?

Odpowiedzi

1 Tim Oct 17 2020 at 17:59

Ogólnie wiadomo, że ReLU przewyższa wiele płynniejszych funkcji aktywacji. Jest łatwa do optymalizacji, ponieważ jest półliniowa. Zaletą korzystania z niego jest zwykle szybkość, więc może się zdarzyć, że jeśli będziesz czekać na więcej iteracji, używałeś innego tempa uczenia się, wielkości partii lub innych hiperparametrów itp., Otrzymasz podobne wyniki.