ReLU превосходит Softplus
Я заметил, что модели PyTorch работают значительно лучше, когда ReLU используется вместо Softplus с Адамом в качестве оптимизатора.
Как может случиться так, что недифференцируемую функцию легче оптимизировать, чем аналитическую? Верно ли тогда, что нет никакой оптимизации градиента, кроме как по названию, и что под капотом используется какая-то комбинаторика?
Ответы
ReLU в целом, как известно, превосходит многие более плавные функции активации. Его легко оптимизировать, потому что он полулинейный. Преимущество при его использовании обычно заключается в скорости, поэтому может случиться так, что если вы подождете большего количества итераций, используете другую скорость обучения, размеры пакетов или другие гиперпараметры и т. Д., Вы получите аналогичные результаты.