ReLU превосходит Softplus

Oct 17 2020

Я заметил, что модели PyTorch работают значительно лучше, когда ReLU используется вместо Softplus с Адамом в качестве оптимизатора.

Как может случиться так, что недифференцируемую функцию легче оптимизировать, чем аналитическую? Верно ли тогда, что нет никакой оптимизации градиента, кроме как по названию, и что под капотом используется какая-то комбинаторика?

Ответы

1 Tim Oct 17 2020 at 17:59

ReLU в целом, как известно, превосходит многие более плавные функции активации. Его легко оптимизировать, потому что он полулинейный. Преимущество при его использовании обычно заключается в скорости, поэтому может случиться так, что если вы подождете большего количества итераций, используете другую скорость обучения, размеры пакетов или другие гиперпараметры и т. Д., Вы получите аналогичные результаты.