ReLU surpasse Softplus

Oct 17 2020

J'ai remarqué que les modèles PyTorch fonctionnent beaucoup mieux lorsque ReLU est utilisé au lieu de Softplus avec Adam comme optimiseur.

Comment se fait-il qu'une fonction non différentiable soit plus facile à optimiser qu'une fonction analytique? Est-il vrai, alors, qu'il n'y a pas d' optimisation de gradient sauf que dans le nom, et une sorte de combinatoire est utilisée sous le capot?

Réponses

1 Tim Oct 17 2020 at 17:59

ReLU en général est connu pour surpasser de nombreuses fonctions d'activation plus fluides. C'est facile à optimiser, car il est semi-linéaire. L'avantage lors de son utilisation est généralement la vitesse, il se peut donc que si vous attendiez plus d'itérations, utilisiez un taux d'apprentissage, des tailles de lot ou d'autres hyperparamètres différents, etc., vous obtiendrez des résultats similaires.