ReLU surpasse Softplus
J'ai remarqué que les modèles PyTorch fonctionnent beaucoup mieux lorsque ReLU est utilisé au lieu de Softplus avec Adam comme optimiseur.
Comment se fait-il qu'une fonction non différentiable soit plus facile à optimiser qu'une fonction analytique? Est-il vrai, alors, qu'il n'y a pas d' optimisation de gradient sauf que dans le nom, et une sorte de combinatoire est utilisée sous le capot?
Réponses
ReLU en général est connu pour surpasser de nombreuses fonctions d'activation plus fluides. C'est facile à optimiser, car il est semi-linéaire. L'avantage lors de son utilisation est généralement la vitesse, il se peut donc que si vous attendiez plus d'itérations, utilisiez un taux d'apprentissage, des tailles de lot ou d'autres hyperparamètres différents, etc., vous obtiendrez des résultats similaires.