ReLU superando Softplus
Percebi que os modelos PyTorch têm um desempenho significativamente melhor quando ReLU é usado em vez de Softplus com Adam como otimizador.
Como pode acontecer que uma função não diferenciável seja mais fácil de otimizar do que uma analítica? É verdade, então, que não há otimização de gradiente, exceto no nome, e algum tipo de combinatória é usada sob o capô?
Respostas
Em geral, o ReLU é conhecido por superar muitas funções de ativação mais suaves. É fácil de otimizar porque é semilinear. A vantagem ao usá-lo geralmente é a velocidade, então pode ser que se você esperasse mais iterações, usasse diferentes taxas de aprendizado, tamanhos de lote ou outros hiperparâmetros, etc, você obteria resultados semelhantes.