ReLU superando Softplus

Oct 17 2020

Percebi que os modelos PyTorch têm um desempenho significativamente melhor quando ReLU é usado em vez de Softplus com Adam como otimizador.

Como pode acontecer que uma função não diferenciável seja mais fácil de otimizar do que uma analítica? É verdade, então, que não há otimização de gradiente, exceto no nome, e algum tipo de combinatória é usada sob o capô?

Respostas

1 Tim Oct 17 2020 at 17:59

Em geral, o ReLU é conhecido por superar muitas funções de ativação mais suaves. É fácil de otimizar porque é semilinear. A vantagem ao usá-lo geralmente é a velocidade, então pode ser que se você esperasse mais iterações, usasse diferentes taxas de aprendizado, tamanhos de lote ou outros hiperparâmetros, etc, você obteria resultados semelhantes.