ReLU mengungguli Softplus
Saya telah memperhatikan bahwa model PyTorch bekerja secara signifikan lebih baik ketika ReLU digunakan daripada Softplus dengan Adam sebagai pengoptimal.
Bagaimana mungkin fungsi yang tidak dapat dibedakan lebih mudah untuk dioptimalkan daripada fungsi analitik? Jadi, apakah benar bahwa tidak ada optimasi gradien kecuali dalam nama, dan beberapa jenis kombinatorik digunakan di bawah tenda?
Jawaban
ULT secara umum dikenal mengungguli banyak fungsi aktivasi yang lebih mulus. Mudah untuk dioptimalkan, karena setengah linier. Keuntungan saat menggunakannya biasanya kecepatan, jadi bisa jadi jika Anda menunggu lebih banyak iterasi, menggunakan kecepatan pembelajaran yang berbeda, ukuran batch, atau hyperparameter lain, dll, Anda akan mendapatkan hasil yang serupa.