ReLU vượt mặt Softplus

Oct 17 2020

Tôi nhận thấy rằng các mô hình PyTorch hoạt động tốt hơn đáng kể khi ReLU được sử dụng thay vì Softplus với Adam làm trình tối ưu hóa.

Làm thế nào có thể xảy ra rằng một chức năng không phân biệt lại dễ tối ưu hóa hơn một chức năng phân tích? Vậy có đúng là không có tối ưu hóa gradient ngoại trừ tên gọi, và một số loại tổ hợp được sử dụng dưới mui xe?

Trả lời

1 Tim Oct 17 2020 at 17:59

ReLU nói chung được biết là hoạt động tốt hơn nhiều chức năng kích hoạt mượt mà hơn. Thật dễ dàng để tối ưu hóa, vì nó nửa tuyến tính. Lợi thế khi sử dụng nó thường là tốc độ, vì vậy có thể xảy ra trường hợp nếu bạn đợi nhiều lần lặp hơn, sử dụng tốc độ học khác nhau, kích thước lô hoặc các siêu tham số khác, v.v., bạn sẽ nhận được kết quả tương tự.