ReLU는 Softplus를 능가합니다.
Oct 17 2020
필자는 Adam을 옵티 마이저로 사용하는 Softplus 대신 ReLU를 사용할 때 PyTorch 모델이 훨씬 더 나은 성능을 발휘한다는 것을 알게되었습니다.
미분 할 수없는 함수가 분석적 함수보다 최적화하기 더 쉽다는 것이 어떻게 일어날 수 있습니까? 그렇다면 이름 외에는 그라디언트 최적화 가 없으며 어떤 종류의 조합이 내부에서 사용 된다는 것이 사실 입니까?
답변
1 Tim Oct 17 2020 at 17:59
일반적으로 ReLU는 더 부드러운 활성화 기능을 능가하는 것으로 알려져 있습니다. 반 선형이기 때문에 최적화하기 쉽습니다. 사용시 장점은 일반적으로 속도이므로 더 많은 반복을 기다리거나 다른 학습률, 배치 크기 또는 기타 하이퍼 파라미터 등을 사용하면 유사한 결과를 얻을 수 있습니다.