Key points are not available for this paper at this time.
AdaGrad, RMSprop, Adam과 같은 적응형 최적화 방법은 학습률에 대한 원소 단위 스케일링 항을 사용하여 빠른 훈련 프로세스를 달성하기 위해 제안되었습니다. 현재 널리 사용되고 있지만, 이들은 SGD와 비교했을 때 일반화가 잘 되지 않거나 불안정하고 극단적인 학습률로 인해 수렴에 실패하는 경우가 관찰되었습니다. 최근의 연구에서는 AMSGrad와 같은 알고리즘이 이 문제를 해결하기 위해 제안되었지만 기존 방법보다 상당한 개선을 이루지 못했습니다. 본 논문에서는 극단적인 학습률이 성능 저하를 초래할 수 있음을 보여줍니다. 우리는 각각 AdaBound와 AMSBound라 불리는 Adam과 AMSGrad의 새로운 변형을 제공하며, 이들은 학습률에 동적 경계를 적용하여 적응형 방법에서 SGD로의 점진적이고 매끄러운 전환을 달성하고 수렴에 대한 이론적 증명을 제공합니다. 또한, 우리는 이전 연구에서 종종 부족했던 다양한 인기 작업과 모델에 대한 실험을 수행합니다. 실험 결과에 따르면 새로운 변형은 적응형 방법과 SGD 간의 일반화 갭을 없애고 훈련 초기 단계에서 더 높은 학습 속도를 유지할 수 있음을 보여줍니다. 더욱이, 이들은 복잡한 심층 네트워크에서 특히 프로토타입보다 상당한 개선을 가져올 수 있습니다. 알고리즘의 구현은 https://github.com/Luolc/AdaBound 에서 확인할 수 있습니다.
Luo et al. (2019)는 이 질문을 연구했습니다.