ディープラーニングの概要と手法
最適化手法であるSGD(モメンタムなし)とAdamの違いに関する説明として、最も適切なものはどれか。
- ASGDは各パラメータごとに異なる学習率を勾配の統計量から自動的に調整するのに対し、Adamは全パラメータに同一の固定学習率のみを用いる
- BSGDは勾配の1次・2次モーメントの推定値を用いてパラメータごとに学習率を適応的に調整するのに対し、Adamは単純に勾配に学習率を掛けた値のみでパラメータを更新する
- ✓SGD(モメンタムなし)は現在の勾配の情報のみを用いてパラメータを更新するのに対し、Adamは勾配の1次モーメント(移動平均)と2次モーメントの推定値を用いてパラメータごとに学習率を適応的に調整する
- DSGDとAdamはいずれも損失関数の二階微分(ヘッセ行列)を明示的に計算して更新方向を決定する
解説
SGD(モメンタムなし)は現在のミニバッチの勾配のみを用いて単純にパラメータを更新する。一方Adamは勾配の1次モーメントと2次モーメントの推定値を保持し、パラメータごとに学習率を適応的に調整しながら更新する。
根拠シラバス項目: ディープラーニングの概要 - 最適化手法