機械学習の基礎および深層学習の応用(画像認識、自然言語処理、生成モデル、深層強化学習等)
強化学習における更新方式であるSARSA(オンポリシー型)とQ学習(オフポリシー型)の違いに関する記述として正しいものはどれか。
- ASARSAは経験再生バッファを用いて過去の遷移からランダムサンプリングして学習するのに対し、Q学習はオンラインの遷移のみを用いる。
- BSARSAとQ学習はどちらも次状態で必ず最大価値の行動を用いて更新するため、更新則に本質的な違いはない。
- CQ学習は行動選択に用いた方策をそのまま評価するオンポリシー型であり、SARSAは別の貪欲方策を仮定して評価するオフポリシー型である。
- ✓SARSAは実際に選択した次の行動の価値を用いて更新するオンポリシー型であり、Q学習は次状態で最大価値を与える行動を仮定して更新するオフポリシー型である。
解説
SARSAは実際にε-greedyなどで選択した次の行動の価値を用いて更新するためオンポリシーであり、Q学習は次状態で最大の行動価値を仮定して更新するためオフポリシーである。経験再生の有無はこの区別の本質ではない。
根拠シラバス項目「深層強化学習」