機械学習の基礎および深層学習の応用(画像認識、自然言語処理、生成モデル、深層強化学習等)
あるQ学習エージェントが行動価値の過大評価(overestimation bias)により学習が不安定になった。この問題を緩和するために一般的に用いられる手法はどれか。
- Aε-greedyのεを0にして完全に貪欲に行動選択する。
- ✓Double Q-learningを用い、行動の選択と価値の評価に異なる価値関数(ネットワーク)を用いることで過大評価を緩和する。
- C学習率を大きく上げて価値関数の更新を速める。
- D経験再生バッファを廃止しオンラインの遷移のみで学習する。
解説
Q学習では次状態の最大値を取る操作がノイズにより過大評価を招きやすいため、行動選択と価値評価に別々の価値関数を用いるDouble Q-learningが過大評価バイアスの緩和策として知られている。εを0にすることは探索を失わせ問題を悪化させる。
根拠シラバス項目「深層強化学習」