機械学習の基礎および深層学習の応用(画像認識、自然言語処理、生成モデル、深層強化学習等)
あるQ学習エージェントが常に貪欲(greedy)に現在の推定価値が最大の行動のみを選択して学習していたところ、局所最適な方策に収束し真に最適な行動を発見できなかった。この問題を緩和するために一般的に用いられる手法はどれか。
- A学習率を極端に小さくして更新量を抑える
- B割引率γを1より大きい値に設定し将来の報酬を過大に重視する
- ✓ε-greedy法などにより一定の確率でランダムな行動を選択し、探索(exploration)を促す
- D報酬関数の値を常に一定にして学習を単純化する
解説
常に貪欲な行動選択のみを行うと未探索の行動の真の価値を評価できず局所最適に陥りやすい。ε-greedy法のように一定確率でランダム行動を選ぶことで探索と活用のバランスを取ることが一般的な対処である。
根拠シラバス「深層学習の応用/深層強化学習」