機械学習の基礎および深層学習の応用(画像認識、自然言語処理、生成モデル、深層強化学習等)
強化学習のあるエピソードにおいて、時刻t=0,1,2で得られた報酬がそれぞれr0=2、r1=3、r2=1であり、割引率γ=0.9とする。時刻0から見た割引累積報酬(収益)Gの値はいくらか。
- ✓5.51
- B6.00
- C5.00
- D4.51
解説
G=r0+γr1+γ^2r2=2+0.9×3+0.81×1=2+2.7+0.81=5.51となる。割引率を各時刻の報酬に累乗で適用して合計する点が計算のポイントである。
根拠シラバス「深層学習の応用/深層強化学習」