深層学習の基礎(順伝播型ネットワーク、最適化、正則化、CNN、RNN、Transformer等)
Transformerのself-attention機構における計算手順として、次の①〜④を正しい順序に並べたものはどれか。①クエリ・キー・バリューを線形変換により生成する②クエリとキーの内積を計算し次元数の平方根でスケーリングする③スケーリングされた値にsoftmaxを適用して注意重みを求める④注意重みとバリューの加重和を計算する
- A②→①→③→④
- B①→③→②→④
- C③→②→①→④
- ✓①→②→③→④
解説
まずQ・K・Vを生成し、QとKの内積をスケーリングして類似度を計算し、softmaxで注意重みに変換し、最後にVとの加重和を取って出力を得る、という順序が正しい。
根拠シラバス「深層学習の基礎 - Transformer」