深層学習の基礎(順伝播型ネットワーク、最適化、正則化、CNN、RNN、Transformer等)
Transformerにおけるマルチヘッドアテンションの説明として正しいものはどれか。
- ✓クエリ・キー・バリューを複数の低次元の部分空間に分割し、それぞれで独立にアテンションを計算した後結合することで、異なる観点の関係性を並行して捉える仕組み
- B単一のアテンション計算を用いて全ての次元を一度に処理することで計算量を削減する仕組み
- C複数の異なる入力系列を同時にバッチ処理するための仕組みであり、アテンションの計算自体は1種類のみ行う
- DRNNの複数の隠れ層を並列に配置し、それぞれの出力を平均することでアテンションを近似する仕組み
解説
マルチヘッドアテンションはクエリ・キー・バリューを複数のヘッド(部分空間)に分割し、各ヘッドで独立にアテンションを計算した後に結合することで、系列内の多様な関係性を並行して捉えられるようにする仕組みである。
根拠シラバス項目「Transformer」