開発・運用環境(エッジコンピューティング、分散処理、アクセラレータ、環境構築)
複数のノードにまたがる分散深層学習を行っていたところ、ノード間のネットワーク帯域が狭くAll-Reduce通信の待ち時間が学習全体のボトルネックとなっていることが判明した。この状況への対策として最も適切なものはどれか。
- ✓勾配の圧縮(量子化や勾配スパース化など)や勾配蓄積により通信データ量や通信頻度を削減する
- B各ノードのミニバッチサイズを極端に小さくし、通信回数を増やす
- CAll-Reduce通信を完全に廃止し、各ノードが独立して別々のモデルを学習させる
- DGPUの演算精度をFP64に引き上げて計算誤差を減らす
解説
ネットワーク帯域がボトルネックの場合、勾配圧縮や勾配蓄積(複数ステップごとに同期)によって通信量・通信頻度を削減することが有効な対策となる。
根拠シラバス「開発・運用環境」内「分散処理」