E資格(エンジニア資格)の全問題一覧
数学的基礎(確率・統計、情報理論)
- ある事象の生起確率が0.25であるとき、この事象が起きたことを知らせる情報の自己情報量(ビット)はいくらか。
- 確率変数XとYが互いに独立であり、Var(X)=4、Var(Y)=9であるとき、Var(2X-3Y)の値はいくらか。
- 確率分布pとqについて、交差エントロピーH(p,q)、pのエントロピーH(p)、KLダイバージェンスD_KL(p||q)の関係として正しいものはどれか。
- ある疾病の有病率は1%であり、検査の感度(罹患者が陽性となる確率)は99%、特異度(非罹患者が陰性となる確率)は95%である。この検査で陽性と判定された人が実際にこの疾病に罹患している確率に最も近い値はどれか。
- 最尤推定によりモデルのパラメータを求める際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①対数尤度に変換する ②観測データから尤度関数を構築する ③対数尤度をパラメータで微分し0とおいて方程式を解く ④得られた解が最大値であることを確認する
- 正解ラベルがone-hotベクトルで表される多クラス分類において、モデルが正解クラスに割り当てた予測確率が0.2であったとき、この事例の交差エントロピー損失(log2を用いて計算)に最も近い値はどれか。
- 標本から母分散を推定する際に用いる「不偏分散」と、単純に標本の値から計算する「標本分散」の違いについて正しく述べているものはどれか。
- 確率変数XとYの相互情報量I(X;Y)の説明として正しいものはどれか。
- 母平均50、母分散100の母集団からサイズn=400の標本を無作為抽出したとき、標本平均の分布として最も適切なものはどれか。
- 統計的仮説検定を行う際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①有意水準を設定する ②帰無仮説と対立仮説を設定する ③検定統計量を計算する ④p値を求め有意水準と比較して判定する
- ある工場では製品の60%を機械Aが、40%を機械Bが生産している。機械Aの不良率は2%、機械Bの不良率は5%である。生産された製品からランダムに1個取り出したところ不良品であった。この不良品が機械Bで生産された確率に最も近い値はどれか。
- 表が出る確率が0.3である偏ったコインを4回投げるとき、ちょうど2回表が出る確率に最も近い値はどれか。
- 母平均の信頼区間を標本データから構築する際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①標本平均を計算する②標本の標準偏差から標準誤差を計算する③信頼水準に応じた分布の臨界値を求める④点推定値に臨界値×標準誤差を加減して区間を求める
- 統計的仮説検定における第一種の誤りと第二種の誤りの違いに関する説明として正しいものはどれか。
- あるサイコロを1000回投げてその目の平均を計算したところ、理論値である3.5に非常に近い値になった。この現象を最もよく説明する法則・定理はどれか。
- ある離散確率変数が3つの値を取り、それぞれの生起確率が0.5、0.25、0.25であるとき、この確率分布のエントロピー(ビット単位、log2使用)に最も近い値はどれか。
- ベイズの定理を用いて事後確率を求める際の一般的な計算手順として、次の①〜④を正しい順序に並べたものはどれか。①事前確率を設定する②尤度を計算する③尤度と事前確率の積(同時確率)を計算する④正規化して事後確率を求める
- 最尤推定(MLE)と最大事後確率推定(MAP)の違いに関する記述として正しいものはどれか。
- 言語モデルなどの評価指標として用いられる「パープレキシティ」の説明として正しいものはどれか。
- あるコールセンターには1時間あたり平均5件の問い合わせがランダムかつ互いに独立して到着する。この到着件数をモデル化するのに最も適した確率分布はどれか。
深層学習の基礎(順伝播型ネットワーク、最適化、正則化、CNN、RNN、Transformer等)
- あるニューラルネットワークの学習曲線を確認したところ、訓練誤差はエポックが進むにつれて単調に減少し続けているが、検証誤差はあるエポックを過ぎたところから上昇に転じた。この状況で取るべき対応として最も適切なものはどれか。
- 入力画像のサイズが32×32、カーネルサイズが5×5、ストライドが1、パディングが0の畳み込み層を適用したとき、出力される特徴マップの一辺のサイズはどれか。
- 入力層のユニット数が784、次の全結合層のユニット数が256であり、各出力ユニットにバイアス項を持つ場合、この全結合層の学習可能パラメータ数はどれか。
- ミニバッチを用いた誤差逆伝播法によるニューラルネットワークの1回の更新において、次の①〜④を正しい順序に並べたものはどれか。①順伝播を行い出力を計算する②損失関数を用いて誤差を計算する③誤差を出力層から入力層へ逆伝播させて各層の勾配を計算する④勾配に基づきパラメータを更新する
- Transformerのself-attention機構における計算手順として、次の①〜④を正しい順序に並べたものはどれか。①クエリ・キー・バリューを線形変換により生成する②クエリとキーの内積を計算し次元数の平方根でスケーリングする③スケーリングされた値にsoftmaxを適用して注意重みを求める④注意重みとバリューの加重和を計算する
- バッチ正規化(Batch Normalization)とレイヤー正規化(Layer Normalization)の違いに関する記述として正しいものはどれか。
- 深層ニューラルネットワークの学習における勾配消失問題と勾配爆発問題の違いに関する説明として正しいものはどれか。
- ニューラルネットワークの正則化手法であるDropoutの説明として正しいものはどれか。
- 非常に長い時系列データを単純なRNN(vanilla RNN)で学習したところ、系列の初期に入力された情報が出力にほとんど反映されないという現象が生じた。この現象の主な原因として最も適切なものはどれか。
- ある画像分類モデルを学習率固定のSGD(確率的勾配降下法)で学習していたところ、損失が減少と増加を繰り返し収束しない状態になった。この問題への対処として最も適切なものはどれか。
- あるCNNを学習率0.1のSGDで学習していたところ、数エポック以内に損失値がNaNとなり学習が破綻した。この状況で最初に取るべき対応として最も適切なものはどれか。
- 数百枚程度の少量の画像データで新たな分類タスクを解くために、ImageNetで事前学習済みのCNNを利用した転移学習を行う。データ量が少ないことを踏まえた適切なアプローチとして最も適切なものはどれか。
- ある画像分類モデルにおいて、ミニバッチサイズを非常に大きく設定して学習したところ、訓練精度は高いままテスト精度(汎化性能)が低下する現象が観測された。この現象への対処として最も適切なものはどれか。
- 入力特徴マップに対して、カーネルサイズ3×3・ストライド1・パディング0の畳み込み層を2層連続で適用した場合、2層目の出力ユニット1つが入力側で参照する領域(受容野)の一辺のサイズはいくつか。
- サイズ28×28の特徴マップに、カーネルサイズ2×2・ストライド2の最大値プーリング層(パディングなし)を適用した場合、出力される特徴マップの一辺のサイズはどれか。
- LSTMセルにおける1タイムステップ内の計算の一般的な順序として、次の①〜④を正しい順序に並べたものはどれか。①忘却ゲートの出力を計算し前の記憶セルの情報をどれだけ保持するか決定する②入力ゲートの出力を計算し新しい情報をどれだけ記憶セルに加えるか決定する③忘却ゲートと入力ゲートの結果を用いて記憶セルの状態を更新する④出力ゲートの出力と更新された記憶セルの状態から隠れ状態を計算する
- 深層学習モデルの学習において早期終了(Early Stopping)を実装する際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①訓練データとは別に検証データを用意する②各エポック終了時に検証データでの損失を監視する③検証損失が一定エポック数(patience)にわたり改善しなくなった時点で学習を停止する④検証損失が最良であった時点のパラメータを最終モデルとして採用する
- L1正則化とL2正則化の違いに関する記述として正しいものはどれか。
- 重みの初期化手法であるXavier(Glorot)初期化とHe初期化の違いに関する記述として正しいものはどれか。
- Transformerにおけるマルチヘッドアテンションの説明として正しいものはどれか。
開発・運用環境(エッジコンピューティング、分散処理、アクセラレータ、環境構築)
- あるGPUで大規模なCNNモデルを学習していたところ「CUDA out of memory」エラーが発生した。モデルの精度への影響をできるだけ抑えつつ対処する方法として最も適切なものはどれか。
- 組み込み機器(エッジデバイス)にディープラーニングモデルをデプロイする際、計算資源とメモリが限られているという制約がある。この制約下で推論速度とメモリ使用量を改善するために有効な手法として最も適切なものはどれか。
- 単一GPUでバッチサイズ32、学習率0.01で良好に学習できていたモデルを、データ並列で4台のGPUを用いて学習する際、各GPUに同じバッチサイズ32を割り当て全体のバッチサイズを128に拡大した。この場合に一般的に推奨される調整として最も適切なものはどれか。
- あるモデルの重みが32ビット浮動小数点(FP32)で表現され、モデル全体のパラメータ数が1000万個であるとき、全パラメータを8ビット整数(INT8)に量子化した場合、モデルサイズはおよそ何分の1になるか。
- 1台のGPUで1エポックの学習に40分かかるモデルを、通信オーバーヘッドを無視できると仮定して4台のGPUによるデータ並列で学習する場合、理論上1エポックにかかる時間に最も近いものはどれか。
- 複数GPUを用いたデータ並列学習における1イテレーションあたりの一般的な処理の順序として、次の①〜④を正しい順序に並べたものはどれか。①各GPUに異なるミニバッチを配布する②各GPUがそれぞれ順伝播・逆伝播を行い勾配を計算する③All-Reduce通信により各GPUの勾配を集約し平均化する④集約された勾配を用いて各GPUのモデルパラメータを更新する
- ディープラーニングの学習環境をDockerを用いて構築する際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①必要なライブラリやフレームワークを記述したDockerfileを作成する②Dockerfileからイメージをビルドする③ビルドしたイメージからコンテナを起動する④コンテナ内でスクリプトを実行し学習を行う
- 分散深層学習における「データ並列」と「モデル並列」の違いに関する記述として正しいものはどれか。
- モデル軽量化手法である「量子化(quantization)」と「枝刈り(pruning)」の違いに関する記述として正しいものはどれか。
- エッジコンピューティングの説明として最も適切なものはどれか。
- Googleが開発したディープラーニング処理向けの専用プロセッサであるTPU(Tensor Processing Unit)の特徴として正しいものはどれか。
- 分散深層学習における勾配の集約方式である「パラメータサーバー方式」と「All-Reduce方式」の違いに関する記述として正しいものはどれか。
- モデル並列の代表的な手法である「パイプライン並列」と「テンソル並列」の違いに関する記述として正しいものはどれか。
- スマートフォンなどの計算資源が限られたエッジデバイス上で画像分類を行うアプリケーションを開発する際、モデルサイズと推論速度を重視した設計として最も適切なものはどれか。
- 複数のノードにまたがる分散深層学習を行っていたところ、ノード間のネットワーク帯域が狭くAll-Reduce通信の待ち時間が学習全体のボトルネックとなっていることが判明した。この状況への対策として最も適切なものはどれか。
- あるモデルのパラメータ数が非常に多く、単一GPUのメモリ容量に収まらないため学習を開始できない。この問題に対する最も適切な対応はどれか。
- 学習済みの深層学習モデルをエッジデバイスへデプロイするまでの一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①学習済みモデルの精度を評価する②量子化や枝刈りなどによりモデルを軽量化する③軽量化したモデルをエッジデバイス向けの推論フォーマットに変換する④エッジデバイス上で推論速度と精度を検証する
- あるモデルの学習処理のうち90%は並列化可能であり、残り10%は逐次的に処理せざるを得ない。GPU数を非常に多く増やした極限において、Amdahlの法則に基づく理論上の最大速度向上倍率に最も近いものはどれか。
- あるモデルのパラメータ数が2,500万個であり、FP32(4バイト/パラメータ)で保持されている。全パラメータをFP16(2バイト/パラメータ)に変換した場合、モデルサイズはおよそ何MBになるか。ただし1MB=10^6バイトとする。
機械学習の基礎および深層学習の応用(画像認識、自然言語処理、生成モデル、深層強化学習等)
- ある物体検出モデルが同一の物体に対して複数の重複したバウンディングボックスを信頼度スコア付きで出力した。これらの重複を解消し、信頼度が最も高いボックスのみを残すために一般的に用いられる後処理手法はどれか。
- あるGANを学習していたところ、Generatorが生成する画像の多様性が失われ、入力ノイズを変えてもほぼ同じような画像ばかりを出力するようになった。この現象と対処の組み合わせとして正しいものはどれか。
- あるQ学習エージェントが常に貪欲(greedy)に現在の推定価値が最大の行動のみを選択して学習していたところ、局所最適な方策に収束し真に最適な行動を発見できなかった。この問題を緩和するために一般的に用いられる手法はどれか。
- 画像中の正解バウンディングボックスが座標(0,0)-(10,10)、予測バウンディングボックスが座標(5,5)-(15,15)であるとき、この2つのボックスのIoU(Intersection over Union)に最も近い値はどれか。
- 強化学習のあるエピソードにおいて、時刻t=0,1,2で得られた報酬がそれぞれr0=2、r1=3、r2=1であり、割引率γ=0.9とする。時刻0から見た割引累積報酬(収益)Gの値はいくらか。
- Attention機構を備えたEncoder-DecoderモデルによるSeq2seqの推論において、①エンコーダが入力系列を処理し各タイムステップの隠れ状態を得る、②デコーダの現在の隠れ状態とエンコーダの各隠れ状態から注意重みを計算する、③注意重みでエンコーダの隠れ状態を加重和しコンテキストベクトルを得る、④コンテキストベクトルとデコーダの隠れ状態から次の出力トークンを予測する、という4つの処理を正しい順序に並べたものはどれか。
- GAN(敵対的生成ネットワーク)の標準的な学習における1イテレーションの処理として、①ノイズからGeneratorが偽データを生成する、②本物データと偽データをDiscriminatorに入力し識別させる、③Discriminatorの損失を計算しパラメータを更新する、④Generatorの損失(Discriminatorを騙せたか)を計算しパラメータを更新する、という4つを正しい順序に並べたものはどれか。
- 物体検出における2段階検出器(例: Faster R-CNN)と1段階検出器(例: YOLO, SSD)の違いに関する記述として正しいものはどれか。
- 生成モデルであるVAE(変分オートエンコーダ)とGAN(敵対的生成ネットワーク)の違いに関する記述として正しいものはどれか。
- CNNの判断根拠を可視化する説明性手法であるGrad-CAMの説明として正しいものはどれか。
- セマンティックセグメンテーションとインスタンスセグメンテーションの違いに関する記述として正しいものはどれか。
- ある物体検出モデルにおいて、画像内の小さな物体の検出精度が著しく低いことが確認された。この問題への対応として最も適切なものはどれか。
- 拡散モデル(DDPM)の学習における処理として、次の①〜④を正しい順序に並べたものはどれか。①元のデータに段階的にノイズを加えていく前向き過程(拡散過程)を定義する②ある時刻のノイズ付きデータとタイムステップの情報をニューラルネットワークに入力する③ネットワークがそのステップで加えられたノイズを予測する④予測したノイズと実際に加えたノイズとの誤差を用いてパラメータを更新する
- 強化学習における更新方式であるSARSA(オンポリシー型)とQ学習(オフポリシー型)の違いに関する記述として正しいものはどれか。
- BERTの事前学習タスクの一つであるMasked Language Model(MLM)の説明として正しいものはどれか。
- あるセマンティックセグメンテーションのタスクにおいて、画素の大部分が背景クラスであり前景クラスの画素数が非常に少ないため、モデルが背景ばかりを予測する傾向が生じた。この問題への対処として最も適切なものはどれか。
- RNNやSeq2seqモデルの学習で用いられるTeacher Forcingの説明として正しいものはどれか。
- ある物体検出モデルを評価したところ、正解物体10個のうち8個を正しく検出できた(TP=8)が、誤検出(FP)が2個、検出漏れ(FN)が2個あった。このときのPrecision(適合率)とRecall(再現率)の組み合わせとして正しいものはどれか。
- あるQ学習エージェントが行動価値の過大評価(overestimation bias)により学習が不安定になった。この問題を緩和するために一般的に用いられる手法はどれか。
- セマンティックセグメンテーションの評価に用いられるDice係数について、正解マスクの画素数が80、予測マスクの画素数が100、両者の共通部分(intersection)が60画素であるとき、Dice係数に最も近い値はどれか。