全79問から、出題範囲の骨格が掴める28問だけを抜き出しました。まずはここだけ流して、必要なら全問へ進んでください。
全79問に進むこの28問の内容
出典: オリジナル想定問題(当サイト作成、実際の過去問ではありません)。公表されている出題範囲に基づく(最終更新 2026-09-27)
ある事象の生起確率が0.25であるとき、この事象が起きたことを知らせる情報の自己情報量(ビット)はいくらか。
- A0.5
- ✓2
- C4
- D0.25
解説
自己情報量は -log2(p) で定義される。p=0.25のとき -log2(0.25)=log2(4)=2ビットとなる。
根拠シラバス:数学的基礎 - 情報理論(自己情報量)
確率分布pとqについて、交差エントロピーH(p,q)、pのエントロピーH(p)、KLダイバージェンスD_KL(p||q)の関係として正しいものはどれか。
- ✓H(p,q) = H(p) + D_KL(p||q)
- BH(p,q) = D_KL(p||q) - H(p)
- CH(p,q) = H(p) - D_KL(p||q)
- DH(p,q)は情報エントロピーH(p)と独立であり、D_KL(p||q)のみで決まる
解説
交差エントロピーは分布pのエントロピーとKLダイバージェンスの和で表され、H(p,q)=H(p)+D_KL(p||q)が成り立つ。これは深層学習の損失関数として交差エントロピーが用いられる理論的背景でもある。
根拠シラバス:数学的基礎 - 情報理論(交差エントロピー、KLダイバージェンス)
最尤推定によりモデルのパラメータを求める際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①対数尤度に変換する ②観測データから尤度関数を構築する ③対数尤度をパラメータで微分し0とおいて方程式を解く ④得られた解が最大値であることを確認する
- A①→②→③→④
- ✓②→①→③→④
- C②→③→①→④
- D①→③→②→④
解説
まず観測データから尤度関数を構築し(②)、計算を簡単にするため対数を取り(①)、対数尤度を微分して極値を求め(③)、最後にそれが最大値であることを確認する(④)という順序が正しい。
根拠シラバス:数学的基礎 - 確率・統計(最尤推定)
標本から母分散を推定する際に用いる「不偏分散」と、単純に標本の値から計算する「標本分散」の違いについて正しく述べているものはどれか。
- ✓不偏分散は分母にn-1を用いることで推定量の期待値が母分散に一致するように補正したものであり、標本分散は分母にnを用いる
- B標本分散は常に不偏分散より大きな値になる
- C不偏分散と標本分散はサンプルサイズによらず常に同じ値になる
- D不偏分散は分母にnを用い、標本分散は分母にn-1を用いる
解説
標本分散は分母にnを用いるため母分散を過小評価する偏りがあり、これを補正するため分母にn-1を用いたものが不偏分散である。両者はnが大きいほど値が近づくが常に同じにはならない。
根拠シラバス:数学的基礎 - 確率・統計(不偏分散、標本分散)
母平均50、母分散100の母集団からサイズn=400の標本を無作為抽出したとき、標本平均の分布として最も適切なものはどれか。
- A平均50、分散100の正規分布に従う
- ✓平均50、分散0.25の正規分布に近似的に従う
- C母集団と同じ分布形状のまま、平均50、分散0.25の分布に従う
- D一様分布に近似的に従う
解説
中心極限定理により、標本サイズnが十分大きいとき母集団の分布形状によらず標本平均は近似的に平均μ、分散σ²/nの正規分布に従う。ここでは100/400=0.25となる。
根拠シラバス:数学的基礎 - 確率・統計(中心極限定理)
ある工場では製品の60%を機械Aが、40%を機械Bが生産している。機械Aの不良率は2%、機械Bの不良率は5%である。生産された製品からランダムに1個取り出したところ不良品であった。この不良品が機械Bで生産された確率に最も近い値はどれか。
- A0.375
- ✓0.625
- C0.2
- D0.8
解説
P(不良)=0.6×0.02+0.4×0.05=0.032であり、ベイズの定理よりP(B|不良)=0.02/0.032=0.625となる。単純に不良率の比(0.05/(0.02+0.05))を取ると誤りやすいので注意が必要である。
根拠シラバス「数学的基礎」内「確率・統計」(ベイズの定理・条件付き確率)
母平均の信頼区間を標本データから構築する際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①標本平均を計算する②標本の標準偏差から標準誤差を計算する③信頼水準に応じた分布の臨界値を求める④点推定値に臨界値×標準誤差を加減して区間を求める
- ✓①→②→③→④
- B②→①→③→④
- C①→③→②→④
- D④→③→②→①
解説
まず標本平均という点推定値を求め、次に標準誤差を計算し、信頼水準から臨界値を定め、最後にそれらを組み合わせて区間の上下限を求めるという順序が正しい。
根拠シラバス「数学的基礎」内「確率・統計」(区間推定・信頼区間)
あるニューラルネットワークの学習曲線を確認したところ、訓練誤差はエポックが進むにつれて単調に減少し続けているが、検証誤差はあるエポックを過ぎたところから上昇に転じた。この状況で取るべき対応として最も適切なものはどれか。
- A学習率をさらに大きくして学習を加速する
- Bエポック数を増やしさらに学習を継続する
- ✓Dropoutやweight decayなどの正則化を導入し、必要に応じて早期終了を検討する
- Dバッチサイズを大きくして勾配のノイズを減らす
解説
訓練誤差は下がる一方で検証誤差が上昇するのは典型的な過学習の兆候である。正則化手法の導入や早期終了によって汎化性能の悪化を防ぐのが適切な対応である。
根拠シラバス「深層学習の基礎 - 深層モデルのための正則化」
入力層のユニット数が784、次の全結合層のユニット数が256であり、各出力ユニットにバイアス項を持つ場合、この全結合層の学習可能パラメータ数はどれか。
- A200704
- ✓200960
- C201216
- D199680
解説
重みの数は784×256=200704であり、これに出力ユニット数と同数のバイアス256を加えると200960となる。
根拠シラバス「深層学習の基礎 - 順伝播型ネットワーク」
Transformerのself-attention機構における計算手順として、次の①〜④を正しい順序に並べたものはどれか。①クエリ・キー・バリューを線形変換により生成する②クエリとキーの内積を計算し次元数の平方根でスケーリングする③スケーリングされた値にsoftmaxを適用して注意重みを求める④注意重みとバリューの加重和を計算する
- A②→①→③→④
- B①→③→②→④
- C③→②→①→④
- ✓①→②→③→④
解説
まずQ・K・Vを生成し、QとKの内積をスケーリングして類似度を計算し、softmaxで注意重みに変換し、最後にVとの加重和を取って出力を得る、という順序が正しい。
根拠シラバス「深層学習の基礎 - Transformer」
深層ニューラルネットワークの学習における勾配消失問題と勾配爆発問題の違いに関する説明として正しいものはどれか。
- A勾配消失は逆伝播時に勾配が指数的に増大する現象であり、勾配爆発は勾配が指数的に減衰する現象である
- ✓勾配消失は逆伝播時に勾配が層を遡るごとに指数的に減衰し浅い層のパラメータが更新されにくくなる現象であり、勾配爆発は勾配が指数的に増大し学習が不安定になる現象である
- C勾配消失と勾配爆発はいずれも学習率が小さすぎることのみに起因する
- D勾配消失はCNNに特有の現象であり、勾配爆発はRNNに特有の現象である
解説
いずれも逆伝播時の勾配の連鎖的な乗算に起因するが、勾配消失は値が小さくなり続けて浅い層が学習されにくくなる現象、勾配爆発は値が大きくなり続けて学習が不安定になる現象であり、両者は逆方向の現象である。
根拠シラバス「深層学習の基礎 - 深層モデルのための最適化」
非常に長い時系列データを単純なRNN(vanilla RNN)で学習したところ、系列の初期に入力された情報が出力にほとんど反映されないという現象が生じた。この現象の主な原因として最も適切なものはどれか。
- ✓誤差を時間方向に逆伝播させる際、勾配が繰り返し乗算されることで指数的に減衰する勾配消失問題が生じているため
- Bモデルが訓練データに過学習しているため
- C学習率が小さすぎるため損失が全く減少していないため
- Dバッチサイズが大きすぎるため勾配の分散が大きくなっているため
解説
RNNでは時間方向の逆伝播(BPTT)において同じ重み行列が繰り返し乗算されるため、系列が長いほど初期時刻に関する勾配が指数的に減衰し、長期依存関係を学習しにくくなる。
根拠シラバス「深層学習の基礎 - リカレントニューラルネットワーク」
あるCNNを学習率0.1のSGDで学習していたところ、数エポック以内に損失値がNaNとなり学習が破綻した。この状況で最初に取るべき対応として最も適切なものはどれか。
- Aバッチサイズを大きくして学習を継続する
- Bエポック数を増やして様子を見る
- ✓学習率を下げる、または勾配クリッピングを導入する
- D学習率をさらに大きくする
解説
学習率が大きすぎると勾配更新のステップが過大になり損失が発散してNaNになることがある。この場合は学習率を下げるか、勾配爆発を抑える勾配クリッピングを導入するのが基本的な対処である。
根拠シラバス項目「深層モデルのための最適化」
ある画像分類モデルにおいて、ミニバッチサイズを非常に大きく設定して学習したところ、訓練精度は高いままテスト精度(汎化性能)が低下する現象が観測された。この現象への対処として最も適切なものはどれか。
- Aバッチサイズをさらに増やして安定性を高める
- ✓バッチサイズを小さくする、または学習率を調整する
- C損失関数の種類を変更する
- D学習率を極端に小さくして更新を止める
解説
バッチサイズを過度に大きくすると鋭い(sharp)極小解に収束しやすくなり汎化性能が低下することが知られている。バッチサイズを小さくする、または学習率をバッチサイズに応じて調整することが一般的な対処である。
根拠シラバス項目「深層モデルのための最適化」
あるGPUで大規模なCNNモデルを学習していたところ「CUDA out of memory」エラーが発生した。モデルの精度への影響をできるだけ抑えつつ対処する方法として最も適切なものはどれか。
- ✓ミニバッチサイズを小さくする
- B学習率を大きくする
- Cエポック数を増やす
- D全結合層のユニット数を増やす
解説
GPUメモリ不足は主に1ステップあたりの中間活性化やパラメータのメモリ消費量が原因であり、ミニバッチサイズを小さくすることでメモリ消費を直接抑えられる。学習率やエポック数の変更、モデルの拡大はメモリ不足の解決にはならない。
根拠シラバス「開発・運用環境」アクセラレータ・環境構築
単一GPUでバッチサイズ32、学習率0.01で良好に学習できていたモデルを、データ並列で4台のGPUを用いて学習する際、各GPUに同じバッチサイズ32を割り当て全体のバッチサイズを128に拡大した。この場合に一般的に推奨される調整として最も適切なものはどれか。
- ✓全体のバッチサイズの増加に応じて学習率を大きくする
- B学習率は変更せずエポック数を4倍にする
- C各GPUのバッチサイズを1に減らす
- D勾配を各GPUで独立に破棄し同期しない
解説
データ並列によって実効バッチサイズが増加した場合、勾配のばらつきが減るため学習率をバッチサイズの増加比率に応じて大きくすることが一般的に推奨される(線形スケーリング則)。学習率を据え置くと収束が遅くなる。
根拠シラバス「開発・運用環境」分散処理
1台のGPUで1エポックの学習に40分かかるモデルを、通信オーバーヘッドを無視できると仮定して4台のGPUによるデータ並列で学習する場合、理論上1エポックにかかる時間に最も近いものはどれか。
- A40分
- B20分
- ✓10分
- D4分
解説
データ並列では各GPUが全体のデータの一部を分担して処理するため、通信オーバーヘッドを無視すると処理時間はGPU台数に反比例し、40分÷4台=10分となる。
根拠シラバス「開発・運用環境」分散処理
ディープラーニングの学習環境をDockerを用いて構築する際の一般的な手順として、次の①〜④を正しい順序に並べたものはどれか。①必要なライブラリやフレームワークを記述したDockerfileを作成する②Dockerfileからイメージをビルドする③ビルドしたイメージからコンテナを起動する④コンテナ内でスクリプトを実行し学習を行う
- A②→①→③→④
- ✓①→②→③→④
- C①→③→②→④
- D③→①→②→④
解説
Dockerによる環境構築では、まず必要なライブラリを定義したDockerfileを作成し、それをビルドしてイメージ化し、そのイメージからコンテナを起動し、コンテナ内で実際の学習スクリプトを実行するという流れになる。
根拠シラバス「開発・運用環境」環境構築
モデル軽量化手法である「量子化(quantization)」と「枝刈り(pruning)」の違いに関する記述として正しいものはどれか。
- A量子化は不要な重みを削除する手法であり、枝刈りは数値精度を下げる手法である
- B量子化と枝刈りはどちらもモデルの層数を増やす手法である
- ✓量子化は重みやパラメータの数値表現のビット精度を下げる手法であり、枝刈りは重要度の低い重みやニューロンを削除する手法である
- D量子化は学習データを削減する手法であり、枝刈りは学習エポック数を削減する手法である
解説
量子化は32ビット浮動小数点を8ビット整数などより少ないビット数で近似的に表現することで計算量とメモリを削減する手法であり、枝刈りは寄与度の低い重みや接続、ニューロンそのものを削除してモデルを疎(スパース)にする手法である。両者はアプローチが異なる軽量化技術である。
根拠シラバス「開発・運用環境」アクセラレータ・環境構築(モデル軽量化)
Googleが開発したディープラーニング処理向けの専用プロセッサであるTPU(Tensor Processing Unit)の特徴として正しいものはどれか。
- A汎用的な逐次命令処理に最適化されたプロセッサであり、CPUの代替として設計されている
- B主にグラフィックス描画処理のために設計され、副次的に深層学習にも利用される
- ✓行列演算(積和演算)を高速に実行するsystolic array構造を採用し、深層学習の学習・推論に特化して設計されている
- D消費電力を度外視して演算精度の高さのみを追求したプロセッサである
解説
TPUはsystolic array構造により行列積和演算を高速に処理できるよう設計された、深層学習専用のアクセラレータである。汎用プロセッサやGPUの代替としての用途とは設計思想が異なる。
根拠シラバス「開発・運用環境」内「アクセラレータ」
モデル並列の代表的な手法である「パイプライン並列」と「テンソル並列」の違いに関する記述として正しいものはどれか。
- Aパイプライン並列はミニバッチを複数デバイスに分割するのに対し、テンソル並列は層を複数デバイスに分割する
- ✓パイプライン並列はモデルを層単位で複数デバイスに分割し各デバイスが異なる層の処理を担当するのに対し、テンソル並列は同一層内の行列演算を複数デバイスに分割して並列に計算する
- Cパイプライン並列とテンソル並列はどちらも同じ処理を指す用語であり、実装上の違いはない
- Dパイプライン並列は必ず単一デバイス内で実行されるのに対し、テンソル並列のみが複数デバイスを利用する
解説
パイプライン並列は層単位でモデルを分割し各デバイスが異なる層を担当するのに対し、テンソル並列は同一層内の行列演算そのものを複数デバイスに分割して並列計算する点が異なる。
根拠シラバス「開発・運用環境」内「分散処理」
ある物体検出モデルが同一の物体に対して複数の重複したバウンディングボックスを信頼度スコア付きで出力した。これらの重複を解消し、信頼度が最も高いボックスのみを残すために一般的に用いられる後処理手法はどれか。
- ✓NMS(Non-Maximum Suppression)を適用し、信頼度が最も高いボックスを残して重なりの大きい他のボックスを抑制する
- BBatch Normalizationを適用し中間層の出力分布を正規化する
- CDropoutを適用し一部のユニットを無効化する
- Dデータ拡張により学習データの水増しを行う
解説
物体検出では、重複するバウンディングボックスのうちIoUが高いものを信頼度に基づいて抑制するNMSが後処理として標準的に用いられる。Batch NormalizationやDropout、データ拡張は学習時の手法であり、この後処理には該当しない。
根拠シラバス「深層学習の応用/画像認識/物体検出」
あるQ学習エージェントが常に貪欲(greedy)に現在の推定価値が最大の行動のみを選択して学習していたところ、局所最適な方策に収束し真に最適な行動を発見できなかった。この問題を緩和するために一般的に用いられる手法はどれか。
- A学習率を極端に小さくして更新量を抑える
- B割引率γを1より大きい値に設定し将来の報酬を過大に重視する
- ✓ε-greedy法などにより一定の確率でランダムな行動を選択し、探索(exploration)を促す
- D報酬関数の値を常に一定にして学習を単純化する
解説
常に貪欲な行動選択のみを行うと未探索の行動の真の価値を評価できず局所最適に陥りやすい。ε-greedy法のように一定確率でランダム行動を選ぶことで探索と活用のバランスを取ることが一般的な対処である。
根拠シラバス「深層学習の応用/深層強化学習」
強化学習のあるエピソードにおいて、時刻t=0,1,2で得られた報酬がそれぞれr0=2、r1=3、r2=1であり、割引率γ=0.9とする。時刻0から見た割引累積報酬(収益)Gの値はいくらか。
- ✓5.51
- B6.00
- C5.00
- D4.51
解説
G=r0+γr1+γ^2r2=2+0.9×3+0.81×1=2+2.7+0.81=5.51となる。割引率を各時刻の報酬に累乗で適用して合計する点が計算のポイントである。
根拠シラバス「深層学習の応用/深層強化学習」
GAN(敵対的生成ネットワーク)の標準的な学習における1イテレーションの処理として、①ノイズからGeneratorが偽データを生成する、②本物データと偽データをDiscriminatorに入力し識別させる、③Discriminatorの損失を計算しパラメータを更新する、④Generatorの損失(Discriminatorを騙せたか)を計算しパラメータを更新する、という4つを正しい順序に並べたものはどれか。
- A②→①→③→④
- B①→③→②→④
- ✓①→②→③→④
- D③→④→①→②
解説
まずGeneratorが偽データを生成し、それをDiscriminatorに識別させ、その結果からDiscriminatorの損失で更新を行った後、Generatorが騙せたかどうかに基づく損失で更新を行うのが一般的な手順である。
根拠シラバス「深層学習の応用/生成モデル」
生成モデルであるVAE(変分オートエンコーダ)とGAN(敵対的生成ネットワーク)の違いに関する記述として正しいものはどれか。
- ✓VAEは潜在変数の確率分布への符号化と復号を行い、再構成誤差とKLダイバージェンスからなる損失を最小化するのに対し、GANはGeneratorとDiscriminatorの敵対的学習によりデータ分布を近似し明示的な尤度計算を行わない
- BGANはエンコーダとデコーダを用いて明示的にデータの尤度を計算するのに対し、VAEは識別器との敵対的学習によって学習する
- CVAEとGANはいずれも識別器(Discriminator)を用いて生成データの真偽を判定する点で同一の仕組みである
- DVAEは敵対的学習のみによって学習され、GANは変分下限(ELBO)を最大化することで学習される
解説
VAEはエンコーダ・デコーダ構造を持ち再構成誤差とKLダイバージェンス項からなる変分下限を最大化して学習するのに対し、GANはDiscriminatorとの敵対的な枠組みで学習し明示的な尤度計算を行わない点が本質的な違いである。
根拠シラバス「深層学習の応用/生成モデル」
セマンティックセグメンテーションとインスタンスセグメンテーションの違いに関する記述として正しいものはどれか。
- Aセマンティックセグメンテーションは物体の個体を区別するが、インスタンスセグメンテーションはクラスのみを予測し個体を区別しない。
- ✓セマンティックセグメンテーションはピクセル単位でクラスラベルを予測するが同一クラス内の個体を区別せず、インスタンスセグメンテーションは同一クラスでも個体ごとに異なる領域として区別する。
- C両者は出力形式が同一であり、算出する損失関数が異なるだけである。
- Dセマンティックセグメンテーションはバウンディングボックスを出力し、インスタンスセグメンテーションはピクセル単位のマスクを出力する。
解説
セマンティックセグメンテーションは画素ごとにクラスを予測するのみで同一クラスの複数個体を区別しないが、インスタンスセグメンテーションは同一クラスであっても個体ごとに異なる領域として分離する点が本質的な違いである。バウンディングボックス出力は物体検出の特徴であり誤り。
根拠シラバス項目「セマンティックセグメンテーション」
拡散モデル(DDPM)の学習における処理として、次の①〜④を正しい順序に並べたものはどれか。①元のデータに段階的にノイズを加えていく前向き過程(拡散過程)を定義する②ある時刻のノイズ付きデータとタイムステップの情報をニューラルネットワークに入力する③ネットワークがそのステップで加えられたノイズを予測する④予測したノイズと実際に加えたノイズとの誤差を用いてパラメータを更新する
- ✓①→②→③→④
- B②→①→③→④
- C①→③→②→④
- D④→①→②→③
解説
拡散モデルではまず前向き過程でデータにノイズを付加する仕組みを定義し、その後ノイズ付きデータとタイムステップをネットワークに入力してノイズを予測させ、予測誤差を用いてパラメータを更新する。この順序が学習の基本手順である。
根拠シラバス項目「生成モデル」