G検定 ⑤ DL理論基礎

ディープラーニングを支える理論的な基礎を学ぶ分野です。ニューラルネットワークの構造、活性化関数、誤差逆伝播法、勾配降下法と各種最適化手法、勾配消失問題やその対策が中心テーマになります。なぜ深い層の学習が難しいのか、それをどう克服してきたのかという流れの理解が問われます。数式そのものより、各手法が「何を解決するためのものか」を押さえることが効率的な学習につながります。

この分野の問題96問を、選択肢・正解・解説つきで掲載しています。まず自分で解答を考えてから「正解と解説を見る」を開いて答え合わせをしてください。

クイズモードで挑戦 →

376人間の脳の神経回路を模したアルゴリズムであり、ディープラーニングの土台となる仕組みはどれか。

  1. A決定木
  2. Bサポートベクターマシン
  3. Cニューラルネットワーク
  4. Dランダムフォレスト
正解と解説を見る

正解:Cニューラルネットワーク

2章でも言及された通り、人間の脳のニューロンを模した巨大なネットワークです。

この問題の解説ページを開く →

377ニューラルネットワークの各層において、入力された信号を受け取り出力する役割を持つ要素を何と呼ぶか。

  1. Aエッジ
  2. Bニューロン
  3. Cシナプス
  4. Dカーネル
正解と解説を見る

正解:Bニューロン

情報を処理し伝達する役割を担う基本単位であり、各層に配置されています。

この問題の解説ページを開く →

378入力層のニューロンと出力層のニューロンの間の繋がりの強さを表し、学習によって調整される値を何と呼ぶか。

  1. A閾値
  2. B活性化関数
  3. Cバイアス
  4. D重み
正解と解説を見る

正解:D重み

各ニューロン間の接続の強さを「重み」で表し、この値を調整することで学習が進みます。

この問題の解説ページを開く →

379単純パーセプトロンにおいて、入力の総和を0から1の値に変換し、出力へ伝播させるかを調整する関数を何と言うか。

  1. A誤差関数
  2. B損失関数
  3. C活性化関数
  4. D評価関数
正解と解説を見る

正解:C活性化関数

入力の総和に対して閾値の調整などをし、出力値を決定するための関数です。

この問題の解説ページを開く →

380単純パーセプトロンで最初に用いられていた、出力が0か1かの二値にしかならないような活性化関数はどれか。

  1. Aシグモイド関数
  2. BReLU関数
  3. Cソフトマックス関数
  4. Dステップ関数
正解と解説を見る

正解:Dステップ関数

閾値を超えたら1、超えなければ0という階段状の出力を行う関数です。

この問題の解説ページを開く →

381出力を0と1の二値ではなく、0から1の間の連続的な確率のような値で出力できる滑らかな活性化関数はどれか。

  1. Aステップ関数
  2. Bシグモイド関数
  3. C恒等関数
  4. Dランパ関数
正解と解説を見る

正解:Bシグモイド関数

ロジスティック回帰でも用いられ、微積分がしやすく学習に適した滑らかな関数です。

この問題の解説ページを開く →

382入力層と出力層だけで構成される単純パーセプトロンの決定的な弱点はどれか。

  1. A計算速度が遅すぎること
  2. B画像データしか扱えないこと
  3. C線形分離不可能な複雑な問題が解けないこと
  4. Dメモリを大量に消費すること
正解と解説を見る

正解:C線形分離不可能な複雑な問題が解けないこと

直線で分けられないような複雑な分布のデータを分類できないという限界がありました。

この問題の解説ページを開く →

383単純パーセプトロンの弱点を克服するために、入力層と出力層の間に追加された層を何と呼ぶか。

  1. A隠れ層(中間層)
  2. B受容層
  3. Cプーリング層
  4. D畳み込み層
正解と解説を見る

正解:A隠れ層(中間層)

隠れ層(中間層)を追加することでネットワークが複雑な分布や概念を扱えるようになります。

この問題の解説ページを開く →

384隠れ層を追加した多層パーセプトロンにおける「モデルの学習」とは何を意味するか。

  1. A隠れ層の数を無限に増やすこと
  2. Bデータに最適なパラメータ(重み)の値を求めること
  3. CコンピュータのCPUを最新のものに交換すること
  4. D人間が手動で全ての特徴量を設計すること
正解と解説を見る

正解:Bデータに最適なパラメータ(重み)の値を求めること

予測値と実際の値の誤差を最小にするように、ネットワーク内の重みを調整することです。

この問題の解説ページを開く →

385ニューラルネットワークの構造のうち、ハイパーパラメータに該当するものはどれか。

  1. A学習中に自動更新される各ニューロンの重み
  2. B隠れ層のニューロン数や層の深さ
  3. C予測結果と正解との誤差
  4. D入力データのピクセル値
正解と解説を見る

正解:B隠れ層のニューロン数や層の深さ

隠れ層の数など、学習で自動的に決まらず事前に人間が設定すべき値をハイパーパラメータと呼びます。

この問題の解説ページを開く →

386一般的にディープラーニングと呼ばれる手法は、どのような構造のニューラルネットワークを指すか。

  1. A隠れ層が1つもないネットワーク
  2. B入力層と出力層が直接繋がっているネットワーク
  3. C隠れ層を増やした(深い)ネットワーク
  4. D全ての重みが固定されたネットワーク
正解と解説を見る

正解:C隠れ層を増やした(深い)ネットワーク

隠れ層が複数ある深いニューラルネットワークを用いた学習をディープラーニングと呼びます。

この問題の解説ページを開く →

387「半導体の集積率は18ヶ月ごとに2倍になる」という、ハードウェアの進化を表現した経験則は何か。

  1. Aムーアの法則
  2. Bメトカーフの法則
  3. Cアムダールの法則
  4. Dギルダーの法則
正解と解説を見る

正解:Aムーアの法則

Intel創設者のゴードン・ムーアが提唱し、コンピュータの性能向上を示す指標となりました。

この問題の解説ページを開く →

388ディープラーニングの膨大な計算において、CPU以上に適しているとされる演算処理装置はどれか。

  1. AHDD
  2. BSSD
  3. CGPU
  4. Dメモリ
正解と解説を見る

正解:CGPU

本来は画像処理用ですが、大規模な並列演算を得意とするためディープラーニングに最適です。

この問題の解説ページを開く →

389GPUを本来の画像処理以外の目的(ディープラーニングなど汎用的な計算)に利用する技術を何と呼ぶか。

  1. A仮想化技術
  2. Bエッジコンピューティング
  3. CGPGPU
  4. Dクラウドコンピューティング
正解と解説を見る

正解:CGPGPU

General-Purpose computing on GPUの略で、汎用的な計算にGPUを用いる技術です。

この問題の解説ページを開く →

390ディープラーニング向けのGPU開発を牽引し、AIブームで大きく成長した代表的な半導体メーカーはどこか。

  1. AIntel
  2. BNVIDIA
  3. CAMD
  4. DARM
正解と解説を見る

正解:BNVIDIA

NVIDIA社が提供するGPUと開発プラットフォームがディープラーニングの実装を支えています。

この問題の解説ページを開く →

391Googleが独自に開発した、テンソル計算処理に最適化されたAI専用チップの名称は何か。

  1. ACPU
  2. BGPU
  3. CTPU
  4. DNPU
正解と解説を見る

正解:CTPU

Tensor Processing Unitの略で、機械学習に特化した演算処理装置として開発されました。

この問題の解説ページを開く →

392ディープラーニングが十分な精度を出すために必要なデータ量に関する「バーニーおじさんのルール」とはどのようなものか。

  1. Aモデルのパラメータ数の10倍のデータが必要
  2. Bモデルのパラメータ数の1000倍のデータが必要
  3. C常に最低1億件のデータが必要
  4. Dデータ量は多いほど悪影響が出る
正解と解説を見る

正解:Aモデルのパラメータ数の10倍のデータが必要

経験則として、パラメータ数の10倍程度のデータ数が必要だと言われています。

この問題の解説ページを開く →

393モデルの学習において、予測値と実際の正解の値を比較し、その「ズレ」を数値化した関数を何と呼ぶか。

  1. A活性化関数
  2. B誤差関数(損失関数)
  3. Cシグモイド関数
  4. Dステップ関数
正解と解説を見る

正解:B誤差関数(損失関数)

この誤差関数の値が最小になるようにモデルの重みを調整していくことが学習の目的です。

この問題の解説ページを開く →

394回帰問題において一般的に用いられる、予測値と正解値の差を2乗して平均する誤差関数はどれか。

  1. A交差エントロピー誤差関数
  2. Bカルバック・ライブラー情報量
  3. C平均二乗誤差関数
  4. DContrastive Loss
正解と解説を見る

正解:C平均二乗誤差関数

回帰問題でよく使われ、誤差の2乗和の平均をとることで予測性能を評価します。

この問題の解説ページを開く →

395平均二乗誤差関数において、誤差を「2乗」する数学的なメリットは何か。

  1. Aメモリの消費を完全にゼロにできる
  2. Bプラスとマイナスの誤差が打ち消し合うのを防ぎ、微分計算がしやすくなる
  3. Cデータセットのサイズを自動的に縮小できる
  4. D学習時間を1秒以内に短縮できる
正解と解説を見る

正解:Bプラスとマイナスの誤差が打ち消し合うのを防ぎ、微分計算がしやすくなる

絶対値をとるよりも微分(最適化計算)がしやすく、正負の相殺も防げる利点があります。

この問題の解説ページを開く →

396分類問題において、出力された予測確率と実際の正解(1か0)との差を測るのによく用いられる誤差関数はどれか。

  1. A平均二乗誤差関数
  2. B交差エントロピー誤差関数
  3. CTriplet Loss
  4. DL1正則化
正解と解説を見る

正解:B交差エントロピー誤差関数

2つの確率分布がどれくらい異なるかを表す指標であり、分類問題で多用されます。

この問題の解説ページを開く →

397分類問題において交差エントロピー誤差関数が好まれる理由として正しいものはどれか。

  1. Aパラメータの数を自動的に減らしてくれるから
  2. B計算にGPUが不要になるから
  3. Cシグモイド関数などとの相性が良く、誤差計算に伴う微分計算が容易になるから
  4. D全てのデータが自動的に正解になるから
正解と解説を見る

正解:Cシグモイド関数などとの相性が良く、誤差計算に伴う微分計算が容易になるから

シグモイド関数やソフトマックス関数の出力に対して微分がシンプルになり、学習が効率化されます。

この問題の解説ページを開く →

398文字通りデータ間の「距離」を測り、データの類似度を推定するような学習アプローチを何と呼ぶか。

  1. A距離学習(metric learning)
  2. B強化学習
  3. Cアンサンブル学習
  4. D転移学習
正解と解説を見る

正解:A距離学習(metric learning)

データ同士が似ているか似ていないかを距離として測り、顔認証などに応用されます。

この問題の解説ページを開く →

399深層距離学習で用いられる「Siamese Network」の特徴として正しいものはどれか。

  1. A3つのデータを同時に入力して処理する
  2. B2つのデータを入力し、それらが同じか異なるか(距離)を学習する
  3. Cデータを一切入力せずに画像を出力する
  4. Dテキストデータ専用のネットワークである
正解と解説を見る

正解:B2つのデータを入力し、それらが同じか異なるか(距離)を学習する

双子という意味があり、2つの入力データの特徴量の距離を近づけたり遠ざけたりします。

この問題の解説ページを開く →

400Siamese Networkの学習によく用いられる、同じクラスは近づけ、異なるクラスは遠ざけるための誤差関数は何か。

  1. AContrastive Loss
  2. BTriplet Loss
  3. C平均二乗誤差
  4. D交差エントロピー
正解と解説を見る

正解:AContrastive Loss

Siamese Networkなどで用いられ、類似ペアと非類似ペアの距離を最適化する損失関数です。

この問題の解説ページを開く →

401深層距離学習で用いられる「Triplet Network」にはいくつのデータが同時に入力されるか。

  1. A1つ
  2. B2つ
  3. C3つ
  4. D4つ
正解と解説を見る

正解:C3つ

基準データ、同じクラスのデータ、異なるクラスのデータの3つ(トリプレット)を入力します。

この問題の解説ページを開く →

402Triplet Networkの学習に用いられる誤差関数の名称はどれか。

  1. AContrastive Loss
  2. BTriplet Loss
  3. C平均二乗誤差
  4. D交差エントロピー
正解と解説を見る

正解:BTriplet Loss

Triplet Networkにおいて、3つの入力の相対的な距離関係を最適化するための損失関数です。

この問題の解説ページを開く →

403生成モデルの学習において、生成されたデータの確率分布と実際の分布との「ズレ」を測る指標は何か。

  1. Aカルバック・ライブラー情報量(KLダイバージェンス)
  2. B平均二乗誤差
  3. C正解率(Accuracy)
  4. DF値
正解と解説を見る

正解:Aカルバック・ライブラー情報量(KLダイバージェンス)

2つの確率分布がどれくらい似ているか(ズレているか)を示す指標として定義されます。

この問題の解説ページを開く →

404KLダイバージェンスを改良し、AからBへのズレとBからAへのズレを対称的に評価できるようにした指標は何か。

  1. A平均二乗誤差
  2. BJaccard係数
  3. Cイェンセン・シャノン情報量(JSダイバージェンス)
  4. Dコサイン類似度
正解と解説を見る

正解:Cイェンセン・シャノン情報量(JSダイバージェンス)

KLダイバージェンスの非対称性を補うために用いられ、GANなどの生成モデルでも利用されます。

この問題の解説ページを開く →

405ディープラーニングにおいて、訓練データに過剰に適合してしまい、未知のデータに対する予測性能が落ちる現象を何と呼ぶか。

  1. A勾配消失
  2. B次元削減
  3. C汎化
  4. D過学習
正解と解説を見る

正解:D過学習

訓練データ特有のノイズまで学習してしまい、新しいデータに正しく対応できなくなる状態です。

この問題の解説ページを開く →

406過学習を防ぎ、モデルの汎化性能(未知のデータへの対応力)を高めるための手法の総称を何と呼ぶか。

  1. A最適化
  2. B正則化
  3. Cクラスタリング
  4. Dバギング
正解と解説を見る

正解:B正則化

モデルが複雑になりすぎるのを防ぐため、学習に様々な制約を組み込む手法の総称です。

この問題の解説ページを開く →

407誤差関数にパラメータ(重み)の大きさに応じたペナルティを加えることで過学習を防ぐ正則化手法はどれか。

  1. Aドロップアウト
  2. BL1/L2正則化
  3. C勾配降下法
  4. Dアンサンブル学習
正解と解説を見る

正解:BL1/L2正則化

重みが大きくなりすぎる(特定の特徴に過剰に依存する)のを防ぐためにペナルティを加えます。

この問題の解説ページを開く →

408パラメータの「絶対値の和」をペナルティ項として誤差関数に加算する正則化手法を何と呼ぶか。

  1. AL2正則化
  2. BL1正則化
  3. Cドロップアウト
  4. Dバッチ正規化
正解と解説を見る

正解:BL1正則化

L1ノルム(絶対値の和)を加算する手法で、不要なパラメータがゼロになりやすい特徴があります。

この問題の解説ページを開く →

409パラメータの「2乗の和」をペナルティ項として誤差関数に加算する正則化手法を何と呼ぶか。

  1. AL1正則化
  2. BL2正則化
  3. Cデータ拡張
  4. Dアーリーストッピング
正解と解説を見る

正解:BL2正則化

L2ノルム(2乗の和の平方根など)に関連するペナルティで、パラメータを全体的にゼロに近づけます。

この問題の解説ページを開く →

410線形回帰に対してL1正則化を適用した手法を一般に何と呼ぶか。

  1. Aリッジ回帰
  2. Bラッソ回帰
  3. Cロジスティック回帰
  4. D多項式回帰
正解と解説を見る

正解:Bラッソ回帰

L1正則化を用いた回帰手法はラッソ(Lasso)回帰と呼ばれ、特徴量選択にも利用されます。

この問題の解説ページを開く →

411線形回帰に対してL2正則化を適用した手法を一般に何と呼ぶか。

  1. Aラッソ回帰
  2. BElastic Net
  3. Cリッジ回帰
  4. Dロジスティック回帰
正解と解説を見る

正解:Cリッジ回帰

L2正則化を用いた回帰手法はリッジ(Ridge)回帰と呼ばれます。

この問題の解説ページを開く →

412L1正則化を適用して学習を進めた際に見られる特徴的な結果はどれか。

  1. A全てのパラメータが必ず1になる
  2. B一部のパラメータの値が完全にゼロになり、特徴量が選択される
  3. C学習時間が永遠に終わらなくなる
  4. D誤差関数が常にゼロになる
正解と解説を見る

正解:B一部のパラメータの値が完全にゼロになり、特徴量が選択される

L1正則化は不要な特徴量の重みをゼロにする性質があり、スパースなモデルを構築します。

この問題の解説ページを開く →

413ラッソ回帰(L1正則化)とリッジ回帰(L2正則化)の両方を組み合わせて適用した手法を何と呼ぶか。

  1. AElastic Net
  2. Bランダムフォレスト
  3. Cサポートベクターマシン
  4. Dk-means
正解と解説を見る

正解:AElastic Net

L1とL2のペナルティをブレンドして、両方の利点を活かそうとする手法です。

この問題の解説ページを開く →

414ディープラーニング特有の過学習対策として、学習時にネットワークの一部ニューロンをランダムに無効化する手法はどれか。

  1. Aバッチ正規化
  2. BL1正則化
  3. Cアーリーストッピング
  4. Dドロップアウト
正解と解説を見る

正解:Dドロップアウト

学習ステップごとにランダムにニューロンを除外することで、特定のニューロンへの過度な依存を防ぎます。

この問題の解説ページを開く →

415ドロップアウトが過学習を防ぐ効果は、機械学習のどのような手法と似た考え方であると解釈できるか。

  1. A決定木
  2. B強化学習
  3. Cアンサンブル学習
  4. D主成分分析
正解と解説を見る

正解:Cアンサンブル学習

毎回異なる形状のネットワークで学習を行うため、多数のモデルの多数決を取るアンサンブル学習と似た効果があります。

この問題の解説ページを開く →

416ドロップアウトにおいて、除外するニューロンの選択はどのタイミングで行われるか。

  1. Aネットワークの構築時に一度だけ決める
  2. B学習のエポックや更新のたびに毎回ランダムに選び直す
  3. Cユーザーが手動で全て指定する
  4. D最も重みが大きいニューロンを常に除外する
正解と解説を見る

正解:B学習のエポックや更新のたびに毎回ランダムに選び直す

毎回異なるニューロンをランダムに除外することで、ネットワークを強制的に変化させます。

この問題の解説ページを開く →

417学習アルゴリズムを使って、誤差関数を最小にするようなパラメータ(重み)の値を探索する手法の総称を何と呼ぶか。

  1. A正則化手法
  2. B最適化手法
  3. C初期化手法
  4. D評価手法
正解と解説を見る

正解:B最適化手法

誤差を最小化するための計算アルゴリズムを総称して最適化手法(オプティマイザ)と呼びます。

この問題の解説ページを開く →

418最適化手法の中でも基本となる、誤差関数の「傾き」を計算して、少しずつ谷底(最小値)へとパラメータを更新していく手法はどれか。

  1. A最小二乗法
  2. B勾配降下法
  3. Cガウス・ニュートン法
  4. Dモンテカルロ法
正解と解説を見る

正解:B勾配降下法

微分により現在の位置の傾き(勾配)を求め、低い方へ向かってパラメータを更新する手法です。

この問題の解説ページを開く →

419勾配降下法を現実世界で例えると、どのような行動に似ているとテキストで表現されているか。

  1. A海の底を潜水艦で進む
  2. B目隠しをして足元の傾きだけを頼りに山を下り谷底を目指す
  3. C飛行機で空高く飛び上がる
  4. D地図を見ながら最短距離の道を歩く
正解と解説を見る

正解:B目隠しをして足元の傾きだけを頼りに山を下り谷底を目指す

全体の地形(誤差関数)は見えないため、現在の地点の傾き情報だけを頼りに最小値を目指します。

この問題の解説ページを開く →

420勾配降下法において、1回の更新でパラメータをどの程度大きく動かすかを調整するための係数を何と呼ぶか。

  1. A学習率
  2. Bエポック数
  3. Cマージン
  4. D閾値
正解と解説を見る

正解:A学習率

式中のαなどで表され、傾きに対してどれだけの幅でパラメータを更新するかを決定します。

この問題の解説ページを開く →

421勾配降下法で学習率が大きすぎる場合、どのような問題が発生するか。

  1. Aパラメータの更新量が小さすぎて計算に時間がかかる
  2. Bメモリが不足してプログラムがクラッシュする
  3. C谷底を飛び越えてしまい、いつまでも最適解に辿り着かない
  4. D即座に学習が完了してしまい過学習になる
正解と解説を見る

正解:C谷底を飛び越えてしまい、いつまでも最適解に辿り着かない

更新幅が大きすぎると、最小値を通り越してしまい学習が収束しなくなります。

この問題の解説ページを開く →

422勾配降下法で学習率が小さすぎる場合、どのような問題が発生するか。

  1. A計算精度が上がりすぎて過学習になる
  2. B谷底を飛び越えて発散する
  3. Cメモリ消費が爆発的に増える
  4. Dパラメータの更新量が小さすぎ、最適解に到達するまでに膨大な時間がかかる
正解と解説を見る

正解:Dパラメータの更新量が小さすぎ、最適解に到達するまでに膨大な時間がかかる

小刻みにしか進まないため、計算回数が増大し学習に時間がかかってしまいます。

この問題の解説ページを開く →

423勾配降下法において、最適なパラメータを求めるために「手持ちの訓練データをすべて使って」1回の更新を行う方式を何と呼ぶか。

  1. A確率的勾配降下法
  2. Bバッチ勾配降下法
  3. Cミニバッチ勾配降下法
  4. Dニュートン法
正解と解説を見る

正解:Bバッチ勾配降下法

すべてのデータを使って全体の誤差を計算してからパラメータを更新するオーソドックスな方式です。

この問題の解説ページを開く →

424バッチ勾配降下法がディープラーニングにおいて持つ決定的な欠点はどれか。

  1. A常に間違った方向にパラメータが更新される
  2. Bデータが少ないと計算できない
  3. C膨大なデータを用いた場合、1回の更新に莫大な計算時間とメモリが必要になる
  4. D必ず過学習を引き起こす
正解と解説を見る

正解:C膨大なデータを用いた場合、1回の更新に莫大な計算時間とメモリが必要になる

大量のデータを一度に処理しなければならないため、メモリや計算コストの面で実用的ではありません。

この問題の解説ページを開く →

425人工知能のプログラム自身がデータから学習する仕組みを指す言葉はどれか。

  1. Aルールベース
  2. Bオントロジー
  3. C機械学習
  4. Dエキスパートシステム
正解と解説を見る

正解:C機械学習

機械自身が大量のデータからパターンを抽出・学習する仕組みを指します。

この問題の解説ページを開く →

426ニューラルネットワークの「入力層」の役割として正しいものはどれか。

  1. A最終的な予測結果を出力する
  2. Bデータを受け取り、ネットワーク内に信号を伝える
  3. C誤差関数を計算する
  4. D全てのデータを削除する
正解と解説を見る

正解:Bデータを受け取り、ネットワーク内に信号を伝える

入力層は外部からのデータ(画像ピクセルなど)を受け取り、後続の層へ伝える入り口です。

この問題の解説ページを開く →

427ディープラーニングは機械学習の一種である。この関係性を表す図において、最も外側にある大きな枠組みの概念はどれか。

  1. A機械学習
  2. B人工知能(AI)
  3. Cディープラーニング
  4. Dニューラルネットワーク
正解と解説を見る

正解:B人工知能(AI)

人工知能の中に機械学習があり、機械学習の手法の一つであるニューラルネットワークの発展形がディープラーニングです。

この問題の解説ページを開く →

428CPUとGPUの役割の違いについて、GPUが得意とする処理はどれか。

  1. A複雑な条件分岐を含む直列処理
  2. Bデータの長期的な保存
  3. C膨大な数の単純な並列演算処理
  4. Dオペレーティングシステムの起動
正解と解説を見る

正解:C膨大な数の単純な並列演算処理

映像処理のために作られたGPUは、同時に大量の単純な計算を行う並列処理に特化しています。

この問題の解説ページを開く →

429CPUとGPUの役割の違いについて、CPUが得意とする処理はどれか。

  1. A単純な行列計算の並列処理
  2. Bディープラーニングのモデル学習
  3. Cコンピュータ全体の制御や複雑な直列処理
  4. Dグラフィックのレンダリング
正解と解説を見る

正解:Cコンピュータ全体の制御や複雑な直列処理

CPUは少数のコアで、複雑で多様なタスクを順番に高速処理するのに適しています。

この問題の解説ページを開く →

430ディープラーニングが普及した2010年代以降、GPUを活用する上で重要となった計算の種類は何か。

  1. Aテンソル(行列やベクトル)による大規模な並列計算
  2. Bテキストファイルの圧縮計算
  3. C音声の録音処理
  4. D単一の足し算
正解と解説を見る

正解:Aテンソル(行列やベクトル)による大規模な並列計算

ニューラルネットワークの学習は、行列やベクトル(テンソル)の掛け算・足し算を膨大に繰り返す計算です。

この問題の解説ページを開く →

431モデルの性能を評価するための「誤差関数」は、別の呼び方で何関数と呼ばれることが多いか。

  1. A活性化関数
  2. B損失関数(Loss Function)
  3. Cシグモイド関数
  4. Dコスト関数
正解と解説を見る

正解:B損失関数(Loss Function)

誤差関数は「損失関数」や「コスト関数」とも呼ばれ、モデルの悪さを表す指標です。

この問題の解説ページを開く →

432交差エントロピー誤差関数の式に含まれる「対数計算」にはどのような利点があるか。

  1. A足し算を掛け算に変換できる
  2. B計算機が扱いやすいように、微分の計算がシンプルになる
  3. C文字列を数値に変換できる
  4. Dデータ量を物理的に減らせる
正解と解説を見る

正解:B計算機が扱いやすいように、微分の計算がシンプルになる

シグモイド関数などと一緒に微分の計算を行う際、対数の性質により計算が非常に簡単になる利点があります。

この問題の解説ページを開く →

433Contrastive Lossを用いるネットワークはどれか。

  1. ASiamese Network
  2. BTriplet Network
  3. CRNN
  4. DGAN
正解と解説を見る

正解:ASiamese Network

2つのデータの類似度を測るSiamese Networkで、距離を縮めたり離したりする学習に用いられます。

この問題の解説ページを開く →

434L1正則化で追加されるペナルティ項は、どのような性質を持っているか。

  1. A全ての重みを均等に小さくする
  2. B重要な重みだけを極端に大きくする
  3. C一部の重みを完全に0にすることで、変数選択の効果をもたらす
  4. Dネットワークの層の数を自動で減らす
正解と解説を見る

正解:C一部の重みを完全に0にすることで、変数選択の効果をもたらす

L1ノルムの性質により、不要な特徴量にかかる重みがゼロになりやすく、スパースなモデルになります。

この問題の解説ページを開く →

435L2正則化で追加されるペナルティ項は、どのような性質を持っているか。

  1. A重みを完全に0にしてしまう
  2. B重みが極端に大きくなるのを防ぎ、全体的に滑らかなモデルにする
  3. C学習率を自動的に下げる
  4. D活性化関数をシグモイド関数に変更する
正解と解説を見る

正解:B重みが極端に大きくなるのを防ぎ、全体的に滑らかなモデルにする

重みの2乗に比例したペナルティを与えるため、突出して大きな重みを持つことを抑制します。

この問題の解説ページを開く →

436ドロップアウトの効果について、誤っている記述はどれか。

  1. A過学習を防ぐ効果がある
  2. Bネットワークの一部をランダムに無効化して学習する
  3. C学習に必要なデータ量が自動的に増える
  4. D複数の異なるネットワークの多数決のようなアンサンブル効果がある
正解と解説を見る

正解:C学習に必要なデータ量が自動的に増える

ドロップアウトはネットワークの構造に対する制約であり、データ量を増やす機能はありません。

この問題の解説ページを開く →

437ドロップアウトが行われるのはニューラルネットワークのどの工程か。

  1. A学習(訓練)のプロセス中
  2. Bデータ収集の段階
  3. C最終的なテストデータの評価時のみ
  4. Dモデルのデプロイ後
正解と解説を見る

正解:A学習(訓練)のプロセス中

学習中にランダムにニューロンを無効化することで過学習を防ぐため、訓練時に適用されます。

この問題の解説ページを開く →

438勾配降下法において、パラメータ更新のたびに計算しなければならないものは何か。

  1. A全てのデータの平均値
  2. B誤差関数における現在のパラメータ地点での「傾き(微分値)」
  3. C新しいハイパーパラメータの値
  4. Dネットワークの層の数
正解と解説を見る

正解:B誤差関数における現在のパラメータ地点での「傾き(微分値)」

誤差関数の傾きを計算し、その傾きが下がる方向へパラメータを微小に動かします。

この問題の解説ページを開く →

439学習率が高すぎる場合の勾配降下法の軌跡を示すグラフはどのような特徴を示すか。

  1. A最小値に向かって一直線に進む
  2. B谷を挟んで左右にジグザグと激しく振動し、収束しない
  3. C最初の一歩で完全に停止する
  4. Dグラフが平坦になる
正解と解説を見る

正解:B谷を挟んで左右にジグザグと激しく振動し、収束しない

谷底を飛び越えてしまうため、右へ左へと大きく振動を繰り返して最小値に到達できません。

この問題の解説ページを開く →

440勾配降下法の目的となる「関数を最小化する」という数学的なアプローチを一般に何と呼ぶか。

  1. A最適化問題
  2. B線形計画法
  3. C因数分解
  4. D確率微分方程式
正解と解説を見る

正解:A最適化問題

与えられた条件下で目的とする関数を最小(または最大)にするパラメータを求める問題です。

この問題の解説ページを開く →

441単純パーセプトロンが1958年に提案された当時、画期的だった点は何か。

  1. A学習によって自ら「重み」を調整し振る舞いを変えられる点
  2. B隠れ層を100層以上持っていた点
  3. C画像生成が可能だった点
  4. DCPUを搭載していた点
正解と解説を見る

正解:A学習によって自ら「重み」を調整し振る舞いを変えられる点

固定されたルールではなく、データに合わせて自動的にパラメータを学習できるニューロンモデルでした。

この問題の解説ページを開く →

442ニューラルネットワークにおいて、人間の脳の「ニューロン」に相当するものを図示する際、通常どのような形で描かれるか。

  1. A四角形
  2. B三角形
  3. C円(丸)
  4. D星型
正解と解説を見る

正解:C円(丸)

各ノード(ニューロン)は通常、円で表現され、それらを矢印でつなぐ形でネットワークを図示します。

この問題の解説ページを開く →

443ディープラーニングの実装において、計算能力の向上だけでなく不可欠だった要素はどれか。

  1. Aアナログコンピュータの普及
  2. Bインターネットの普及による大規模データ(ビッグデータ)の蓄積
  3. Cフロッピーディスクの大容量化
  4. Dエキスパートシステムの完成
正解と解説を見る

正解:Bインターネットの普及による大規模データ(ビッグデータ)の蓄積

大量のパラメータを学習させるためには、インターネットで蓄積された大規模なデータが不可欠でした。

この問題の解説ページを開く →

444ディープラーニングにおいて、データの中から着目すべき「特徴量」は誰(何)が決定するか。

  1. A専門家の人間
  2. Bコンピュータ(モデル自身)
  3. C外部のデータベース
  4. Dクラウドワーカー
正解と解説を見る

正解:Bコンピュータ(モデル自身)

ディープラーニングの最大の特徴は、人間が設計せずともデータの中から有用な特徴量を自ら抽出(学習)できる点にあります。

この問題の解説ページを開く →

445ディープラーニングの学習において現在主流となっている全データを小さなグループに分けて更新を繰り返す手法はどれか。

  1. Aバッチ勾配降下法
  2. Bオンライン学習
  3. Cミニバッチ勾配降下法
  4. Dグリッドサーチ
正解と解説を見る

正解:Cミニバッチ勾配降下法

バッチ学習とオンライン学習の中間的な手法でメモリの制約を回避しつつ効率よく学習します。

この問題の解説ページを開く →

446ミニバッチ学習において全データを分割した1つひとつの小さなデータのかたまりに含まれるデータ数を何と呼ぶか。

  1. Aエポック
  2. Bイテレーション
  3. Cバッチサイズ
  4. D学習率
正解と解説を見る

正解:Cバッチサイズ

数個から数千個程度の適切なサイズに分割して更新計算を行います。

この問題の解説ページを開く →

447ミニバッチ学習において手元にある全訓練データをすべて使い切ってパラメータ更新を一周した状態を表す単位は何か。

  1. Aエポック
  2. Bイテレーション
  3. Cバッチサイズ
  4. Dステップ
正解と解説を見る

正解:Aエポック

全データを一通り学習させると1エポックとなり通常は何十エポックも繰り返して学習します。

この問題の解説ページを開く →

448全データが1000個でバッチサイズが50の場合1エポックあたりのパラメータの更新回数であるイテレーション数は何回になるか。

  1. A10回
  2. B20回
  3. C50回
  4. D1000回
正解と解説を見る

正解:B20回

1000個のデータを50個ずつ処理するため1エポックで20回の更新処理が行われます。

この問題の解説ページを開く →

449勾配降下法において本当の最小値ではないがある範囲の中で局所的に凹んでしまい学習が止まりかける地点を何と呼ぶか。

  1. A局所最適解
  2. B大域最適解
  3. C学習率
  4. D閾値
正解と解説を見る

正解:A局所最適解

ローカルミニマムとも呼ばれここから抜け出して本当の最小値を探すことが重要です。

この問題の解説ページを開く →

450誤差関数全体の中で真に最も値が小さくなっている本当の最小値の地点を何と呼ぶか。

  1. A局所最適解
  2. B大域最適解
  3. C鞍点
  4. Dプラトー
正解と解説を見る

正解:B大域最適解

グローバルミニマムとも呼ばれモデルが目指すべき最終的な最適解です。

この問題の解説ページを開く →

451ある次元から見れば極小であるが別の次元から見ると極大になっており最適化の進行を妨げてしまう地点を何と呼ぶか。

  1. A局所最適解
  2. B大域最適解
  3. C鞍点
  4. Dプラトー
正解と解説を見る

正解:C鞍点

サドルポイントとも呼ばれ勾配がゼロに近くなるため学習が停滞する原因となります。

この問題の解説ページを開く →

452勾配降下法において一度平坦な場所に陥ってしまい学習がなかなか進まなくなる停留状態を何と呼ぶか。

  1. A過学習
  2. Bプラトー
  3. Cアンサンブル
  4. D早期終了
正解と解説を見る

正解:Bプラトー

鞍点付近などで勾配がゼロに近くなりパラメータがほとんど更新されなくなる状態です。

この問題の解説ページを開く →

453過学習を防ぐために検証データに対する誤差が下がらなくなり上がり始めたタイミングで学習を打ち切る手法はどれか。

  1. Aバッチ正規化
  2. B早期終了
  3. Cグリッドサーチ
  4. Dドロップアウト
正解と解説を見る

正解:B早期終了

アーリーストッピングとも呼ばれ無駄な過学習が進む前に最適なタイミングで学習を止めます。

この問題の解説ページを開く →

454過去の勾配の移動量を足し合わせることで物理学における慣性のような振る舞いを持たせ学習を加速させる手法はどれか。

  1. Aモメンタム
  2. BAdaGrad
  3. CRMSprop
  4. DAdam
正解と解説を見る

正解:Aモメンタム

急な谷を転がり落ちるボールのように勢いを利用して局所最適解を抜け出しやすくします。

この問題の解説ページを開く →

455パラメータごとに過去の勾配の大きさを考慮して学習率を自動的に調整する古い最適化手法はどれか。

  1. Aモメンタム
  2. BAdaGrad
  3. CAdaBound
  4. DAdam
正解と解説を見る

正解:BAdaGrad

過去の勾配の2乗を蓄積して学習率を下げていく手法ですが学習が途中で止まる欠点があります。

この問題の解説ページを開く →

456AdaGradの欠点を克服し過去の勾配の情報を指数関数的に減衰させて最新の勾配を重視する手法はどれか。

  1. Aモメンタム
  2. BSGD
  3. CRMSprop
  4. DAdam
正解と解説を見る

正解:CRMSprop

Adadeltaなども同様のアプローチで学習率がゼロになり更新が止まる問題に対処しています。

この問題の解説ページを開く →

457モメンタムの慣性の良さとRMSpropの学習率自動調整の良さを組み合わせた現在非常に人気のある最適化手法はどれか。

  1. AAdaGrad
  2. BAdadelta
  3. CAdam
  4. DAdaBound
正解と解説を見る

正解:CAdam

両者のメリットを取り入れており多くのディープラーニングの実装で標準的に使われています。

この問題の解説ページを開く →

458あらゆる問題において常に他の手法より優れている万能の最適化アルゴリズムは存在しないという定理を何というか。

  1. Aノーフリーランチ定理
  2. Bムーアの法則
  3. Cアムダールの法則
  4. Dピーターの法則
正解と解説を見る

正解:Aノーフリーランチ定理

ある問題に最適な手法が別の問題でも最適とは限らないため様々な手法を試す必要があります。

この問題の解説ページを開く →

459テストデータに対する誤差が増えた後にさらにパラメータを増やすと再び誤差が減っていく近年確認された現象を何というか。

  1. A勾配消失問題
  2. B二重降下現象
  3. C過学習
  4. D未学習
正解と解説を見る

正解:B二重降下現象

ダブルディセント現象と呼ばれパラメータを極端に増やすと再び性能が向上するという現象です。

この問題の解説ページを開く →

460ハイパーパラメータの探索においてあらかじめ試す値の候補を複数指定しすべての組み合わせを網羅的に試す手法はどれか。

  1. Aランダムサーチ
  2. Bベイズ最適化
  3. Cグリッドサーチ
  4. Dモメンタム
正解と解説を見る

正解:Cグリッドサーチ

全ての組み合わせを機械的に処理するため確実ですが計算時間が膨大になるデメリットがあります。

この問題の解説ページを開く →

461指定した範囲の乱数を用いてハイパーパラメータの値をランダムに決定し指定回数だけ試す探索手法を何と呼ぶか。

  1. Aグリッドサーチ
  2. Bランダムサーチ
  3. Cベイズ最適化
  4. Dアンサンブル学習
正解と解説を見る

正解:Bランダムサーチ

グリッドサーチに比べて重要なパラメータに探索を集中しやすく効率的とされる手法です。

この問題の解説ページを開く →

462出力層で生じた誤差を合成関数の微分を用いて入力層に向かって逆向きに伝播させ重みを効率よく更新する手法は何か。

  1. Aランダムフォレスト
  2. B誤差逆伝播法
  3. C主成分分析
  4. D距離学習
正解と解説を見る

正解:B誤差逆伝播法

バックプロパゲーションとも呼ばれディープラーニングの学習において不可欠な計算手法です。

この問題の解説ページを開く →

463誤差逆伝播法において層が深くなるにつれて勾配が掛け合わされるうちにゼロに近づき重みが更新されなくなる問題を何というか。

  1. A過学習
  2. B勾配消失問題
  3. C次元の呪い
  4. D二重降下現象
正解と解説を見る

正解:B勾配消失問題

入力に近い層のニューロンが全く学習されなくなりディープラーニング実現の大きな壁でした。

この問題の解説ページを開く →

464第3次AIブーム以前に多層ネットワークで主に使用されており微分の最大値が小さいため勾配消失問題の大きな原因となっていた関数はどれか。

  1. Aステップ関数
  2. Bシグモイド関数
  3. CReLU関数
  4. D恒等関数
正解と解説を見る

正解:Bシグモイド関数

微分の最大値が0.25であるため何層も掛け合わせると勾配が急速にゼロに近づいてしまいます。

この問題の解説ページを開く →

465シグモイド関数を微分したときの値の最大値はいくつか。

  1. A0.25
  2. B0.5
  3. C1.0
  4. D3.14
正解と解説を見る

正解:A0.25

この微分の最大値が1より著しく小さいため多層ネットワークでは勾配消失問題を引き起こします。

この問題の解説ページを開く →

466出力値の範囲がマイナス1から1であり微分の最大値が1になるためシグモイド関数よりも勾配消失が起きにくい活性化関数はどれか。

  1. Aステップ関数
  2. Bソフトマックス関数
  3. Ctanh関数
  4. DReLU関数
正解と解説を見る

正解:Ctanh関数

ハイパボリックタンジェント関数と呼ばれシグモイド関数を線形変換した性質を持ちます。

この問題の解説ページを開く →

467入力が0以下の場合は0を出力し0より大きい場合は入力値をそのまま出力する勾配消失を防ぐ効果が高い活性化関数はどれか。

  1. Aシグモイド関数
  2. Btanh関数
  3. CReLU関数
  4. Dステップ関数
正解と解説を見る

正解:CReLU関数

現在最も普及している活性化関数で入力がプラスであれば微分値が常に1になります。

この問題の解説ページを開く →

468ReLU関数の大きな特徴でありディープラーニングの多層化において勾配消失問題を防ぐことができる理由はどれか。

  1. A常に出力値が0と1の間に収まるため
  2. B入力が0より大きい場合微分値が常に最大値である1になり勾配が減衰しないため
  3. Cすべての負の値を正の値に変換するため
  4. D指数関数を用いて滑らかな曲線を描くため
正解と解説を見る

正解:B入力が0より大きい場合微分値が常に最大値である1になり勾配が減衰しないため

微分値が1であればいくら掛け合わせても値が小さくならないため深い層まで勾配が届きます。

この問題の解説ページを開く →

469ReLU関数の弱点として入力が0以下の場合に微分値が0になるためニューロンが全く学習しなくなる派生問題の対策として考案された関数はどれか。

  1. Aステップ関数
  2. Bシグモイド関数
  3. CLeaky ReLU
  4. Dソフトマックス関数
正解と解説を見る

正解:CLeaky ReLU

入力が負の領域でもわずかな傾きを持たせることで勾配消失の弱点を補った活性化関数です。

この問題の解説ページを開く →

470Leaky ReLUの発展形として入力が0以下の場合のわずかな傾きの値を学習によって最適な値に調整する活性化関数はどれか。

  1. ARandomized ReLU
  2. BParametric ReLU
  3. Ctanh関数
  4. Dシグモイド関数
正解と解説を見る

正解:BParametric ReLU

負の領域の傾きを固定値にせずパラメータとしてネットワークに自動学習させる手法です。

この問題の解説ページを開く →

471入力が0以下の場合の傾きの値を学習のたびにランダムに変化させることでアンサンブル学習のような効果を狙う活性化関数はどれか。

  1. AParametric ReLU
  2. BLeaky ReLU
  3. CRandomized ReLU
  4. Dソフトマックス関数
正解と解説を見る

正解:CRandomized ReLU

学習ステップごとに負の領域の傾きをランダムに変動させ汎化性能の向上を目指す手法です。

この問題の解説ページを開く →
G検定の全分野一覧へ戻る