データサイエンティスト検定リテラシーレベル ③ 機械学習・ディープラーニング

機械学習と深層学習の代表的な手法を学ぶ分野です。教師あり・教師なし学習の区別、ランダムフォレストや勾配ブースティングなどのアンサンブル学習、過学習と汎化性能、連合学習・転移学習といった学習パラダイム、そしてニューラルネットワークの基礎までが問われます。手法ごとに「何を得意とし、どんな課題があるか」を対比して押さえることが重要です。用語の丸暗記ではなく、各モデルの仕組みと使いどころを理解すると応用問題にも対応できます。

この分野の問題45問を、選択肢・正解・解説つきで掲載しています。まず自分で解答を考えてから「正解と解説を見る」を開いて答え合わせをしてください。

クイズモードで挑戦 →

101汎化性能を向上させるために複数のモデルを組み合わせる手法を何と呼ぶか。

  1. Aアンサンブル学習
  2. Bディープラーニング
  3. Cサポートベクターマシン
  4. Dクラスタリング
正解と解説を見る

正解:Aアンサンブル学習

複数のモデルを組み合わせることで汎化性能を向上させる手法をアンサンブル学習と呼びます。

この問題の解説ページを開く →

102データの一部と特徴量をサンプリングしたデータでそれぞれ決定木を学習し、その多数決や平均を予測値とするモデルはどれか。

  1. Aロジスティック回帰
  2. Bランダムフォレスト
  3. Ck-means法
  4. Dサポートベクターマシン
正解と解説を見る

正解:Bランダムフォレスト

ランダムフォレストはデータと特徴量をサンプリングして複数の決定木を学習させ、その結果を統合するモデルです。

この問題の解説ページを開く →

103勾配ブースティングなどの決定木ベースのモデルにおいて、木の深さ(max_depth)を極端に大きな値に設定した場合に発生しやすい問題はどれか。

  1. A勾配消失
  2. Bデータ欠損
  3. C過学習
  4. D次元の呪い
正解と解説を見る

正解:C過学習

木の深さを深くすると分割ルールが増えすぎ、訓練データに過度に適合する過学習を起こしやすくなります。

この問題の解説ページを開く →

104生データを共有せず、各拠点やデバイスで構築したモデルのパラメータのみを集約して一つのモデルに統合する学習手法はどれか。

  1. A強化学習
  2. B転移学習
  3. C能動学習
  4. D連合学習
正解と解説を見る

正解:D連合学習

連合学習はプライバシー保護の観点などからデータ自体を共有せず、モデルのパラメータを共有して学習する手法です。

この問題の解説ページを開く →

105モデルの予測性能を改善するためのアプローチに関する記述として、最も適切なものはどれか。

  1. A高度なモデル手法の採用が常に最優先される
  2. Bデータを増やしたり質を見直す方が効果的な場合が多い
  3. Cデータクレンジングに限界はないため全て自動化すべきである
  4. D初学者はデータ収集よりもパラメータ調整のみに注力すべきである
正解と解説を見る

正解:Bデータを増やしたり質を見直す方が効果的な場合が多い

モデルの構築手法を工夫するよりも、データを増やしたりデータの質を見直したりする方が効果的である場面が多くあります。

この問題の解説ページを開く →

106深層学習(ディープラーニング)のメリットとして適切なものはどれか。

  1. A特徴量を人間が手動で定義する必要がある
  2. B少量のデータでも高い精度を出すことができる
  3. Cモデルが大量の訓練データから特徴量を自動的に抽出する
  4. D学習済みモデルの別タスクへの再利用は不可能である
正解と解説を見る

正解:Cモデルが大量の訓練データから特徴量を自動的に抽出する

深層学習は、人間が特徴量を定義することなく、大量の訓練データからモデルが特徴量を自動的に抽出できる点がメリットです。

この問題の解説ページを開く →

107データサイエンスにおいて、画像、音声、テキストといったデータの種類の違いを指す用語はどれか。

  1. Aモダリティ
  2. Bクラスタ
  3. Cカテゴリ
  4. Dプロトコル
正解と解説を見る

正解:Aモダリティ

分析上、単純に併せることができず、異なった取り扱いをする必要のあるデータの違いをモダリティと呼びます。

この問題の解説ページを開く →

108時系列データにおいて、長期間にわたる持続的な上昇や下降の変化傾向を何と呼ぶか。

  1. Aノイズ
  2. B季節成分
  3. C周期性
  4. Dトレンド
正解と解説を見る

正解:Dトレンド

時間経過に伴う長期的な変化傾向のことはトレンド(傾向変動)と呼ばれます。

この問題の解説ページを開く →

1091年や四半期など、一定の間隔で繰り返される時系列データの変動要因を何と呼ぶか。

  1. A季節成分
  2. Bノイズ成分
  3. C不規則変動
  4. D短期的変動
正解と解説を見る

正解:A季節成分

月や四半期など一定の間隔で繰り返される変動を季節変動(季節成分)と呼びます。

この問題の解説ページを開く →

110教師なし学習に分類される分析手法はどれか。

  1. Aロジスティック回帰
  2. Bランダムフォレスト
  3. C階層クラスタリング
  4. Dサポートベクターマシン
正解と解説を見る

正解:C階層クラスタリング

階層クラスタリングは事前に正解データを与えずにデータをグループ分けする教師なし学習の一種です。

この問題の解説ページを開く →

111未知の画像を「猫」か「犬」かに分類するモデルを構築する際、正解ラベル付きデータを用いて学習させる手法はどれか。

  1. A教師なし学習
  2. B教師あり学習
  3. C強化学習
  4. Dクラスタリング
正解と解説を見る

正解:B教師あり学習

正解となる出力値(ラベル)が含まれた訓練データを用いて学習させる手法は教師あり学習と呼ばれます。

この問題の解説ページを開く →

112階層クラスター分析において、データがどのようにグループ化されていくかを距離に基づいて表した樹形図を何と呼ぶか。

  1. Aヒストグラム
  2. Bヒートマップ
  3. C散布図行列
  4. Dデンドログラム
正解と解説を見る

正解:Dデンドログラム

距離が小さいものから順にまとめていく過程を表した樹形図をデンドログラムと呼びます。

この問題の解説ページを開く →

113k-means法に関する記述として、最も適切なものはどれか。

  1. A事前にクラスター数を指定する必要がない
  2. Bデータ間のすべての距離を測定するため計算量が非常に多い
  3. C初期値としてランダムに設定される重心によって結果が異なることがある
  4. D樹形図を出力して最適なクラスター数を判断することができる
正解と解説を見る

正解:C初期値としてランダムに設定される重心によって結果が異なることがある

k-means法は初期値依存性があるため、初期値やクラスター数を変えて複数回分析するのが一般的です。

この問題の解説ページを開く →

114ネットワーク分析において、ものや人を表す点(頂点)を何と呼ぶか。

  1. Aエッジ
  2. Bノード
  3. Cクラス
  4. Dウェイト
正解と解説を見る

正解:Bノード

ネットワークグラフにおいて、対象そのものを表す点はノード(頂点)、関係性を表す線はエッジ(辺)と呼ばれます。

この問題の解説ページを開く →

115ネットワーク分析において、ノードに接続しているエッジの数を表す用語はどれか。

  1. A次数
  2. B重み
  3. C距離
  4. D階層
正解と解説を見る

正解:A次数

ノードに接続するエッジの数のことを次数と呼び、重要なノードを探る指標として利用されます。

この問題の解説ページを開く →

116ユーザーが過去に高く評価したアイテムの属性(ジャンルや監督など)に類似した別のアイテムを推薦するアルゴリズムはどれか。

  1. A協調フィルタリング
  2. Bバスケット分析
  3. Cネットワーク分析
  4. Dコンテンツベースフィルタリング
正解と解説を見る

正解:Dコンテンツベースフィルタリング

アイテム自体の特性に焦点を当て、過去に好んだアイテムと似た特徴を持つものを推薦する手法です。

この問題の解説ページを開く →

117「ユーザーAがアイテムXを好むなら、アイテムXを好む別のユーザーBが高評価したアイテムYも好むだろう」という仮定に基づく推薦アルゴリズムはどれか。

  1. Aコンテンツベースフィルタリング
  2. Bルールベースフィルタリング
  3. C協調フィルタリング
  4. Dデンドログラム分析
正解と解説を見る

正解:C協調フィルタリング

ユーザー間やアイテム間の関係性に基づく推薦手法を協調フィルタリングと呼びます。

この問題の解説ページを開く →

118自然言語処理の前処理において、単語の語形変化(時制など)を取り除き、表記を統一する処理を何と呼ぶか。

  1. Aステミング
  2. B半角変換
  3. Cパディング
  4. D正規化
正解と解説を見る

正解:Aステミング

時制などによる単語の一部の変化をなくし、基本形に統一する処理をステミングと呼びます。

この問題の解説ページを開く →

119日本語の文章を「意味のある最小の塊」に分割し、それぞれの品詞を判別する処理を何と呼ぶか。

  1. A係り受け解析
  2. B形態素解析
  3. C構文解析
  4. D意味解析
正解と解説を見る

正解:B形態素解析

文章を形態素(意味のある最小の塊)に分割し、品詞を把握する作業を形態素解析といいます。

この問題の解説ページを開く →

120テキストから人名、組織名、地域名などの特定の情報を機械的に抽出するタスクを何と呼ぶか。

  1. A感情分析
  2. B機械翻訳
  3. C文書要約
  4. D固有表現抽出
正解と解説を見る

正解:D固有表現抽出

文章中から人名や組織名などの特定の表現を抽出するタスクは固有表現抽出と呼ばれます。

この問題の解説ページを開く →

121画像のデジタル表現において、画像を等間隔の格子状の点(ピクセル)に分割するプロセスを何と呼ぶか。

  1. A正規化
  2. B量子化
  3. C標本化
  4. D標準化
正解と解説を見る

正解:C標本化

画像を細かい区画に分割してデジタル化する最初のプロセスを標本化(サンプリング)と呼びます。

この問題の解説ページを開く →

122画像データの前処理において、画像の縦横比を保ったまま特定のサイズに収まるように拡大・縮小する処理はどれか。

  1. Aリサイズ
  2. Bパディング
  3. Cトリミング
  4. Dスケーリング
正解と解説を見る

正解:Aリサイズ

画像サイズを変更する処理をリサイズと呼び、アスペクト比を保つかどうかが重要な観点となります。

この問題の解説ページを開く →

123画像内の物体が「どの位置にあるか」を四角い枠で囲んで特定し、その物体が何であるかを分類するタスクはどれか。

  1. A画像分類
  2. B物体検出
  3. Cセマンティックセグメンテーション
  4. Dインスタンスセグメンテーション
正解と解説を見る

正解:B物体検出

画像中の物体の位置と範囲をバウンディングボックスで特定し分類するタスクは物体検出と呼ばれます。

この問題の解説ページを開く →

124画像の1ピクセルごとにどのクラスに属するかを予測し、重なり合う同一クラスの物体を個別に区別しないタスクはどれか。

  1. A画像分類
  2. B物体検出
  3. Cインスタンスセグメンテーション
  4. Dセマンティックセグメンテーション
正解と解説を見る

正解:Dセマンティックセグメンテーション

ピクセル単位でクラス分類を行うが、同一クラスの個体を区別しないのはセマンティックセグメンテーションです。

この問題の解説ページを開く →

125動画データにおいて、1秒間に表示される画像の枚数を表す単位はどれか。

  1. Abps
  2. Bfps
  3. Cdpi
  4. DHz
正解と解説を見る

正解:Bfps

1秒間に表示するフレーム数はフレームレートと呼ばれ、単位はfps(frame per second)が使われます。

この問題の解説ページを開く →

126人間の可聴領域に着目し、聞こえない音の情報を削ることでデータ量を圧縮する音声フォーマットはどれか。

  1. AMP3
  2. BWAV
  3. CAVI
  4. DCSV
正解と解説を見る

正解:AMP3

MP3は人間の耳に聞こえにくい音域のデータをカットすることでファイルサイズを圧縮する音声フォーマットです。

この問題の解説ページを開く →

127大規模言語モデル(LLM)において、事実とは異なる内容や関連性の低い情報をまるで事実であるかのように生成してしまう現象を何と呼ぶか。

  1. Aオーバーフィッティング
  2. Bアンダーフィッティング
  3. Cハルシネーション
  4. D勾配消失
正解と解説を見る

正解:Cハルシネーション

事実と異なる内容やもっともらしい嘘を生成してしまう現象はハルシネーション(幻覚)と呼ばれます。

この問題の解説ページを開く →

128政府や自治体が公開しており、営利目的・非営利目的を問わず無償かつ機械判読可能な形で二次利用できるデータを何と呼ぶか。

  1. Aビッグデータ
  2. Bトランザクションデータ
  3. Cプライベートデータ
  4. Dオープンデータ
正解と解説を見る

正解:Dオープンデータ

国や自治体が公開し、誰もが容易に加工や再配布できるデータをオープンデータと呼びます。

この問題の解説ページを開く →

129システムの高可用性を高めるため、予備のサーバーを常に稼働状態にして本番機と同期させ、障害時に即座に切り替える構成はどれか。

  1. Aコールドスタンバイ
  2. Bウォームスタンバイ
  3. Cホットスタンバイ
  4. Dロードバランシング
正解と解説を見る

正解:Cホットスタンバイ

本番機と同期させながら常に稼働させておき、即座に切り替えられる構成をホットスタンバイと呼びます。

この問題の解説ページを開く →

130データベースのバックアップにおいて、前回のバックアップ以降に変更された部分のみを保存し、バックアップ時間は短いが復元に手間がかかる手法はどれか。

  1. A増分バックアップ
  2. B差分バックアップ
  3. Cフルバックアップ
  4. Dスナップショット
正解と解説を見る

正解:A増分バックアップ

前回のバックアップから変更されたデータだけをバックアップする手法を増分バックアップと呼びます。

この問題の解説ページを開く →

131ソースコードを一切記述することなく、用意されたパーツを組み合わせてソフトウェアを開発できるツールを何と呼ぶか。

  1. Aローコードツール
  2. Bノーコードツール
  3. Cコンパイラ
  4. Dフレームワーク
正解と解説を見る

正解:Bノーコードツール

プログラミングの知識がなくても画面上の操作のみで開発できるツールをノーコードツールと呼びます。

この問題の解説ページを開く →

132ホストOS上のカーネルを共有しつつプロセスを隔離することで、軽量で高速に仮想環境を構築できる技術の代表例はどれか。

  1. ASpark
  2. BVMware
  3. CHadoop
  4. DDocker
正解と解説を見る

正解:DDocker

Dockerはコンテナ型仮想化技術の代表的なソフトウェアであり、分析環境の構築にもよく利用されます。

この問題の解説ページを開く →

133クラウド事業者がインフラ構築からソフトウェアの運用管理までを一体として提供し、ユーザーが環境構築の手間なく利用できるサービス形態を何と呼ぶか。

  1. Aオンプレミス
  2. Bマネージドサービス
  3. Cオープンソース
  4. Dベアメタル
正解と解説を見る

正解:Bマネージドサービス

インフラ管理を含めて提供され、すぐに利用開始できるサービスをマネージドサービスと呼びます。

この問題の解説ページを開く →

134ソフトウェア開発において、特定のプラットフォーム向けの機能を利用するためのプログラムやAPI、説明書などを一式まとめた開発キットを何と呼ぶか。

  1. ASDK
  2. BGUI
  3. CIDE
  4. DSQL
正解と解説を見る

正解:ASDK

Software Development Kit(SDK)は、ソフトウェア開発に必要なツールをまとめたパッケージのことです。

この問題の解説ページを開く →

135Webページからのデータ収集に関して、アクセス時の状況にかかわらず常に同じHTMLファイルが返却されるコンテンツを何と呼ぶか。

  1. A動的コンテンツ
  2. Bリッチコンテンツ
  3. C静的コンテンツ
  4. Dストリーミングコンテンツ
正解と解説を見る

正解:C静的コンテンツ

誰がいつアクセスしても同じ内容が表示されるWebページを静的コンテンツと呼びます。

この問題の解説ページを開く →

136WebブラウザとWebサーバーの間で通信内容を暗号化し、盗聴や改ざんを防止するために使用される通信プロトコルはどれか。

  1. AHTTP
  2. BFTP
  3. CTelnet
  4. DHTTPS
正解と解説を見る

正解:DHTTPS

HTTPの通信をSSL/TLSで暗号化したプロトコルがHTTPSです。

この問題の解説ページを開く →

137特定のルールやフォーマット(行と列など)に従って記録され、リレーショナルデータベースなどで管理しやすいデータはどれか。

  1. A非構造化データ
  2. B構造化データ
  3. C画像データ
  4. D音声データ
正解と解説を見る

正解:B構造化データ

一定のフォーマットに従い、表形式などで整理されたデータを構造化データと呼びます。

この問題の解説ページを開く →

138データベース設計において、エンティティ間の関係性(「1対多」など)を可視化するために用いられる図を何と呼ぶか。

  1. Aデンドログラム
  2. Bフローチャート
  3. CER図
  4. Dユースケース図
正解と解説を見る

正解:CER図

実体(エンティティ)とその関連性を表現するデータモデリングの手法がER図です。

この問題の解説ページを開く →

139データベースの正規化において、繰り返し項目を排除し、レコード単位でデータを扱えるようにする処理を何と呼ぶか。

  1. A第一正規化
  2. B第二正規化
  3. C第三正規化
  4. D非正規化
正解と解説を見る

正解:A第一正規化

繰り返し項目を別項目として切り出し、テーブルの基本要件を満たす状態にすることを第一正規化と呼びます。

この問題の解説ページを開く →

140データ分析基盤において、行単位での更新処理よりも、特定の列を対象とした大量データの集計や抽出に特化したデータベースのアーキテクチャはどれか。

  1. A行指向型DB
  2. Bグラフ指向DB
  3. Cドキュメント指向DB
  4. Dカラム指向型DB
正解と解説を見る

正解:Dカラム指向型DB

列(カラム)単位でデータを保持し、集計処理を高速に行えるのがカラム指向型DBです。

この問題の解説ページを開く →

141大規模なデータを複数のコンピュータに分散して並列処理する技術であり、メモリ上で処理を行うことで高速化を実現しているフレームワークはどれか。

  1. AHadoop
  2. BSpark
  3. CMySQL
  4. DDocker
正解と解説を見る

正解:BSpark

SparkはHadoopと異なりメモリ上で分散処理を行うため、反復的な処理に強いという特徴があります。

この問題の解説ページを開く →

142一般的なリレーショナルデータベース(RDBMS)とは異なり、固定されたテーブル構造を持たず、大量のデータを分散処理することに長けたデータベースの総称はどれか。

  1. ANoSQL
  2. BDWH
  3. CAPI
  4. DSDK
正解と解説を見る

正解:ANoSQL

SQLを使わずに操作することが多く、スケーラビリティに優れたデータベース群をNoSQLと総称します。

この問題の解説ページを開く →

143動画データを保存・再生する際に、映像や音声のデータを圧縮(エンコード)したり復元(デコード)したりするソフトウェアやアルゴリズムを何と呼ぶか。

  1. AAPI
  2. Bプロトコル
  3. Cコーデック
  4. Dクローラー
正解と解説を見る

正解:Cコーデック

動画や音声の圧縮・伸張を行うプログラムをコーデックと呼びます。

この問題の解説ページを開く →

144深層学習モデルが学習に用いたデータセットに含まれる情報の偏りによって、特定の職業と性別を強く結びつけてしまうような現象の原因となるものはどれか。

  1. A勾配消失
  2. B過学習
  3. C次元の呪い
  4. Dデータのバイアス
正解と解説を見る

正解:Dデータのバイアス

訓練データに含まれる社会的・統計的な偏り(バイアス)は、モデルの出力に不適切な影響を与える原因となります。

この問題の解説ページを開く →

145データベースから抽出したデータをExcelで読み込む際の注意点として、最も適切なものはどれか。

  1. A元のデータベースが更新されればExcel上のデータも自動的に更新される
  2. B文字列として入力したデータが意図せず数式や数値として自動変換されることがある
  3. C読み込める行数に制限はなく、数億行のデータでも問題なく処理できる
  4. DCSV形式でエクスポートした場合、データ内のカンマによって列が分割されることはない
正解と解説を見る

正解:B文字列として入力したデータが意図せず数式や数値として自動変換されることがある

Excelでは自動的にデータ型が認識されるため、「-XXXX」などが数式として誤認されるなどの注意が必要です。

この問題の解説ページを開く →
データサイエンティスト検定リテラシーレベルの全分野一覧へ戻る