④ データ加工・DB・BI

データサイエンティスト検定リテラシーレベル158

問題

プログラムで乱数を用いたランダムサンプリングを行う際の特徴として適切な記述はどれか。

A抽出間隔をあらかじめ固定して等間隔でデータを取得する手法である
Bシードを固定すれば再現可能な乱数系列を用いて対象を抽出する✓ 正解
C母集団の属性割合が標本にも完全に一致するように意図して抽出を行う
Dデータの並び順に依存して最初のデータから順次一定数を抽出する手法である

正解

Bシードを固定すれば再現可能な乱数系列を用いて対象を抽出する

解説

ランダムサンプリングは乱数を用いて抽出します。乱数はシードを基に生成されるため、シードを固定すると同じ抽出結果を再現できます。

分野解説:④ データ加工・DB・BI

データを扱うための実務スキルを学ぶ分野です。SQLによるデータ抽出(LIKE演算子や条件指定など)、正規表現によるパターン処理、HadoopのHDFSやSparkといった分散処理技術、NoSQLデータストア、クラウドのオブジェクトストレージ、BIツールによる可視化などが問われます。分析の前段となるデータの取得・加工・蓄積を横断的に扱う分野なので、各技術が「どんなデータをどう処理するのに向くか」を整理しながら学ぶと定着します。

この分野の問題をすべて見る →

本番形式で問題を解いてみよう

クイズモードで挑戦 →
← 第157159問 →

データサイエンティスト検定リテラシーレベルについて

DS検定リテラシーレベルの基礎を固める

主催一般社団法人 データサイエンティスト協会
出題形式100問(CBT方式)
試験時間100分
受験料11,000円(税込)※学生5,500円
合格基準合格基準は公式サイトで要確認
難易度★★★☆☆
試験詳細を見る →
← 問題一覧へ戻る