【G検定過去問風テスト】データの来歴(データリネージ)とは?意味や重要性を解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

AIの学習や推論に用いられたデータが「いつ・どこで・だれによって収集され、どのように加工・変換されてモデルに投入されたか」という一連の履歴・軌跡を指す言葉として、最も適切な選択肢を1つ選べ。

  • A)スケーリング則
  • B)ゼロショットラーニング
  • C)データの来歴(データリネージ)
  • D)量子化
🔍 ここをクリックして正解を見る
  • 正解: C)データの来歴(データリネージ)

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 「データの来歴(Data Lineage)」とは、データの収集から加工・利用までの全履歴を指す。
  • 著作権の証明やバイアス(偏り)の原因追及、監査可能性(Auditability)の確保において極めて重要な役割を持つ。

■ 初学者向け解説(例え話や背景)

高級レストランで提供される料理の「産地直送の食材リストや、だれが調理したかの履歴」がしっかりしていると安心できますよね。AIのデータも同じで、どんなデータを使って学習したのかという履歴(来歴)が不明確だと、著作権違反の混入や、予期せぬ偏り(バイアス)が見つかったときに原因を追えなくなってしまいます。そのため、データの足跡をたどれるようにすることが求められます。


■ 選択肢の解説

  • A) スケーリング則(×): 大規模なデータセットと計算資源を用いることでモデルの性能が向上するという法則のことです。
  • B) ゼロショットラーニング(×): 新しいクラスのデータに対して、事前の学習なしに識別を行う機械学習の手法です。
  • C) データの来歴(データリネージ)(○): データがいつ・どこで収集され、どう加工されたかという一連の履歴や軌跡を指します。
  • D) 量子化(×): エッジデバイス等でモデルを動かすため、モデルの重みを少ないバイト数で表現するプロセスです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?