【G検定対策】AIに必要な数理・統計知識を完全攻略!確率分布から仮説検定まで

※本記事では、アフィリエイトプログラムより教材を紹介しています。
【重要度】★★★
「数学や統計の単語を見ただけで拒絶反応が…」「正規分布や帰無仮説ってAIとどう関係あるの?」とお悩みではありませんか?
AIや機械学習のアルゴリズムは、一見複雑そうに見えますが、本質は「データの平均やバラつき、関係性を計算して予測する仕組み」にすぎません。
この記事では、G検定で登場する「数理・統計知識」の最重要29キーワードを、難しい数式を使わず直感的な例え話と比較表でわかりやすく解説します。
1. AIに必要な数理・統計知識とは?分かりやすい例え話で解説
AI開発における統計知識は、「学校のクラス全体の体力測定結果を分析する作業」に例えると非常に理解しやすくなります。
- 基本統計量(平均・分散など):クラスの反復横跳びの「平均回数」や、「みんなの記録がどれくらいバラついているか」を把握することです。
- 確率分布(正規分布・二項分布など):「クラス全体の記録がどのようなカタチ(山型など)で分布しているか」というパターンのことです。
- 相関と距離(相関係数・コサイン類似度など):「身長が高い人ほど跳べる回数が多いか」という関係性や、「A君とB君の運動能力タイプがどれくらい似ているか」を測ることです。
- 仮説検定(帰無仮説・対立仮説):「新トレを導入した結果、平均記録が伸びたのは『たまたま』か『本当に効果があったのか』」を厳密に判定することです。
AIは、こうした統計的な計算を人間には不可能なスピードで何億回も繰り返し実行することで、データの傾向やルールを発見しています。
2. 試験に出る!最重要キーワードの解説と覚え方
① データの基本統計量と分布(記述統計)
平均(Mean)・中央値(Median)・最頻値(Mode)
データを代表する値(代表値)です。
- 平均:すべてのデータの合計を個数で割った値。極端な値(外れ値)に強く影響を受けます。
- 中央値:データを大きさ順に並べたときに、ちょうど真ん中にくる値。外れ値の影響を受けにくいのが特徴です。
- 最頻値:データの中で最も多く出現する値。
度数分布(Frequency Distribution)・外れ値(Outlier)
- 度数分布:データをいくつかの区間(階級)に分け、それぞれの区間に属するデータの数(度数)を整理した表やグラフ(ヒストグラム)です。
- 外れ値:他のデータから極端に離れた値のことです。平均値を大きくゆがませるため、データ前処理で除外や補正を行います。
分散(Variance)・標準偏差(Standard Deviation)
データの「バラつき具合」を表す指標です。
- 分散:各データと平均値との差(偏差)を2乗して平均した値。
- 標準偏差:分散の平方根(ルート)をとった値。元データと同じ単位でバラつきを直感的に表せます。
移動平均(Moving Average)
時系列データにおいて、一定期間ごとの平均値をズラしながら計算していく手法です。
日々の細かい変動(ノイズ)を取り除き、全体的な「トレンド(傾向)」を把握するのに役立ちます。
② 確率と確率分布
確率変数(Random Variable)・確率密度(Probability Density)
- 確率変数:サイコロの出目のように、とる値によって確率が決まる変数のことです。
- 確率密度:連続的な値(身長や体重など)をとる確率変数において、特定の値の近辺にデータがどれくらい集まっているかを表す密度のことです。
期待値(Expected Value)・条件付き確率(Conditional Probability)
- 期待値:確率変数がとる値の「平均的に見込まれる値」のことです。
- 条件付き確率:「イベントAが起きたという条件のもとで、イベントBが起きる確率」のことです(例:雨が降っている日に傘が売れる確率)。
ベルヌーイ分布・二項分布・ポアソン分布・正規分布
G検定で超頻出の4大確率分布です。
- ベルヌーイ分布:「コインの裏表」のように、結果が2パターン(成功/失敗、0/1)しかない試行を1回行ったときの分布です。
- 二項分布:ベルヌーイ試行をN回繰り返したとき、成功する回数が従う分布です(例:コインを10回投げて表が3回出る確率)。
- ポアソン分布:「滅多に起きないイベントが、特定の期間内に何回起きるか」を表す分布です(例:1時間あたりに来店する客数、1年間の交通事故件数)。
- 正規分布(ガウス分布):自然界や社会現象で最もよく見られる、平均値を中心に左右対称の吊り鐘型(ベル型)をした連続確率分布です。
③ 変数間の関係性と相関
共分散(Covariance)・相関係数(Correlation Coefficient)
2つの変数の関係性を表す指標です。
- 共分散:2つの変数が一緒に増減する傾向を表しますが、データの単位によって値の大きさが変わってしまう欠点があります。
- 相関係数:共分散を標準化し、-1 から +1 の範囲に収めた指標です。+1に近いと正の相関、-1に近いと負の相関、0だと相関なしを意味します。
偏相関係数(Partial Correlation Coefficient)・疑似相関(Spurious Correlation)
- 疑似相関:2つの変数間に実際には因果関係がないのに、第3の変数(潜伏変数)の影響で相関があるように見えてしまう現象です(例:「アイスの売上」と「水難事故数」の相関 ➔ 原因は「気温」)。
- 偏相関係数:第3の変数の影響を取り除いたうえで、純粋な2変数間の相関を計算した値です。
相互情報量(Mutual Information)
一方の変数を知ることで、もう一方の変数に関する曖昧さ(情報量)がどれくらい減るかを表す指標です。
線形な関係だけでなく、複雑な非線形関係の強さも捉えられるため、特徴量選択などで活用されます。
④ 統計的推定・仮説検定と最適化
最小二乗法(OLS)・最尤法(MLE)
モデルのパラメータを決定する(学習させる)ための代表的な手法です。
- 最小二乗法:実際のデータとモデルの予測値との「誤差の2乗和」が最小になるようにパラメータを決める手法(回帰分析で多用)。
- 最尤法:手元にあるデータが得られる「確率(尤度:ゆうど)」が最も高くなるようにパラメータを決める手法。
帰無仮説(Null Hypothesis)・対立仮説(Alternative Hypothesis)
統計的仮説検定で使われる対となる仮説です。
- 帰無仮説(H0):「差がない」「効果がない」とする仮説(否定されることを前提に立てる仮説)。
- 対立仮説(H1):「差がある」「効果がある」と主張したい本来の仮説。
- 判定の流れ:データを分析して帰無仮説が起こる確率が極めて低い(P値が有意水準未満)場合、帰無仮説を「棄却(捨て)」して、対立仮説を採択します。
⑤ データの距離と類似度の尺度
ユークリッド距離(Euclidean Distance)
2点間の「直線距離」を測る、最も一般的な距離計算方法です。
ピタゴラスの定理と同じ考え方で計算されます。
コサイン類似度(Cosine Similarity)
2つのベクトルが向いている「角度」の近さで類似度を測る指標です。
値は -1 から +1(正の範囲では 0 から 1)をとり、データ(ベクトル)の「大きさ(長さ)」の影響を受けないため、自然言語処理(文章の類似度判定)で非常によく使われます。
マハラノビス距離(Mahalanobis Distance)
データの「バラつき(分散や共分散)」を考慮した距離です。
変数間の相関を考慮して距離を測るため、異常検知(外れ値検出)の分野で威力を発揮します。
3. 【要点整理】統計指標と確率分布・距離の比較表
4大確率分布のまとめ
| 確率分布名 | データの種類 | 特徴・キーワード | 具体例 |
|---|---|---|---|
| ベルヌーイ分布 | 離散型 | 1回の試行、結果は2通り | コイン投げ1回(表/裏) |
| 二項分布 | 離散型 | ベルヌーイ試行をN回反復 | コインを10回投げて表が出る回数 |
| ポアソン分布 | 離散型 | めったに起きないイベントの発生回数 | 1時間の問合せ件数、交通事故数 |
| 正規分布 | 連続型 | 左右対称のベル型、自然界に多出 | 人の身長、試験の点数分布 |
代表的な3つの距離・類似度
| 尺度名 | 特徴 | 主な用途・適したタスク |
|---|---|---|
| ユークリッド距離 | 単純な直線距離 | 一般的なクラスタリング(k-meansなど) |
| コサイン類似度 | ベクトルの向き(角度)を評価 | 自然言語処理、文章や単語の類似度 |
| マハラノビス距離 | データの分散・相関を考慮 | 異常検知、多次元データの外れ値判定 |
4. G検定の「ひっかけ問題パターン」を総チェック!
【問題1】
相関係数が「+0.95」と非常に高い値を示したため、変数Aが増加したことが原因となって変数Bが増加したという明確な因果関係が証明された。
× バツ!
【解説】 「相関関係」と「因果関係」は別物です!相関が高くても、単に同じ傾向で動いているだけ(または第3の変数による疑似相関)である可能性があり、相関係数だけで因果関係を結論付けることはできません。
【問題2】
統計的仮説検定において、帰無仮説が正しい確率が有意水準(例:5%)を上回った場合、帰無仮説が正しいことが数学的に証明されたと結論付ける。
× バツ!
【解説】 帰無仮説が棄却されなかった場合、「帰無仮説が正しいと証明された」のではなく、「帰無仮説を捨てるほどの証拠が得られなかった(判断を保留する)」状態を意味します。ここが試験で最も狙われるひっかけです!
【問題3】
自然言語処理における単語や文章のベクトル類似度を計算する際、テキストの長さに左右されないよう、常にユークリッド距離を用いるのが最も適切である。
× バツ!
【解説】 テキストの長さに左右されない尺度はコサイン類似度です!ユークリッド距離はベクトルの長さ(単語数や出現頻度の絶対量)の影響を強く受けてしまうため、文章比較には向きません。
🔥 まとめ:数式の丸暗記ではなく「意味と使い分け」を押さえよう!
G検定における数理・統計問題は、複雑な手計算をさせられることはほとんどありません。
- 各統計量や確率分布が「どんな場面で使われるか」
- 相関と因果、疑似相関の違い
- 帰無仮説と対立仮説の検定ロジック
- ユークリッド距離とコサイン類似度の使い分け
この「意味と概念の使い分け」を頭に入れておけば、文系出身者でも統計問題で確実に満点を狙えます!自信を持って問題集に進みましょう!
【大人気💡】過去問風ミニテスト&関連テキスト
[AIに必要な数理・統計知識]はバッチリ理解できましたか?
知識を確実に定着させて一発合格を引き寄せるために、今のあなたに最適なステップを選んで進んでみましょう!
合格率をグッと上げる!「過去問風ミニテスト」に挑戦
解説を読んだら、さっそく問題に挑戦して実力を確かめてみましょう!
ボタンをクリックするとミニテストのページが開きます。
🚀 最短ルートで合格を目指す!「厳選参考書」参考書をチョイス
G検定合格へのロードマップは、この一冊を机に置くことから始まります。まずは目次だけでもチェックしてみてください。
知識を『覚えたつもり』で終わらせない。この1冊を解き終える頃には、合格ライン突破に確実に近づきます。
