【G検定対策】教師なし学習を完全攻略!クラスタリングと次元削減の超分かりやすい覚え方

※本記事では、アフィリエイトプログラムより教材を紹介しています。

【重要度】★★★

「教師あり学習は『正解』があるから分かりやすかったけど、教師なし学習って一体何を目指しているの?」
「k-means法、主成分分析(PCA)、t-SNE…アルファベットやカタカナだらけで区別がつかない!」
「レコメンデーションの『協調』と『コンテンツベース』の違いがいつもゴチャゴチャになる…」

あなたも、教師なし学習の広大な範囲を前にして、このように頭を抱えていませんか?

前回学んだ「教師あり学習」は、問題と答えがセットだったのでゴールが明確でした。
しかし、今回の「教師なし学習」は、AIに「答え(正解ラベル)」を一切与えない状態で学習をスタートさせます。
そのため、「答えがないのにどうやって学習するの?」と、初学者が最も混乱しやすい泥沼ジャンルなのです。

でも、心配ありません!
教師なし学習の本質は、私たちの日常で行われている「お片付け」や「グルーピング」とまったく同じです。
難しい数式を覚える必要はありません。
それぞれのアルゴリズムが「どんな役割を持っているのか」を身近な例え話でイメージできれば、試験問題を見た瞬間に正解を選べるようになります。

この記事では、G検定で出題される「教師なし学習」の重要キーワードを1つも漏らさず、しっかりとかみくだいて解説します。
得点源に変えるための必勝法を、今から伝授します!


1. 教師なし学習とは?分かりやすい例え話で解説

教師なし学習を一言で表すと、「だれも答えを教えてくれない状態で、大量のものを『なんとなく似たもの同士』でグループ分けしたり、スッキリ整理整頓したりするスタイル」です。

例え話を用意しました。
あなたが「言葉の全く通じない海外のスーパーマーケット」に迷い込んだと想像してください。

値札の文字も読めず、店員さんに質問もできません。
つまり「正解(データの中身の答え)」が分からない状態です。
しかし、店内をぐるりと見渡すと、あなたは自然と次のように荷物を整理できるはずです。

  • 「こっちの棚には、緑色で丸くて葉っぱがついたものが集まっているから、きっと『野菜コーナー』だな」
  • 「あっちの冷蔵棚には、白いパックに赤いお肉っぽいものが入っているから『お肉コーナー』だな」

このように、だれからも「これはトマトだよ」「これは牛肉だよ」という答え(正解ラベル)を教えてもらっていないのに、データの「見た目の特徴(色、形、置かれている場所など)」だけを頼りにして、自力で共通点を見つけ出し、仲間分けする技術
これが「教師なし学習」です。

教師なし学習の2大タスク

教師なし学習が試験で問われるとき、その目的は大きく分けて「クラスタリング」「次元削減」の2つに集約されます。
ここがすべての基礎になります。

1. クラスタリング(仲間分け)
データを「なんとなく似ているグループ(クラスター)」に切り分けるタスクです。
海外のスーパーで野菜とお肉のコーナーを見分けるようなものです。

2. 次元削減(情報の要約・お片付け)
データの種類(ヒントの数)が多すぎてゴチャゴチャしているときに、「重要なエッセンスだけを残して、データをスッキリとコンパクトにまとめる」タスクです。
例えるなら、分厚い教科書を、大事なポイントだけをまとめた「1枚の要約プリント」にするようなお片付け作業です。

試験では、「このキーワードはクラスタリングの手法か、それとも次元削減の手法か」という骨組みを問う問題が多発します。
この2つの引き出しを意識しながら、具体的なキーワードを見ていきましょう。


2. 試験に出る!最重要キーワードの解説と覚え方

それでは、最重要キーワードを試験で狙われるポイントに絞って徹底解説します。

クラスタリング ★★★

データを「正解なし」で、似たもの同士のグループ(クラスター)に分類するタスクそのもののことです。
顧客を購買傾向でグループ分けする「顧客セグメンテーション」や、画像の類似検索などに使われます。

k-means法(k平均法) ★★★

クラスタリングの中で最も有名で、試験に一番出る王道アルゴリズムです。
最初に「データをk個のグループに分けるぞ!」と人間が数を指定します。
その後、AIがランダムにグループの中心点を決め、それぞれのデータから一番近い中心点のグループに所属させ、中心点を微調整する…というステップを、グループがきれいに安定するまで繰り返す手法です。

💡 覚え方メタファー:
「クラス替えで、先生が『今からランダムに選んだ3人をリーダー(中心点)とする!みんな自分の席から一番近いリーダーの周りに集まりなさい!』と指示し、集まったメンバーの真ん中にリーダーが移動する。
これを繰り返して、最終的にきれいな3つの班を作るゲーム」と覚えましょう。

ウォード法 ★★☆

k-means法とは異なり、最初に数を決めない「階層型クラスタリング」の代表手法です。
最初は、すべてのデータが「1人だけの独立したグループ」としてスタートします。
そこから、「最も距離が近く、似ている者同士」を、下から順番に2個ずつ合体させていき、最終的に1つの巨大なグループになるまで合体し続ける手法です。
合体させる際の基準として「グループ内のバラつき(分散)が最も小さくなるように選ぶ」のがウォード法の特徴です。

デンドログラム(樹形図) ★★★

ウォード法などの階層型クラスタリングを行った結果を、「トーナメント表」や「家系図」のようなツリー構造で視覚化したグラフのことです。

試験では、「階層型クラスタリングの結果を視覚化する図を何というか」という直球問題が出ます。
答えは一発で「デンドログラム」です。

次元削減 ★★★

データの「特徴量(情報の次元)」が多すぎると、計算が爆発してAIの性能が落ちてしまいます(これを次元の呪いと呼びます)。
これを防ぐために、データの重要な情報をできるだけ失わないようにしながら、要素の数をギュッと凝縮して減らす技術です。

主成分分析(PCA) ★★★

次元削減の絶対王者です。
たくさんの特徴量(例:身長、体重、胸囲、座高、足のサイズ…)があるデータから、データの全体的なバラつき(情報量)が最も大きくなるような「新しい共通の物差し(主成分)」を自ら作り出し、少ない次元にギュッとまとめる手法です。

💡 覚え方メタファー:
「生徒の『国語・数学・理科・社会・英語』の5科目の点数データ(5次元)を、全体の傾向を最もよく表す『文系度』と『理系度』という2つの総合指標(2次元)にギュッと凝縮して、2次元の散布図にプロットし直す作業」です。

特異値分解(SVD) ★★☆

主成分分析(PCA)の裏側で使われている、非常に強力な数学的テクニックです。
どんな複雑な行列データであっても、3つのシンプルな行列の掛け算に分解することができます。
画像の圧縮技術や、後述するレコメンデーション(おすすめ機能)の背景にある超重要技術です。

多次元尺度構成法(MDS) ★★☆

データ同士の「似ている度合い(類似度や距離)」のデータを元にして、それらを2次元や3次元のグラフ上に「見た目の距離」として正しく配置する手法です。
例えば、各都市の「移動時間」のデータだけをAIに渡すと、AIが自力で日本地図のような「位置関係のグラフ」を再現してくれます。

t-SNE(ティースニー) ★★★

主成分分析(PCA)は「直線的(線形)」な削減しかできませんが、t-SNEは「複雑な(非線形)」データも、きれいに2次元や3次元に落とし込むことができます。
最大の特徴は、「元の高次元世界で近かったデータ同士は、2次元に落とした後も、しっかり近くに集まるように配置される」という点です。
データの可視化において、現代のAI開発で必須の技術となっています。

トピックモデル / 潜在的ディリクレ配分法(LDA) ★★☆

大量のテキストデータ(ニュース記事など)を読み込ませ、「この記事には、どんなテーマ(トピック)が、どれくらいの割合で含まれているか」を確率的に自動分類する手法です。
その代表格が潜在的ディリクレ配分法(LDA)です。
例えば、「政治の話題が60%、経済が30%、スポーツが10%」というように、目に見えない(潜在的な)テーマの構成比を暴き出します。

協調フィルタリング ★★★

AmazonやNetflixの「あなたへのおすすめ」を決めるレコメンデーションエンジンの基幹技術です。
「あなたと過去の行動パターン(購入履歴や評価)が似ている別のユーザー」を探し出し、その人が買っているけれど、あなたがまだ買っていない商品をリコメンドする手法です。

💡 覚え方メタファー:
「映画の好みが自分とソックリなA君が、最近『この映画最高だった!』と言っていた。
それなら、まだ観ていない自分もきっと気に入るはずだから観てみよう」という、「他人の口コミ連動型」のおすすめ方法です。

コンテンツベースフィルタリング ★★★

協調フィルタリングのライバルです。
他人の行動は一切無視します。
「あなたが過去に購入した商品そのものの特徴(コンテンツ)」に注目し、それと性質が似ている別の商品をリコメンドする手法です。

💡 覚え方メタファー:
「あなたが昨日『SFアクション映画』を観たから、今日も別の『SFアクション映画』をおすすめする」という、「商品の属性・カタログスペック連動型」のおすすめ方法です。

コールドスタート問題 ★★★

レコメンデーション、特に協調フィルタリングにおいて必ず発生する致命的な弱点(ジレンマ)です。
サービスを開始したばかりの時期(あるいは新規登録したばかりのユーザー)は、「過去の購入履歴や評価データ」が全く蓄積されていない(データが冷え切っている)ため、AIがだれに何をおすすめしていいか分からずうまく機能しない問題のことです。
試験では、この単語の意味をそのまま問う問題が頻出します。


3. 【要点整理】教師なし学習の特性・違い比較一覧表

試験で混乱しやすい「似た者同士」のキーワードを、一目で区別できるように構造化しました。
脳内の引き出しを整理しましょう。

① クラスタリング手法の比較

手法名 階層の有無 特徴 メリット・デメリット
k-means法 非階層型(階層なし) 最初にグループ数(k)を人間が指定する 計算が高速で大量データ向き。ただし、丸い塊以外の複雑な分布は苦手。
ウォード法 階層型(階層あり) 近いものから順に合体させ、デンドログラムを作る 最初に数を決めなくて良いが、データ量が膨大になると計算が非常に重くなる。

② 次元削減手法の比較

手法名 性質 特徴 主な用途
主成分分析 (PCA) 線形(直線的) データのバラつきが最大の方向(主成分)を探す データの軽量化、前処理の基本
t-SNE 非線形(曲線的) 高次元での近さを、低次元でも維持する 人間の目によるデータの可視化・分析

③ レコメンデーション手法の比較

手法名 注目する対象 メリット デメリット・弱点
協調フィルタリング 「自分と似た他人」の行動 自分では選ばないような意外な商品に出会える 履歴がないと何もできない(コールドスタート問題
コンテンツベース 「商品そのもの」の属性 新商品や新規ユーザーでも、属性さえあればすぐおすすめできる おすすめが似たようなものばかりになり、意外性がない

4. G検定の「ひっかけ問題パターン」を総チェック!

G検定で頻出される知識の甘い受験生をふるい落とすための「ひっかけパターン」を確認していきましょう。
ここを意識するだけで、失点を確実に防げます。

🚨 ひっかけパターン①:k-means(教師なし)と k-NN(教師あり)

  • ❌ 誤った選択肢の例:k-means法とは、未知のデータが得られた際に、それと距離が近いk個の教師データを元に、多数決によってそのクラスを分類する手法である。
  • ⭕ 正しい見極め方:これは「k-NN(k近傍法)」という教師あり学習の手法の定義です!
    名前の頭にどちらも「k」がつくため、選択肢ですり替えられるケースが非常に多いです。
    k-means = 答えなし。データk個の塊にクラスタリングする。
    k-NN = 答えあり。周りのk個の先輩の意見を聞いて多数決で分類する。

🚨 ひっかけパターン②:レコメンデーションの主語すり替え

  • ❌ 誤った選択肢の例:コンテンツベースフィルタリングとは、ユーザーの過去の行動履歴を元に、そのユーザーと嗜好が類似した他のユーザーの行動データを分析しておすすめを行う手法である。
  • ⭕ 正しい見極め方:これは「協調フィルタリング」の定義です!
    「他のユーザー(他人)」に注目するのが協調、「商品そのものの属性(コンテンツ)」に注目するのがコンテンツベースです。定義が完全に逆にすり替えられています。

🚨 ひっかけパターン③:t-SNEの特性ひっかけ

  • ❌ 誤った選択肢の例:t-SNEは線形な次元削減手法であり、高次元データ全体のグローバルな構造(遠く離れたデータ同士の位置関係)を完全に維持したまま低次元に投影する。
  • ⭕ 正しい見極め方:t-SNEは「非線形」の手法であり、維持するのは遠くの構造ではなく「ローカルな構造(近くにあるデータ同士の近接関係)」です!逆の意味の言葉が紛れ込んでいます。

🔥 まとめ:答えのない世界を切り拓くAIを味方に!

お疲れ様でした!
教師なし学習の重要ポイントをすべてマスターしましたね。

正解が与えられない過酷なデータの世界で、自力で共通点を見つけ出す「教師なし学習」のアルゴリズムたちは、現代のビッグデータ社会を裏で支える超一流の整理職人たちです。

「チーム分けのk-means」「トーナメント表のウォード法(デンドログラム)」「ギュッと凝縮するPCAとt-SNE」「他人の口コミを頼る協調フィルタリング」。
このようにイメージのフックを脳内に作っておけば、G検定の本番でどんな複雑な選択肢が出題されても、落ち着いて正解を射抜くことができます。

これで、教師なし学習という大きな山をまた一つ超えました。
あなたの努力は確実に合格へと近づいています。
この熱量のまま、次のステップも一緒に楽しく進んでいきましょう!


【大人気💡】過去問風ミニテスト&関連テキスト

クラスタリングと次元削減はバッチリ理解できましたか?
知識を確実に定着させて一発合格を引き寄せるために、今のあなたに最適なステップを選んで進んでみましょう!

合格率をグッと上げる!「過去問風ミニテスト」に挑戦

解説を読んだら、さっそく問題に挑戦して実力を確かめてみましょう!
ボタンをクリックするとミニテストのページが開きます。

🚀 最短ルートで合格を目指す!「厳選参考書」参考書をチョイス

G検定合格へのロードマップは、この一冊を机に置くことから始まります。
まずは目次だけでもチェックしてみてください。

知識を『覚えたつもり』で終わらせない。
この1冊を解き終える頃には、合格ライン突破に確実に近づきます。

関連項目の解説テキストを確認