【G検定過去問風テスト】シミュレータと現実のギャップを埋めるドメインランダマイゼーション
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
シミュレータ上で学習させたAIポリシーを現実世界の物理ロボットなどに適応させる際のギャップを克服するため、仮想空間内の環境条件をあえてランダムに変化させまくって学習を行う手法として、最も適切な選択肢を1つ選べ。
- A)報酬成形
- B)ドメインランダマイゼーション
- C)状態表現学習
- D)残差強化学習
🔍 ここをクリックして正解を見る
- 正解: B)ドメインランダマイゼーション
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- ドメインランダマイゼーションは、シミュレータ内の摩擦、重力、色、ライティングなどの条件をあえてランダムに変化させてAIを鍛える技術である。
- シミュレータと現実世界のズレ(Sim-to-Realギャップ)を克服し、現実でも頑健に動くモデルを作るために必須の手法である。
■ 初学者向け解説(例え話や背景)
ロボットの制御をAIに学ばせるとき、いきなり現実世界の高価なロボットで何万回も失敗させると壊れてしまいますよね。そのため、まずはパソコン上のシミュレータ(バーチャル空間)で安全に練習させます。
しかし、シミュレータの中で完璧に動けるようになったロボットをいざ現実世界に連れ出すと、床の滑り具合や光の反射などのちょっとした違い(ズレ)で全く動けなくなってしまいます。これが有名な「Sim-to-Realギャップ」です。
これを防ぐための特訓が「あえてスパルタな悪条件(ガチャガチャした環境)で練習させること」です!シミュレータの摩擦や色をランダムに変えまくって過酷な環境でもみくちゃにすることで、どんな現実世界に行っても動じない「打たれ強いAI」を育てることができます。
■ 選択肢の解説
- A) 報酬成形(×): ゴールが遠い課題において、学習をスムーズにするため人間が中間報酬(ヒント)を与えて導く技術です。
- B) ドメインランダマイゼーション(○): シミュレータの条件をあえてランダムに変化させて現実適応力を高める手法であり、本問の正解です。
- C) 状態表現学習(×): カメラ画像のような高次元で複雑なデータから制御に必要な本質的な状態情報だけを低い次元のベクトルとして抽出する手法です。
- D) 残差強化学習(×): 既存の古典的な制御ルールの出力をベースにし、AIはその補正分(残差)だけを学習する効率的な手法です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
