サイト内検索

NVIDIA社では近年、「フィジカルAI(Physical AI)」に関する取り組みが数多く紹介されています。フィジカルAIとは、カメラやセンサーの⼊⼒と⾔語による指⽰を理解し、現実世界での⾏動を⽣成するAIです。従来の「認識するAI」から「⾏動するAI」への進化と⾔えます。その中でも⾃動運転はフィジカルAIの代表的な適⽤先であり、フィジカルAIを実現する上で最も難易度が⾼い領域の⼀つです。実世界には無数の交通状況が存在し、歩⾏者の⾶び出しや複雑な交差点、⼯事区間などのエッジケースに適切に対応しなければなりません。

しかし従来の開発⼿法では、実⾞両を⾛らせてデータを収集する必要があり、コストや時間の制約からエッジケースを⼗分に学習・評価することが困難でした。こうした課題を解決するには、シミュレーションや合成データを活⽤しながら、AIモデルの学習・評価を継続的に回す仕組みが不可⽋です。そこでNVIDIA社は、⾃動運転向けAIモデル、合成データ⽣成、シミュレーション、AIモデルの学習・評価・デプロイ基盤といったソリューションを包括的に提供し、フィジカルAI時代の⾃動運転開発をリードしています。


本記事では、NVIDIA社の⾃動運転AI開発ソリューション群の全体像をご紹介します。

 ※本記事の情報は、資料作成時点(2026年8⽉)のものです。AIモデルやフレームワーク等に関しましては、適宜最新情報をご参照ください。

この記事のゴールと対象

ゴール

NVIDIA社の⾃動運転AI開発ソリューションの概要を理解し、⾃社の⾃動運転開発やソリューション開発のどこに適⽤できるかをイメージできるようになる。

対象

・⾃動運転の開発に携わる⽅
・実⾞両中⼼のデータ収集・検証に限界を感じている⽅
・シミュレーションや合成データによる開発効率化に関⼼のある⽅
・VLA(Vision Language Action)モデルなど最新の⾃動運転AIモデルを知りたい⽅

自動運転AI開発の主要技術

⾃動運転開発は、「賢いAIモデルを作れば終わり」という単純なものではありません。現実世界には無数の交通状況が存在するため、⼤量のデータを収集し、AIを学習させ、シミュレーションで検証し、実⾞で評価するサイクルを継続的に回す必要があります。本章では、その全体像を理解するために、まず⾃動運転AIの中核となるVLAモデルから、開発基盤、そしてデータ収集の課題までを順に⾒ていきます。

VLA(Vision Language Action)モデルとは

⾃動運転AIの究極的な⽬的は、「周囲の状況を理解し、⼈間の意図を踏まえて、安全な運転⾏動を選択すること」です。しかし従来のAIは、認識・予測・制御を個別に処理するため、複雑な状況への対応に限界がありました。こうした課題を解決する次世代アーキテクチャーとして注⽬されているのが、VLAモデルです。

以下の図はVLAモデルの⼊出⼒の概要を表しています。カメラなどのセンサー情報とユーザーからのテキスト指⽰を⼊⼒として受け取り、⾃動運転⾞やロボットが取るべき⾏動(Action)を出⼒します。

VLAモデルの概要図

⾃動運転ソフトウェアの進化

NVIDIA社は⾃動運転ソフトウェアの進化を3世代で整理しています。

VLAの登場によって、自動運転ソフトウェアそのものの設計思想も大きく変化しています。最新のAV(Autonomous Vehicles)3.0世代では、AIが単に運転操作を出⼒するだけでなく、「なぜその判断をしたのか」という思考過程が⾒えることが⼤きな特長です。これにより、⾃動運転AIは単なるブラックボックスから検証可能なシステムへと進化しました。開発者はAIの判断根拠を分析しながらモデルを改善できるため、デバッグ効率や安全性評価の精度が向上します。また、これまで対応が難しかったレアケースについても、AIの判断過程を 確認しながら継続的に学習・改善できるようになり、⾃動運転開発のスピード向上につながっています。

世代

名称

特長

AV 1.0

Classical Modular Stack

認識・予測・計画・制御を

個別モジュールで構築する従来型

AV 2.0

End-to-End VLA

センサー⼊⼒からVLAを介して運転出⼒まで⼀気通貫

AV 3.0

End-to-End Reasoning VLA

判断理由を説明可能なリーズニング能⼒を備える

⾃動運転ソフトウェアの進化

フィジカルAI開発に必要な「3つのコンピューター」

⾼性能なVLAモデルを作るだけでは⾃動運転は実現できません。モデルを学習し、シミュレーションで検証し、最終的に⾞両上で動作させるためには、開発から運⽤までを⽀える計算基盤が必要です。そこでNVIDIA社は、フィジカルAI開発を⽀える「3つのコンピューター」という考え⽅を提唱しています。

役割

コンピューター

①学習

AIモデルの⼤規模トレーニングを担うスーパーコンピューター

NVIDIA DGX™ / NVIDIA HGX™ 

②検証

シミュレーション実⾏と合成データ⽣成

NVIDIA RTX PRO™ Server / NVIDIA RTX PRO™ Workstation

③実行

⾃動運転⾞の「頭脳」として⾞載で推論を実⾏

AGX(⾃動運転では、NVIDIA DRIVE AGX™ が該当)

⽴ちはだかる「データ収集の壁」

フィジカルAI開発の最⼤の課題はデータ収集です。強⼒な計算基盤を⽤意しても、学習に使うデータがなければAIは賢くなりません。特に⾃動運転では、エッジケースを⼤量に学習させる必要がありますが、実世界だけでそれらを収集することは極めて困難です。ここで直⾯するのが「データ収集の壁」です。データには3つの調達⼿段があり、それぞれに⼀⻑⼀短があります。

・実世界データ:⾼品質だが少量・⾼コストで、実機と時間の制約がある
・Webデータ:⼤量・低コストだが品質にムラがあり、欲しいデータが存在するとは限らない
・シミュレーションデータ:理論上は無限にスケール可能で任意のデータを⽣成できるが、GPUリソースが必要

NVIDIA社の⾃動運転AI開発ソリューションは、この「データ収集の壁」をシミュレーションや合成データ⽣成で乗り越えることを狙いとしています。

NVIDIA社 自動運転AI開発ソリューションの全体像

⾃動運転AI開発で重要なのは、データ収集から学習、評価、実機検証までを継続的なループとして回し続けることです。NVIDIA社はこの⼀連の開発サイクルをサポートするソリューションを提供しています。
以下の図は、NVIDIA社が提供する⾃動運転AI開発ソリューションの全体像を⽰しています。
本記事では、この中でも緑字で⽰した主要ソリューションを中⼼に、それぞれの役割や特長について解説します。

⾃動運転AI開発ソリューションの全体像

NVIDIA Cosmos:学習データ生成 / 拡張とデータの処理 / 検索 / 評価

NVIDIA Cosmos™ は、フィジカルAI向けの世界基盤モデル(World Foundation Models)を中⼼としたプラットフォームです。動画の⽣成・理解を⾏うオープンモデル群と、それを使った学習データセット構築のためのワークフローを提供します。実データだけでは不⾜する領域を補い、データセットの網羅性・多様性・品質を⾼めることが⽬的です。Cosmosは複数のモデル/ツールで構成されています。

Cosmos世界基盤モデル

Cosmosは⾃動運転AI開発におけるデータ不⾜の課題にアプローチができます。しかし、その課題には⼤きく2つのパターンがあります。


①そもそも学習に必要なシナリオが存在しないケースです。
 例えば、重⼤事故につながるエッジケースや特殊な交通状況など、実世界では⼗分な量を収集できないシナリオがあります。

②データは存在するものの、バリエーションや品質が不⾜しているケースです。
 例えば、晴天時の⾛⾏データは豊富でも、⾬天・夜間・積雪時のデータが不⾜してたり、シミュレーションで⽣成した映像が実世界と⽐べて不⾃然だったりする場合があります。


Cosmosでは、これらの課題に対して異なる役割を持つモデルを提供しています。
・Cosmos 3:不⾜しているシナリオや世界そのものを⽣成
・Cosmos-Transfer 2.5:既存データの条件変換や、シミュレーション映像のフォトリアル化によって学習データを拡張

以下では、それぞれの役割について説明します。

※なお、Cosmos-Transferの機能は、今後Cosmos 3へ統合される予定です。

◆Cosmos 3

実世界では⼗分な学習データが存在しないケースが数多くあります。
例えば、
・発⽣頻度の低いシナリオ
・複雑な交通状況 などです。


Cosmos 3は、このような不⾜するシナリオを⽣成するための世界基盤モデル(World Foundation Model)です。
テキスト・画像・動画・⾳声・⾏動(Action)のすべてを扱うオムニモデルとして、世界理解・世界⽣成・⾏動⽣成を実現します。

以下のような特長があります。 
・1つのモデルで多⽤途:
 World Understanding(世界理解)/World Generation(世界⽣成)/World Action(⾏動⽣成)/
 Multimodal Simulation(マルチモーダル・シミュレーション)を単⼀モデルで実現
・2つのサイズラインナップ:
 NVIDIA Cosmos 3 Nano(16B)とNVIDIA Cosmos 3 Super(64B)
・オープン提供:
 オープンウェイト、学習レシピ、ベンチマークを Hugging Face・GitHub で公開。NVIDIA NIM™ Microservicesでもデプロイ可能
・世界モデルとして:

 マルチフレームレート(10〜30)、マルチ解像度(256p/480p/720p)に対応し、最⼤30秒の⻑尺⽣成に対応
 ⾳声付きの世界⽣成(Generate Worlds With Sound)も可能

◆Cosmos-Transfer 2.5

Cosmos-Transfer 2.5は、既存の映像を別の条件や表現へ変換するモデルです。学習データの拡張では、晴天を⾬天に変換する、昼間を夜間に変換するといった形でデータセットの多様性を⾼めることができます。

また、⾃動運転開発で広く利⽤されるシミュレーション映像を、実写に近いフォトリアルな映像へ変換する⽤途にも活⽤できます。これにより、シミュレーションで⼤量⽣成したデータを、より実世界に近いデータとして学習に利⽤できるようになります。

Cosmos-Transferイメージ画像

Cosmosのデータ処理・検索・評価ツール

CosmosのAIモデルを組み込んだ、データ処理・検索・評価ツールも提供されています。

コンポーネント

役割

Cosmos Curator

膨⼤な動画データをGPUで⾼速処理し、データセットを整理

Cosmos Dataset Search

⾃然⾔語や動画から、データセット内の任意のシーンを⾼速に検索

Cosmos Evaluator

AIが⽣成した動画の評価を⾃動化

NVIDIA Cosmos-Dreams:自動運転シミュレーション向け世界モデル

NVIDIA Cosmos-Dreamsは、NVIDIA Cosmosファミリーに位置づけられる、車両の走行条件に応じて先のシーンを逐次生成する世界モデルです。初期RGBフレーム、テキストプロンプト、HDマップ画像、軌道ポーズを入力とし、マルチカメラのフォトリアル動画をリアルタイムに生成します。

後述するAlpamayoやAlpaSimと組み合わせたクローズドループ検証の文脈では、Alpamayoがポリシーモデル、AlpaSimがシミュレーションランタイム、Cosmos-Dreamsが世界モデルとして機能するという構成として整理できます。この構成では、AlpaSim側の状態更新をもとに、Cosmos-Dreamsが次の合成カメラ映像を生成し、モデルの挙動を継続的に評価する流れになります。

ドメイン特化のポストトレーニング

Cosmosは、LoRA・DMD2・教師ありファインチューニング(SFT)・強化学習(RL)によってドメイン特化モデルに調整が可能です。
自動運転だけでなく、ロボティクス、医療、製造業など幅広い分野への適⽤が可能です。

Cosmosの導入効果

・データ収集コストの削減:Cosmos 3、Cosmos-Transfer 2.5で、実⾞⾛⾏に頼らず、不⾜するエッジケースやデータの多様性を合成データで補えます
・開発スピードの向上:Cosmos Curatorは、2,000万時間の動画処理に要する時間を、最適化されていない2,000基のCPU環境での3.4年相当から、NVIDIA Hopper GPU環境では40日へ短縮します
・データ探索の⾼速化:Cosmos Dataset Searchは、億単位の動画から⽬的のシナリオを瞬時に検索し、従来⼿法より約20倍⾼速にデータ発⾒ループを回せます
・評価の⾃動化:Cosmos Evaluatorは、30基のNVIDIA A100で3時間あたり1,500本の動画を、⼈による判断のばらつきなく評価できます

・世界モデルを活用したシミュレーション検証:Cosmos-Dreamsは、車両の走行条件に応じた先のシーンを逐次生成できるため、将来シーンを生成しながら自動運転AIの挙動を検証する用途への活用が期待できます

NVIDIA Omniverse NuRec:実⾞両データを⽤いたシミュレーション空間再構成

NVIDIA Omniverse™ NuRec は、実⾞⾛⾏から取得したセンサーデータ(カメラ/LiDARデータ等)を取り込み、3Dシミュレーション環境を再構成・レンダリングするモデル/サービス群です。⼀度撮影した⾛⾏シーンを、何度でも条件を変えて再現・検証できる「再利⽤可能な3Dシミュレーション環境」に変えられる点が最⼤の特長です。実⾞⾛⾏から取得したセンサー情報をNCore形式(NVIDIAが定義するセンサーデータ記録の標準化フォーマット)に変換し、再構成・レンダリングを経て、シミュレーション空間を描画します。

前述のCosmos-Dreamsが条件入力に基づいて将来のカメラ映像を生成する世界モデルであるのに対し、NuRecは実世界で取得したセンサーデータを起点に、実在する走行シーンを3Dシミュレーション環境として再構成する点が特徴です。つまり、Cosmos-Dreamsが「先のシーンを生成する」役割を担うのに対し、NuRecは「撮影済みの実世界シーンを再利用可能な環境に変換する」役割を担います。

 

主な機能

・新しい軌道、センサー視点の⽣成:再構成した空間内で、センサーのFOVや位置を変更したり、元の⾛⾏軌道から横⽅向にずらした視点をレンダリングしたりすることが可能
・シナリオの拡張:シミュレーション空間にアセットを後から挿⼊し、新しいシナリオの作成が可能
・Fixer:再構成時に⽣じるアーティファクトやブラーを補正するモデル
・Harmonizer:再構成・レンダリング後のフレームに対して、照明、影、外観の調和や時間的⼀貫性を⾼めるモデル
・Asset Harvester:実世界データ内のアクターやオブジェクトを3Dアセット化し、他のシーンで再利⽤しやすくするモデル/ワークフロー
・InstantNuRec:マルチビュー画像⼊⼒から3D Gaussian Splatting(3DGS)シーンを出⼒するモデル
・Agent Skills連携:NuRec向けのAgent Skills(nurec-skills)が提供されており、AIエージェントによるNuRec関連ワークフローの⽀援に活⽤可能

シミュレーションフレームワークとの連携

NuRecは、NVIDIA社が提供するシミュレーションフレームワークであるAlpaSimはもちろん、CARLA・Foretellixといったシミュレーション分野の主要パートナーのツールチェーンと連携しています。

NVIDIA Alpamayo:自動運転向けオープンVLAモデルとツール群

NVIDIA Alpamayoは、⾃動運転向けのオープンVLAモデル、シミュレーションフレームワーク、強化学習インフラストラクチャ、フィジカルAIデータセットからなるファミリーで、⾃動運転AI開発の出発点として活⽤できます。
Alpamayoのモデルラインナップは以下の通りです。

項⽬

NVIDIA Alpamayo 1 Nano

NVIDIA Alpamayo 1.5 Nano

NVIDIA Alpamayo 2 Super

位置づけ

世界初のオープン推論VLA(AV向け)

ステアリング・対話・⾃社データ学習が可能に

最⼤規模のオープンAV推論

VLA基盤モデル

リリース

2025年11⽉

2026年3⽉

2026年8月

パラメータ

10B

10B

34B

バックボーン

Cosmos-Reason 2

Cosmos-Reason 2

Cosmos 3 Reasoner

⼊⼒

前方4カメラ
+ 自車の過去の動き
+ ユーザー指示文

前方1〜4カメラ
+ 自車の過去の動き
+ ナビ指示
+ 画像に関する質問文

最大7カメラ(360度カバー)
+ 自車の過去の動き
+ ナビ指示
+ 画像に関する質問文
+ Meta-Action生成指示
+ 自動ラベル付け指示文

出⼒

6.4秒先までの軌道計画
+ リーズニング過程

6.4秒先までの軌道計画  
+ リーズニング過程
+ 画像質問への回答

6.4秒先までの軌道計画  
+ リーズニング過程
+ 画像質問への回答
+ Meta-Action(高レベルな運転判断)
+ 画像上の対象位置特定

学習

SFTのみ

SFT
+ オープンループRL

SFT
+ オープンループRL

「なぜその運転判断をしたのか」をリーズニングとして説明できる点が、AV 3.0世代の特長を体現しています。

また、Alpamayoは⼤規模かつ多様なデータで事前学習がされています。Alpamayoを利⽤する企業は、これをベースに特定⽤途向けのリーズニング強化やレアケース対応を追加できます。

事前学習済みの⾼性能VLAモデル

Alpamayoファミリー

◆NVIDIA AlpaSim:オープンソースのクローズドループAVシミュレーションフレームワーク

Alpamayoのようなポリシーモデル(運転を担うAI)をシミュレーション空間内で⾛⾏させ、その挙動を評価するPythonベースのクローズドループ・シミュレーターです。録画映像を再⽣するオープンループ検証とは異なり、モデルの操作がシーンに反映され、その結果が次の⼊⼒として返るため、現実の道路に近い相互作⽤のもとで⽅策を評価できます。

◆NVIDIA AlpaGym:クローズドループ強化学習インフラストラクチャ

AlpaGym は、AlpaSimを実⾏エンジンとして⽤い、Alpamayoの運転⽅策を強化学習で鍛えるためのフレームワークです。AlpaSim上でモデルを⾛⾏させて得た結果を報酬として⽅策を更新し、その⽅策で再び⾛⾏するというループを⾼スループットに回します。

◆PhysicalAI-Autonomous-Vehicles:フィジカルAI向け⼤規模・多様なマルチセンサーデータセット

PhysicalAI-Autonomous-Vehicles は、オープンに公開されている⼤規模かつ多様な⾛⾏データセットです。

・1,700時間以上の⾛⾏データ
・30万クリップ以上のマルチカメラ+LiDAR(各20秒)、16万クリップ以上のレーダーデータ
・25か国・2,500都市以上にわたる地理的カバレッジ(⽇本は含まれておりませんのでご注意ください)

お問い合わせはこちら

本記事が、NVIDIA社の⾃動運転AI開発ソリューションの理解を深める⼀助となれば幸いです。

マクニカでは、NVIDIA社の⾃動運転AI開発ソリューションの導⼊⽀援、ハードウェアのGPUカードやGPUワークステーションの選定、サポートが可能です。

導⼊を検討される際は、下記よりお気軽にお問い合わせください。