サイト内検索

近年、AIの進化はテキストや画像の領域だけでなく、ロボット制御の分野にも広がっています。その中でも注目されているのが、Vision-Language-Action(VLA)モデルです。

VLAは、カメラから取得した視覚情報(Vision)と自然言語による指示(Language)を理解し、ロボットの動作(Action)へ直接変換する新しいAIアーキテクチャーです。つまり、ロボットの「見る」「理解する」「動く」を一つのモデルでつなぐ仕組みです。

本記事では、「NVIDIA Isaac GR00T N1.7」の実測結果をもとに、Physical AIの学習およびロボット推論に適したNVIDIAプラットフォームをご紹介します。

NVIDIA Isaac GR00T N1.7とは

NVIDIAが提供する Isaac GR00T N1.7 は、汎用ヒューマノイドロボットスキルの実現を目的とした、オープンなVLAモデルです。自然言語による指示とカメラ画像を入力として受け取り、ロボットの動作を生成します。また、独自データによるファインチューニングに対応しており、特定のロボット、タスク、環境へ柔軟に適応させることが可能です。


参考: Isaac-GR00T N1.7 Github

    NVIDIA Isaac GR00T

今回の検証内容

GR00T N1.7を活用する際、「学習や評価をどのGPU環境で行うか」、「完成したモデルをどのプラットフォームへデプロイするか」という点は、開発環境を選定するうえで重要です。

そこで今回は、同一のデータセットと学習条件を使用し、3つのNVIDIAプラットフォームでGR00T N1.7-3Bをファインチューニングしました。各環境の学習時間を比較し、用途に応じた選び方を確認します。

比較した環境

フラットフォーム

主な用途

構成

NVIDIA® Jetson Thor™

ロボット上でのリアルタイム推論、

センサー処理、制御

CPU 14コア

128GBメモリ

NVIDIA DGX Spark™

生成AIモデルのプロトタイプ開発、

推論、ファインチューニング

CPU 20コア

128GBユニファイドメモリ

NVIDIA RTX PRO™ 6000 Blackwell Workstation Edition

AIモデルの学習・評価、

シミュレーション

CPU 64コア

GPUメモリ96GB

参考:NVIDIA GPU および 関連ハードウェアの詳細はこちら

ファイチューニング条件

ベースモデル

GR00T N1.7-3B

データセット

DROID Dataset(lerobot/droid_1.0.1)

使用データ

1,000 Episodes

比較項目

10,000 Stepsファインチューニング完了までの時間

検証結果

今回の検証では、RTX PRO 6000 Blackwellが最も高速でした。反復的な学習と評価を行うPhysical AI開発において、おすすめの構成です。

フラットフォーム

学習時間

Jetson Thor

約12時間

DGX Spark

約15時間

RTX PRO 6000 Blackwell

約2.5時間

RTX PRO 6000は、Jetson ThorやDGX Sparkと比較して約5〜6倍短い時間で学習完了。

なぜ学習時間が重要なのか

ロボット開発では、一度ファインチューニングを実行して終了ではありません。学習途中で生成されるCheckpointを評価し、必要に応じてデータやパラメーターを調整しながら、モデルを継続的に改善します。

このサイクルを何度も回す開発では、学習時間は単なる待ち時間ではありません。学習が長時間化すると、Checkpointの評価から次の学習までの間隔が延び、限られた開発期間内で試せる回数が少なくなります。その結果、モデル改善のスピードにも影響します。つまり、学習時間の長さは開発サイクル全体の回転速度を左右する重要な要素です。

学習時間を短縮できれば、Checkpointの評価と改善をより多く繰り返すことができ、開発サイクル全体を高速化できます。

まとめ

本記事では、Physical AIを実現するための技術であるVLAモデルと、NVIDIA Isaac GR00T N1.7の概要を紹介するとともに、Jetson Thor、DGX Spark、RTX PRO 6000におけるファインチューニング時間を比較しました。実測結果から、用途ごとに適したプラットフォームを選ぶことが、効率的なPhysical AI開発のポイントであることが分かります。
※大規模なデータセットや複数GPUを利用する場合は、より上位の構成も選択肢となります。

本記事が、GR00T N1.7の学習時間やPhysical AI開発環境を検討する際の参考になれば幸いです。

関連ページ

DGX Sparkを生成AI向けた応用は以下の記事をご覧ください。

お問い合わせはこちら

Physical AIの導入をご検討中の方や、学習環境の構築、デプロイに関するご相談がございましたら、お気軽にお問い合わせください。