![]()
この記事のまとめ
エヌビディアはCosmos 3を、物理世界を扱うフィジカルAIの基盤モデルとして公開しました。世界の生成、物理の推論、行動の生成を複数の情報形式を扱う統合モデル(オムニモデル)にまとめたことで、訓練と評価のサイクルが数か月から数日になるとエヌビディアは説明しています。押さえておきたい点は3つです。
- Cosmos 3は複数のトランスフォーマーを組み合わせる仕組み(Mixture-of-Transformers)に基づくオムニモデルで、これまで能力ごとに分かれていた世界生成、制御された生成、シーン理解、ポリシー生成を1つのモデルで扱います。
- 短縮の中身は、合成データの生成、品質フィルターによる選別、物理AI向けベンチマークでの採点という一連の自動化です。
- 出力は物理的に正確なシミュレーションとして扱えないため、展開前の追加検証と安全設計が前提になります。
フィジカルAIとワールドモデルの基礎

フィジカルAIとワールドモデルの定義
フィジカルAIとワールドモデルは、名前が似ていても担う役割が違います。
文章や画像を作るAIは、画面の中の情報を扱います。フィジカルAIは、物がどう動くか、力が加わると何が起きるかという現実世界を扱います。私がChatGPTやClaudeを日常的に使ってきた感覚からすると、言語・画像系のAIはあくまで「情報の世界」で完結しています。それに対してフィジカルAIは、重力があり、摩擦があり、想定外の出来事が起きる「物理の世界」に踏み込む話です。
身体を持つ知能のシステムは、いろいろな種類の情報をまとめた知覚、世界のモデル化、状況に応じた制御を組み合わせ、変化して読みにくい環境の中でも、動いて結果を受け取り次の動きを決める循環を繰り返します(参照*1)。
ワールドモデルは、限られた計算資源という制約のもとで、物理世界の状態が移り変わる過程を圧縮して表したモデルです(参照*2)。
この定義の出どころは研究論文なので、業界の共通合意として読む必要はありません。現実をそのまま再現する装置ではなく、計算の枠に収まる形へ縮めた写しと考えられます。逆に言えば、ワールドモデルの「世界」はあくまで近似であり、ロボットや自動運転車のAIを評価するときは、どの範囲の物理を写しているのかを確かめる姿勢が欠かせません。
データ収集とシミュレーションの壁
フィジカルAIの開発でまず立ちはだかるのは、データとシミュレーションの負担です。
実機でデータを集める作業は、時間も場所も必要になります。ある研究チームは、Agilex Cobot Magicで199時間、AgiBot G1で983時間、合計1182時間の独自データを、3100平方メートルの面積にわたって集めました。データは産業、商業、オフィス、住宅、研究所という5つの環境カテゴリーにまたがります(参照*3)。
これは特定の研究の事例で、業界の平均値ではありません。ただ、この規模感を見ると、実機でのデータ収集がいかに重い作業かは伝わります。
シミュレーションは長い間ロボット工学と身体性AIの中核の道具で、物理世界へ展開する前にアルゴリズムを開発し評価するための、制御された再現できる環境を提供してきました(参照*4)。
実機での収集が重いほど、合成データで補う動きが出てくるのは必然です。自社の計画では、集めたい環境の種類と時間、面積を書き出すと比較の土台ができます。生成AIの業務導入でも同じですが、まず「現状の入力と出力を定義する」ところから始めないと、どこにツールを噛ませるべきかが見えません。
Cosmos 3の構造とモデル構成

MoTアーキテクチャとオムニモデル
Cosmos 3で最も大きく変わったのは、扱うモデルの数え方です。
以前は、世界生成のCosmos Predict、制御された生成のCosmos Transfer、シーン理解のCosmos Reason、ポリシー生成のCosmos Policyというように、能力ごとに別のモデルを使い分ける必要がありました。Cosmos 3は複数のトランスフォーマーを組み合わせる仕組み(Mixture-of-Transformers、MoT)に基づくオムニモデルで、1つのモデルでこれらをすべて実行し、1回にまとめられた計算の流れで異なる種類の情報を推論し生成します(参照*5)。
使い方は2つの面に分かれます。推論機能(Reasoner)は文字と映像を受け取って文字を返し、世界の理解、物理の推論、作業の計画、行動の予測、自律システムの意思決定に使います。生成機能(Generator)は文字、映像、音、行動を受け取って映像、音、行動を返し、世界の生成やシミュレーション、未来予測、合成データ生成、ポリシー学習に使います(参照*6)。
1つのモデルに収まることは、あらゆる作業で最良の結果になるという意味ではありません。やりたいことがReasonerの側かGeneratorの側かを先に分けると、入出力の設計が決めやすくなります。ここで重要なのは、統合されたモデルを「万能」と読み違えないことです。何ができて何が苦手かを業務単位で確かめる姿勢は、生成AIのどのモデルを使う場合でも変わりません。
Super・Nano・Edgeのモデル構成
Cosmos 3は、規模の違うモデルとして配られています。
Cosmos3-Superは64Bで、データセンターでの展開、質の高い合成データ生成、蒸留のための教師モデルに向きます。推奨ハードウェアはデータセンター向けのH200、B200、GB200です。Cosmos3-Nanoは16Bで、動かせるハードウェアの幅が広く、速度と品質のつり合いが取れており、ポストトレーニングの土台として強いモデルです(参照*7)。
行動の入力は、対応する身体形態でのみ使えます。一般的なカメラ動作は9次元、自動運転車は9次元、自己中心的動作は57次元、RobotiQグリッパー付きの単腕Franka Pandaは10次元、同じ構成の双腕は20次元、Agibotは29次元、URは10次元、グーグルロボットは10次元、WidowX 250は10次元、UMIは9次元です(参照*8)。
Edgeは、ロボットの上だけで動かす実時間の自律制御を狙った小さい選択肢です(参照*9)。
手元のGPUと、動かしたいロボットの形が対応表にあるかを合わせて見ると、候補は絞り込めます。
検証が数か月から数日になる理由

分断されたスタックの統合
短縮の1つ目の理由は、分かれていた仕組みが1つにまとまったことです。
Cosmos 3は、文字、画像、動画、環境音、行動をそのまま理解し生成でき、物理の正確さに優れた、世界で初めての完全にオープンなオムニモデルです。物理AIの訓練と評価のサイクルを数か月から数日に短縮するとエヌビディアは説明しています(参照*10)。
この統合は前の世代から続く流れの上にあります。フローに基づくCosmos-Predict2.5は、文字から世界、画像から世界、動画から世界という生成を単一のモデルにまとめ、身体AI向けの視覚と言語のモデルであるCosmos-Reason1を使って、文字との結び付きと細かな世界シミュレーションの制御を提供しました(参照*11)。
能力別にモデルを切り替える進め方では、どのモデルをどの順で呼ぶか、出力をどう受け渡すかという管理が発生します。1回の計算の流れに集まれば、その受け渡しと管理の手間が減ります。これは言語AIのワークフロー設計でも同じで、モデルを繋ぐ複雑さ自体がボトルネックになることは珍しくありません。
短縮の幅はエヌビディアの説明に基づくもので、扱うデータや条件によって結果は変わります。前世代のモデルが不要になるわけではなく、公開レシピの多くはその上に積み上がっています。
合成データ生成と評価の自動化
2つ目の理由は、データ作りと採点が自動で回るようになったことです。
合成データは作るだけでは使えず、質の選別が必要になります。Cosmosのクックブックは、指標、可視化、定性的な検査を通じて追加学習したモデルの整合性と頑健さを確かめる工程を置き、Cosmos Reason 1を品質フィルターとして使う例に合成データの棄却サンプリングを挙げました(参照*12)。
評価の側も規模を持って用意されています。PBenchは物理AIのすべての領域にわたって合計1,044サンプルと5,636個のQAペアを含み、各サンプルは条件画像、テキストプロンプト、平均5.4個のQAペアを持ちます(参照*13)。
生成、選別、採点がひとつながりになると、1回の試行にかかる人手が減ります。ただし、ベンチマークの点数は用意された設問に対する結果です。実運用での信頼性は別に確かめる必要があります。私が生成AIの導入支援をしていて感じるのも、この点で、「評価環境での成績」と「現場での使い勝手」は別物だということです。
領域別のユースケースと適用条件

Cosmos 3の使い先は、ロボットから工場、医療まで広がっています。
公式が想定する用途は物理AIで、ロボティクス、自動運転車、スマートスペース環境を含み、産業や工場規模の使い方も入ります(参照*8)。
用途はもう少し細かく分けられます。Cosmos-Predict2.5の系列では、ロボット工学と自律システム向けに、より信頼できる合成データ生成、方策の評価、閉ループのシミュレーションが可能になり、シミュレーションから現実への変換(Sim2Real)と現実から現実への変換(Real2Real)に向けたControlNet風の枠組みであるCosmos-Transfer2.5でファミリーを広げました(参照*11)。
公開レシピは、領域ごとの入口になります。現実感とプロンプトとの一致を改善した交通異常の生成、ヒューマノイドロボット学習に向けた合成軌道データ生成のGR00T-Dreams、方策評価のための行動条件付き手術シミュレーターとしてCosmos Predict 2.5を微調整する例が並びます(参照*12)。
手術シミュレーターの例は、前の世代のモデルを使った事例です。
シミュレーション基盤の使われ方も参考になります。Isaac Simは産業、医療、家庭など幅広い分野で採用され、アルゴリズム評価の試験台としてだけでなく、知覚データを体系的に作り、現実の環境では調べにくい長期の、システム全体としてのロボットの振る舞いを分析するデータ中心の基盤としても使われています(参照*4)。
効果が見えやすいのは、現実では集めにくい状況のデータが必要な工程です。倉庫や工場のように環境の型が決まっている現場では、生成した場面を評価用の試験台として組み込む形が取れます。安全性が問われる領域では、展開前の追加検証が前提になります。これは生成AIの業務活用全般に言えることで、「生成できる」ことと「安全に使える」ことは別問題です。
導入手順とポストトレーニング

推論と提供の選択肢
Cosmos 3を動かす入口は、目的で分かれます。
生成の中身を調べたり手を入れたいときは生成モデル向けライブラリ(Diffusers)が向き、Pythonを中心に生成側の挙動を確認して変更できます。本番の生成推論ではAPI提供基盤(vLLM-Omni)が選択肢で、画像、動画、音、行動の出力をAPI経由で扱えます(参照*6)。
配布物も揃っています。Cosmos 3 SuperとCosmos 3 Nanoはモデルカードとライセンス付きでHugging Faceに置かれ、生成パイプライン向けのCosmos 3 Diffusers統合、独自データで訓練するためのポストトレーニングスクリプトがGitHubに、物理AI向けのオープンな合成データ生成データセットも公開されました(参照*5)。
扱える情報の種類は、どの統合先を使うかで変わります。研究向けの経路で挙動を見てから本番向けの経路へ移すという順序なら、入口の違いを比べながら進められます。
ポストトレーニングの流れと計算資源
自社データに合わせる作業は、レシピとして用意されています。
Cosmos Frameworkでは、自分のデータに対して教師ありファインチューニング(SFT)を実行できます。各レシピはそれ自体で完結する起動スクリプトで、1本のbashスクリプトがデータを準備または検証し、必要なベースチェックポイントを用意し、8基のH100で学習を走らせます(参照*7)。
この8基という構成は検証済みの一例で、必要な計算量はデータの量や対象の身体形態によって変わります。手元の1基のGPUで小さく調整する作業と同じ規模では考えられません。生成AIの導入相談でも「まず小さく回してノウハウを貯める」ことを勧めるのと同じ発想で、最初から本番規模を想定すると、条件の違いで見積もりが大きく外れます。
着手前に見積もる対象は、データ形式の変換、チェックポイントの準備、データの選別、学習の実行という4つの工程です。学習に使うデータの権利関係とライセンスの確認も、この段階で片づけられます。
モデル選定と展開層の判断基準

判断の軸は、モデルの大きさ、動かす場所、土台にする方式の3つです。
出発点にする事前学習の中身は、成績に効きます。Cosmos 3の技術レポートは、同じレシピ、データ、計算量で訓練した2つのDROIDポリシーを比べ、一方はベースチェックポイントから、もう一方は複数領域の行動データで訓練したオムニチェックポイントから始めました。オムニチェックポイントを使った側は、RoboLabの成功率が28.1%から36.8%へ上がりました(参照*14)。
動かす場所を決めるときは、成功率と計算量のつり合いが問題になります。閉ループのRoboLab評価で、追加学習したEdgeのポリシーはタスク一式で22.9%の成功率に届き、これは大きいCosmos3の系列よりずっと少ない推論計算で得られた結果です(参照*9)。
推論の速さも方式の選び方で変わります。GigaWorld-Policy-0.5は、KVキャッシュとtorchコンパイルを有効にした場合にA100で189ミリ秒の推論レイテンシを達成し、同じ設定のFastWAMの229ミリ秒から17.5%速くなりました(参照*15)。
WLAは推論中にワールドエキスパートを既定で無効にし、複数の高速化を組み合わせてRTX 5090上で約40ミリ秒の推論レイテンシによる実時間の行動予測を実現します(参照*16)。
これらの数値は評価条件やハードウェアが違うため、横に並べて優劣を決める材料にはなりません。第三者の研究のレイテンシはCosmos 3の実測値ではないので、方式の考え方を知る手掛かりとして読むのが適切です。新しいモデルが出るたびに宣伝文句ではなく手元のタスクで実力を確かめるべき、というのは言語AIでも物理AIでも変わらない原則です。
幻覚と安全性に関する注意点

品質が崩れる場所を知ると、使い方の線が引けます。私がDeep Research系の機能を検証してきた経験でも、出力が調査レポートらしく見えるほど、読者は内容まで正しいと錯覚しやすくなります。フィジカルAIでも同じリスクは存在します。
Cosmos 3は、長時間、高解像度、または物理的に複雑な出力でアーティファクトを出す場合があります。よくある崩れ方は、時間的な一貫性の欠如、カメラや物体の不安定な動き、音と映像のずれ、行動と状態の一貫性の不足、物体の変形、不正確な3D構造、あり得ない物理の動きです(参照*7)。
閉ループでは別の問題も起きます。ある研究は、閉ループのやりとりで想像した結果と実際の結果が体系的にずれることを幻覚と定義し、世界モデルが見た目にはもっともらしい経過を作りながら、物理的に誤った状態の移り変わりや、ポリシーの行動に対する偽の成功信号まで予測しうると指摘しました(参照*17)。
学習データの側にも構造的な限界があります。物理システムは本質的に非定常で常に変化し、安全上重大な故障やまれな故障モードなど最も重要な出来事は、静的な訓練データに一度も現れない可能性があります(参照*2)。
そのため、出力の扱いには制限が付きます。Cosmos 3の出力は、物理的に正確なシミュレーション、信頼できる正解の推論、安全性が認証された意思決定として扱うべきものではありません。AIが生成した文章が自然であることと事実として正しいことが別であるのと同様に、物理AIが生成したシミュレーション映像がもっともらしく見えることと、物理的に正確であることは全く別です。
ロボット制御、自律システム、科学シミュレーション、安全性が重要な計画に関わる用途では、展開前に追加の検証、外部からの制約、システム全体の安全性分析、領域ごとのガードレールが必要です(参照*8)。
採用事例とエコシステムの動き

どこで使われているかを見ると、広がり方と数字の性質が同時に分かります。ただし、採用事例を読むときは、ベンダーが発表する数字と独立した検証を区別する視点が必要です。
物理AIの開発者は、業界全体でCosmosプラットフォームを使っています。ロボティクス向けにはAgile Robots、Doosan Robotics、LG Electronics、Samsung Electronics、Skild AI、自動運転向けにはLi Auto、産業AIとスマートスペースの用途を支える映像AIエージェント向けにはCentific、Fogsphere、Linker Vision、Milestone Systems、Yuanが名前を挙げられています(参照*10)。
効率の改善値も出ています。Pegatronは訓練と展開の時間を67%削減、Delta Electronicsは欠陥検出率を17%改善、Foxconnは一次歩留まりを約3%改善、Inventecはデータ収集の手間を30%削減し、Li AutoはOmniverse NuRecのモデルで1,000件を超えるニューラルシーン再構成と、1日あたり30万件を超えるレンダリングとシミュレーションを行っています。これらはベンダー報告で、一般的な展開ではなく特定の用途を対象にした数値です(参照*18)。
少ない実データでの成果例もあります。Aigenは、多様な作物と雑草のバリエーションを合成するためにCosmosを追加学習し、自律除草システムの訓練で実世界データを1%だけ使って強い性能に届きました(参照*9)。
外部の評価も出ています。技術レポート執筆の時点で、追加学習を行ったCosmos 3モデルは、Artificial Analysisにより最高のオープンソースのText-to-ImageモデルおよびImage-to-Videoモデル、RoboArenaにより最高のポリシーモデルに位置づけられました(参照*19)。
順位は評価した時点と対象の範囲で変わるため、自社の用途に近い条件かどうかを見分けたうえで読み取れます。
おわりに
Cosmos 3は、世界を作る、物理を推論する、行動を出すという3つを1つに束ねた物理世界向けの基盤モデルです。能力別にモデルを切り替えていた工程が1回の計算の流れに収まり、合成データの生成と品質の選別、ベンチマークでの採点がつながることで、訓練と評価の往復が速くなります。「数か月から数日へ」という短縮は、このスタック統合と自動化の組み合わせによるものです。
一方で、出力は物理的に正確なシミュレーションとしては扱えず、閉ループでは幻覚という崩れも起きます。公開されている数値はベンダー報告や特定条件の測定を含むため、自社の条件に置き換えて確かめる作業が必要です。生成AIの業務導入で私が繰り返し見てきたパターンと同じで、「できる」と「安全に使える」と「現場に定着する」は別々に検証しなければなりません。展開前の追加検証と安全設計は、Cosmos 3に限らずフィジカルAI全般に共通する前提条件です。
監修者
安達裕哉(あだち ゆうや)
デロイト トーマツ コンサルティングにて品質マネジメント、人事などの分野でコンサルティングに従事しその後、監査法人トーマツの中小企業向けコンサルティング部門の立ち上げに参画。大阪支社長、東京支社長を歴任したのち2013年5月にwebマーケティング、コンテンツ制作を行う「ティネクト株式会社」を設立。ビジネスメディア「Books&Apps」を運営。
2023年7月に生成AIコンサルティング、およびAIメディア運営を行う「ワークワンダース株式会社」を設立。ICJ2号ファンドによる調達を実施(1.3億円)。
著書「頭のいい人が話す前に考えていること」 が、95万部(2026年6月時点)を売り上げる。
(“2023年・2024年上半期に日本で一番売れたビジネス書”(トーハン調べ/日販調べ))
参照
- (*1) PubMed Central (PMC) – A review of embodied intelligence systems: a three-layer framework integrating multimodal perception, world modeling, and structured strategies
- (*2) A Definition and Roadmap for World Models
- (*3) GigaBrain-0: A World Model-Powered Vision-Language- Action Model
- (*4) NVIDIA Isaac Sim: Enabling Scalable, GPU-Accelerated Simulation for Robotics
- (*5) Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI Reasoning and Action
- (*6) DeepInfra – Cosmos3 Nano API – Demo – DeepInfra
- (*7) GitHub – GitHub – NVIDIA/cosmos: NVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more. · GitHub
- (*8) nvidia/Cosmos3-Nano · Hugging Face
- (*9) NVIDIA Technical Blog – Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control
- (*10) NVIDIA Newsroom – NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI
- (*11) arXiv.org – [2511.00062] World Simulation with Video Foundation Models for Physical AI
- (*12) Cosmos Cookbook
- (*13) PBench: A Physical AI Benchmark for World Models
- (*14) NVIDIA Technical Blog – Beyond VLAs: How World Action Models Reshape Robot Manipulation
- (*15) GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
- (*16) World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
- (*17) WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
- (*18) Futurum – NVIDIA Cosmos 3 and Open Agent Tools: Is Physical AI About to Leave the Lab?
- (*19) arXiv.org – Omnimodal World Models for Physical AI