NVIDIA Cosmos Reason 2 リリースノート / 新機能
NVIDIAは、ロボットやAIエージェントが物理世界で計画し行動するために必要な常識と物理的推論を提供することを目的としたオープンリasoningビジョン・ランゲージモデル(VLM)であるCosmos Reason 2をリリースしました。このモデルは現在、Physical AI BenchおよびPhysical Reasoningのリーダーボードで視覚理解に関するトップランクのオープンモデルとなっています。
技術的な機能と改善点
Cosmos Reason 2は、空間-時間の理解とタイムスタンプの精度を向上させることで前バージョンを上回ります。エッジとクラウドの両環境で柔軟にデプロイできるよう設計されており、2Bおよび8Bのパラメータサイズで提供されます。
主な技術的アップグレードは以下の通りです:
- Expanded Context Window: 入力トークン上限が256Kに増加し、Cosmos Reason 1がサポートしていた16Kトークンから大幅に拡大しました。
- Enhanced Visual Perception: モデルは現在、2D/3Dポイントの位置特定、バウンディングボックス座標、軌道データ、そして光学文字認識(OCR)をサポートします。
- Deployment Flexibility: 2Bおよび8Bのモデルサイズにより、さまざまなデプロイ規模をサポートします。
物理AIの主なユースケース
Cosmos Reason 2は、物理環境におけるより自律的で体系的な意思決定を可能にするため、3つの主要領域で活用されています。
ビデオ分析AIエージェント
Cosmos Reason 2は、エージェントが大量のビデオデータから洞察を抽出できるようにします。OCRと2D/3Dポイント位置特定が追加されたことで、エージェントはビデオ内のテキストを解釈し、環境条件を評価できます。NVIDIAは、これらのエージェントの開発を加速するためにVideo Search and Summarization(VSS)ブループリントを提供しています。例えば、SalesforceはVSSブループリントとCosmos ReasonをVLMとして使用し、Cobaltロボットの映像を分析して職場の安全性とコンプライアンスを評価しています。
データ注釈と批評
このモデルは、トレーニングデータセット向けに高品質でタイムスタンプ付きのキャプションや詳細な説明の生成を自動化します。UberはCosmos Reason 2を活用して、自律走行車(AV)トレーニングデータの検索可能なビデオキャプションを作成しています。AVビデオキャプションとVQAに関する共同執筆レシピにおいて、8Bモデルはファインチューニング後に測定可能な改善を示しました:
- BLEU scores: 10.6%向上(0.113から0.125へ)。
- MCQ-based VQA: 0.67ポイント上昇(80.18%から80.85%へ)。
- LingoQA: 13.8%向上(63.2%から77.0%へ)。
ロボット計画と推論
Cosmos Reason 2はVision Language Action(VLA)モデルの推論エンジンとして機能します。タスクの次の論理的ステップを決定するだけでなく、ロボットのグリッパー用の具体的な軌道座標も提供できるようになりました。Encordはロボティクスおよび物理AI開発者を支援するために、Cosmos Reason 2を自社のData Agentライブラリに統合しています。
Cosmosモデルファミリーエコシステム
Cosmos Reason 2は、物理AI向けに設計された幅広いモデルスイートの一部です:
- Cosmos Predict 2.5: 将来の物理状態をビデオとして予測する生成AIモデルです。2億本のクリップで事前学習されており、テキスト、画像、またはビデオ入力に基づいて最大30秒の物理的に一貫したビデオを生成できます。2Bおよび14Bサイズで提供されます。
- Cosmos Transfer 2.5: ビデオから実世界へのスタイル転送を行うマルチコントロールモデルで、異なる環境や照明条件でシミュレーションを拡張するために使用され、NVIDIA Isaac SimやNVIDIA Omniverse NuRecと組み合わせて使用されることが多いです。
- NVIDIA GR00T N1.6: ヒューマノイドロボット向けに特化したオープンリasoning VLAモデルで、Cosmos Reasonを活用してコンテキスト理解と全身制御を強化します。