NVlabs/alpamayo

NVIDIA Alpamayo 1 Nano is an open 10B reasoning VLA model for autonomous vehicles that pairs driving trajectories with Chain-of-Causation reasoning.

What it solves

Alpamayo 1 は、自動運転の一般化を改善するために設計されており、標準モデルがしばしば苦労する「ロングテール」シナリオに特化して対処します。高レベルの推論と具体的な行動予測(軌道計画)の間のギャップを埋め、車両が複雑な環境をより信頼性高くナビゲートできるように支援します。

How it works

このプロジェクトは、Cosmos-Reason バックボーンとアクション エキスパートを組み合わせた Vision-Language-Action (VLA) アーキテクチャを使用します。マルチカメラ動画とエゴモーション履歴を入力として取り、2 つの出力を生成します:理由付けトレース(Chain-of-Causation 理由付けと呼ばれる方法を使用)と、10 Hz で 6.4 秒のホライズンにわたる 64 個のウェイポイントからなる予測軌道。

Who it’s for

このツールは、自動車 (AV) スタックで作業している研究者および開発者を対象としており、カスタマイズされた AV アプリケーションを構築するための基盤モデルまたは理由付けベースの自動ラベル付けツールを作成したいと考えている人々に適しています。

Highlights

  • Chain-of-Causation (CoC) reasoning: ヒューマン・イン・ザ・ループを用いたハイブリッド自動ラベル付けを使用して、理由付けトレースを生成します。
  • VLA Architecture: ビジョン、言語、およびアクション予測を単一のモデルに統合します。
  • Trajectory Prediction: 6.4s ホライズンに対する正確なウェイポイントを予測します。
  • SFT and RL Pipelines: Alpamayo Recipes を介して、教師ありファインチューニング (SFT) と強化学習 (RL) のポストトレーニング パイプラインを含みます。

{"summary": "自動運転のための Vision-Language-Action モデルで、理由付けトレースと軌道予測を組み合わせて複雑でロングテールの運転シナリオに対処します。"}

{"title": ""}