NVlabs/alpamayo
NVIDIA Alpamayo 1 Nano is an open 10B reasoning VLA model for autonomous vehicles that pairs driving trajectories with Chain-of-Causation reasoning.
What it solves
Alpamayo 1 は、自動運転の一般化を改善するために設計されており、標準モデルがしばしば苦労する「ロングテール」シナリオに特化して対処します。高レベルの推論と具体的な行動予測(軌道計画)の間のギャップを埋め、車両が複雑な環境をより信頼性高くナビゲートできるように支援します。
How it works
このプロジェクトは、Cosmos-Reason バックボーンとアクション エキスパートを組み合わせた Vision-Language-Action (VLA) アーキテクチャを使用します。マルチカメラ動画とエゴモーション履歴を入力として取り、2 つの出力を生成します:理由付けトレース(Chain-of-Causation 理由付けと呼ばれる方法を使用)と、10 Hz で 6.4 秒のホライズンにわたる 64 個のウェイポイントからなる予測軌道。
Who it’s for
このツールは、自動車 (AV) スタックで作業している研究者および開発者を対象としており、カスタマイズされた AV アプリケーションを構築するための基盤モデルまたは理由付けベースの自動ラベル付けツールを作成したいと考えている人々に適しています。
Highlights
- Chain-of-Causation (CoC) reasoning: ヒューマン・イン・ザ・ループを用いたハイブリッド自動ラベル付けを使用して、理由付けトレースを生成します。
- VLA Architecture: ビジョン、言語、およびアクション予測を単一のモデルに統合します。
- Trajectory Prediction: 6.4s ホライズンに対する正確なウェイポイントを予測します。
- SFT and RL Pipelines: Alpamayo Recipes を介して、教師ありファインチューニング (SFT) と強化学習 (RL) のポストトレーニング パイプラインを含みます。
{"summary": "自動運転のための Vision-Language-Action モデルで、理由付けトレースと軌道予測を組み合わせて複雑でロングテールの運転シナリオに対処します。"}
{"title": ""}