NVlabs/alpamayo1.5

NVIDIA Alpamayo 1.5 Nano is an open 10B reasoning VLA model for autonomous vehicles with reinforcement-learning enhanced reasoning, navigation guidance, and visual question answering.

何を解決するか

Alpamayo 1.5 は、自律走行における高レベルの推論と具体的な行動予測のギャップを埋めるように設計されており、特に「ロングテール」(稀なまたは複雑な)シナリオにおいて有効です。これは、エンドツーエンドのドライブバックボーンや推論ベースの自動ラベリングツールを開発するための基盤を提供します。

動作方法

このシステムは、Cosmos-Reasonバックボーンと拡散エキスパートを備えたビジョン・ランゲージ・アクション(VLA)アーキテクチャを使用しています。プロセスは2段階のパイプラインに従います:

  1. 推論:ビジョン・ランゲージモデル(VLM)が「因果連鎖」の推論トレースを生成します。
  2. 行動:拡散エキスパートが、VLMの隠れ状態を条件として、軌道予測(6.4秒の予測範囲、10Hzで64のウェイポイント)を生成します。

Alpamayo 1.5 は、強化学習(RL)を用いて後学習され、推論と結果の軌道の整合性を向上させています。

対象ユーザー

カスタムドライブアプリケーションの構築、科学的調査、ベンチマーク作成に必要な、自律走行(AV)分野の研究者や開発者。

特徴

  • インタラクティブで操作可能:明示的なナビゲーションガイドや、入力カメラ数の可変をサポート。
  • マルチモーダル機能:軌道予測と一般的な視覚的質問応答(VQA)の両方に対応可能。
  • RLで後学習済み:Alpamayo 1 と比較して、推論品質と軌道の整合性が向上。
  • ハードウェア最適化:拡散エキスパートの起動オーバーヘッドを削減するためのオプションのCUDAグラフ加速を含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト