NVlabs/alpamayo
NVIDIA Alpamayo 1 Nano is an open 10B reasoning VLA model for autonomous vehicles that pairs driving trajectories with Chain-of-Causation reasoning.
它解決了什麼問題
Alpamayo 1 旨在提升自動駕駛的泛化能力,特別是針對標準模型常常遇到困難的「長尾」場景。它彌合了高層次推理與具體動作預測(軌跡規劃)之間的差距,以幫助車輛在複雜環境中更可靠地導航。
它是如何運作的
此專案使用結合 Cosmos-Reason 骨幹與動作專家的視覺-語言-動作(VLA)架構。它以多鏡頭影像和自我運動歷史作為輸入,產生兩種輸出:一種推理軌跡(使用稱為因果鏈推理的方法)以及一個由 64 個航點組成的預測軌跡,時間範圍為 6.4 秒,頻率為 10 Hz。
它適合誰使用
此工具旨在供從事自動駕駛車輛(AV)堆疊的研究人員和開發者使用,特別是那些尋找基礎模型以構建客製化 AV 應用程式或創建基於推理的自動標註工具的人。
亮點
- 因果鏈(CoC)推理:使用帶有人在迴圈中的混合自動標註來生成推理軌跡。
- VLA 架構:將視覺、語言和動作預測整合到單一模型中。
- 軌跡預測:預測 6.4秒範圍內的精確航點。
- SFT 和 RL 管道:透過 Alpamayo Recipes 包含監督微調(SFT)和強化學習(RL)的後訓練管道。