NVIDIA Cosmos Reason 2 版本說明 / 新功能
技術能力與改進
Cosmos Reason 2 在前代基礎上提升了時空理解與時間戳精度。它被設計為可在邊緣與雲端環境靈活部署,提供 2B 與 8B 參數規模。
主要技術升級包括:
- 擴展上下文窗口:輸入 token 限制提升至 256K,較 Cosmos Reason 1 支援的 16K token 有顯著提升。
- 增強視覺感知:模型現在支援 2D/3D 點定位、邊界框座標、軌跡資料以及光學字符辨識 (OCR)。
- 部署彈性:透過 2B 與 8B 模型規模支援多種部署規模。
物理 AI 的主要使用案例
Cosmos Reason 2 應用於三個主要領域,以實現更自主且有條理的實體環境決策。
影片分析 AI 代理
Cosmos Reason 2 使代理能從大量影片資料中提取洞見。加入 OCR 與 2D/3D 點定位後,這些代理能解讀影片中的文字以評估環境狀況。NVIDIA 提供 Video Search and Summarization (VSS) 藍圖以加速此類代理的開發。例如,Salesforce 使用 VSS 藍圖與 Cosmos Reason 作為 VLM,分析 Cobalt 機器人拍攝的影片,以確保工作場所安全與合規。
資料標註與評論
模型自動生成高品質、帶時間戳的字幕與詳細描述,以供訓練資料集使用。Uber 正利用 Cosmos Reason 2 為自動駕駛車輛 (AV) 訓練資料建立可搜尋的影片字幕。在共同撰寫的 AV 影片字幕與 VQA 食譜中,8B 模型在微調後顯示出可量化的提升:
- BLEU 分數:提升 10.6%(0.113 至 0.125)。
- 基於 MCQ 的 VQA:提升 0.67 個百分點(80.18% 至 80.85%)。
- LingoQA:提升 13.8%(63.2% 至 77.0%)。
機器人規劃與推理
Cosmos Reason 2 作為 Vision Language Action (VLA) 模型的推理引擎。除了決定任務的下一步之外,它現在還能提供機器人抓手的具體軌跡座標。Encord 已將 Cosmos Reason 2 整合至其 Data Agent 函式庫,以支援機器人與物理 AI 開發者。
Cosmos 模型家族生態系統
Cosmos Reason 2 是一套針對物理 AI 設計的更廣泛模型組合的一部分:
- Cosmos Predict 2.5:一種生成式 AI 模型,可預測未來的物理狀態並以影片呈現。它在 2 億段影片上預訓練,能根據文字、圖像或影片輸入生成長達 30 秒的物理一致影片。提供 2B 與 14B 兩種規模。
- Cosmos Transfer 2.5:一種多控制模型,用於 video-to-world 風格轉換,可在不同環境與光照條件下擴展模擬,常與 NVIDIA Isaac Sim 或 NVIDIA Omniverse NuRec 搭配使用。
- NVIDIA GR00T N1.6:一款專為類人機器人設計的開放式推理 VLA 模型,利用 Cosmos Reason 增強其情境理解與全身控制。