NVIDIA AI-Q 藍圖:DeepResearch Bench 上排名第一的開源深度研究代理
NVIDIA 的 AI-Q 藍圖是一個可攜式、開源的深度研究代理,已在 DeepResearch Bench 上的 Hugging Face 「LLM with Search」排行榜中名列首位。此成就顯示開源 AI 堆疊能夠驅動先進的代理工作流程,與封閉源碼的替代方案相媲美甚至超越。
核心技術堆疊與架構
AI-Q 藍圖結合了兩個高效能的開源大型語言模型,以處理長上下文檢索、代理推理與綜合:
- Llama 3.3-70B Instruct:作為生成流暢且結構化報告的基礎。
- Llama-3.3-Nemotron-Super-49B-v1.5:一個以推理為中心的變體,透過神經架構搜尋(NAS)、知識蒸餾以及監督式與強化學習進行優化。它專為多步驟推理、查詢規劃、工具使用與反思而設計。
為了支援這些模型,參考範例整合了 NVIDIA NeMo Retriever 以在內部與外部資料上執行可擴展的多模態搜尋,並使用 NVIDIA NeMo Agent toolkit 來協調複雜的多步工作流程。此架構允許對本地與網路資料進行平行、低延遲的搜尋,便於在需要高度隱私與合規性的環境中部署。
Llama Nemotron 的深度推理能力
Llama-3.3-Nemotron-Super-49B-v1.5 進行了後訓練,以支援明確的代理推理,使用者可透過系統提示開啟或關閉推理功能。這使得模型既能作為一般聊天 LLM,也能作為代理管線中深度、思考鏈推理引擎。
主要技術規格包括:
- 後訓練:採用多階段方法,結合指令遵循、數學/程式推理與工具呼叫技能。
- 效能:擁有 49 億參數且上下文窗口可達 128K 令牌,模型可在單一 H100 GPU 或更小的設備上運行,確保推論成本可預測且快速。
- 血統:模型直接可追溯至開源的 Meta 權重,並對合成資料與微調資料集保持透明。
評估指標與透明度
AI-Q 強調推理痕跡與中間步驟的透明性。開發團隊結合標準與專門指標,以確保模型的健全性:
- 幻覺檢測:在生成過程中檢查事實性主張。
- 多來源綜合:能夠從不同證據中綜合出新見解。
- 引用可信度:自動評估主張與證據之間的關聯。
- RAGAS 指標:對檢索增強生成的準確性進行自動評分。
DeepResearch Bench 表現
DeepResearch Bench 透過超過 100 項長上下文、真實世界的研究任務,涵蓋科學、金融、藝術、歷史與軟體等領域,來評估代理堆疊。這些任務需要複雜的多跳推理與報告長度的綜合,而非簡單的問答。
截至 2025 年 8 月,AI-Q 在 LLM with Search 類別中取得 40.52 的總分,成為排名第一的完整開源授權堆疊。系統在全面性(報告深度)、洞察力(分析品質)與引用品質方面表現最為突出。
開發者可用性
Llama-3.3-Nemotron-Super-49B-v1.5 與 Llama 3.3-70B Instruct 均可於 Hugging Face 下載。開發者可使用 Python 將這些模型整合至自家管線,或以 vLLM 部署以獲得快速推論與工具呼叫支援。