Hugging Face 開源 DeepResearch
Hugging Face 已開發並開源一個代理框架,旨在重現 OpenAI 的 Deep Research 能力。透過使用程式碼原生代理方法,該系統在 GAIA 基準測試驗證集上獲得 55.15% 的分數,顯著優於先前的開源框架基準。
代理框架在 LLM 性能中的作用
代理框架是一層集成在大型語言模型(LLM)之上的層,使模型能夠執行動作——例如瀏覽網頁或閱讀 PDF 文件——並將這些操作組織成一系列結構化的步驟。
將 LLMs 整合到代理系統中可提供顯著的性能提升,優於獨立模型。Hugging Face 報告指出,使用 smolagents 庫在某些基準測試中可提升多達 60 分。這與 OpenAI 的發現相符,該發現指出 Deep Research 在「人類最後的考試」基準測試中顯著優於獨立 LLMs。
使用 GAIA 進行基準測試
通用 AI 助理(GAIA)基準測試用於評估這些系統,因為它需要高層次的規劃和嚴格的執行。GAIA 問題通常涉及:
- 受限格式: 要求答案具有特定結構。
- 多模態能力: 從圖像中提取資訊。
- 資訊收集: 尋找多個相互依賴的資料片段。
- 複雜鏈結: 按正確順序執行問題解決軌跡。
儘管獨立的 GPT-4 在 GAIA 驗證集上的得分低於 7%,OpenAI 的 Deep Research 達到 67.36%。Hugging Face 的開源實現目前達到 55.15%。
技術實作:CodeAgents 和工具
程式碼原生代理的優勢
Hugging Face 使用 "CodeAgent," 其中代理以程式碼而非 JSON 表達其動作。此方法提供了幾項技術優勢:
- 簡潔性: 程式碼能更有效地表達複雜的動作序列。例如,執行平行的動作流在程式碼中所需的步驟顯著少於在 JSON Blob 中。
- 效率: 程式碼動作所需的步驟約比 JSON 少 30%,減少 token 生成並降低運營成本。
- 狀態管理: 程式碼允許更好地處理狀態,尤其是多模態任務,因為圖像或音訊可以分配給變數並在多個步驟中重複使用。
- 效能: LLMs 通常在程式碼上表現更好,因為在訓練期間廣泛接觸程式碼。
工具整合
目前的概念驗證採用了兩個主要工具,這些工具改編自 Microsoft Research 的 Magentic-One:
- 文字網頁瀏覽器: 一個用於初始網頁互動的簡單瀏覽器。
- 文字檢查器: 能讀取各種文字檔案格式的工具。
結果與比較
在 24 小時的重現衝刺中,Hugging Face 將 GAIA 上的開源最佳狀態從約 46% (Magentic-One) 提升至 55.15%。當將相同的設置切換到基於 JSON 的代理時,凸顯了程式碼原生方法的重要性,這導致在驗證集上的性能下降至 33%。
未來路線圖與社區努力
為了與專有系統達成完全平等,Hugging Face 識別出改進瀏覽器互動的需求。開發的下一階段專注於構建能夠檢視螢幕並直接透過滑鼠和鍵盤互動的 GUI 代理。
其他社區的 Deep Research 實現來自貢獻者 dzhng、assafelovic (gpt-researcher)、nickscamara、jina-ai 和 mshumer。Hugging Face 旨在使用開源 LLMs(如 DeepSeek R1)進一步基準這些發現,並探索視覺 LMs 的整合。