Hugging Face 开源 DeepResearch
代理框架在 LLM 性能中的作用
代理框架是集成在大型语言模型(LLM)之上的一个层,它使模型能够执行诸如浏览网页或读取 PDF 文档之类的操作,并将这些操作组织成一个结构化的步骤序列。
将 LLMs 集成到代理系统中相比独立模型能够带来显著的性能提升。Hugging Face 报告称,使用 smolagents 库在某些基准上可以提升多达 60 分。这与 OpenAI 的发现相呼应,OpenAI 指出 Deep Research 在“Humanity’s Last Exam”基准上相比独立 LLMs 表现显著更好。
使用 GAIA 进行基准测试
通用 AI 助手(GAIA)基准被用于评估这些系统,因为它需要高层次的规划和严格的执行。GAIA 问题通常涉及:
- 受限格式: 要求答案采用特定结构。
- 多模态能力: 从图像中提取信息。
- 信息收集: 查找多个相互依赖的数据片段。
- 复杂链: 按正确顺序执行问题求解轨迹。
虽然独立的 GPT-4 在 GAIA 验证集上的得分低于 7%,但 OpenAI 的 Deep Research 达到了 67.36%。Hugging Face 的开源实现目前达到 55.15%。
技术实现:CodeAgents 和工具
代码原生代理的优势
Hugging Face 使用一种称为 “CodeAgent” 的代理,其中代理以代码而非 JSON 的形式表达其行为。这种方法提供了几个技术优势:
- 简洁性: 代码能够更高效地表达复杂的动作序列。例如,运行并行的动作流相比 JSON 大块需要显著更少的步骤。
- 效率: 代码动作所需的步骤大约比 JSON 少 30%,从而减少 token 生成并降低运营成本。
- 状态管理: 代码能够更好地处理状态,特别是多模态任务,因为图像或音频可以分配给变量并在多个步骤中重复使用。
- 性能: LLMs 通常在代码上表现更好,这是因为在训练过程中对代码有广泛的接触。
工具集成
当前的概念验证利用了从 Microsoft Research 的 Magentic-One 改编的两个主要工具:
- 基于文本的网页浏览器: 用于初始网页交互的简单浏览器。
- 文本检查器: 能够读取各种文本文件格式的工具。
结果与比较
在 24 小时的复现冲刺中,Hugging Face 将 GAIA 上的开源最先进水平从大约 46%(Magentic-One)提升至 55.15%。当将相同的设置切换到基于 JSON 的代理时,代码原生方法的重要性凸显出来,这导致在验证集上的性能下降至 33%。
未来路线图与社区努力
为了与专有系统实现完全平等,Hugging Face 认为需要改进浏览器交互。下一阶段的开发重点是构建能够查看屏幕并直接通过鼠标和键盘进行交互的 GUI 代理。
其他社区对 Deep Research 的实现已经由包括 dzhng、assafelovic(gpt-researcher)、nickscamara、jina-ai 和 mshumer 在内的贡献者提出。Hugging Face 旨在使用如 DeepSeek R1 这样的开源 LLMs 进一步基准测试这些发现,并探索视觉 LMs 的集成。