OpenAI 深度研究
概览
OpenAI 已推出 深度研究,这是 ChatGPT 中的一项新型代理能力,旨在自动化复杂的多步骤互联网研究。通过综合数百个在线来源,该工具可以在几十分钟内完成通常需要人类几小时才能完成的研究任务,生成带有完整文档和引用的综合报告。
技术基础与方法论
深度研究由即将发布的 OpenAI o3 模型 的一个版本驱动,该版本专门针对网页浏览和数据分析进行了优化。
训练与推理
深度研究通过在具有挑战性的浏览和推理任务上进行端到端强化学习而开发。它使用了与 OpenAI o1 相同的强化学习方法,使模型能够:
- 制定并执行多步骤轨迹以定位数据。
- 根据遇到的信息实时回溯并调整搜索策略。
- 浏览用户上传的文件并利用 Python 工具绘制和迭代图表。
- 引用来源中的特定句子或段落以确保可验证性。
性能基准
驱动深度研究的模型在多项公开评估中取得了新的最先进(SOTA)成绩:
- 人类的最后考试: 该模型在覆盖 100+ 学科的此专家级测试中达到 26.6% 的准确率,显著优于 GPT-4o(3.3%)和 OpenAI o1(9.1%)。
- GAIA: 深度研究在 GAIA 基准测试中达到了新的 SOTA,该基准测试评估推理、多模态流畅性和工具使用。其平均得分为 67.36%(pass@1),cons@64 为 72.57%。
关键能力与使用场景
深度研究专为金融、科学、政策和工程等领域的密集型知识工作以及高风险的消费者研究(例如购买汽车或家电)而设计。
与 GPT-4o 的功能差异
虽然 GPT-4o 针对实时多模态对话进行了优化,但深度研究专为需要深度、细节和验证的多方面、特定领域的查询而构建。它将快速摘要转化为有文档记录的工作产出。
工作流程与用户体验
用户在 ChatGPT 消息编辑器中选择“深度研究”并提供查询。该过程通常需要 5 到 30 分钟。在此期间,侧边栏会提供已采取步骤和使用来源的实时摘要。最终输出为聊天中的详细报告。
访问与迭代更新
OpenAI 正在迭代部署深度研究,以管理高计算强度。
可用性与限制
截至 2025 年 4 月 24 日,使用限制已更新,以包含由 o4-mini 驱动的轻量版本以提高效率:
- 专业用户: 每月 250 次查询。
- Plus、团队、企业和教育用户: 每月 25 次查询。
- 免费用户: 每月 5 次查询。
功能演变
- 2026 年 2 月 10 日: 增加了与 MCP 或应用的连接、限制搜索仅限可信站点的能力、实时进度跟踪,以及通过后续提示中断和优化研究的能力。
- 2025 年 7 月 17 日: 通过 ChatGPT 代理引入了“代理模式”,提供对可视化浏览器的访问,以实现更广泛和更深入的研究。
局限性与安全
尽管具有这些能力,深度研究仍存在一些已知限制:
- 准确性: 它仍可能产生幻觉事实或做出错误推断,尽管相比之前的 ChatGPT 模型发生率较低。
- 校准: 模型偶尔会难以区分谣言与权威信息,并且可能无法准确传达不确定性。
- 格式: 报告和引用中可能会出现轻微的格式错误。
关于安全,OpenAI 的准备框架将驱动深度研究的 o3 早期版本识别为 中等风险。实验室已实施专门针对网页浏览风险的缓解措施,并继续监控有限发布。
未来路线图
OpenAI 计划扩展深度研究对专业数据源的访问,包括基于订阅或内部的资源。长期愿景是将深度研究(异步调查)与 Operator(实际行动)相结合,以使 ChatGPT 能够执行日益复杂的端到端任务。
Sources
- OriginalIntroducing deep research