OpenAI GDPval:衡量模型在真实知识工作中的性能
OpenAI 推出了 GDPval,这是一套新的评估框架,用于衡量 AI 模型在 44 个专业职业的 1,320 项经济价值任务上的表现,以跟踪真实世界的生产力提升。
OpenAI GDPval:衡量模型在真实知识工作中的性能
OpenAI 推出了 GDPval,这是一套旨在跟踪 AI 模型在经济价值真实任务上表现的新评估框架。通过从对美国国内生产总值(GDP)贡献最大的行业和职业中抽取任务,GDPval 将 AI 评估从学术基准转向衡量实际的专业生产力。
GDPval 框架与方法论
GDPval 在覆盖美国 GDP 超过 5% 的前 9 大行业的 44 种职业中衡量模型性能。评估包括 1,320 项专门任务,其中有一套“黄金”开源的 220 项任务。
任务选择与设计
为确保经济相关性,OpenAI 对职业采用了特定的选择流程:
- 行业选择: 基于圣路易斯联邦储备银行的数据,选取了对美国 GDP 贡献超过 5% 的前 9 大行业。
- 职业选择: 在这些行业中,挑选了对总工资和报酬贡献最大的 5 种职业,前提是它们主要属于知识工作。
- 知识工作阈值: 使用 O*NET 数据,如果职业中至少 60% 的组成任务不涉及体力或手工劳动,则该职业符合条件。
数据集构建
任务由平均拥有 14 年经验的专业人士制定。每个任务基于真实的工作成果——例如护理护理计划、工程蓝图或法律简报——而非合成的考试题目。每个任务平均经过五轮专家审查,包括基于模型的验证和同行检查,以确保其具备代表性和可行性。
与传统基准不同,GDPval 任务包含参考文件和上下文,并要求交付物可能包括电子表格、图表、幻灯片或多媒体文档。
模型性能与评分
模型性能通过同一专业领域的专家“评分员”进行盲比对来评估。这些评分员将 AI 生成的交付物与人类产出进行排名,分类为“更好”“与人类相当”或“逊于”人类专家。
关键发现与基准
对 GPT-4o、o4-mini、OpenAI o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro 和 Grok 4 进行的盲评显示如下:
- 人类等价性: 前沿模型正接近行业专家的质量。Claude Opus 4.1 在近一半的任务中被评为与人类相当或更好,尤其在美学和布局方面表现突出。
- 准确性: GPT-5 在准确性和特定领域知识方面表现尤为出色。
- 增长趋势: 从 GPT-4o(2024 年春)到 GPT-5(2025 年夏),性能提升超过两倍,呈线性趋势。
- 效率: 前沿模型完成这些任务的速度约为人类专家的 100 倍,成本也约为 100 倍,尽管这些数字仅考虑推理和 API 成本,不包括人工监督。
自动评分
OpenAI 开发了“自动评分器”,一种训练用于预测人类专家判断的 AI 系统。虽然在 evals.openai.com 上作为实验性研究服务提供,但由于可靠性差距,尚未用于取代人类专家评分员。
局限性与未来发展
GDPval 目前是一种一次性评估,这意味着它未能捕捉专业工作中的迭代特性,例如根据客户反馈修改文档。它也未考虑真实任务中固有的模糊性,即专业人员必须先确定正确的方案才能执行交付物。
GDPval 的未来迭代将致力于:
- 扩大覆盖的职业和行业数量。
- 融入交互式工作流和多稿迭代。
- 包含需要应对模糊性的任务,以更好地反映专业知识工作的复杂性。