OpenAI GDPval:衡量模型在真实知识工作中的性能

OpenAI 推出了 GDPval,这是一套新的评估框架,用于衡量 AI 模型在 44 个专业职业的 1,320 项经济价值任务上的表现,以跟踪真实世界的生产力提升。

OpenAI GDPval:衡量模型在真实知识工作中的性能

OpenAI 推出了 GDPval,这是一套旨在跟踪 AI 模型在经济价值真实任务上表现的新评估框架。通过从对美国国内生产总值(GDP)贡献最大的行业和职业中抽取任务,GDPval 将 AI 评估从学术基准转向衡量实际的专业生产力。

GDPval 框架与方法论

GDPval 在覆盖美国 GDP 超过 5% 的前 9 大行业的 44 种职业中衡量模型性能。评估包括 1,320 项专门任务,其中有一套“黄金”开源的 220 项任务。

任务选择与设计

为确保经济相关性,OpenAI 对职业采用了特定的选择流程:

  • 行业选择: 基于圣路易斯联邦储备银行的数据,选取了对美国 GDP 贡献超过 5% 的前 9 大行业。
  • 职业选择: 在这些行业中,挑选了对总工资和报酬贡献最大的 5 种职业,前提是它们主要属于知识工作。
  • 知识工作阈值: 使用 O*NET 数据,如果职业中至少 60% 的组成任务不涉及体力或手工劳动,则该职业符合条件。

数据集构建

任务由平均拥有 14 年经验的专业人士制定。每个任务基于真实的工作成果——例如护理护理计划、工程蓝图或法律简报——而非合成的考试题目。每个任务平均经过五轮专家审查,包括基于模型的验证和同行检查,以确保其具备代表性和可行性。

与传统基准不同,GDPval 任务包含参考文件和上下文,并要求交付物可能包括电子表格、图表、幻灯片或多媒体文档。

模型性能与评分

模型性能通过同一专业领域的专家“评分员”进行盲比对来评估。这些评分员将 AI 生成的交付物与人类产出进行排名,分类为“更好”“与人类相当”或“逊于”人类专家。

关键发现与基准

对 GPT-4o、o4-mini、OpenAI o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro 和 Grok 4 进行的盲评显示如下:

  • 人类等价性: 前沿模型正接近行业专家的质量。Claude Opus 4.1 在近一半的任务中被评为与人类相当或更好,尤其在美学和布局方面表现突出。
  • 准确性: GPT-5 在准确性和特定领域知识方面表现尤为出色。
  • 增长趋势: 从 GPT-4o(2024 年春)到 GPT-5(2025 年夏),性能提升超过两倍,呈线性趋势。
  • 效率: 前沿模型完成这些任务的速度约为人类专家的 100 倍,成本也约为 100 倍,尽管这些数字仅考虑推理和 API 成本,不包括人工监督。

自动评分

OpenAI 开发了“自动评分器”,一种训练用于预测人类专家判断的 AI 系统。虽然在 evals.openai.com 上作为实验性研究服务提供,但由于可靠性差距,尚未用于取代人类专家评分员。

局限性与未来发展

GDPval 目前是一种一次性评估,这意味着它未能捕捉专业工作中的迭代特性,例如根据客户反馈修改文档。它也未考虑真实任务中固有的模糊性,即专业人员必须先确定正确的方案才能执行交付物。

GDPval 的未来迭代将致力于:

  • 扩大覆盖的职业和行业数量。
  • 融入交互式工作流和多稿迭代。
  • 包含需要应对模糊性的任务,以更好地反映专业知识工作的复杂性。

Sources