OpenAI GDPval:衡量模型在實務知識工作中的表現

OpenAI 推出了 GDPval,一個新評估框架,旨在追蹤 AI 模型在具經濟價值的實務任務上的表現。透過從對美國國內生產總值(GDP)貢獻最大的產業與職業中抽取任務,GDPval 將 AI 評估從學術基準轉向衡量實際的專業生產力。

GDPval 框架與方法論

GDPval 針對 44 個職業(涵蓋對美國 GDP 貢獻超過 5% 的前 9 大產業)測量模型表現。此評估包含 1,320 項專業任務,其中有一套「金標」開源的 220 項任務。

任務選擇與設計

為確保經濟相關性,OpenAI 使用了特定的職業選擇流程:

  • 產業選擇: 依據聖路易斯聯邦儲備銀行的資料,挑選出對美國 GDP 貢獻超過 5% 的前 9 大產業。
  • 職業選擇: 在這些產業中,選取對總薪資與補償貢獻最大的 5 個職業,前提是它們主要屬於知識工作。
  • 知識工作門檻: 以 O*NET 資料為基礎,若職業中至少 60% 的組成任務不涉及體力或手工勞動,即符合資格。

資料集建構

任務由平均具備 14 年經驗的專業人士設計。每項任務皆基於實際工作產出——例如護理照護計畫、工程藍圖或法律簡報——而非合成的考試題目。每項任務經過平均五輪的專家審查,包括模型驗證與同儕檢查,以確保其具代表性且可行。

與傳統基準不同,GDPval 任務附帶參考檔案與情境,且要求的交付成果可能包括試算表、圖表、簡報或多媒體文件。

模型表現與評分

模型表現透過盲測比較,由同領域的專家「評分者」進行評估。這些評分者將 AI 產出的交付成果與人類專業作品進行排名,分類為「優於」、「與人類相當」或「劣於」人類專家。

主要發現與基準

盲測評估涵蓋 GPT-4o、o4-mini、OpenAI o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro 與 Grok 4,顯示以下結果:

  • 與人類等同: 前沿模型正接近產業專家的品質。Claude Opus 4.1 在近半數任務中被評為與人類相當或更佳,特別在美學與版面設計上表現突出。
  • 準確性: GPT-5 在準確度與領域專業知識方面展現卓越表現。
  • 成長趨勢: 從 GPT-4o(2024 年春)到 GPT-5(2025 年夏),性能提升超過兩倍,呈線性增長。
  • 效率: 前沿模型完成這些任務的速度約為人類專家的 100 倍,成本亦約為 100 倍更低,然而此數據僅計算推論與 API 成本,未包含人工監督。

自動化評分

OpenAI 開發了「自動評分器」,這是一個訓練用以預測人類專家判斷的 AI 系統。雖然在 evals.openai.com 上以實驗性研究服務提供,但因可靠性尚有差距,尚未取代人類專家評分者。

限制與未來發展

GDPval 目前為一次性評估,意味著它未能捕捉專業工作中的迭代過程,例如根據客戶回饋修訂文件。它亦未考慮實務任務中固有的模糊性,專業人士往往需先確定正確的處理方式再執行交付。

未來的 GDPval 版本將致力於:

  • 擴大涵蓋的職業與產業數量。
  • 納入互動式工作流程與多稿迭代。
  • 包含需要處理模糊性的任務,以更真實地反映專業知識工作的複雜性。

Sources