Anthropic 評估當前 AI 模型可能使美國勞動生產力年增長率提升 1.8%

簡要重點

Anthropic 對 10 萬筆真實的 Claude.ai 對話進行研究,發現 AI 可將任務完成時間減少約 80%,若將此結果推廣至整個美國經濟,未來十年每年勞動生產力增長率可能提升約 1.8%——約為近期增長率的兩倍。

方法論:隱私保護的對話分析

Anthropic 使用其 CLIO 隱私保護分析系統,從 Free、Pro 和 Max 各級別中抽樣 10 萬筆匿名的 Claude.ai 對話。針對每筆對話,由 Claude 產生兩項估計:

  • 無 AI 時間 – 一位熟練專業人員獨立完成該任務所需的小時數。
  • 有 AI 時間 – 使用者與 Claude 互動所花費的總分鐘數(包含閱讀、思考、打字及執行建議)。

Claude 透過結構化提示(詳見附錄)產生這些估計。所得任務層級的時間資料隨後對應至 O*NET 職業分類,並與 2024 年 5 月的職業就業與薪資統計資料(OEWS)匹配,以計算隱含的勞動成本。

Claude 時間估計的驗證

自我一致性

在 1,800 筆同意提供的對話中,Claude 的估計在提示變動下高度穩定,對數尺度相關係數為 r = 0.89–0.93

軟體工程工單的外部基準測試

另一項基準測試將 Claude Sonnet 4.5 的估計(僅標題與描述)與開發者自評及實際追蹤時間,針對 1,000 筆 JIRA 工單進行比較:

來源 Spearman ρ 對數尺度皮爾森 r
開發者(自評) 0.50 0.67
Claude Sonnet 4.5(無範例) 0.44 0.46
Claude Sonnet 4.5(10 範例提示) 0.39 0.48

Claude 的方向性相關性僅略低於開發者,但其估計傾向壓縮分佈(短任務高估、長任務低估)。

任務層級的生產力發現

  • 平均時間節省 – 在樣本中,Claude 將任務時長減少 ≈ 80%(中位數 84%)。
  • 任務成本 – 中位數對話對應專業勞動成本為 $54(基於 OEWS 薪資)。
  • 職業差異 – 管理與法律任務的預估人工時間最長(約 2 小時),隱含成本最高($119–$133)。食物準備、安裝/維護與運輸任務較短(約 0.3–0.5 小時),成本較低(約 $8)。
  • 極端範例 – 課程設計任務預估需 4.5 小時,實際僅花 11 分鐘完成(節省約 96%,隱含成本 $115)。發票撰寫任務節省約 87% 時間。

從任務層級增益到整體經濟影響

Anthropic 依循 Hulten 定理,以以下兩項權重計算每項任務的生產力增益:

  1. Claude 評估的該任務佔職業工作時間的比例,以及
  2. 該職業佔美國總薪資支出的比例(OEWS 2024)。

假設當前世代 AI 模型在所觀察任務中普遍採用,模型預測美國勞動生產力將實現 每年 1.8% 的年化增長。以勞動所得佔比 0.6 計算,這相當於 每年約 1.1% 的總要素生產力(TFP)增長——此水平自 2000 年代初以來未曾見過。

職業貢獻者

推動預期增長的前五大職業為:

  1. 軟體開發人員(約佔總增長的 19%)
  2. 一般與運營經理(約 6%)
  3. 市場研究分析師與行銷專員(約 5%)
  4. 客戶服務代表(約 4%)
  5. 中學教師(約 3%)

餐飲、醫療照護、建築與零售等產業貢獻甚微,主要因其任務在 Claude 樣本中出現頻率較低。

可能的瓶頸與不均勻增益

雖然許多任務的時間減少達 80–95%,但部分任務的節省幅度較小或可忽略(例如,診斷影像檢查僅約 20%)。AI 加速程度低的任務可能成為相對瓶頸,進而改變工作者在職業內的時間分配方式。

分析的限制

  • 估計準確性 – Claude 的預測並不完美,且除軟體工單基準外,缺乏現實世界驗證。
  • 任務分類 – 對應至 O*NET 摘要時,忽略了隱性知識、任務間依賴關係與非任務活動(例如,對話後的驗證)。
  • 採用假設 – 1.8% 的數字假設當前模型立即且全面採用,忽略了技術擴散時滯與異質性採用。
  • 資料範圍 – 資料僅反映 Claude.ai 的使用情況,可能偏向使用者認為適合 AI 的任務。
  • 結構性影響 – 模型未捕捉組織重組、資本投資或歷史性擴大生產力增益的廣泛創新。

意義與未來工作

  • 上限估計 – 1.8% 的年增長應視為當前模型效果的上限,而非預測。模型進步更快可能提高上限,而採用較慢則可能降低。
  • 經濟指數追蹤 – Anthropic 將持續將此類估計納入其經濟指數,以長期觀察任務層級節省如何隨著模型能力與採用率演變。
  • 政策相關性 – 即使生產力小幅提升,也可能影響薪資成長、通膨動態與勞動市場政策,凸顯即時衡量的必要性。
  • 研究議程 – 未來工作應(1)以更大規模的現實資料集驗證模型時間估計,(2)納入對話後驗證的耗時,以及(3)建模組織重組的影響。

「這些生產力提升來自於加速現有任務的完成。歷史上,具有轉折意義的生產力進步來自於根本性的生產重組,而非僅僅加快舊任務的執行。」 – Anthropic 研究備忘錄


附錄:用於時間估計的提示片段

(完整提示見原始文件;以下為可重現性的關鍵 excerpt。)

  • 人工時間估計提示 – 要求 Claude 推理所需小時數,輸出 <answer> 標籤。
  • 互動時間估計提示 – 要求 Claude 評估使用者花費的分鐘數,包含閱讀、打字與執行建議。
  • 軟體開發基準提示 – 提供任務標題/描述,並要求輸出原始小時數。
  • 任務分配提示 – 請求輸出 O*NET 任務 ID 與各職業每周小時數的 JSON 對應表。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch