Anthropic 評估當前 AI 模型可能使美國勞動生產力年增長率提升 1.8%
簡要重點
Anthropic 對 10 萬筆真實的 Claude.ai 對話進行研究,發現 AI 可將任務完成時間減少約 80%,若將此結果推廣至整個美國經濟,未來十年每年勞動生產力增長率可能提升約 1.8%——約為近期增長率的兩倍。
方法論:隱私保護的對話分析
Anthropic 使用其 CLIO 隱私保護分析系統,從 Free、Pro 和 Max 各級別中抽樣 10 萬筆匿名的 Claude.ai 對話。針對每筆對話,由 Claude 產生兩項估計:
- 無 AI 時間 – 一位熟練專業人員獨立完成該任務所需的小時數。
- 有 AI 時間 – 使用者與 Claude 互動所花費的總分鐘數(包含閱讀、思考、打字及執行建議)。
Claude 透過結構化提示(詳見附錄)產生這些估計。所得任務層級的時間資料隨後對應至 O*NET 職業分類,並與 2024 年 5 月的職業就業與薪資統計資料(OEWS)匹配,以計算隱含的勞動成本。
Claude 時間估計的驗證
自我一致性
在 1,800 筆同意提供的對話中,Claude 的估計在提示變動下高度穩定,對數尺度相關係數為 r = 0.89–0.93。
軟體工程工單的外部基準測試
另一項基準測試將 Claude Sonnet 4.5 的估計(僅標題與描述)與開發者自評及實際追蹤時間,針對 1,000 筆 JIRA 工單進行比較:
| 來源 | Spearman ρ | 對數尺度皮爾森 r |
|---|---|---|
| 開發者(自評) | 0.50 | 0.67 |
| Claude Sonnet 4.5(無範例) | 0.44 | 0.46 |
| Claude Sonnet 4.5(10 範例提示) | 0.39 | 0.48 |
Claude 的方向性相關性僅略低於開發者,但其估計傾向壓縮分佈(短任務高估、長任務低估)。
任務層級的生產力發現
- 平均時間節省 – 在樣本中,Claude 將任務時長減少 ≈ 80%(中位數 84%)。
- 任務成本 – 中位數對話對應專業勞動成本為 $54(基於 OEWS 薪資)。
- 職業差異 – 管理與法律任務的預估人工時間最長(約 2 小時),隱含成本最高($119–$133)。食物準備、安裝/維護與運輸任務較短(約 0.3–0.5 小時),成本較低(約 $8)。
- 極端範例 – 課程設計任務預估需 4.5 小時,實際僅花 11 分鐘完成(節省約 96%,隱含成本 $115)。發票撰寫任務節省約 87% 時間。
從任務層級增益到整體經濟影響
Anthropic 依循 Hulten 定理,以以下兩項權重計算每項任務的生產力增益:
- Claude 評估的該任務佔職業工作時間的比例,以及
- 該職業佔美國總薪資支出的比例(OEWS 2024)。
假設當前世代 AI 模型在所觀察任務中普遍採用,模型預測美國勞動生產力將實現 每年 1.8% 的年化增長。以勞動所得佔比 0.6 計算,這相當於 每年約 1.1% 的總要素生產力(TFP)增長——此水平自 2000 年代初以來未曾見過。
職業貢獻者
推動預期增長的前五大職業為:
- 軟體開發人員(約佔總增長的 19%)
- 一般與運營經理(約 6%)
- 市場研究分析師與行銷專員(約 5%)
- 客戶服務代表(約 4%)
- 中學教師(約 3%)
餐飲、醫療照護、建築與零售等產業貢獻甚微,主要因其任務在 Claude 樣本中出現頻率較低。
可能的瓶頸與不均勻增益
雖然許多任務的時間減少達 80–95%,但部分任務的節省幅度較小或可忽略(例如,診斷影像檢查僅約 20%)。AI 加速程度低的任務可能成為相對瓶頸,進而改變工作者在職業內的時間分配方式。
分析的限制
- 估計準確性 – Claude 的預測並不完美,且除軟體工單基準外,缺乏現實世界驗證。
- 任務分類 – 對應至 O*NET 摘要時,忽略了隱性知識、任務間依賴關係與非任務活動(例如,對話後的驗證)。
- 採用假設 – 1.8% 的數字假設當前模型立即且全面採用,忽略了技術擴散時滯與異質性採用。
- 資料範圍 – 資料僅反映 Claude.ai 的使用情況,可能偏向使用者認為適合 AI 的任務。
- 結構性影響 – 模型未捕捉組織重組、資本投資或歷史性擴大生產力增益的廣泛創新。
意義與未來工作
- 上限估計 – 1.8% 的年增長應視為當前模型效果的上限,而非預測。模型進步更快可能提高上限,而採用較慢則可能降低。
- 經濟指數追蹤 – Anthropic 將持續將此類估計納入其經濟指數,以長期觀察任務層級節省如何隨著模型能力與採用率演變。
- 政策相關性 – 即使生產力小幅提升,也可能影響薪資成長、通膨動態與勞動市場政策,凸顯即時衡量的必要性。
- 研究議程 – 未來工作應(1)以更大規模的現實資料集驗證模型時間估計,(2)納入對話後驗證的耗時,以及(3)建模組織重組的影響。
「這些生產力提升來自於加速現有任務的完成。歷史上,具有轉折意義的生產力進步來自於根本性的生產重組,而非僅僅加快舊任務的執行。」 – Anthropic 研究備忘錄
附錄:用於時間估計的提示片段
(完整提示見原始文件;以下為可重現性的關鍵 excerpt。)
- 人工時間估計提示 – 要求 Claude 推理所需小時數,輸出
<answer>標籤。 - 互動時間估計提示 – 要求 Claude 評估使用者花費的分鐘數,包含閱讀、打字與執行建議。
- 軟體開發基準提示 – 提供任務標題/描述,並要求輸出原始小時數。
- 任務分配提示 – 請求輸出 O*NET 任務 ID 與各職業每周小時數的 JSON 對應表。
Sources
- OriginalEstimating AI productivity gains
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch