Anthropic 經濟指數 2026 年 1 月報告 – 經濟基本要素

簡要重點

Anthropic 的 2026 年 1 月經濟指數報告新增五項基礎指標——任務複雜度、人類與 AI 技能水平、使用情境、AI 自主性與任務成功率——用於分析 Claude 的使用情況,顯示 AI 採用仍存在地理上的不均,高收入地區更傾向以協作方式使用 Claude,且目前的 AI 成功率也降低了預期的生產力提升幅度。


引言:AI 經濟影響的新指標

該報告提出 經濟基本要素,這是一組簡單且保護隱私的衡量指標,透過要求 Claude 對匿名化的 Claude.ai 與第一方(1P)API 聊天記錄進行分類而得出。這些基本要素涵蓋了 AI 對宏觀經濟影響的五個相關面向:

  1. 任務複雜度 – 估計僅由人類完成的時間、AI 協助下的時間,以及是否在單一對話中涉及多項任務。
  2. 人類與 AI 技能 – 理解提示與回應所需的正式教育年數。
  3. 使用情境 – 工作、課業或個人用途。
  4. AI 自主性 – 決策權委託給 Claude 的程度。
  5. 任務成功率 – Claude 對自身是否完成任務的自我評估。

資料集包含一百萬筆隨機抽樣的 Claude.ai 對話(免費、專業、極限版)與一百萬筆 1P API 記錄,時間範圍為 2025 年 11 月 13 日至 20 日,即 Opus 4.5 發布前的期間。


1. 自 2025 年 9 月報告以來的變化

1.1 任務集中化持續存在

  • 前十大任務佔據 24 % 的 Claude.ai 對話(較 23 % 上升);1P API 流量中此比例更上升至 32 %(較 28 % 上升)。
  • 編碼相關任務主導:約 34 % 的 Claude.ai 對話與 46 % 的 API 對話涉及電腦與數學工作。

1.2 增強模式在 Claude.ai 上重新佔優

  • 增強型互動(任務迭代、學習、驗證)佔 Claude.ai 對話的 52 %,而自動化(指令式)使用則下降至 45 %
  • 產品發布——檔案建立、持久記憶與工作流程「技能」——似乎促使使用者轉向更具協作性的模式。

1.3 區域擴散

  • 美國趨同:各州人均使用量正變得更為均勻;基尼係數從 0.37 下降至 0.32。簡單外推顯示,完全均等可能在 2–5 年 內達成。
  • 全球集中化:Anthropic AI 使用指數(AUI)仍與每人 GDP 緊密相關;各國之間未見明顯趨同跡象。

2. 經濟基本要素 – 定義、驗證與限制

2.1 操作化

基本要素 如何衡量 例子提示
任務複雜度 Claude 評估僅由人類完成的時間、AI 協助下的時間,以及單一對話中是否出現多項任務。 「除錯這個 Python 函數。」
人類與 AI 技能 Claude 預測理解使用者提示與其自身回應所需的正式教育年數。 「解釋這個迴歸背後的統計模型。」
使用情境 分類器將對話標記為 工作課業個人 「幫我寫一篇課程的文獻回顧。」
AI 自主性 1–5 分的量表,根據 Claude 在無需與使用者反覆溝通的情況下執行決策的程度。 「產生一份完整的行銷計畫。」
任務成功率 Claude 評估其認為答案是否滿足需求。 「總結這篇論文的主要發現。」

2.2 驗證

  • 方向準確性 已透過小規模人工標註的 Claude.ai 對話子集與合成 API 數據驗證。
  • 對於三個基本要素(僅人類時間、AI 協助時間、AI 自主性),使用「思考鏈」提示可提升分類器表現;其他則僅需簡單提示即可。
  • 外部基準相符:人類教育估計與 BLS 職業教育水平相關性高(r > 0.92);時間估計預測與 Anthropic 以往研究中觀察到的生產力提升一致。

2.3 注意事項

  • 基本要素具有 雜訊,應視為 信號 而非精確測量。
  • 樣本門檻(≥15 筆對話、≥5 名使用者)排除了低流量地區與罕見任務。
  • 成功率反映模型能力與使用者選擇偏誤:使用者可能避免預期會失敗的任務。

3. AI 使用的地理差異

3.1 按收入的採用模式

  • 工作 vs. 課業 vs. 個人:人均 GDP 較高的國家,其 工作(如丹麥、美國)與 個人 使用比例較高,而低收入國家則更多使用於 課業(如印尼)。
  • 人均 GDP 每增加 1 %,國家層級的 AUI 預期上升 0.7 %

3.2 美國州級驅動因素

  • 擁有較高比例 電腦與數學職業 的州,其 AUI 較高;此類工作者每增加 1 %,人均使用量上升 0.36 %
  • 在控制人均 GDP 後,教育年數基本要素失去統計顯著性,顯示美國境內的勞動力組成是主要驅動因素。

3.3 自主性與協作

  • 高收入地區展現 較低的自動化較低的 AI 自主性,顯示其採用模式偏向協作(增強)。
  • 此模式在美國各州之間 無統計顯著性,可能因收入差異較小所致。

4. 任務層級的生產力與勞動市場影響

4.1 速度提升 vs. 成功率的權衡

  • 速度提升(僅人類時間 ÷ 人類與 AI 共同時間)隨任務教育程度上升:Claude.ai 上,12 年級任務約為 ,16 年級任務約為 12×
  • 複雜度較高的任務成功率下降:低於高中程度任務約為 70 %,大學程度任務約為 66 %
  • 即使以成功率調整速度提升,教育程度梯度仍為正。

4.2 職業的實際 AI 覆蓋率

  • 實際 AI 覆蓋率 = Σ(任務占比 × 成功率)。其與原始任務覆蓋率不同,因部分高頻任務成功率較低。
  • 例如:資料輸入員 雖原始覆蓋率低,但因主要任務(資料輸入)成功率高,故實際覆蓋率高。
  • 放射科醫師醫療打字員 也顯示高實際覆蓋率,而 微生物學家 則低於 45° 線,因實驗室實作任務未被涵蓋。

4.3 技能退化 vs. 技能提升

  • Claude 所處理的任務平均預期教育需求為 14.4 年,比整體經濟平均(13.2 年)高出約 1 年
  • 移除 Claude 覆蓋的任務通常會 降低 剩餘工作的平均教育需求,顯示技術撰稿人、旅遊代理與許多教學職位等職業可能面臨 技能退化
  • 某些職業(如 房地產經理)則出現 技能提升,因例行行政任務被自動化,而高技能談判任務仍保留。

4.4 修正後的生產力估計

  • 基準(僅速度提升)預期未來十年每年勞動生產力成長 1.8 pp
  • 納入 任務成功率 後,估計值降至 1.2 pp(Claude.ai)與 1.0 pp(API)。
  • 透過 CES 聚合考慮 任務互補性,結果對替代彈性(σ)極為敏感:
    • σ = 0.5 → 每年 0.7–0.9 pp
    • σ = 1.5 → 每年 2.2–2.6 pp
  • API 樣本對 σ 更敏感,因其任務集中度更高。

5. 對政策制定者與研究者的關鍵啟示

  1. 經濟基本要素提供比二元自動化/增強劃分更豐富、多維度的 AI 使用視角
  2. 地理不平等持續存在:高收入國家更密集且協作式地採用 Claude,而低收入地區則聚焦於課業用途。
  3. 技能偏誤明顯:Claude 傾向用於高教育程度任務,可能導致許多職業整體技能退化。
  4. 生產力提升確實存在,但受任務成功率與任務間互補程度所調節
  5. 美國擴散迅速(潛在均等在 2–5 年內達成)與全球趨同較慢形成對比,顯示國內政策可更直接影響採用速度。
  6. 人力資本至關重要:使用者提示教育程度與 Claude 回應複雜度之間存在強相關性(r ≈ 0.93),凸顯教育與培訓對釋放 AI 潛能的必要性。

6. 數據可取得性

Anthropic 釋出完整匿名資料集,包含基本要素分類,可於以下取得:


7. 未來方向

  • 追蹤 任務成功率 如何隨著新模型(如 Opus 4.5)演進,以及有效任務範圍是否擴大。
  • 將基本要素擴展至捕捉 AI 使用的 倫理信任安全 維度。
  • 結合 APIClaude.ai 流,建模從互動式對話轉向生產級自動化的過程。
  • 探討可加速公平擴散的 政策工具,例如補貼 AI 接入與針對低人均 GDP 地區的專案式 AI 認知計畫。

報告作者:Ruth Appel, Maxim Massenkoff, Peter McCrory, Miles McCain, Ryan Heller, Tyler Neylon, Alex Tamkin.

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch