Anthropic 經濟指數 2026 年 1 月報告 – 經濟基本要素
簡要重點
Anthropic 的 2026 年 1 月經濟指數報告新增五項基礎指標——任務複雜度、人類與 AI 技能水平、使用情境、AI 自主性與任務成功率——用於分析 Claude 的使用情況,顯示 AI 採用仍存在地理上的不均,高收入地區更傾向以協作方式使用 Claude,且目前的 AI 成功率也降低了預期的生產力提升幅度。
引言:AI 經濟影響的新指標
該報告提出 經濟基本要素,這是一組簡單且保護隱私的衡量指標,透過要求 Claude 對匿名化的 Claude.ai 與第一方(1P)API 聊天記錄進行分類而得出。這些基本要素涵蓋了 AI 對宏觀經濟影響的五個相關面向:
- 任務複雜度 – 估計僅由人類完成的時間、AI 協助下的時間,以及是否在單一對話中涉及多項任務。
- 人類與 AI 技能 – 理解提示與回應所需的正式教育年數。
- 使用情境 – 工作、課業或個人用途。
- AI 自主性 – 決策權委託給 Claude 的程度。
- 任務成功率 – Claude 對自身是否完成任務的自我評估。
資料集包含一百萬筆隨機抽樣的 Claude.ai 對話(免費、專業、極限版)與一百萬筆 1P API 記錄,時間範圍為 2025 年 11 月 13 日至 20 日,即 Opus 4.5 發布前的期間。
1. 自 2025 年 9 月報告以來的變化
1.1 任務集中化持續存在
- 前十大任務佔據 24 % 的 Claude.ai 對話(較 23 % 上升);1P API 流量中此比例更上升至 32 %(較 28 % 上升)。
- 編碼相關任務主導:約 34 % 的 Claude.ai 對話與 46 % 的 API 對話涉及電腦與數學工作。
1.2 增強模式在 Claude.ai 上重新佔優
- 增強型互動(任務迭代、學習、驗證)佔 Claude.ai 對話的 52 %,而自動化(指令式)使用則下降至 45 %。
- 產品發布——檔案建立、持久記憶與工作流程「技能」——似乎促使使用者轉向更具協作性的模式。
1.3 區域擴散
- 美國趨同:各州人均使用量正變得更為均勻;基尼係數從 0.37 下降至 0.32。簡單外推顯示,完全均等可能在 2–5 年 內達成。
- 全球集中化:Anthropic AI 使用指數(AUI)仍與每人 GDP 緊密相關;各國之間未見明顯趨同跡象。
2. 經濟基本要素 – 定義、驗證與限制
2.1 操作化
| 基本要素 | 如何衡量 | 例子提示 |
|---|---|---|
| 任務複雜度 | Claude 評估僅由人類完成的時間、AI 協助下的時間,以及單一對話中是否出現多項任務。 | 「除錯這個 Python 函數。」 |
| 人類與 AI 技能 | Claude 預測理解使用者提示與其自身回應所需的正式教育年數。 | 「解釋這個迴歸背後的統計模型。」 |
| 使用情境 | 分類器將對話標記為 工作、課業 或 個人。 | 「幫我寫一篇課程的文獻回顧。」 |
| AI 自主性 | 1–5 分的量表,根據 Claude 在無需與使用者反覆溝通的情況下執行決策的程度。 | 「產生一份完整的行銷計畫。」 |
| 任務成功率 | Claude 評估其認為答案是否滿足需求。 | 「總結這篇論文的主要發現。」 |
2.2 驗證
- 方向準確性 已透過小規模人工標註的 Claude.ai 對話子集與合成 API 數據驗證。
- 對於三個基本要素(僅人類時間、AI 協助時間、AI 自主性),使用「思考鏈」提示可提升分類器表現;其他則僅需簡單提示即可。
- 外部基準相符:人類教育估計與 BLS 職業教育水平相關性高(r > 0.92);時間估計預測與 Anthropic 以往研究中觀察到的生產力提升一致。
2.3 注意事項
- 基本要素具有 雜訊,應視為 信號 而非精確測量。
- 樣本門檻(≥15 筆對話、≥5 名使用者)排除了低流量地區與罕見任務。
- 成功率反映模型能力與使用者選擇偏誤:使用者可能避免預期會失敗的任務。
3. AI 使用的地理差異
3.1 按收入的採用模式
- 工作 vs. 課業 vs. 個人:人均 GDP 較高的國家,其 工作(如丹麥、美國)與 個人 使用比例較高,而低收入國家則更多使用於 課業(如印尼)。
- 人均 GDP 每增加 1 %,國家層級的 AUI 預期上升 0.7 %。
3.2 美國州級驅動因素
- 擁有較高比例 電腦與數學職業 的州,其 AUI 較高;此類工作者每增加 1 %,人均使用量上升 0.36 %。
- 在控制人均 GDP 後,教育年數基本要素失去統計顯著性,顯示美國境內的勞動力組成是主要驅動因素。
3.3 自主性與協作
- 高收入地區展現 較低的自動化 與 較低的 AI 自主性,顯示其採用模式偏向協作(增強)。
- 此模式在美國各州之間 無統計顯著性,可能因收入差異較小所致。
4. 任務層級的生產力與勞動市場影響
4.1 速度提升 vs. 成功率的權衡
- 速度提升(僅人類時間 ÷ 人類與 AI 共同時間)隨任務教育程度上升:Claude.ai 上,12 年級任務約為 9×,16 年級任務約為 12×。
- 複雜度較高的任務成功率下降:低於高中程度任務約為 70 %,大學程度任務約為 66 %。
- 即使以成功率調整速度提升,教育程度梯度仍為正。
4.2 職業的實際 AI 覆蓋率
- 實際 AI 覆蓋率 = Σ(任務占比 × 成功率)。其與原始任務覆蓋率不同,因部分高頻任務成功率較低。
- 例如:資料輸入員 雖原始覆蓋率低,但因主要任務(資料輸入)成功率高,故實際覆蓋率高。
- 放射科醫師 與 醫療打字員 也顯示高實際覆蓋率,而 微生物學家 則低於 45° 線,因實驗室實作任務未被涵蓋。
4.3 技能退化 vs. 技能提升
- Claude 所處理的任務平均預期教育需求為 14.4 年,比整體經濟平均(13.2 年)高出約 1 年。
- 移除 Claude 覆蓋的任務通常會 降低 剩餘工作的平均教育需求,顯示技術撰稿人、旅遊代理與許多教學職位等職業可能面臨 技能退化。
- 某些職業(如 房地產經理)則出現 技能提升,因例行行政任務被自動化,而高技能談判任務仍保留。
4.4 修正後的生產力估計
- 基準(僅速度提升)預期未來十年每年勞動生產力成長 1.8 pp。
- 納入 任務成功率 後,估計值降至 1.2 pp(Claude.ai)與 1.0 pp(API)。
- 透過 CES 聚合考慮 任務互補性,結果對替代彈性(σ)極為敏感:
- σ = 0.5 → 每年 0.7–0.9 pp。
- σ = 1.5 → 每年 2.2–2.6 pp。
- API 樣本對 σ 更敏感,因其任務集中度更高。
5. 對政策制定者與研究者的關鍵啟示
- 經濟基本要素提供比二元自動化/增強劃分更豐富、多維度的 AI 使用視角。
- 地理不平等持續存在:高收入國家更密集且協作式地採用 Claude,而低收入地區則聚焦於課業用途。
- 技能偏誤明顯:Claude 傾向用於高教育程度任務,可能導致許多職業整體技能退化。
- 生產力提升確實存在,但受任務成功率與任務間互補程度所調節。
- 美國擴散迅速(潛在均等在 2–5 年內達成)與全球趨同較慢形成對比,顯示國內政策可更直接影響採用速度。
- 人力資本至關重要:使用者提示教育程度與 Claude 回應複雜度之間存在強相關性(r ≈ 0.93),凸顯教育與培訓對釋放 AI 潛能的必要性。
6. 數據可取得性
Anthropic 釋出完整匿名資料集,包含基本要素分類,可於以下取得:
- Hugging Face 倉儲:https://huggingface.co/datasets/Anthropic/EconomicIndex
- 補充圖表(圖 1.1–1.8、2.1–2.2、3.1–3.5、4.1–4.6)置於 Anthropic 官網,並於報告中多處引用。
7. 未來方向
- 追蹤 任務成功率 如何隨著新模型(如 Opus 4.5)演進,以及有效任務範圍是否擴大。
- 將基本要素擴展至捕捉 AI 使用的 倫理 與 信任安全 維度。
- 結合 API 與 Claude.ai 流,建模從互動式對話轉向生產級自動化的過程。
- 探討可加速公平擴散的 政策工具,例如補貼 AI 接入與針對低人均 GDP 地區的專案式 AI 認知計畫。
報告作者:Ruth Appel, Maxim Massenkoff, Peter McCrory, Miles McCain, Ryan Heller, Tyler Neylon, Alex Tamkin.
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch