Anthropic Claude Code 使用報告 2026 年 6 月 – 對代理式編碼、專業知識與勞動影響的發現
簡要重點
Anthropic 分析了 2025 年 10 月至 2026 年 4 月間約 40 萬筆 Claude Code 使用會話,發現使用者在規劃階段扮演主要角色,而 Claude 負責執行,成功率與各職業的專業軟體工程師相當,且更高的領域專業知識能顯著提升成果與任務價值。
研究概覽
Anthropic 引入了一套保護隱私的框架,用以分析互動式、代理式編碼會話。資料集涵蓋約 40 萬筆會話,來自約 23.5 萬名使用者,透過 Claude Code 的 CLI、網頁介面與桌面應用程式擷取。分析聚焦於三個面向:工作模式、決策分工與會話成功率,並連結至使用者的專業知識與職業背景。
工作模式與任務組成
結論: 與撰寫相關的工作主導 Claude Code 的使用,但非程式編寫活動正快速成長。
- 會話被分為九種互斥的工作模式:建構、修復、測試、協調(以程式為核心)、操作(部署/監控)、理解與規劃(對既有系統的分析),以及分析與溝通(資料或散文)。
- 分布情形(圖 1):56 % 的會話涉及程式碼的建立、修改或測試(25 % 建構、26 % 修復、5 % 測試/協調)。軟體操作佔 17 %,規劃/探索佔 14 %,分析/溝通佔 13 %。
- 分類可靠性高:超過 90 % 被標記為程式碼變更的會話,皆有對應的遙測資料佐證。
使用者與 Claude 之間的勞動分工
結論: 使用者決定 要建構什麼(約 70 % 的規劃決策),而 Claude 決定 如何建構(約 80 % 的執行決策)。
- 決策歸因:分類器解析會話記錄,將每項決策標記為規劃或執行,並歸因於使用者或 Claude。
- 平均占比:使用者做出約 70 % 的規劃決策,但僅負責約 20 % 的執行決策。
- 每回合的動作次數:典型會話約有 4 次提示-動作循環。每次使用者提示會觸發約 10 次 Claude 的動作(約 2,400 個字的輸出)。當 Claude 控制規劃時,每回合動作數上升至約 16 次;當使用者保留執行控制權時,動作數則降至約 8 次。
- 圖 2 展示了規劃與執行決策的分配情形。
專業程度與模型輸出
結論: 專業程度較高的使用者能引發更長、更豐富的 Claude 輸出——專家每則提示可產生最多 12 次動作與 3,200 個字,而新手僅約 5 次動作與 600 個字。
- 專業程度根據會話記錄中的線索(指令的精確度、驗證請求、修正方向)以 5 點量表(從新手至專家)推斷。
- 表 1(圖 3)顯示來自公開 SWE-chat 資料集的典型新手與專家會話範例。
- 動作與字數數量隨專業程度提升而持續增加;迴歸分析確認其顯著性(p < 0.001),每提升一個專業等級,動作數增加 +9 %,字數增加 +13 %。
誰在使用 Claude Code?
職業分布
結論: 雖然與軟體相關的職業是最大使用者群,但包括商業、藝術、管理與科學等多樣化職業也經常使用 Claude Code。
- 職業根據會話內容(檔案名稱、參考的資產、領域術語)推斷,並對應至 23 種 SOC 分類。
- 在約 70 % 的會話中可辨識職業。前五大類別為:電腦與數學、商業與財務作業、藝術/設計/媒體、管理、生命/物理/社會科學。
- 非軟體領域中成長最快的群體:管理、銷售、法律。
工作類型的演變
結論: 在七個月的期間內,修復 會話的比例從 33 % 下降至 19 %,而 操作、撰寫 與 分析 會話的數量則大致翻倍。
- 圖 4 記錄了各模式的占比變化,顯示趨向於端對端的代理式任務(部署、資料分析、文件生成)。
- 根據自由職業市場報價估算的經濟價值整體上升 27 %,其中建構、操作與修復任務各自增加約 30–40 %。
成功指標與專業知識的角色
結論: 使用者的專業程度與驗證成功的相關性極強;從新手到中階的躍升帶來最大的成效提升。
- 成功定義:兩階段分類器首先判斷使用者是否達成目標(成功、部分成功、失敗、目標不明確)。另一個獨立的驗證器尋找硬性信號(git 提交、合併請求合併、測試通過、使用者明確肯定)。驗證成功需同時滿足兩者。
- 目標不明確的會話(約佔資料的 7.7 %)不納入成功分析。
- 成功率(圖 5):
- 新手:15 % 驗證成功,77 % 至少部分成功。
- 中階/專家:28–33 % 驗證成功,91–92 % 部分成功。
- 在遭遇困難的會話中(失敗信號 > 3),驗證成功率從新手的 4 % 提升至專家的 15 %;部分成功率則從 60 % 上升至約 80 %。
- 放棄(失敗 + 無任何程式碼)在新手會話中佔 19 %,而高專業程度者則為 5–7 %。
職業 vs. 專業知識
結論: 職業背景的影響小於專業知識;各職業的成功率僅差幾百分點。
- 所有會話中的驗證成功率:與軟體相關的使用者為 30 %,其他職業為 26 %。
- 在產生程式碼的會話中,驗證成功率為 34 %(軟體)對 29 %(其他);部分成功率皆超過 88 %。
- 圖 6 顯示,十大職業群體的驗證成功率皆落在軟體工程師的 7 點範圍內。管理類職業在驗證成功率上略優於工程師,可能因使用更明確的確認語句。
對勞動市場的影響
結論: 代理式編碼降低了正式程式背景的重要性,但放大了領域專業知識的價值;中等程度的專業知識已帶來大部分效益,而深度 mastery 僅帶來邊際增益。
- 具有強大領域知識的使用者,能讓 Claude 在每則指令下執行更多工作,進而提升成功率與任務價值。
- 勞動分工顯示,編碼代理扮演 實作引擎 的角色,而人類則提供 問題定義 與 領域判斷。
- 若未來模型能進一步降低專業門檻,我們可能看到所有職業更廣泛地採用軟體生產,進而重塑技能需求。
局限與未來工作
- 未衡量真實世界成果(例如生成程式碼的部署後使用情況)。
- 排除非互動式 Claude Code 使用(例如批次產生);未來框架將納入此類活動。
- 所有分類皆依賴模型驅動的會話分析;雖遙測交叉驗證顯示高一致性,但大規模人工驗證仍具挑戰性。
- 持續監控將追蹤隨著模型自主性提升,專業知識回報是否遞減。
參考文獻
- Hitzig, Z., Massenkoff, M., Lyubich, E., Zhang, S., Heller, R., & McCrory, P. (2026). Agentic coding and persistent returns to expertise. Anthropic. https://www.anthropic.com/research/claude-code-expertise
- 關於衡量自主性的先前研究:https://www.anthropic.com/research/measuring-agent-autonomy
- CLIO 保護隱私的分析:https://www.anthropic.com/research/clio
- SWE-chat 資料集:https://huggingface.co/datasets/SALT-NLP/SWE-chat
所有 referenced 圖表皆出自原始 Anthropic 報告。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch