Anthropic 實際衡量 AI 代理自主性的方法 – 關鍵發現與影響
簡要重點
Anthropic 2026 年 2 月的研究顯示,Claude Code 代理現在每回合可自主運行最多 45 分鐘,經驗豐富的使用者既會自動批准更多操作,也更常中斷,模型在複雜任務上要求澄清的次數是人類中斷次數的兩倍,儘管大多數基於 API 的代理操作風險較低,但在醫療、金融與資安領域的新兴應用,顯示出風險邊界正在擴張。
透過兩種資料來源衡量自主性
Anthropic 結合了 (1) Claude Code 的會話記錄,可連結整個工作流程中的請求,以及 (2) 公開 API 的工具呼叫記錄,提供跨數千名客戶的廣度。兩種資料流皆透過 Anthropic 的隱私保護基礎設施 Clio 進行處理,使分析數百萬次互動的同時,仍能維護使用者的機密性。
Claude Code 提供了逐回合自主性、中斷與澄清行為的深入洞察,因為每個會話都是完全可觀察的。
Public API 提供了跨領域代理部署的廣泛視角,但僅能以單一工具呼叫的細節為單位,限制了重構多步驟工作流程的能力。
Claude Code 的自主性持續提升
- 回合時長幾乎翻倍:最長 0.1 % 的會話時長,從 2025 年 10 月的不到 25 分鐘,上升至 2026 年 1 月的超過 45 分鐘。中位數回合長度則穩定在約 45 秒。
- 增長趨勢在各模型版本間平滑演進,顯示推動長時間自主運行的因素不僅是模型能力本身,還包括使用者信任、任務雄心與產品改進等。
- 內部 Anthropic 使用情況也呈現相同趨勢:最困難任務的成功率翻倍,而平均人類干預次數則從每會話 5.4 次下降至 3.3 次。
「自主模型具備的能力,遠超過其在實務中所展現的。」 – Anthropic 研究團隊
經驗豐富的使用者調整監督策略
- 自動批准率隨使用時間增加:新使用者(少於 50 次會話)自動批准約 20 % 的會話;使用約 750 次會話的使用者,自動批准率超過 40 %。
- 中斷率也隨之上升:使用約 10 次會話的使用者中斷約 5 % 的回合,而資深使用者則中斷約 9 % 的回合。
- 雙向增長反映出從「逐項批准」轉向 監控與介入 的監督模式:經驗豐富的使用者讓代理自由運行,但在必要時才介入。
- 在公開 API 上,人類參與度從低複雜度工具呼叫的 87 % 下降至高複雜度呼叫的 67 %,顯示逐步審核對大型工作流程而言已不切實際。
代理透過澄清實現自我調節
- Claude Code 在最複雜任務上要求澄清的次數,比低複雜度任務高出兩倍以上。
- 澄清請求的頻率超過人類主動中斷,顯示模型在不確定時會主動限制自身自主性。
- 表格 1(原始文章中)顯示模型主動停止的最常見原因(例如提出替代方案占 35 %),以及人類中斷的常見原因(例如提供遺漏的技術背景占 32 %)。
公開 API 代理的風險地圖
- Anthropic 對每個工具呼叫進行 1–10 分的風險評分與 1–10 分的自主性評分。80 % 的呼叫至少有一項防護機制,73 % 的呼叫涉及人類在環,僅有 0.8 % 為不可逆操作。
- 高風險群組(例如 API 金鑰竊取、病患紀錄存取)雖稀少但存在,通常與安全評估有關,而非生產環境使用。
- 高自主性群組 包含自動化系統健康監控與加密貨幣交易機器人,自主性評分最高達 8.3。
- 領域分布:軟體工程佔工具呼叫的約 50 %;其他領域(商業智慧、金融、電商等)各貢獻數個百分點。
研究的限制
- 資料僅限 Anthropic 托管的模型;其他供應商的模式可能不同。
- 公開 API 分析無法重構多步驟會話,可能高估高頻率工作流程的代表性。
- 所有分類(風險、自主性、中斷原因)均由 Claude 自行生成,因隱私限制,手動驗證有限。
- 快照涵蓋 2025 年底至 2026 年初;能力與採用速度的快速變化可能改變趨勢。
- 某些高風險操作可能代表模擬評估,而非實際生產影響。
對利害關係人的建議
模型與產品開發者
- 投資於部署後監控,將離散的工具呼叫連結成連貫會話,同時維護隱私。
- 訓練模型辨識不確定性,並主動提出澄清請求;Claude 的行為顯示這能減少未受監控的自主性。
- 設計主動監控介面(即時導引、OpenTelemetry),而非強制要求逐項批准。
政策制定者
- 避免制定要求每項操作皆需人類批准的規範;資料顯示經驗豐富的使用者更傾向監控與選擇性干預。
- 鼓勵業界建立隱私保護的遙測標準,以捕捉會話層級的自主性指標。
核心洞見
代理在現實中展現的自主性,是模型行為、使用者信任與產品設計的 共同建構。Claude Code 代理已具備遠超目前授予的自主能力,使用者逐漸從細節批准轉向策略性監督,而模型本身則透過請求澄清實現自我調節。因此,有效的安全架構必須結合現實世界監控、具備不確定性感知的模型,以及能賦予使用者必要時介入能力的工具。
*作者:Miles McCain, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, Deep Ganguli。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch