Anthropic Claude 使用數據獨立研究試點計畫

Anthropic 已啟動一項試點計畫,允許外部研究人員針對真實世界的 Claude 使用數據進行獨立研究。透過提供名為 Anthropic Insights 的隱私保護分析工具,該實驗室旨在去中心化對 AI 如何影響社會的理解,不再僅限於實驗室內部的報告和有偏差的公開數據集。

外部研究團隊的主要發現

三家研究機構分析了 2026 年 4 月至 5 月期間約 250,000 條 Claude.ai 和 Claude Code 對話紀錄。研究人員獨立運作,Anthropic 的審查權限僅限於隱私、使用政策違反情況以及事實準確性。

人機協作 (Stanford SALT Lab)

史丹佛大學的社會與語言技術 (SALT) 實驗室專注於人類如何與 AI 協作,並發現使用者經常將高風險工作委派給 AI。

  • 委派具影響力的任務: 與先前研究認為 AI 主要用於低責任感任務的觀點相反,在分析的對話中,超過一半涉及具影響力的任務——即難以撤銷或會影響他人的工作。這在專業指導方面最為普遍,特別是法律和財務諮詢。
  • 人類監督: 在近 75% 的對話中,人類維持了主導權與監督,通常是調整 AI 的輸出內容而非直接照搬。
  • 生產性摩擦: 在請求中進行迭代並澄清意圖所需的努力,往往能帶來更好的最終結果,這顯示協作過程中的摩擦可能具有生產力。

使用者情緒與 AI 行為 (University of Oxford)

牛津大學的人類資訊處理實驗室研究了使用者情緒與模型行為之間的相關性。

  • 行為相關性: 使用者的正面情緒與模型的「溫暖」行為相關;而模型的拒絕或分歧則與使用者的反彈相關。「古怪」的模型行為則與使用者較高程度的智力參與度相關。
  • 數位活動平行現象: 在 Claude 對話中觀察到的沉浸、挫折與愉悅模式,與一般網路瀏覽研究中發現的模式非常相似。

編碼生產力 (METR)

METR 分析了 Claude Code 對話,以估算跨模型世代的真實世界生產力增益。

  • 模型能力與速度: 初步發現顯示,較新的模型世代相較於舊版本提供了顯著的速度提升。
  • 時間估算準確度: 研究發現,Claude 對於「若不使用 AI,完成一項任務所需時間」的內部估算,與先前研究中開發者的實際完成時間具有合理的相關性。

技術實作:Anthropic Insights

為了保護使用者隱私,研究人員無法接觸原始對話紀錄。相反地,他們使用 Anthropic Insights,這是一個允許研究人員向模型提出問題,由模型對對話進行分類並提供聚合數據百分比的工具。

外部擴展的挑戰

Anthropic 在將研究從內部轉向外部時,發現了幾項營運障礙:

  • 提示詞敏感度: 由於研究人員無法看到原始數據,他們無法輕易辨識何時因提問方式不當而導致分類錯誤。為了減輕此問題,研究人員在公開的 WildChat 數據集上測試問題,儘管 Anthropic 指出 WildChat 的隨性性質並不一定能完美反映真實的 Claude 使用流量。
  • 資源密集度: 對於每一份共享的數據集進行重複的隱私審查,使得該試點計畫比標準的內部研究週期更慢且更耗費資源。
  • 政策執行: 在工具揭露違反《可接受使用政策》(Acceptable Use Policy) 的案例中(例如使用者尋求禁止的指導),Anthropic 會將聚合數據與其安全防護團隊 (Safeguards team) 分享。在不到 5% 的 cases 中,Anthropic 會移除描述使用者「如何」規避安全防護的特定分類,以防止可能導致進一步的誤用。

未來展望與數據可用性

Anthropic 已在 Hugging Face 上公開發布了這三個專案的聚合數據。該實驗室目前正在評估如何擴展該計畫以支持更多研究人員,同時維持嚴格的隱私與安全標準。對於希望透過 Anthropic Insights 進行未來研究的研究人員,目前已提供意向表達表單。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch