Anthropic 500 萬美元福祉研究資助計畫
TL;DR
Anthropic 將撥款 500 萬美元作為資助,以支持獨立、開源的評估,研究 AI 系統如何影響使用者福祉,並提供資金、模型存取權限及技術支援。
計畫概述
Anthropic 將向建立開源基準測試(benchmarks)以衡量 AI 驅動對心理與情緒健康影響的研究人員提供最高 500 萬美元的獎勵。資助內容包括直接財務支援、存取 Anthropic 的模型,以及技術協助。獲獎者需獨立作業,且必須在開源授權下發布其工具,以便任何開發者都能採用這些評估方法。
為何福祉評估具有挑戰性
評估福祉與典型的準確性檢查不同,因為它需要對長對話進行情境理解。模型的回答在某種情境下可能無害,但在另一種情境下可能有害——例如,向有飲食失調病史的使用者提供飲食建議。偵測此類細微差別通常取決於多輪對話的動態過程,其中風險會逐漸增加,且使用者可能在幾次交流後才透露敏感資訊。
受資助評估計畫的理想特性
Anthropic 的 Safeguards 團隊提供了一份指導文件,概述了嚴謹福祉基準測試的標準:
- Clear metrics – 定義明確的通過/失敗條件並解釋其相關性。
- Expert involvement – 邀請臨床醫生、心理學家或其他領域專家參與設計與驗證。
- Balanced risk testing – 同時評估過度合規(過度寬容的回答)與過度拒絕(過度限制的回答)。
- Realistic usage scenarios – 模擬情境會變動且風險會累積的多輪對話。
- Validated grading – 確保人類評分者是根據公認專家進行校準的。
這些標準旨在產出既具科學嚴謹性,又對 AI 產業實用且有用的評估方法。
申請流程與時程表
有興趣的團隊可以透過公告中連結的公開表單進行申請。關鍵日期:
- Application deadline: September 21, 2026
- Notification of full-proposal invitations: October 5, 2026
入選的申請者將收到提交詳細提案的進一步指示。
更廣泛的背景與相關計畫
Anthropic 的資助計畫與其在安全防護(safeguards)及使用者與模型互動研究方面的持續工作相輔成效。近期相關工作包括:
- Claude text watermark – 一篇解釋用於追蹤模型輸出的浮水印技術部落格。
- Fable 5 biology safeguards – 減少與生物學相關查詢的「回退」(fallback)事件誤報的更新。
- Leadership appointment – 公布 Mariano-Florentino (Tino) Cuéllar 為全球事務長。
透過培養外部專業知識,Anthropic 旨在加速開發可靠的福祉指標,以引導整個產業實現更安全的 AI 部署。
如何取得指導文件
完整的評估指南集以 PDF 格式提供,由 Anthropic 託管:
鼓勵研究人員在提交提案之前先審閱此文件。
Anthropic 對開源福祉基準測試的承諾,反映了人們日益認識到,AI 安全必須從事實正確性擴展到涵蓋使用者的心理與情緒健康。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch