Anthropic $5M Wellbeing Research Grants

TL;DR

Anthropicは、AIシステムがユーザーのウェルビーイングに与える影響について、独立したオープンソースの評価を行うための500万ドルの助成金を割り当て、資金提供、モデルへのアクセス、および技術サポートを提供します。

Program Overview

Anthropicは、AIによるメンタルヘルスおよび感情的な健康への影響を測定するオープンソースのベンチマークを構築する研究者に対し、最大500万ドルを授与します。助成金には、直接的な資金援助、Anthropicのモデルへのアクセス、および技術支援が含まれます。受領者は独立して活動し、ツールをオープンソースライセンスの下で公開しなければならず、これにより、あらゆる開発者がその評価手法を採用できるようになります。

Why Wellbeing Evaluation Is Challenging

ウェルビーイングの評価は、長期的な会話における文脈の理解を必要とするため、一般的な正確性のチェックとは異なります。あるシナリオでは無害なモデルの回答が、別のシナリオでは有害になる可能性があります。例えば、摂食障害の既往歴があるユーザーに対して食事のアドバイスを提供する場合などです。このようなニュアンスを検知することは、多くの場合、マルチターン(複数回のやり取り)の対話ダイナミクスに依存しており、リスクが徐々に高まり、ユーザーが数回のやり取りの後にのみ機密情報を開示する場合もあります。

Desired Characteristics of Funded Evaluations

AnthropicのSafeguardsチームは、厳格なウェルビーイング・ベンチマークの基準を概説したガイダンス文書を提供しました:

  • Clear metrics – 明確な指標 – 明確な合格/不合格条件を定義し、その関連性を説明すること。
  • Expert involvement – 専門家の関与 – 設計と検証において、臨床医、心理学者、またはその他の主題専門家を関与させること。
  • Balanced risk testing – バランスの取れたリスクテスト – 過剰なコンプライアンス(過度に寛容な回答)と過剰な拒否(過度に制限的な回答)の両方を評価すること。
  • Realistic usage scenarios – 現実的な使用シナリオ – 文脈が変化し、リスクが蓄積していくマルチターン会話をモデル化すること。
  • Validated grading – 検証済みの採点 – 人間の評価者が、認められた専門家と照らし合わせて調整されていることを確認すること。

これらの基準は、科学的に堅牢であり、かつAI業界にとって実用的な評価手法を生み出すことを目的としています。

Application Process and Timeline

関心のあるチームは、発表内でリンクされている公開フォームから申請できます。主な日程は以下の通りです:

  • Application deadline: September 21, 2026
  • Notification of full-proposal invitations: October 5, 2026

選定された申請者は、詳細な提案書を提出するためのさらなる指示を受け取ります。

Broader Context and Related Initiatives

Anthropicの助成金プログラムは、セーフガードに関する継続的な取り組みと、ユーザーとモデルの相互作用に関する研究を補完するものです。最近の関連する取り組みには、以下が含まれます:

  • Claude text watermark – Claudeのテキスト・ウォーターマーク – モデルの出力を追跡するために使用されるウォーターマーク手法について説明するテクニカル・ブログ。
  • Fable 5 biology safeguards – Fable 5の生物学関連のセーフガード – 生物学関連のクエリに対して、誤検知による「フォールバック」イベントを減らすためのアップデート。
  • Leadership appointment – リーダーシップの任命 – Mariano-Florentino (Tino) CuéllarをChief Global Affairs Officerとして任命した発表。

外部の専門知識を活用することで、Anthropicは、業界全体でより安全なAI展開をプログラムするための、信頼できるウェルビーイング指標の開発を加速させることを目指しています。

How to Access Guidance Materials

評価ガイドラインの完全なセットは、AnthropicがホストするPDFとして入手可能です:

研究者は、提案書を提出する前に、この文書をレビューすることをお勧めします。


Anthropicのオープンソースのウェルビーイング・ベンチマークへの取り組みは、AIの安全性は事実の正確性だけでなく、ユーザーのメンタルヘルスや感情的な健康を包含するものであるべきだという認識が高まっていることを反映しています。

Sources

関連