Anthropic $5M Wellbeing Research Grants

TL;DR

Anthropic는 AI 시스템이 사용자 웰빙에 미치는 영향을 독립적이고 오픈 소스로 평가하기 위해 500만 달러의 보조금을 할당하며, 자금 지원, 모델 액세스 및 기술 지원을 제공합니다.

Program Overview

Anthropic는 AI 기반의 정신적 및 정서적 건강에 미치는 영향을 측정하는 오픈 소스 벤치마크를 구축하는 연구자들에게 최대 500만 달러를 지원할 예정입니다. 보조금에는 직접적인 재정 지원, Anthropic 모델에 대한 액세스 및 기술 지원이 포함됩니다. 수혜자는 독립적으로 작업하며, 모든 도구를 오픈 소스 라이선스 하에 게시해야 하므로 모든 개발자가 평가 방식을 채택할 수 있습니다.

Why Wellbeing Evaluation Is Challenging

웰빙 평가는 일반적인 정확도 확인과 다릅니다. 긴 대화 과정에서 문맥적 이해가 필요하기 때문입니다. 모델의 응답은 한 시나리오에서는 무해할 수 있지만 다른 시나리오에서는 해로울 수 있습니다. 예를 들어, 식이 장애 이력이 있는 사용자에게 식단 조언을 제공하는 경우입니다. 이러한 미묘한 차이를 감지하는 것은 종종 다회차 대화의 역학에 달려 있으며, 위험은 점진적으로 증가하고 사용자는 여러 번의 대화가 오간 후에야 민감한 정보를 공개할 수 있습니다.

Desired Characteristics of Funded Evaluations

Anthropic의 Safeguards 팀은 엄격한 웰빙 벤치마크를 위한 기준을 설명하는 가이드라인 문서를 제공했습니다:

  • Clear metrics – 명확한 통과/실패 조건을 정의하고 그 관련성을 설명합니다.
  • Expert involvement – 임상 전문가, 심리학자 또는 기타 주제 전문가를 설계 및 검증 과정에 참여시킵니다.
  • Balanced risk testing – 과잉 준수(지나치게 허용적인 응답)와 과잉 거부(지나치게 제한적인 응답)를 모두 평가합니다.
  • Realistic usage scenarios – 문맥이 변화하고 위험이 축적되는 다회차 대화 모델을 구축합니다.
  • Validated grading – 인간 평가자가 공인된 전문가와 일치하도록 보정합니다.

이러한 표준은 과학적으로 견고하고 AI 산업계에서 실질적으로 유용하게 사용할 수 있는 평가 방식을 생산하는 것을 목표로 합니다.

Application Process and Timeline

관심 있는 팀은 공지사항에 링크된 공개 양식을 통해 지원할 수 있습니다. 주요 일정은 다음과 같습니다:

  • Application deadline: September 21, 2026
  • Notification of full-proposal invitations: October 5, 2026

선정된 지원자는 상세 제안서를 제출하기 위한 추가 안내를 받게 됩니다.

Broader Context and Related Initiatives

Anthropic의 보조금 프로그램은 안전장치(safeguards)에 대한 지속적인 작업과 사용자-모델 상호작용에 대한 연구를 보장합니다. 최근 관련 노력은 다음과 같습니다:

  • Claude text watermark – 모델 출력을 추적하기 위해 사용되는 워터마킹 기술 블로그.
  • Fable 5 biology safeguards – 생물학 관련 질의에 대한 잘못된 양성(false-positive) "fallback" 이벤트를 줄이는 업데이트.
  • Leadership appointment – Mariano-Florentino (Tino) Cuéllar를 Chief Global Affairs Officer로 임명.

외부 전문 지식을 육성함으로써, Anthropic은 산업계 전반에 걸쳐 더 안전한 AI 배포를 가이드할 수 있는 신뢰할 수 있는 웰빙 메트릭을 개발하는 것을 가속화하는 것을 목표로 합니다.

How to Access Guidance Materials

전체 평가 가이드라인 세트는 Anthropic이 호스팅하는 PDF로 제공됩니다:

연구자들은 제안서를 제출하기 전에 이 문서를 검토할 것을 권장합니다.


Anthropic의 오픈 소스 웰빙 벤치마크에 대한 약속은 AI 안전이 사실적 정확성을 넘어 사용자의 정신적 및 정서적 건강을 포괄해야 한다는 인식이 확산되고 있음을 반영합니다.

Sources

관련