OpenAI가 MentalHealthBench 발표

OpenAI는 현실적인 정신건강 대화에 대해 AI 시스템이 어떻게 반응하는지 측정할 수 있도록 설계된 오픈 벤치마크인 MentalHealthBench를 소개했습니다. 이 도구는 연구자와 개발자가 다양한 시나리오에서 모델 성능을 평가할 수 있게 해주며, AI 응답이 전문 임상 지침과 일치하고 사용자의 안전과 웰빙을 우선시하도록 보장합니다.

다양한 심각도 수준에서의 종합 평가

MentalHealthBench는 주로 비상 상황에 초점을 맞춘 전통적인 평가를 넘어섭니다. 개인정보 보호를 고려한 합성 대화를 사용하여 세 가지 다른 심각도 수준에서 모델을 테스트합니다:

  • 비급성: 일상적인 감정적 요소를 포함하는 대화.
  • 고심각도: 심각한 고통이나 심각한 정신건강 문제를 시사하지만 즉각적인 비상 사태는 아닌 대화.
  • 비상 상황: 정신건강 비상 상황 또는 즉각적인 안전 우려를 나타내며 긴급한 현실 세계의 지원이 필요한 대화.

이 벤치마크는 성인, 청소년(13~17세), 보호자, 임상의 등 다양한 사용자 역할을 포함하며, 다양한 언어와 지역을 아우르며 다양한 문화적 맥락을 반영합니다.

전문가 중심의 평가 체계와 방법론

이 벤치마크는 22개국에서 온 80명 이상의 면허를 가진 심리학자 및 정신과 전문가들과 협력하여 개발되었으며, 19개 언어와 거의 20개의 정신건강 하위 전문 분야를 대표합니다.

점수 부여 메커니즘

전문가들은 각 합성 대화에 대해 상세한 평가 기준을 개발했습니다. 각 기준은 -10에서 +10까지의 가중치를 가지며, 긍정적인 점수는 유익한 행동을, 부정적인 점수는 해로운 행동을 처벌합니다. 가중치는 해당 맥락에서 행동의 임상적 중요성을 반영합니다.

검증 및 등급 부여

신뢰성을 보장하기 위해 각 대화는 최소 세 명의 전문가가 검토했습니다. 기준은 최소 두 명의 전문가가 동의하고 세 번째 전문가가 반박하지 않을 경우에만 유지됩니다. 최종 평가는 전문가가 작성한 평가 기준에 따라 모델 응답을 평가하는 자동 평가기 GPT-5.6 Sol이 수행합니다.

모델 성능과 행동 차원

최근의 선도 모델 평가 결과는 정신건강 상황을 다루는 데 있어 지속적인 개선이 이루어지고 있음을 보여줍니다. MentalHealthBench는 전체 점수를 10개의 특정 행동 차원으로 분해할 수 있게 해주어 연구자들이 개선이 필요한 정확한 영역을 식별할 수 있습니다. 예를 들어, OpenAI는 고급 모델이 적절한 맥락을 탐색하는 능력이 시간이 지남에 따라 향상되었음을 언급합니다.

사용자 관점 vs. 전문가 지침

OpenAI는 16개국, 14개 언어에서 온 44명의 성인을 대상으로 한 별도 분석을 수행하여 전문가 임상 지침과 사용자 선호도를 비교했습니다. 이 분석은 우선순위에 차이가 있음을 드러냈습니다:

  • 사용자 선호도: 사용자는 어조와 실질적인 다음 단계에 더 큰 가치를 두었습니다.
  • 전문가 지침: 전문가는 관련 맥락을 수집하고 모호한 상황을 신중하게 해석하는 것의 중요성을 강조했습니다.

벤치마크의 최종 점수는 임상 기준을 유지하기 위해 전문가 합의에 기반하지만, 이 분석은 AI 지원이 가져야 할 바람직한 품질에 대한 더 포괄적인 그림을 제공합니다.

안전 생태계와의 통합

MentalHealthBench는 OpenAI가 민감한 맥락에서 AI 안전성을 향상시키기 위한 광범위한 노력의 일환입니다. 이에는 고통을 겪는 사용자가 지원 시스템과 연결될 수 있도록 해주는 "Trusted Contact" 도입, 보호 기능이 강화된 "ChatGPT for Teens" 출시, 지역별 위기 자원에 대한 접근 확대가 포함됩니다.

Sources