ChatGPT에서 건강 인텔리전스 향상

ChatGPT에서 건강 인텔리전스 향상

GPT-5.5 Instant가 건강 인텔리전스를 향상시킵니다

OpenAI는 GPT-5.5 Instant를 도입했으며, 이 모델은 ChatGPT가 건강 및 웰니스 질문을 처리하는 능력을 크게 향상시킵니다. 이 모델은 응급 치료 필요성을 인식하고, 관련 사용자 컨텍스트를 요청하며, 불확실성을 설명하고, 복잡한 건강 정보를 단순화하는 데 있어 큰 진전을 보여줍니다.

GPT-5.5 Instant는 ChatGPT의 모든 무료 사용자에게 제공되어 이러한 건강 관련 기능에 대한 접근성을 확대합니다. 가장 어려운 건강 평가에서도 그 성능은 이제 OpenAI의 최첨단 Thinking 모델과 비교될 수 있습니다.

건강 성능 및 정확도 측정

OpenAI는 건강 특화 평가를 사용하여 응답이 정확하고 이해하기 쉬우며 올바른 판단에 기반하도록 합니다. 진행 상황은 다음 프레임워크를 통해 측정됩니다:

평가 프레임워크

  • HealthBench 및 HealthBench Professional: 이 평가들은 현실적인 건강 대화와 의사가 작성한 루브릭을 활용하여 정확성, 안전성, 커뮤니케이션, 컨텍스트 인식, 완전성 및 적절한 에스컬레이션을 평가합니다.
  • Physician-led Comparison: 의사 패널이 GPT-5.5 Instant의 3,500개 응답을 의사가 작성한 응답(시간과 인터넷 접근은 무제한이지만 AI는 사용하지 않음) 및 이전 모델과 비교했습니다. GPT-5.5 Instant는 정확성, 커뮤니케이션, 완전성, 지시 따름, 건강 결정 도움 등 모든 기준에서 더 높은 평가를 받았습니다.

프로덕션 트래픽 모니터링

실제 성능을 추적하기 위해 OpenAI는 프로덕션 트래픽에 대한 프라이버시 보호 모니터를 사용합니다. 수십억 건의 주간 메시지 분석 결과, 최소 하나의 사실성 문제가 표시된 응답 비율이 지난 두 달 동안 71% 감소한 것으로 나타났습니다.

의사 주도 모델 개선

GPT-5.5 Instant의 개선은 60개국, 49개 언어, 26개 의료 전문 분야에 걸친 260명 이상의 의사들로 구성된 글로벌 네트워크에 의해 추진됩니다. 이 네트워크는 실제 건강 상황에서 “좋은” 응답을 정의하는 데 필요한 의료 전문 지식을 제공합니다.

의사 피드백의 역할

  • Response Review: 의사들은 환자와 임상의 실제 사용을 반영한 700,000개 이상의 모델 응답 예시를 검토했습니다.
  • Rubric Development: 의사 피드백은 응답이 정확하고, 안전하며, 명확하고, 완전하며, 적절히 신중한지를 측정할 수 있도록 루브릭 및 평가 기준을 만드는 데 사용됩니다.
  • Failure Mode Identification: GPT-5.5 Instant는 이전 모델 및 인간 의사보다 실패 모드가 적으며, 특히 현지 의료 컨텍스트에 맞춘 응답, 위험 신호 식별, 사용자에게 필요한 추가 컨텍스트 요청과 같은 영역에서 그렇습니다.

광범위한 의료 도구와의 통합

일반 건강 인텔리전스의 이러한 발전은 ChatGPT for Clinicians 및 OpenAI for Healthcare와 같은 전문 도구를 포함한 OpenAI의 광범위한 의료 이니셔티브를 지원하며, 의료 전문가가 문서화, 연구 및 진료 제공을 돕습니다.

SUMMARY: OpenAI는 GPT-5.5 Instant를 통해 ChatGPT를 업데이트했으며, 이는 최첨단 Thinking 모델에 필적하는 건강 인텔리전스를 보여주고 프로덕션 건강 트래픽에서 사실성 문제가 71% 감소했습니다.

TITLE: ChatGPT에서 건강 인텔리전스 향상

Sources