OpenAI와 Penda Health AI 임상 코파일럿 연구
OpenAI와 Penda Health는 AI Consult라는 LLM 기반 임상 코파일럿을 개발·연구했으며, 이는 1차 진료에서 의료 오류를 크게 줄입니다. 케냐 나이로비의 15개 클리닉에서 39,849건의 환자 방문을 대상으로 한 연구에서, AI Consult를 사용한 임상의는 도구를 사용하지 않은 경우에 비해 진단 오류가 16% 상대적으로 감소하고 치료 오류가 13% 감소했습니다.
모델 구현 격차 해소
GPT-4o 및 o3와 같은 최첨단 모델은 HealthBench와 같은 벤치마크 및 진단 추론 작업에서 높은 성능을 보이지만, 모델 능력과 실제 임상 사용 사이에는 "모델 구현 격차"가 존재합니다. 이를 해결하기 위해 OpenAI는 1차 진료 제공자인 Penda Health와 파트너십을 맺어 단순 AI 질의 수준을 넘어 LLM을 임상 워크플로에 직접 통합했습니다.
AI Consult: 기술 구현 및 워크플로
AI Consult는 Penda의 전자 건강 기록(EHR)에 통합되어 실시간 안전망으로 작동합니다. 환자 식별자를 제거한 문서를 분석하고 방문 중 핵심 시점에 OpenAI API에 전송합니다. 시스템은 계층형 알림 시스템을 통해 피드백을 제공합니다:
- 녹색: 문제가 없음을 나타내는 체크표시.
- 노란색: 중간 정도의 문제가 있음을 나타내는 종소리이며, 임상의가 선택적으로 확인할 수 있습니다.
- 빨간색: 안전에 중요한 문제에 대한 필수 팝업으로, 임상의가 진행하기 전에 반드시 확인해야 합니다.
안전성과 현지 적합성을 보장하기 위해 시스템은 임상의가 모든 최종 결정을 완전히 통제하도록 설계되었습니다. 프롬프트는 케냐 역학 상황, 현지 임상 지침, Penda의 표준 운영 절차에 맞게 맞춤화되었습니다.
치료 질에 미치는 영향
108명의 독립 의사가 무작위로 선택한 5,666건의 방문을 분석한 결과, AI Consult는 네 가지 핵심 차원에서 오류율을 크게 낮췄습니다:
| 차원 | 상대 오류 감소 |
|---|---|
| 병력 청취 | 32% |
| 검사 | 10% |
| 진단 | 16% |
| 치료 | 13% |
AI Consult가 "빨간색 알림"을 트리거한 방문에서는 진단 오류가 31%, 치료 오류가 18% 감소하는 등 더욱 뚜렷한 효과를 보였습니다. 절대적으로는 시스템이 연간 Penda만으로도 진단 오류 22,000건, 치료 오류 29,000건을 방지할 것으로 추정됩니다.
적극적 배포의 역할
연구는 모델 능력만으로는 충분하지 않으며, 임상의 수용을 위해 적극적 배포가 중요함을 강조했습니다. 초기 "도입 기간" 동안 임상의는 빨간색 알림을 무시하는 경우가 많았으며, "빨간색 알림 미해결 비율"(해결되지 않은 빨간색 알림 비율)은 35-40%로 AI 미사용 그룹과 유사했습니다.
Penda는 이 비율을 낮추기 위해 다음과 같은 적극적 배포 전략을 시행했습니다:
- 동료 챔피언: 지점 관리자와 동료가 일대일 코칭을 제공하고 도구의 제한점을 설명했습니다.
- 측정: 추적된 상호작용 비율을 기반으로 개인화된 코칭을 진행했습니다.
- 인센티브: 도구를 효과적으로 활용한 임상의와 클리닉을 인정했습니다.
이러한 개입 후 AI 그룹의 "빨간색 알림 미해결 비율"은 20%로 감소했으며, 비AI 그룹은 여전히 약 40% 수준을 유지했습니다.
임상의 피드백 및 환자 결과
임상의는 AI Consult가 "방 안의 컨설턴트"이자 "학습 도구"라고 보고했습니다. 데이터는 AI를 사용한 임상의가 시간이 지남에 따라 빨간색 알림을 덜 트리거하게 되었음을 보여줍니다(방문당 45%에서 35%로 감소). 이는 도구가 임상의의 임상 기술 향상에 도움이 되었음을 시사합니다.
환자 결과에 관해서는 다음과 같은 결과가 나타났습니다:
- 환자 회복: AI 그룹의 3.8% 환자가 8일 후에도 호전되지 않은 반면, 비AI 그룹은 4.3%였으며 통계적으로 유의미한 차이는 없었습니다.
- 안전: AI 그룹에서 7건, 비AI 그룹에서 5건의 환자 안전 보고가 있었으며, AI Consult의 권고가 해를 끼친 사례는 없었습니다. 다만, 권고를 따랐다면 해를 예방했을 가능성이 있습니다.
향후 방향
OpenAI와 Penda Health는 AI Consult를 초기 원형으로 보고 있습니다. 향후 버전에서는 문서 작업 부담을 줄이기 위한 음성 우선 인터페이스나, 임상의 확인 후 건강 기록 내에서 행동을 수행할 수 있는 에이전트 등을 포함할 수 있습니다. Penda는 현재 PATH와 함께 무작위 대조 시험을 진행 중이며, 환자 결과에 대한 장기 효과를 추가로 측정하고 있습니다.