환각의 위험: 클리닉에서 AI 기록원이 실패할 때
온타리오에서의 최근 감사는 AI 기반 의료 기록원의 도입에서 우려스러운 경향을 드러냈습니다: 이러한 시스템들은 기본 사실을 포착하는 데 반복적으로 실패하며, 때로는 위험한 결과를 초래합니다. 보고에 따르면, 평가된 AI 기록원 시스템의 60% 이상이 환자 기록에서 처방약을 혼동했으며, 상당한 수의 시스템들이 정보를 조작하거나 논의되지 않았던 치료 계획을 제시했습니다.
이 실패는 현대 의료에서의 중요한 긴장을 부각시킵니다: 임상진료자의 행정적 번아웃을 줄이고자 하는 욕구와 의료 정확성의 절대적 필요성 사이의 갈등입니다. AI의 약속은 의사들을 키보드에서 해방시키는 것이지만, 현실은 이러한 도구들이 환자 기록에 새로운, 더 은밀한 유형의 오류를 도입할 수 있다는 것입니다.
실패의 본질: 전사 vs 해석
혼동의 핵심이자 주요 위험 요인 중 하나는 음성-텍스트 전사와 LLM 기반 요약 사이의 구분입니다. 전통적인 전사 소프트웨어는 말한 내용의 문자 그대로의 기록을 만들려고 합니다.相比之下, 많은 현대적인 'AI 기록원'은 대화 해석과 구조화된 의료 노트로 합성하기 위해 대규모 언어 모델(LLM)을 사용합니다.
이 해석 레이어가 위험이 존재하는 곳입니다. LLMs는 확률적이지 결정적이지 않습니다. 그들은 의료 사실을 '이해'하지 못합니다; 그들은 시퀀스에서 다음에 올 가능성이 높은 토큰을 예측합니다. 대화가 비선형적이거나 미묘할 때, AI는 실제 대화보다는 훈련 데이터에 기반하여 '타당해 보이지만' 잘못된 정보로 간격을 메울 수 있습니다.
한 사용자가 이 현상의 끔찍한 예를 공유했습니다:
러너스 무릎으로 진단받았습니다. AI 요약에서는 골다공증으로 진단받았고 엉덩이 통증과 보행 어려움이 있다고 말했지만, 실제로 그러한 내용은 전혀 언급되거나 암시되지 않았습니다.
"거의 맞음" 함정
기술 관찰자들은 AI가 독특하게 속이는 방식으로 자주 실패한다고 지적합니다. 출력이 문법적으로 올바르고 전문적으로 표현되어 있기 때문에, superficial한 인간 검토를 쉽게 통과할 수 있습니다. 이는 종종 "좀비" 효과라고 불립니다—여기서 AI는 거의 맞게 행동하지만, 작은 중요한 세부 사항이根本적으로 잘못되어 있습니다.
이는 의료에만 국한되지 않습니다. 기업 환경에서는 LLM 메모 작성 도구가 공급업체 협상 중에 이루어진 약속을 잘못 표현하거나 기술적인 주고받기 토론의 미묘함을 놓치는 경우가 알려져 있습니다. 위험은 도구가 "대부분 맞음" 90%의 시간일 때 사용자들이 위험한 수준의 신뢰를 개발하여, 의료 맥락에서 katastrofic할 수 있는 10%의 오류를 놓칠 가능성이 낮아진다는 것입니다.
인간 요소: 오류율 및 감독
어떤 사람들은 인간 의사도 오류를 범하기 쉽다고 주장합니다. AI의 60% 오류율이 의료 기록에서의 역사적 인간 오류율과 비슷할 수 있다는 것이 논점입니다. 그러나 오류의 성격은 다릅니다. 인간 오류는 종종 누락인 반면, AI 오류는 자주 조작(환각)입니다.
또한, 수정 책임이 이동하고 있습니다. 노트를 쓰는 대신, 의사들은 이제 AI가 생성한 노트를 감사하는 데 시간을 보내고 있습니다. 토론토의 한 환자가 다음과 같이 관찰했습니다:
내 의사はいつも AI 메모 작성기를 사용할 수 있는지 물어봅니다... 상담이 끝날 때 그녀는 메모를 검토하고 수정하며, 종종 컴퓨터와 대화하는 시간이 나와의 대화 시간보다 더 많다고 불평합니다.
위험 완화
AI 기록원이 책임이 되는 것을 방지하기 위해, 실무자와 사용자들이 여러 가지 보호 조치를 제안했습니다:
- 타임스탬프 링크: 요약을 원본 오디오 녹음과 통합하여, 임상의가 특정 메모를 클릭하여 그 순간에 정확히何が言われたか를 들을 수 있게 합니다.
- 엄격한 전사 우선: 즉각적인 요약을 피하고 고충실도 전사를 주요 기록으로 의존하며, AI는 선택적 조직에만 사용합니다.
- 명시적 면책 조항: 회의 시작 부분에서 AI가 사용되고 있으며 그 해석이 부정확할 수 있음을 명확히 밝힙니다.
- 환자 검증: 환자들이 자신의 전사와 요약을 검토하여 환각으로 인해 병력이 손상되지 않도록 장려합니다.
결론
온타리오 감사는 기술이 100% 사실 정확성이라는 특정 요구 사항에 대비되지 않은 상태에서 고위험 환경에 AI가 배포되고 있다는 경고를 줍니다. 효율성 향상은 유혹적이지만, 진단을 조작하거나 약물을 오인하는 위험은 어떤 의료 시스템도 감수할 수 없는 위험입니다. 이러한 모델들이 확률적 추측에서 결정적 정확성으로 이동할 때까지, 인간은 의료 기록의 주요 저자이자 가장 회의적인 편집자가 되어야 합니다.