메타인지를 통한 LLM 환각 현상 해결하기
대규모 언어 모델(LLMs)은 우리가 정보와 상호작용하는 방식을 혁신적으로 변화시켰지만, 사실과 다르지만 그럴듯하게 들리는 텍스트를 생성하는 '환각(hallucinate)' 경향은 신뢰를 구축하는 데 있어 여전히 중대한 장벽으로 남아 있습니다. 이러한 모델들이 고위험 환경에 통합됨에 따라, 모델이 '자신이 무엇을 아는지' 그리고 더 중요하게는 '자신이 무엇을 모르는지'를 알 수 있게 하는 메커니즘의 필요성이 매우 중요해지고 있습니다.
환각의 과제
환각 문제의 핵심은 LLM이 다음 토큰을 예측하는 확률적 예측기라는 본질에 있습니다. 이들은 텍스트 시퀀스의 가능성을 최대화하도록 설계되었지, 진실에 대한 엄격한 내부 표현을 유지하도록 설계된 것이 아닙니다. 이는 종종 모델이 완전히 조작된, 자신감 넘치는 어조의 주장을 생성하게 만듭니다.
이에 대한 한 가지 관점은 이 문제의 언어적 프레이밍입니다. 일부 비평가들이 지적했듯이, "환각"이라는 용어는 잘못된 명칭일 수 있습니다. 환각은 자극이 없는 상태에서의 감각적 지각을 의미하지만, LLM의 오류는 "bullshitting"—진실에 무관심한 텍스트를 의도적 또는 비의도적으로 생성하는 것—에 더 가깝습니다. 이러한 구분은 모델이 존재하지 않는 것을 보고 있는 것이 아니라, 사실적 정확성을 무시하고 확률적인 경로를 따르고 있다는 점을 강조하기 때문에 중요합니다.
메타인지로서의 해결책
메타인지, 즉 "생각에 대한 생각"은 제안된 해결책입니다. AI의 맥락에서 메타인지란 모델이 사용자에게 출력을 제시하기 전에 자신의 내부 상태, 신뢰 수준, 그리고 자신의 출력의 신뢰성을 스스로 평가하는 2차 프로세싱을 의미합니다.
메타인지 계층을 구현함으로써, AI는 자신의 내부 신뢰도가 낮을 때를 식별하거나 자신의 논리를 효과적으로 '재검토'할 수 있습니다. 이는 모델을 단순한 출력 생성기에서 스스로를 교정하고 불확실성을 표현할 수 있는 시스템으로 전환시켜, 거짓 주장의 빈도를 줄일 수 있습니다.
내부 vs 외부 메타인지
기술 전문가들 사이의 주요 논쟁은 이러한 메타인지 능력이 LLM 자체의 고유한 기능이어야 하는지, 아니면 외부 래퍼(wrapper)여야 하는지에 대한 것입니다.
내부적 접근 방식
내부적 접근 방식은 모델이 자신의 신뢰도를 더 잘 보정(calibrate)할 수 있도록 훈련시키는 것을 포함합니다. 이를 위해서는 아키텍처의 변경이나, 정직하게 무지를 인정하는 것보다 자신감 넘치는 거짓말을 더 무겁게 처벌하는 특화된 훈련 데이터가 필요할 것입니다.
외부 하네스(Harness) 접근 방식
대안으로, 일부는 메타인지를 모델의 출력을 관리하는 외부 시스템인 "하네스(harness)"를 통해 시뮬레이션할 수 있다고 제안합니다. 이 제안된 아키텍처는 다음과 같은 과정을 포함합니다:
- 출력 모니터링: LLM의 초기 출력을 읽는 별도의 프로세스.
- 검증: 출력에 포함된 모든 사실적 주장을 독립적으로 검증하기 위해 연구 서브 에이전트(research sub-agent)를 사용하는 것.
- 정제: 사실적 주장이 독립적으로 검증될 수 없는 경우, 불확실성을 전달하기 위해 최종 출력을 재구성하는 것.
이 외부적 접근 방식은 검증 에이전트가 근거가 되는 진실의 원천(데이터베이스나 검색 엔진 등)을 사용하여 모델의 주요 생성 프로세스를 검증할 수 있는 더 모듈식 설계를 가능하게 합니다.
결론
환각을 줄이는 것은 단순한 기술적 과제가 아니라 신뢰의 과제입니다. 메타인지적 방향으로의 내부 아키텍처 변화를 통하거나, 외부 검증 하네스를 구현하는 것을 통하거나, 목표는 자신의 한계를 스스로 소통할 수 있는 AI 시스템으로 나아가는 것입니다. 확률적 토큰 예측에서 자기 평가가 가능한 시스템으로의 전환은 더 신뢰할 수 있고 믿을 수 있는 인공지능을 향러한 움직임의 본질입니다.