Anthropic 연구: 언어 모델은 (대부분) 자신이 무엇을 아는지 알고 있다

Anthropic 연구에 따르면 대규모 언어 모델(LLM)은 자신의 주장의 타당성을 평가하고 질문에 올바르게 답변할 가능성이 있는지 예측할 수 있습니다. 이러한 능력은 모델이 불확실성을 표현하고 자신의 지식 공백을 식별할 수 있게 하며, 이는 더 정직하고 신뢰할 수 있는 AI 시스템을 개발하는 데 중요한 단계입니다.

객관식 및 참/거짓 질문에 대한 모델 보정(Calibration)

대규모 언어 모델은 올바른 형식으로 제공될 경우 다양한 객관식 및 참/거짓 질문에 대해 잘 보정되어 있습니다. 이러한 보정은 모델이 예측한 정답 확률이 실제 답변의 정확도와 밀접하게 일치함을 의미합니다. 모델의 크기가 커질수록 이러한 보정 성능이 향상되며, 이는 더 큰 모델이 자신의 정확도를 더 잘 추정하는 스케일링 효과를 보여줍니다.

개방형 샘플링 작업의 자기 평가

개방형 작업의 경우, Anthropic 연구원들은 모델에게 먼저 답변을 제안하게 한 다음, 그 답변이 정답일 확률인 "P(True)"를 평가하도록 요청함으로써 자기 평가에 접근했습니다.

주요 결과는 다음과 같습니다:

  • Performance and Scaling: P(True)에 대해 다양한 작업 전반에서 고무적인 성능, 보정 및 스케일링이 나타납니다.
  • Sample Consideration: 모델이 특정 답변의 타당성을 예측하기 전에 자신이 생성한 답변의 여러 샘플을 검토할 수 있도록 하면 자기 평가 정확도가 향상됩니다.

지식 확률 예측 (P(IK))

연구원들은 모델이 특정 제안된 답변을 참조하지 않고도 질문에 대한 답변을 "I know" 할 확률인 "P(IK)"를 예측하도록 훈련될 수 있는지 조사했습니다.

P(IK) 예측에 관한 결과는 다음과 같습니다:

  • Generalization: 모델은 P(IK)를 예측하는 데 뛰어난 성능을 보여주며 다양한 작업 전반에서 부분적인 일반화 능력을 보여줍니다.
  • Calibration Challenges: 모델은 완전히 새로운 작업을 접할 때 P(IK)의 보정 문제에 직면합니다.
  • Contextual Influence: 관련 소스 자료가 컨텍스트에 제공되거나 수학 문장제 문제에 대한 힌트가 제공될 때 예측된 P(IK) 확률이 증가합니다.

AI 정직성에 대한 시사점

이러한 관찰 결과는 LLM이 자신의 지식 상태에 대한 내부 표현을 보유하고 있음을 시사합니다. 이러한 확률—P(True)와 P(IK)—을 활용함으로써 모델은 자신이 모르는 것에 대해 더 정직해지도록 훈련될 수 있으며, 이를 통해 환각 현상을 줄이고 전체 시스템의 신뢰성을 향상시킬 수 있습니다.

Sources

관련