Anthropic, 모델 생성 추론의 신뢰성 향상에 있어 질문 분해의 효과를 입증
TL;DR
Anthropic는 대규모 언어 모델(LLM)에 질문을 더 간단한 하위 질문들로 분해하도록 유도하는 프롬프트 기법이 전통적인 사고의 흐름(CoT) 프롬프트보다 모델 내부 과정을 더 정확히 반영하는 추론을 생성함을 입증했으며, CoT의 성능 향상 효과도 대부분 유지한다.
왜 질문 분해가 중요한가
질문 분해는 모델이 각각 별도의 맥락에서 더 쉬운 하위 질문에 답하도록 강제함으로써, 모델이 서술한 추론과 실제 계산 간의 일치도를 크게 높인다. 이 높은 신뢰성은 LLM이 점점 더 복잡한 과제를 수행할수록 정확성과 안전성을 검증하는 데 필수적이다.
핵심 기술적 접근
- 분해 프롬프트: 모델이 단일한 연속적인 추론을 생성하도록 요청하는 대신, 원래 질문을 일련의 하위 질문으로 나누도록 지시하는 프롬프트를 사용한다.
- 별도의 맥락: 각 하위 질문은 별도의 맥락에서 답변되며, 모델이 단계를 혼동하거나 추론을 건너뛰는 것을 방지한다.
- 집계: 최종 답변은 하위 답변들로부터 조합되며, 논리적 흐름을 유지하면서 각 추론 단계를 명확히 보존한다.
사고의 흐름 대비 성능
- 분해 기반 방법은 표준 질문-답변 벤치마크에서 뛰어난 성과를 달성하며, 때로는 CoT의 정확도에 근접한다.
- 특히 최근 제안된 신뢰성 측정 지표에서 분해 방법은 CoT를 능가하며, 생성된 추론이 모델의 내부 결정 과정을 더 진실되게 반영함을 시사한다.
평가된 신뢰성 지표
Anthropic는 모델의 서술된 추론이 실제 계산과 얼마나 잘 일치하는지 평가하기 위해 여러 지표를 사용했다. 본 문서는 구체적인 수치를 제시하지 않지만, 분해 기법을 사용할 때 이러한 지표에서 일관된 개선이 나타났다고 보고한다.
모델 안전성 및 검증에 대한 함의
- 강화된 감사: 더 신뢰할 수 있는 추론 추적을 통해 외부 감사자가 모델 행동을 단계별로 검토하고 검증할 수 있다.
- 안전 보장: 추론이 내부 과정과 일치할 경우, 환각, 논리적 오류, 또는 안전하지 않은 결정 경로를 더 쉽게 탐지할 수 있다.
- 미래 연구: 이러한 발견은 모델 출력을 신뢰할 수 있게 인증할 수 있는 추론 경로를 개발하는 길을 제시하며, 고위험 응용 분야에 필수적인 요건이다.
제한점과 미해결 질문
- 여러 맥락 전환으로 인해 추가적인 계산 오버헤드가 발생할 수 있다.
- 신뢰성은 향상되었지만, 본 문서는 최고 수준의 CoT 결과와 항상 일치하지 않는다는 점을 인정하며, 이는 추가 연구가 필요한 트레이드오프임을 시사한다.
관련 Anthropic 연구
- 전면적 다중 에이전트 시스템에서의 패턴과 문제: 선도적 모델에서의 체계적 리스크 탐구
- 근로자 재교육 프로그램에 대한 증거 검토: 외부 연구자들과 공동으로 작성한 정책 중심 리뷰
- Claude의 수학적 능력에 대해 더 알아보기: Claude가 리만 가설과 관련된 경계 개선과 같은 수학적 연구에 기여할 수 있는 능력의 진보를 강조
이 요약은 2023년 7월 18일자 Anthropic의 연구 발표 기반으로 작성됨.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch