대화형 에이전트를 유용하게 만드는 요소는? 기술 분석
요약
현대의 대화형 에이전트는 사전 학습된 기본 언어 모델에 일련의 파인튜닝 기법을 적용하여 단순 텍스트 예측에서 명령 수행으로 전환함으로써 만들어집니다. 유용성의 주요 동인은 작업 다양성을 위한 Instruction Fine‑Tuning (IFT), 안전성과 도움이 되는 응답을 위한 Supervised Fine‑Tuning (SFT), 선호도 정렬을 위한 Reinforcement Learning from Human Feedback (RLHF), 그리고 복잡한 추론을 위한 Chain‑of‑Thought (CoT) 입니다.
대화형 에이전트 비교 현황
ChatGPT가 이러한 기법을 대중화했지만, 여러 조직이 훈련 데이터와 정렬 방법을 다르게 조합하여 유사한 대화형 에이전트를 개발했습니다.
| Model | Organization | Size | Pre‑trained Base | Web Access | RLHF |
|---|---|---|---|---|---|
| LaMDA | 137B | Unknown | 예 | 아니오 | |
| BlenderBot 3 | Meta | 175B | OPT | 예 | 아니오 |
| Sparrow | DeepMind | 70B | Chinchilla | 예 | 예 |
| ChatGPT/InstructGPT | OpenAI | 175B | GPT‑3.5 | 아니오 | 예 |
| Assistant | Anthropic | 52B | Unknown | 아니오 | 예 |
이 모델들의 공통 목표는 명령 수행이며, 이를 통해 사용자가 지정한 작업(예: 시 쓰기, 텍스트 요약)을 실행할 수 있습니다.
Instruction Fine‑Tuning (IFT)
Instruction Fine‑Tuning은 기본 모델의 목표를 다음 토큰 예측에서 특정 지시를 따르는 것으로 전환합니다. 이 과정은 지시, 선택적 입력, 출력의 세 요소로 구성된 시연 데이터를 사용해 모델을 파인튜닝하는 것을 포함합니다.
IFT 데이터 소스
IFT 데이터셋은 인간과 모델의 다양한 기여를 통해 만들어집니다:
- 완전 모델 생성: Unnatural Instructions와 같은 데이터셋은 전적으로 언어 모델에 의해 생성됩니다.
- 부트스트랩: Self‑instruct는 소량의 고품질 시드 데이터를 사용해 새로운 지시와 출력을 생성합니다.
- 수작업: Super‑natural instructions는 대규모 커뮤니티가 작성한 인간 데이터에 의존합니다.
- 템플릿 기반: T0, FLAN LM, Natural Instructions와 같은 프로젝트는 기존 NLP 데이터셋을 통합된 지시 스키마로 변환합니다.
안전성 및 정렬 기법
모델이 회피하거나 위험한 콘텐츠를 생성하지 않도록 개발자는 특정 정렬 전략을 사용합니다.
Supervised Fine‑Tuning (SFT)
SFT는 도움이 되고 무해한 응답에 초점을 맞춘 고품질 인간 주석 데이터를 사용해 기본 모델을 파인튜닝합니다. IFT가 SFT의 하위 집합이지만, 초기 지시 튜닝 이후 안전성 주제에 대해 별도로 SFT 단계가 자주 활용됩니다.
Reinforcement Learning from Human Feedback (RLHF)
InstructGPT, Sparrow, Anthropic의 Constitutional AI에서 사용되는 RLHF는 인간 선호와 모델을 정렬하기 위해 세 단계 과정을 거칩니다:
- 인간 주석자가 여러 모델 응답을 순위 매깁니다.
- 이러한 순위를 기반으로 선호 모델을 학습시켜 스칼라 보상을 제공합니다.
- 대화형 에이전트를 강화 학습으로 훈련시켜 해당 보상을 최대화합니다.
Chain‑of‑Thought (CoT) 로 추론 향상
Chain‑of‑Thought 프롬프트와 파인튜닝은 에이전트가 단계별 추론을 수행하도록 유도합니다. 인간이 추론 과정을 주석한 데이터셋으로 훈련함으로써 모델은 다음 영역에서 큰 성능 향상을 보입니다:
- 상식 추론
- 산술
- 기호 추론
또한 CoT 파인튜닝은 일부 경우 RLHF보다 무해성을 더 효과적으로 개선하여, 민감한 프롬프트에 대해 "이 질문에 답변할 수 없습니다"와 같은 회피 응답 빈도를 감소시킵니다.
주요 기술 요점
- 데이터 효율성: Instruction Fine‑Tuning은 사전 학습에 사용되는 데이터의 극히 일부(수백 개 샘플 수준)만 필요합니다.
- SFT를 통한 안전성: SFT에 포함된 인간 주석은 모델 출력이 안전하고 도움이 되도록 하는 데 핵심적입니다.
- CoT를 통한 추론: CoT 파인튜닝은 복잡한 사고 작업에 필수이며, 민감한 주제에 대한 모델 회피성을 줄여줍니다.
대화형 에이전트 개발의 미해결 질문
다음과 같은 해결되지 않은 과제가 남아 있습니다:
- RL 필요성: RLHF의 성능을 더 높은 품질의 IFT 또는 SFT 데이터만으로 달성할 수 있는지 여부.
- SFT vs. RLHF: LaMDA와 같이 SFT만으로 안전성을 확보하는 경우와 Sparrow와 같이 SFT+RLHF를 결합하는 경우의 상대적 효과성 비교.
- 사전 학습 트레이드오프: 고급 파인튜닝 기법과 결합했을 때 필요한 최적의 사전 학습 양이 아직 정의되지 않음.
- 레드팀 재현성: 레드팀(실패 모드 탐색) 효과를 기록하고 재현하는 체계적인 방법이 현재 없음.