OpenAI, Fill‑in‑the‑Middle을 위한 언어 모델 효율적 훈련 발표

TL;DR

OpenAI는 표준 자동 회귀 언어 모델이 원래의 좌‑우 순차 생성 성능을 유지하면서 누락된 구간을 채우는(Fill‑in‑the‑Middle, FIM) 학습을 할 수 있게 하는 데이터‑증강 기법을 도입했으며, 이를 통해 FIM을 실용적인 기본 훈련 목표로 만들었습니다.

왜 FIM이 중요한가

모델을 Fill‑in‑the‑Middle 작업에 훈련시키면 편집, 코드 완성, 인터랙티브 라이팅 등 사용자가 텍스트를 처음부터 생성하기보다 삽입하거나 교체해야 하는 상황에서 유용성이 크게 확대됩니다. 사전 훈련 단계에 FIM을 통합함으로써 OpenAI는 추가 파인‑튜닝이나 아키텍처 변경 없이도 모델이 이 능력을 습득할 수 있음을 보여줍니다.

핵심 기법: Span‑Shift 변환

이 방법은 문서 중간에서 연속된 구간을 선택해 동일 문서의 끝으로 이동시켜 훈련 코퍼스를 변형합니다. 모델은 주변 컨텍스트를 입력받아 이동된 텍스트를 예측하는 목표를 갖게 됩니다. 이 간단한 변환은 인필 작업을 생성하면서도 이동되지 않은 부분은 원래의 좌‑우 순서를 유지합니다.

실험 결과

  • 생성 능력 저하 없음: 여러 모델 규모에 걸쳐 표준 좌‑우 언어 모델링 벤치마크에서 퍼플렉시티가 광범위한 FIM 훈련 후에도 변하지 않았습니다.
  • 우수한 인필 성능: 변형된 예시 비율이 높은 모델은 OpenAI가 공개한 전용 인필 벤치마크에서 경쟁력 있는 결과를 달성했습니다.
  • 확장성: 이 접근법은 소형 모델부터 대형 모델까지 일관되게 작동하여 변환이 스케일링 법칙을 방해하지 않음을 시사합니다.

Ablation 연구 및 최적 설정

OpenAI는 세 가지 핵심 하이퍼파라미터에 대해 체계적인 Ablation을 수행했습니다:

  1. Transformation Frequency – Span‑Shift가 적용되는 훈련 예시 비율. 결과는 중간 정도의 빈도(예: 30‑50%)가 인필 스킬과 생성 충실도 사이의 균형을 잘 맞춘다는 것을 보여줍니다.
  2. Span Structure – 구간 길이와 위치를 다양하게 바꿨을 때, 길이와 위치를 모두 무작위화하는 것이 가장 견고한 성능을 제공합니다.
  3. Span Selection Method – 무작위 선택이 휴리스틱이나 길이 편향 전략보다 우수하여 구현이 단순해집니다.

이 실험을 토대로 OpenAI는 다음과 같은 기본값을 권장합니다:

  • 전체 훈련 데이터의 약 절반에 변환을 적용한다.
  • 사전 정의된 범위(예: 10‑50 토큰) 내에서 구간 길이를 균등하게 무작위 선택한다.
  • 문서 내에서 구간 위치를 무작위로 지정하되, 시작이나 끝에 너무 가깝지 않게 한다.

공개된 리소스

  • Best‑in‑class FIM Model: OpenAI는 API를 통해 최고의 인필 모델을 배포했으며, 개발자는 이를 직접 호출해 Fill‑in‑the‑Middle 예측을 받을 수 있습니다.
  • Infill Benchmarks: 평가 데이터셋 및 스크립트 모음이 오픈소스로 제공되어 FIM 능력에 대한 재현 가능한 연구를 지원합니다.

향후 언어 모델 개발에 미치는 영향

  • 기본 훈련 목표: 좌‑우 성능에 미치는 영향이 거의 없으므로, OpenAI는 향후 자동 회귀 모델이 FIM 훈련을 표준 관행으로 채택할 것을 제안합니다.
  • 효율성 향상: 변환 과정이 최소한의 계산 오버헤드만 발생시켜 대규모 사전 훈련 파이프라인에 매력적입니다.
  • 광범위한 적용 가능성: 이 기법은 모델에 구애받지 않으며 모든 자동 회귀 아키텍처에 적용 가능해, 분야 전반에 인필 기능 도입을 가속화할 수 있습니다.

"이 데이터 증강은 최근 몇 년간 큰 관심을 받아왔지만, 우리는 이러한 방식으로 변환된 데이터 비율이 높더라도 원래의 좌‑우 생성 능력이 해치지 않는다는 광범위한 증거를 제공합니다..." – OpenAI 저자

결론

OpenAI의 효율적인 FIM 훈련 방법은 간단한 데이터셋 변환만으로 자동 회귀 언어 모델에 강력한 인필 능력을 부여하면서도 핵심 생성 역량을 손상시키지 않음을 입증했습니다. 공개된 모델, 벤치마크, 권장 하이퍼파라미터는 커뮤니티가 향후 언어 모델에 Fill‑in‑the‑Middle 기능을 통합하는 명확한 경로를 제공합니다.

Sources