OpenAI 대조 학습 사전 훈련을 통한 텍스트 및 코드 임베딩
TL;DR
OpenAI는 대규모 비지도 데이터에 대한 대조 학습 사전 훈련을 통해 고품질의 텍스트 및 코드 벡터 표현을 생성하는 방법을 도입했습니다. 이 접근 방식은 단일 비지도 모델이 선형 프로브 분류 및 대규모 시맨틱 검색을 포함한 여러 작업에서 최첨단(state-of-the-art) 결과를 달성할 수 있게 하며, 종종 이전에 미세 조정된 지도 학습 모델보다 더 나은 성능을 보여줍니다.
범용 임베딩을 위한 대조 학습 사전 훈련
대규모 비지도 데이터에 대한 대조 학습 사전 훈련은 깊은 의미론적 의미를 포착하는 벡터 표현(임베딩)을 생성할 수 있게 합니다. 아키텍처, 학습 목표 및 데이터셋 선택이 특정 사용 사례에 따라 달라져야 했던 이전 방식과 달리, 이 방법은 시맨틱 검색 및 텍스트 유사도와 같은 광범위한 응용 분야에 유용한 범용 임베딩을 생성합니다.
텍스트 임베딩 분류 성능
이 방법으로 생성된 비지도 텍스트 임베딩은 선형 프로브 분류에서 새로운 최첨단 결과를 달성했습니다. 7가지 서로 다른 작업에 대한 평균을 기준으로, 가장 우수한 비지도 모델은 이전의 가장 우수한 비지도 모델보다 4%의 상대적 개선을, 이전의 가장 우수한 지도 학습 텍스트 임베딩 모델보다 1.8%의 상대적 개선을 보여주었습니다.
시맨틱 검색의 발전
대조 학습 사전 훈련 접근 방식은 대규모 시맨틱 검색의 성능을 크게 향상시킵니다. 표준 벤치마크를 기준으로 평가했을 때, 가장 우수한 비지도 모델은 이전의 가장 우수한 비지도 방식에 대해 다음과 같은 상대적 개선을 달성했습니다:
- MSMARCO: 23.4% 상대적 개선
- Natural Questions: 14.7% 상대적 개선
- TriviaQA: 10.6% 상대적 개선
코드 임베딩 기능
OpenAI는 (text, code) 쌍을 사용하여 코드 임베딩 모델을 학습시킴으로써, 동일한 대조 학습 사전 훈련 로직이 프로그래밍 언어에도 동일한 효과로 확장될 수 있음을 입였습니다. 이 과정은 코드 검색 분야의 이전 최고 작업 대비 20.8%의 상대적 개선을 가져왔습니다.
기술적 영향 요약
이 연구는 규모와 비지도 데이터에 대한 대조 학습 사전 훈련만으로도 자연어와 프로그래밍 코드 모두에서 answer-first, answer-first, 지도 학습된 미세 조정 모델과 매우 경쟁력 있는 임베딩을 생성하기에 충분하다는 것을 보여줍니다.
Sources
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- Dispatch