OpenAI 텍스트 및 코드 임베딩 출시

OpenAI는 텍스트와 코드를 고차원 벡터 표현으로 매핑하도록 설계된 새로운 임베딩 모델 세트를 출시했습니다. 이 모델들은 코드 검색에서 20%의 상대적 향상을 포함하여 세 가지 표준 벤치마크에서 기존의 최고 모델들을 능가합니다.

임베딩 기술 개요

임베딩은 개념을 수치 시퀀스(벡터)로 변환하여 컴퓨터가 서로 다른 데이터 조각 사이의 의미론적 관계를 분석할 수 있도록 합니다. 이 고차원 공간에서 수치적으로 유사한 벡터는 의미론적으로도 유사합니다. OpenAI의 임베딩은 GPT-3에서 파생된 신경망 모델을 사용하여 생성되며, 결과 벡터의 각 차원은 입력 텍스트 또는 코드의 특정 측면을 포착합니다.

사용 가능한 임베딩 모델 제품군

OpenAI는 특정 사용 사례에 최적화된 세 가지 별도의 임베딩 모델 제품군을 제공합니다:

Model Family Use Cases Specific Models
Text Similarity Clustering, regression, anomaly detection, and visualization text-similarity-{ada, babbage, curie, davinci}-001
Text Search Semantic information retrieval and context relevance text-search-{ada, babbage, curie, davinci}-{query, doc}-001
Code Search Finding relevant code using natural language queries code-search-{ada, babbage}-{code, text}-001

텍스트 유사도 및 선형 프로빙

텍스트 유사도 모델을 사용하면 사용자가 임베딩의 내적(dot product)을 사용하여 -1과 1 사이의 유사도 점수(코사인 유사도)를를 생성하여 두 텍스트 조각을 비교할 수 있습니다. 점수가 높을수록 의미론적 유사성이 더 높음을 나타냅니다.

이 모델들은 머신러닝 분류 작업을 위한 특징(features)으로 사용될 때 특히 효과적인데, 이를 "linear probes"라고 합니다. OpenAI의 텍스트 유사도 모델은 SentEval 벤치마크 내의 linear probe 분류에서 최첨단(state-of-the-art) 결과를 달성했습니다.

의미론적 텍스트 검색

텍스트 검색 모델은 쿼리(query)와 문서(document)에 대해 별도의 임베딩을 생성하여 대규모 정보 검색을 용이하게 합니다. 쿼리 벡터와 문서 벡터 사이의 코사인 유사도를 비교함으로써 시스템은 가장 관련성 높은 콘텐츠를를 포착할 수 있습니다.

단어의 중복에 의존하는 고전적인 키워드 검색과 달리, 임베딩 기반 검색은 의미론적 의미를 포착하며 정확한 문구에 덜 민감합니다. OpenAI의 텍스트 검색 모델은 이전 방법들에 비해 BEIR 검색 평가 스위트에서 우수한 성능을 보여주었습니다.

실제 사례 및 성능

산업계의 구현 사례들은 이전 임베딩 기술에 비해 정확도와 효율성 면에서 상당한 큰 이득을을 보여줍니다:

  • Educational Content Mapping: FineTune Learning은 text-search-curie 모델을 사용하여 교과서 내용을 학습 목표에 매핑하여 top-5 정확도를 89.1% 달성했습니다. 이는 64.5%를 달성한 Sentence-BERT보다 뛰어난 성능이며, 교과서 라벨링 시간을 시간 단위에서 초 단위로 단축시켰습니다.
  • Customer Insight Analysis: Fabius는 임베딩을 사용하여 고객 통화 녹취록의 기능 요청 사항을 태깅했습니다. 모호한 키워드 검색에서 OpenAI 임베딩으로 전환함으로써, 이들은 일반적인 사례를 2배 더 많이 식별하고, 명확한 키워드가 부족한 추상적인 사용 사례에 대해서는 6배~10배 더 많은 사례를 식별했습니다.

Sources

관련