OpenAI text-embedding-ada-002 릴리스
TL;DR
OpenAI는 text-embedding-ada-002를 출시했습니다. 이 단일 임베딩 모델은 다섯 개의 이전 모델을 대체하고, 텍스트 검색, 코드 검색 및 문장 유사도에서 더 강력한 성능을 제공하며, 8K 컨텍스트를 지원하고, 1536‑차원 벡터를 사용하며, 이전 Davinci‑기반 임베딩보다 비용이 최대 99.8% 낮습니다.
모델 개선 사항
Unified capability – 새로운 모델은 다섯 개의 이전 임베딩 모델(text-similarity, text-search-query, text-search-doc, code-search-text, code-search-code)을 하나의 API 엔드포인트로 통합하여 통합을 단순화하고, 광범위한 벤치마크 스위트 전반에 걸쳐 더 나은 결과를 제공합니다.
Performance gains – BEIR 벤치마크 스위트(ArguAna, ClimateFEVER, DBPedia, FEVER, FiQA2018, HotpotQA, NFCorpus, QuoraRetrieval, SciFact, TRECCOVID, Touche2020 포함)에서 text-embedding-ada-002는 53.3점을 기록하여 다음 최고 모델인 text-search-davinci-*-001(52.8)과 모든 이전 임베딩을 능가합니다. 또한 텍스트 분류에서 Davinci와 동등한 성능을 보이며 코드 검색에서는 이전 모델들을 초과합니다.
Longer context – 컨텍스트 길이가 2048 토큰에서 8192 토큰으로 증가하여 훨씬 긴 문서를 잘라내지 않고 임베딩할 수 있게 되었습니다.
Smaller vectors – 임베딩은 1536 차원이며, 이전 Davinci‑001 임베딩의 1/8 크기로, 벡터 데이터베이스에서 저장 및 검색 비용을 감소시킵니다.
Cost reduction – 가격이 동일한 크기의 이전 모델보다 90% 낮으며, 전체 비용은 Davinci 임베딩을 사용할 때보다 99.8% 낮아 동일하거나 더 나은 성능을 제공합니다.
제한 사항
text-embedding-ada-002는 SentEval 선형 탐색 분류 벤치마크에서 text-similarity-davinci-001보다 우수하지 않음을 나타냅니다. 임베딩 위에 가벼운 선형 분류기를 학습하는 작업의 경우, 사용자는 두 모델을 비교하여 더 높은 정확도를 제공하는 모델을 선택해야 합니다.
보다 광범위한 제한 사항 및 위험 고려 사항은 임베딩 문서의 Limitations & Risks 섹션을 참조하십시오.
사용 예시
새 모델을 사용하여 짧은 텍스트를 임베딩하려면 OpenAI 라이브러리를 이용한 파이썬 코드 두 줄만 필요합니다:
import openai
response = openai.Embedding.create(
input="porcine pals say",
model="text-embedding-ada-002"
)
응답에는 입력을 나타내는 1536‑차원 벡터가 포함됩니다.
실제 적용 사례
- Kalendar AI는 새로운 임베딩을 사용해 영업 피치를 340 M 고객 프로필에 매칭하여 이전 방식에 비해 원치 않는 타깃팅을 40–56% 감소시킵니다.
- Notion은 키워드 기반 검색을 OpenAI 임베딩으로 교체하여 워크스페이스 플랫폼 내에서 관련성과 발견성을 향상시킬 계획입니다.
개발자와 기업을 위한 시사점
다섯 개 모델을 하나의 더 저렴하고 성능이 높은 임베딩 서비스로 통합함으로써 엔지니어링 오버헤드와 운영 비용이 감소합니다. 더 긴 컨텍스트 윈도우와 작은 벡터 크기로 전체 문서를 임베딩하고 효율적으로 저장하는 것이 가능해져 의미 검색, 추천, 코드 검색 등 다양한 응용 분야가 확대됩니다.
참고 자료
- OpenAI 문서: Embeddings API
- 벤치마크 데이터셋: BEIR
- 원본 임베딩 출시: Introducing Text and Code Embeddings
Sources
- OriginalNew and improved embedding model