OpenAI Text and Code Embeddings 發佈

OpenAI 已推出一套全新的嵌入模型(embedding models),旨在將文本和代碼映射為高維向量表示。這些模型在三個標準基準測試中表現優於現有的頂尖模型,其中在代碼搜索方面的相對改進達到了 20%。

Embedding 技術概覽

嵌入(Embeddings)將概念轉換為數值序列(向量),使電腦能夠分析不同數據片段之間的語義關係。在這個高維空間中,數值相似的向量在語義上也具有相似性。OpenAI 的嵌入是使用源自 GPT-3 的神經網絡模型生成的,其中生成的向量的每個維度都捕捉了輸入文本或代碼的特定方面。

可用的 Embedding 模型系列

OpenAI 提供三種不同的嵌入模型系列,每種都針對特定用例進行了優化:

Model Family Use Cases Specific Models
Text Similarity Clustering, regression, anomaly detection, and visualization text-similarity-{ada, babbage, curie, davinci}-001
Text Search Semantic information retrieval and context relevance text-search-{ada, babbage, curie, davinci}-{query, doc}-001
Code Search Finding relevant code using natural language queries code-search-{ada, babbage}-{code, text}-001

Text Similarity 與 Linear Probing

Text similarity 模型允許用戶使用其嵌入的點積(dot product)來比較兩段文本,從而生成介於 -1 到 1 之間的相似度分數(餘弦相似度,cosine similarity)。分數越高,表示語義相似度越高。

這些模型在機器學習分類任務中作為特徵非常有效,這種方法被稱為「linear probes」。OpenAI 的 text similarity 模型在 SentEval 基準測試的 linear probe 分類中取得了最先進的結果。

Semantic Text Search

Text search 模型透過為查詢(queries)和文檔(documents)生成獨立的嵌入,來促進大規模的信息檢索。透過比較查詢向量與文檔向量之間的餘弦相似度,系統可以識別出最相關的內容。

與依賴詞彙重疊的傳統關鍵詞搜索不同,基於嵌入的搜索捕捉了語義含義,且對精確措辭的敏感度較低。OpenAI 的 text search 模型在 BEIR 搜索評估套件上的表現優於以往的方法。

實際應用與性能

行業實施證明,與之前的嵌入技術相比,在準確性和效率方面有顯著提升:

  • Educational Content Mapping: FineTune Learning 使用了 text-search-curie 模型將教科書內容映射到學習目標,實現了 89.1% 的 top-5 準確度。這優於 Sentence-BERT(其準確度為 64.5%),並將教科書的標籤製作時間從數小時縮短至數秒。
  • Customer Insight Analysis: Fabius 利用嵌入來標記客戶通話記錄中的功能需求。透過從模糊的關鍵詞搜索轉向 OpenAI 嵌入,他們識別出的通用範例增加了 2 倍,而對於缺乏明確關鍵詞的抽象用例,識別出的範例增加了 6 到 10 倍。

Sources

相關