OpenAI Text and Code Embeddings 發佈
OpenAI 已推出一套全新的嵌入模型(embedding models),旨在將文本和代碼映射為高維向量表示。這些模型在三個標準基準測試中表現優於現有的頂尖模型,其中在代碼搜索方面的相對改進達到了 20%。
Embedding 技術概覽
嵌入(Embeddings)將概念轉換為數值序列(向量),使電腦能夠分析不同數據片段之間的語義關係。在這個高維空間中,數值相似的向量在語義上也具有相似性。OpenAI 的嵌入是使用源自 GPT-3 的神經網絡模型生成的,其中生成的向量的每個維度都捕捉了輸入文本或代碼的特定方面。
可用的 Embedding 模型系列
OpenAI 提供三種不同的嵌入模型系列,每種都針對特定用例進行了優化:
| Model Family | Use Cases | Specific Models |
|---|---|---|
| Text Similarity | Clustering, regression, anomaly detection, and visualization | text-similarity-{ada, babbage, curie, davinci}-001 |
| Text Search | Semantic information retrieval and context relevance | text-search-{ada, babbage, curie, davinci}-{query, doc}-001 |
| Code Search | Finding relevant code using natural language queries | code-search-{ada, babbage}-{code, text}-001 |
Text Similarity 與 Linear Probing
Text similarity 模型允許用戶使用其嵌入的點積(dot product)來比較兩段文本,從而生成介於 -1 到 1 之間的相似度分數(餘弦相似度,cosine similarity)。分數越高,表示語義相似度越高。
這些模型在機器學習分類任務中作為特徵非常有效,這種方法被稱為「linear probes」。OpenAI 的 text similarity 模型在 SentEval 基準測試的 linear probe 分類中取得了最先進的結果。
Semantic Text Search
Text search 模型透過為查詢(queries)和文檔(documents)生成獨立的嵌入,來促進大規模的信息檢索。透過比較查詢向量與文檔向量之間的餘弦相似度,系統可以識別出最相關的內容。
與依賴詞彙重疊的傳統關鍵詞搜索不同,基於嵌入的搜索捕捉了語義含義,且對精確措辭的敏感度較低。OpenAI 的 text search 模型在 BEIR 搜索評估套件上的表現優於以往的方法。
實際應用與性能
行業實施證明,與之前的嵌入技術相比,在準確性和效率方面有顯著提升:
- Educational Content Mapping: FineTune Learning 使用了
text-search-curie模型將教科書內容映射到學習目標,實現了 89.1% 的 top-5 準確度。這優於 Sentence-BERT(其準確度為 64.5%),並將教科書的標籤製作時間從數小時縮短至數秒。 - Customer Insight Analysis: Fabius 利用嵌入來標記客戶通話記錄中的功能需求。透過從模糊的關鍵詞搜索轉向 OpenAI 嵌入,他們識別出的通用範例增加了 2 倍,而對於缺乏明確關鍵詞的抽象用例,識別出的範例增加了 6 到 10 倍。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch