OpenAI Text and Code Embeddings Release
OpenAIは、テキストとコードを高次元のベクトル表現にマッピングするように設計された、新しい埋め込み(embedding)モデルのセットを導入しました。これらのモデルは、コード検索において20%の相対的な改善を含む、3つの標準的なベンチマークにおいて既存のトップモデルを凌駕しています。
Overview of Embedding Technology
埋め込み(embeddings)は、概念を数値のシーケンス(ベクトル)に変換し、コンピュータが異なるデータ間の意味的な関係を分析できるようにします。この高次元空間において、数値的に類似したベクトルは意味的にも類似しています。OpenAIの埋め込みは、GPT-3から派生したニューラルネットワークモデルを使用して生成され、結果として得られるベクトルの各次元は、入力テキストまたはコードの特定の側面を捉えています。
Available Embedding Model Families
OpenAIは、特定のユースケースに最適化された3つの異なる埋め込みモデルのファミリーを提供しています。
| Model Family | Use Cases | Specific Models |
|---|---|---|
| Text Similarity | Clustering, regression, anomaly detection, and visualization | text-similarity-{ada, babbage, curie, davinci}-001 |
| Text Search | Semantic information retrieval and context relevance | text-search-{ada, babbage, curie, davinci}-{query, doc}-001 |
| Code Search | Finding relevant code using natural language queries | code-search-{ada, babbage}-{code, text}-001 |
Text Similarity and Linear Probing
テキスト類似性モデルは、ユーザーが2つのテキストを埋め込みのドット積を使用して比較し、-1から1の間の類似性スコア(コサイン類似度)を生成できるようにします。
これらのモデルは、機械学習の分類タスクの「linear probes」として機能する特徴量として特に効果的です。OpenAIのテキスト類似性モデルは、SentEvalベンチマーク内のlinear probe分類において、最先端(state-of-the-art)の結果を達成しました。
Semantic Text Search
テキスト検索モデルは、クエリとドキュメントに対して個別の埋め込みを生成することで、大規模な情報検索を促進します。クエリベクトルとドキュメントベクトルの間のコサイン類似度を比較することで、システムは最も関連性の高いコンテンツを特定できます。
単語の重複に依存する従来のキーワード検索とは異なり、埋め込みベースの検索は意味的な意味を捉え、正確な言い回しに左右されにくくなります。OpenAIのテキスト検索モデルは、BEIR検索評価スイートにおいて、従来の方法と比較して優れた性能を示しました。
Real-World Applications and Performance
業界での実装例は、以前の埋め込み技術と比較して、精度と効率において大幅な向上を示しています。
- Educational Content Mapping: FineTune Learningは、
text-search-curieモデルを使用して教科書のコンテンツを学習目標にマッピングし、トップ5の精度が89.1%に達しました。これは、64.5%を達成したSentence-BERTを上回る結果であり、教科書のラベル付け時間を数時間から数秒に短縮しました。 - Customer Insight Analysis: Fabiusは、埋め込みを使用して、機能リクエストのための顧客の通話記録にタグを付けるために利用しました。曖昧なキーワード検索からOpenAIの埋め込みに移行することで、彼らは2倍の一般的な例と、明確なキーワードが欠けている抽象的なユースケースに対して6倍から10倍の例を特定しました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch