対照学習による事前学習によるOpenAIのテキストおよびコードのEmbeddings

TL;DR

OpenAIは、大規模な教師なしデータに対する対照学習による事前学習を通じて、高品質なテキストおよびコードのベクトル表現を生成する手法を導入しました。このアプローチにより、単一の教師なしモデルが、線形プローブ分類や大規模なセマンティック検索を含む複数のタスクにおいて、最先端の結果を達成することが可能になり、多くの場合、以前の微調整された教師ありモデルを凌駕しています。

Contrastive Pre-training for General Purpose Embeddings

大規模な教師なしデータに対する対照学習による事前学習は、深い意味的意味を捉えるベクトル表現(embeddings)の作成を可能にします。アーキテクチャ、学習目的、データセットの選択が異なる、特定のユースケースに合わせてモデルをカスタマイズする必要があった従来のアプローチとは異なり、この手法は、セマンティック検索やテキストの類似性など、幅広いアプリケーションに有用な汎用的なembeddingsが生成されます。

Performance in Text Embedding Classification

この手法によって生成された教師なしテキストembeddingsは、線形プローブ分類において新たな最先端の結果を達成しています。7つの異なるタスクの平均において、最高の教師なしモデルは、以前の最高の教師なしモデルと比較して4%の相対的な改善を示し、以前の最高の教師ありテキストembeddingsモデルと比較して1.8%の改善を示しました。

Code Embedding Capabilities

(text, code)のペアでコードembeddingsモデルを学習させることにより、OpenAIは、同じ対照学習による事前学習のロジックがプログラミング言語に対しても同様の効果をもたらすように拡張できることを示しました。このプロセスにより、コード検索の分野における以前の最高の結果と比較して20.8%の相対的な改善が達成されました。

Advancements in Semantic Search

対照学習による事前学習のアプローチは、大規模なセマンティック検索のパフォーマンスを大幅に向上させます。標準的なベンチマークで評価した際、最高の教師なしモデルは、以前の最高の教師なし手法と比較して、以下の相対的な改善を達成しました:

  • MSMARCO: 23.4%の相対的な改善
  • Natural Questions: 14.7%の相対的な改善
  • TriviaQA: 10.6%の相対的な改善

Summary of Technical Impact

この研究は、規模と教師なしデータに対する対照学習による事前学習が、自然言語とプログラミングコードの両方において、first-answer-first、highly competitive with supervised, fine-tuned models(教師ありの微調整されたモデルと非常に競争力のある)embeddingsを生成するのに十分であることを示しています。

Sources

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch