koaning/embetter

just a bunch of useful embeddings for scikit-learn pipelines

解決する課題

Embetterは、高品質なテキストおよび画像埋め込みをscikit-learnパイプラインに統合するプロセスを簡素化します。概念実証、分類器、または大量のラベル付けワークフローを構築する際に、手動でのデータ準備や事前学習済みモデルの管理に伴う煩雑さを解消します。

仕組み

パイプライン内でステートレスなコンポーネントとして機能する、scikit-learn互換のエンコーダーとローダーを提供します。ユーザーは ColumnGrabber を使用して pandas DataFrames からデータを抽出し、それを専用のエンコーダー(テキスト用の SentenceEncoder やマルチモーダルデータ用の ClipEncoder など)に通すことで、Logistic Regression のような標準的な scikit-learn 推定器に入力可能な埋め込みを生成できます。

対象ユーザー

scikit-learn を使用しており、大量のボイラープレートコードを書くことなく、テキストやビジョンタスク向けの埋め込みベースの機能を迅速に実装したいデータサイエンティストおよび機械学習エンジニア。

特徴

  • Scikit-learn 互換性: make_pipeline のステップとしてシームレスに動作します。
  • マルチモーダルサポート: テキスト、コンピュータビジョン (Timm, Color Histogram)、マルチモーダルモデル (CLIP) 用のエンコーダーが含まれています。
  • 外部 API 統合: OpenAI や Cohere などのプロバイダーからの埋め込みをサポートしています。
  • アウトオブコア処理: メモリに収まらない大規模なデータセットを処理するための partial_fit メカニズムと互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト