koaning/embetter
just a bunch of useful embeddings for scikit-learn pipelines
解決する課題
Embetterは、高品質なテキストおよび画像埋め込みをscikit-learnパイプラインに統合するプロセスを簡素化します。概念実証、分類器、または大量のラベル付けワークフローを構築する際に、手動でのデータ準備や事前学習済みモデルの管理に伴う煩雑さを解消します。
仕組み
パイプライン内でステートレスなコンポーネントとして機能する、scikit-learn互換のエンコーダーとローダーを提供します。ユーザーは ColumnGrabber を使用して pandas DataFrames からデータを抽出し、それを専用のエンコーダー(テキスト用の SentenceEncoder やマルチモーダルデータ用の ClipEncoder など)に通すことで、Logistic Regression のような標準的な scikit-learn 推定器に入力可能な埋め込みを生成できます。
対象ユーザー
scikit-learn を使用しており、大量のボイラープレートコードを書くことなく、テキストやビジョンタスク向けの埋め込みベースの機能を迅速に実装したいデータサイエンティストおよび機械学習エンジニア。
特徴
- Scikit-learn 互換性:
make_pipelineのステップとしてシームレスに動作します。 - マルチモーダルサポート: テキスト、コンピュータビジョン (Timm, Color Histogram)、マルチモーダルモデル (CLIP) 用のエンコーダーが含まれています。
- 外部 API 統合: OpenAI や Cohere などのプロバイダーからの埋め込みをサポートしています。
- アウトオブコア処理: メモリに収まらない大規模なデータセットを処理するための
partial_fitメカニズムと互換性があります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト