koaning/embetter

just a bunch of useful embeddings for scikit-learn pipelines

解決的問題

Embetter 簡化了將高品質文字與影像嵌入整合至 scikit-learn 管線的過程。它消除了在建立概念驗證、分類器或大量標註工作流程時,手動準備資料與管理預訓練模型的繁瑣步驟。

運作方式

它提供了一組與 scikit-learn 相容的編碼器與載入器,作為管線中的無狀態組件。使用者可以使用 ColumnGrabber 從 pandas DataFrames 中提取資料,然後將資料傳遞給專門的編碼器(例如用於文字的 SentenceEncoder 或用於多模態資料的 ClipEncoder),以產生可輸入至標準 scikit-learn 估計器(如 Logistic Regression)的嵌入。

適用對象

使用 scikit-learn 並希望在不編寫大量樣板程式碼的情況下,快速為文字或視覺任務實作基於嵌入特徵的資料科學家與機器學習工程師。

特色

  • Scikit-learn 相容性:可無縫作為 make_pipeline 中的一個步驟運作。
  • 多模態支援:包含用於文字、電腦視覺 (Timm, Color Histogram) 與多模態模型 (CLIP) 的編碼器。
  • 外部 API 整合:支援來自 OpenAI 與 Cohere 等供應商的嵌入。
  • 記憶體外處理:相容於 partial_fit 機制,可用於處理超出記憶體容量的大型資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案