koaning/embetter

just a bunch of useful embeddings for scikit-learn pipelines

解决的问题

Embetter 简化了将高质量文本和图像嵌入集成到 scikit-learn 流水线中的过程。它消除了在构建概念验证、分类器或批量标注工作流时,手动准备数据和管理预训练模型的繁琐工作。

运作方式

它提供了一组与 scikit-learn 兼容的编码器和加载器,作为流水线中的无状态组件。用户可以使用 ColumnGrabber 从 pandas DataFrames 中提取数据,然后将数据传递给专门的编码器(例如用于文本的 SentenceEncoder 或用于多模态数据的 ClipEncoder),以生成可输入到标准 scikit-learn 估计器(如 Logistic Regression)中的嵌入。

适用对象

使用 scikit-learn 并希望在不编写大量样板代码的情况下,快速为文本或视觉任务实现基于嵌入特征的数据科学家和机器学习工程师。

特色

  • Scikit-learn 兼容性:可无缝作为 make_pipeline 中的一个步骤运行。
  • 多模态支持:包含用于文本、计算机视觉 (Timm, Color Histogram) 和多模态模型 (CLIP) 的编码器。
  • 外部 API 集成:支持来自 OpenAI 和 Cohere 等提供商的嵌入。
  • 核外处理:兼容 partial_fit 机制,用于处理超出内存容量的大型数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目