feast-dev/feast
The Open Source Feature Store for AI/ML
解决的问题
Feast 提供了一种集中管理机器学习特征的方法,弥合了用于训练的历史数据与用于推理的实时数据之间的鸿沟。它通过确保时间点正确性来防止数据泄露,并将机器学习模型与底层数据基础设施解耦,使模型在不同环境中更具可移植性。
工作原理
Feast 作为一个数据访问层,将存储与检索抽象化。它管理两种主要的存储类型:
- Offline Store: 处理用于批量评分或模型训练的历史数据。
- Online Store: 为实时预测提供支持的低延迟存储。
它包含一个用于提供预计算特征的特征服务器,以及一个用于跟踪特征定义的注册表。用户可以将数据从离线存储物化(materialize)到在线存储中以供实时使用。
适用对象
需要大规模将分析数据投入生产环境,用于模型训练和在线推理的机器学习平台团队和数据科学家。
亮点
- 广泛的基础设施支持: 与各种数据源、离线存储(如 Snowflake, BigQuery, DuckDB)和在线存储(如 Redis, DynamoDB, Qdrant)集成。
- 时间点正确性: 通过确保未来值不会泄露到训练集中,生成避免数据泄露的特征集。
- 按需转换: 支持在读取或写入时进行转换,以动态处理特征。
- 特征质量监控: 包括内置指标、漂移检测和服务日志监控。
- 向量搜索支持: 包括对用于 NLP 任务的 Milvus 和 Faiss 等向量存储的 alpha 版本支持。
相关
- 项目
- 项目
- 项目
- 项目
- 项目