volotat/Anagnorisis
Local data-management platform with built-in trainable recommendation engine and distributed file-sharing ecosystem for content search and discovery.
解决的问题
Anagnorisis 是一个本地、私有的推荐系统,旨在帮助用户在不依赖云服务的情况下管理并过滤个人数据(文本、音频、图像和视频)。它通过允许用户训练一个与个人偏好和兴趣完全匹配的专属模型,解决了“AI 垃圾”和通用推荐的问题。
工作原理
用户通过 0 到 10 的评分系统对自身数据进行评分。系统随后对模型进行微调,以预测这些偏好,进而用于对新数据进行排序和排名。
在发现功能方面,它采用三种搜索模式:
- 基于文件名:文件名的模糊匹配
- 基于内容:使用嵌入模型将文件本身与查询进行比较
- 基于元数据:对文本描述进行嵌入,包括由描述模型自动生成的描述、零样本标签以及内部元数据(如 EXIF 或 ID3)
技术上,它通过 jina-embeddings-v5-omni-small 模型为所有内容类型建立共享向量空间,并使用专门的 MiniCPM-o-4_5 描述模型生成自然语言文件描述。后端基于 Flask 和 PyTorch 构建,前端使用 Bulma。
适用人群
适用于希望在自己硬件上完全运行、高度个性化且私密的信息管理系统的人群(GPU 至少需要 8GB VRAM,或 CPU 模式下 16GB RAM),以避免数据泄露和云服务追踪。
特色亮点
- 隐私优先:所有数据处理和存储均在用户本地计算机上完成。
- 多模态支持:在单一共享向量空间中处理图像、音乐、文本和视频。
- 个性化微调:用户可通过评分系统主动训练模型,使其“喜欢”自己真正喜欢的内容。
- 可扩展架构:支持外部模块以添加新数据类型,例如 YouTube 或 WebSearch。
- 仅本地索引:远程文件不会自动下载,搜索在 CPU 上执行,以节省 GPU 资源用于后台任务。
相关
- 项目
- 项目
- 项目
- 项目
- 项目