enjalot/latent-scope
A scientific instrument for investigating latent spaces
解决的问题
Latent Scope 为可视化和探索非结构化文本和图像数据集提供了一条简化的流程。它通过将高维嵌入自动转换为可交互的、带标签的 2D 地图,解决了手动分析大量数据的问题,使用户能够探索并发现其中的模式与洞察。
工作原理
该工具遵循一个可通过 Web 界面或命令行界面管理的多步骤流程:
- 嵌入:使用本地模型(HuggingFace)或 API(OpenAI、Cohere 等)将非结构化数据转换为向量。支持密集嵌入和 ColBERT 晚期交互嵌入。
- 投影:使用 UMAP 将高维向量降维为 2D 坐标。
- 聚类:使用 HDBSCAN、KMeans、高斯混合或 EVoC 等方法对点进行分组。
- 标注:使用 LLM 总结聚类内容,并为其分配人类可读的标签。
- 探索:生成的「范围」通过 Web UI 提供,用户可以交互式浏览带注释的数据,执行相似性搜索,并比较不同的投影/聚类配置。
适用人群
专为需要探索非结构化数据集以理解其组成、识别主题或为机器学习任务整理数据的 AI 研究人员、数据科学家和分析师设计。
特色亮点
- 多模态支持:支持文本和图像数据集,包含针对 CLIP 风格嵌入的专用图像地图。
- GPU 加速:可选 NVIDIA GPU 支持,通过 cuML 加速 UMAP 和聚类,以处理更大规模的数据集。
- LLM 驱动标注:使用聊天模型自动生成聚类描述。
- 扁平文件架构:所有中间数据和元数据均以标准扁平文件(Parquet、JSON、H5)存储,便于移植和复现。
- Agent 友好:包含跨提供商 Agent 技能,允许 AI 编码 Agent(如 Claude Code 或 Cursor)驱动数据映射流程。
相关
- 项目
- 项目
- 项目
- 项目