enjalot/latent-scope

A scientific instrument for investigating latent spaces

解决的问题

Latent Scope 为可视化和探索非结构化文本和图像数据集提供了一条简化的流程。它通过将高维嵌入自动转换为可交互的、带标签的 2D 地图,解决了手动分析大量数据的问题,使用户能够探索并发现其中的模式与洞察。

工作原理

该工具遵循一个可通过 Web 界面或命令行界面管理的多步骤流程:

  1. 嵌入:使用本地模型(HuggingFace)或 API(OpenAI、Cohere 等)将非结构化数据转换为向量。支持密集嵌入和 ColBERT 晚期交互嵌入。
  2. 投影:使用 UMAP 将高维向量降维为 2D 坐标。
  3. 聚类:使用 HDBSCAN、KMeans、高斯混合或 EVoC 等方法对点进行分组。
  4. 标注:使用 LLM 总结聚类内容,并为其分配人类可读的标签。
  5. 探索:生成的「范围」通过 Web UI 提供,用户可以交互式浏览带注释的数据,执行相似性搜索,并比较不同的投影/聚类配置。

适用人群

专为需要探索非结构化数据集以理解其组成、识别主题或为机器学习任务整理数据的 AI 研究人员、数据科学家和分析师设计。

特色亮点

  • 多模态支持:支持文本和图像数据集,包含针对 CLIP 风格嵌入的专用图像地图。
  • GPU 加速:可选 NVIDIA GPU 支持,通过 cuML 加速 UMAP 和聚类,以处理更大规模的数据集。
  • LLM 驱动标注:使用聊天模型自动生成聚类描述。
  • 扁平文件架构:所有中间数据和元数据均以标准扁平文件(Parquet、JSON、H5)存储,便于移植和复现。
  • Agent 友好:包含跨提供商 Agent 技能,允许 AI 编码 Agent(如 Claude Code 或 Cursor)驱动数据映射流程。

相关

  • 项目
  • 项目
  • 项目
  • 项目