emcf/thepipe

Get clean data from tricky documents, powered by vision-language models ⚡

解决的问题

简化从复杂且“棘手”的文档中提取干净、结构化数据和多模态内容(文本、图像、音频、视频)的过程。解决了将多种文件格式(如 PDF、PowerPoint 和 Jupyter Notebook)转换为大型语言模型(LLM)和视觉语言模型(VLM)易于处理的格式的问题。

工作原理

该工具结合使用计算机视觉模型、启发式方法和 VLM 来分析文档布局并抓取内容。它使用 Whisper 进行音频和视频转录,并对图像执行 OCR。提取的内容可使用多种分块方法(按页、长度、章节、关键词或语义)进行处理,以适应模型的令牌限制。它可直接集成到 OpenAI 兼容 API 中,并提供将抓取的数据转换为聊天消息或 LlamaIndex 文档的实用工具。

适用人群

构建 RAG(检索增强生成)管道、AI 代理或任何需要从各种非结构化文件类型中提取高质量数据以供 LLM 使用的开发者。

主要亮点

  • 多模态支持:从 PDF、Word 文档、PPT 和笔记本中提取文本、表格和图像,并转录音频/视频。
  • VLM 驱动的提取:使用视觉语言模型实现更优的输出质量和布局分析。
  • 灵活的分块策略:提供多种策略,包括语义和代理式分块,以保持有意义的上下文。
  • 广泛兼容性:开箱即用支持 OpenAI、OpenRouter、本地 VLM 服务器(如 OpenLLM)和 LlamaIndex。

相关

  • 项目
  • 项目
  • 项目
  • 项目