oomol-lab/pdf-craft

PDF craft can convert PDF files into various other formats. This project will focus on processing PDF files of scanned books.

解决的问题

pdf-craft 是一个转换库,旨在将 PDF(包括扫描文档)转换为可搜索、可编辑的格式,如 Markdown 或 EPUB。它特别针对书籍、学术论文和技术文档,能够处理目录、脚注、表格、公式和图像等复杂元素。

工作原理

该库使用 OCR(光学字符识别)管道将页面图像转换为文本。它支持多种 OCR 后端,包括 DeepSeek OCR 和百度的无限 OCR,这些后端既可以在 NVIDIA GPU 上本地运行(通过 CUDA),也可以通过远程供应商服务运行。在翻译方面,它集成了独立的文本 LLM,可在转换过程中翻译内容,或翻译现有的 EPUB 文件。它还支持“PDF 到 PDF”翻译,即将翻译后的文本写回原始 PDF 布局中。

适用人群

需要从扫描 PDF 中提取文本,或将其转换为结构化、可编辑格式以进行进一步处理或翻译成其他语言的研究人员、学生和开发者。

主要亮点

  • 灵活的 OCR 后端: 支持本地 GPU 执行和基于远程 API 的 OCR。
  • 多格式输出: 可将 PDF 转换为 Markdown、EPUB 或翻译后的 PDF。
  • LLM 驱动的翻译: 集成文本 LLM,在转换过程中翻译内容。
  • 复杂文档处理: 特别优化了包含公式和表格的学术和技术文档。
  • EPUB 翻译: 可翻译现有 EPUB 文件,支持替换原文或追加翻译。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目