kotaro-kinoshita/yomitoku
YomiTokuはAIを活用した日本語文書解析エンジンを提供するPythonパッケージです。 Yomitoku is an AI-powered document image analysis package designed specifically for the Japanese language.
解决的问题
YomiToku 是一个专为日文文本和布局设计的文档 AI 引擎。它解决了从文档图像中提取结构化信息的问题,能够处理一般 OCR 工具常难以应对的日文特有挑战,如竖排文字、手写体以及复杂的表格结构。
工作原理
该项目使用四个自定义训练的 AI 模型,完成完整的文档分析流程:
- 文本检测:定位图像中文字所在的位置。
- 文本识别:将检测到的文字区域转换为字符串,支持超过 7,000 个日文字符。
- 布局分析:识别文档的语义结构,包括段落、图表和图片。
- 表格结构识别:分析表格的网格和单元格结构,以保持数据之间的语义关系。
支持多种输出格式,包括 Markdown、HTML、JSON、CSV 和可搜索 PDF。还提供一种「轻量」模式,用于在 CPU 上实现更快的推理。
适用人群
- 希望在应用中集成高精度日文 OCR 和布局分析的 开发者。
- 从事日文文档数字化工作的 研究人员。
- 需要自动化提取表单、报告和发票数据的 企业(通过表格语义解析器和提取器)。
亮点
- 日文专精:对竖排文字和手写日文文本具有高精度识别能力。
- 结构化提取:能够将表格转换为结构化 JSON 或 CSV,同时保留阅读顺序。
- 灵活提取:通过 YAML 模式,同时支持固定表单的规则提取和非结构化文档的 LLM 提取。
- 硬件高效:可在 VRAM 少于 8GB 的 GPU 上运行,或使用轻量模型在 CPU 上运行。
- 隐私优先的演示:提供基于浏览器的演示(YomiToku Studio),通过 WebAssembly/WebGPU 在本地执行推理,确保图像不会上传至服务器。
相关
- 项目
- 项目
- 项目
- 项目
- 项目