aws-samples/amazon-textract-textractor
Analyze documents with Amazon Textract and generate output in multiple formats.
解决的问题
Textractor 简化了与 Amazon Textract(文档智能服务)交互的过程。它消除了直接调用原始 API 和解析 JSON 响应的复杂性,使构建从简单脚本到复杂分布式文档处理流水线都变得更加容易。
工作原理
它作为 Amazon Textract API 的 Python 封装,提供了一个高级接口,用于执行各种文档分析任务。它可以处理图像、字节数据或 S3 路径,并提供针对不同需求的专用方法:
- 文本识别:从文档中提取原始文本。
- 表格提取:识别并提取表格中的结构化数据,可导出为 Excel 等格式。
- 表单处理:提取表单中的键值对,并支持模糊匹配。
- 身份文档分析:从身份证件中提取特定字段。
- 费用处理:从收据中提取摘要字段。
适用人群
需要使用 AWS 服务从文档中提取结构化数据,但又不想处理底层 API 响应的开发人员和数据工程师。
主要亮点
- 全面的工具集:包含集成的实用工具,用于调用 API、解析响应、绘制边界框(叠加层),以及将输出转换为 CSV、文本或 Markdown(美化打印)。
- 灵活的安装方式:提供适用于 AWS Lambda 的最小版本,以及可选的扩展功能,包括 pandas、PDF 光栅化(通过 pdfium 或 pdf)、以及用于基于 ML 的单词搜索的 torch。
- CLI 支持:提供命令行界面,可直接从终端调用并叠加结果。
- 多源支持:支持多种文件源,包括本地图像、图像列表、字节数据和 S3 路径。
相关
- 项目
- 项目
- 项目
- 项目
- 项目