aws-samples/amazon-textract-textractor
Analyze documents with Amazon Textract and generate output in multiple formats.
解決的問題
Textractor 簡化了與 Amazon Textract(文件智慧服務)互動的過程。它消除了直接呼叫原始 API 和解析 JSON 回應的複雜性,讓從簡單的指令碼到複雜的分散式文件處理流程都能輕鬆建構。
如何運作
它作為 Amazon Textract API 的 Python 包裝,提供高階介面,以執行各種文件分析任務。可處理影像、位元組資料或 S3 路徑,並提供針對不同需求的專用方法:
- 文字辨識:從文件中提取原始文字。
- 表格提取:識別並提取表格中的結構化資料,可匯出為 Excel 等格式。
- 表單處理:提取表單中的鍵值對,並支援模糊比對。
- 身分文件分析:從身分證件中提取特定欄位。
- 費用處理:從收據中提取摘要欄位。
適用對象
需要使用 AWS 服務從文件中提取結構化資料,但又不想處理底層 API 回應的開發人員與資料工程師。
主要特色
- 完整的工具集:包含整合的實用工具,用於呼叫 API、解析回應、繪製邊界框(覆疊層),以及將輸出轉換為 CSV、文字或 Markdown(美觀列印)。
- 彈性安裝:提供適用於 AWS Lambda 的最小版本,以及可選的額外功能,包括 pandas、PDF 光柵化(透過 pdfium 或 pdf)、以及用於機器學習基礎的字詞搜尋的 torch。
- CLI 支援:提供命令列介面,可直接從終端機呼叫並疊加結果。
- 多來源支援:支援多種檔案來源,包括本機影像、影像清單、位元組資料和 S3 路徑。
相關
- 專案
- 專案
- 專案
- 專案
- 專案