DharmaOCR: 巴西葡萄牙语 OCR 的专业化优势
DharmaOCR: 巴西葡萄牙语 OCR 的专业化优势
DharmaOCR 通过有针对性的微调和直接偏好优化(DPO),将所有模型参数集中在单一领域,从而在巴西葡萄牙语文档上优于更新的通用模型,如 Mistral OCR4 和 Unlimited-OCR。
领域专业化 vs. 多语言广度
专业化通过优化有限模型参数的分配,相较于通用模型具有结构优势。多语言模型必须将其表示能力分配到 N 种语言中,而像 DharmaOCR 这样的专业模型则将所有参数专用于单一目标语言的特定词汇、形态学和正字模式。
这种资源集中使模型能够捕捉通用模型常常遗漏的语言细微差别。例如,在使用 ENEM 作文(巴西全国高中考试)的基准测试中,通用模型未能正确转录巴西全国公认的人物和短语,如“Chico Buarque”,而 DharmaOCR 正确处理了它们。这表明通用模型的失败不是随机的,而是特定地发生在区分特定语言与更广泛多语言语料库的词汇和专有名词上。
性能基准
在以葡萄牙语为中心的评估中,DharmaOCR 显著优于其发布后推出的更新且资源更丰富的模型:
| 模型 | 提取质量得分 |
|---|---|
| DharmaOCR | 0.925 |
| Mistral OCR4 | 0.798 |
| Unlimited-OCR | 0.7587 |
DharmaOCR 相比 Mistral OCR4 领先约 13 分,相比 Unlimited-OCR 领先超过 16 分,这表明即使面对更近期的架构进步,领域专业化仍然有效。
通过 DPO 解决文本退化
文本退化——模型产生重复、不连贯或语义脱节的输出——是生产 OCR 中的关键失败模式,通常由视觉歧义触发,例如小字体或扫描质量下降。
DharmaOCR 通过两阶段训练管道缓解此问题:
- 监督微调 (SFT): 此阶段通过将模型权重与巴西葡萄牙语的词汇和文档结构对齐来构建领域能力。
- 直接偏好优化 (DPO): 与逐步预测 token 的 SFT 不同,DPO 根据完整输出的质量来训练模型。通过教模型基于完整提取的连贯性来区分竞争响应,DPO 抑制导致退化的漂移和重复循环。
此方法确保模型在通用模型(如 Mistral OCR4)可能生成与源文档完全脱节的输出的条件下保持稳定。
专业化的结构逻辑
虽然更新的架构和扩展的数据集可能会提高所有模型的绝对性能上限,但专业化的相对优势仍然存在。结构动态保持不变:将所有资源指向单一领域的系统将在该领域从这些资源中提取更多价值,而将资源分散到多个领域的系统则不然。
DharmaOCR 的策略是将新兴前沿技术——包括新架构和对齐方法——专门应用于巴西葡萄牙语 OCR 的固定领域,以在最低成本和推理时间的情况下保持最高可能的提取质量。
Sources
- OriginalNewer Models, Same Advantage