Tencent-Hunyuan/HunyuanOCR

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

解决的问题

HunyuanOCR-1.5 是一个轻量级、端到端的视觉语言模型(VLM),旨在统一多种以文本为中心的视觉任务。它解决了长结构化输出(如表格和公式)推理速度慢的问题,以及低资源、古文字 OCR 和多图像文本中心问答缺乏专用能力的问题。

工作原理

该项目采用轻量级 VLM 架构,并引入多项关键优化:

  • DFlash 指示性解码:使用轻量级块扩散草稿模型并行预测多个候选 token,再由目标模型一次性验证,从而降低延迟。
  • 智能体驱动的数据流:一种由智能体驱动的系统,可识别模型弱点,并自动生成针对长尾能力的定制化训练数据。
  • 灵活部署:支持通过 vLLM 和原生 transformers 实现高性能服务,也支持通过 llama.cpp(GGUF 格式)在 CPU 和笔记本电脑等消费级硬件上部署。
  • 升级的训练:将图像分辨率扩展至 4K,上下文窗口扩展至 128K,并引入强化学习(RL)以优化 OCR 任务。

适用人群

适合需要高性能、轻量级 OCR 模型,可在服务器级 GPU 和消费级硬件上部署的开发者和研究人员,以及需要处理复杂文档、古文字或进行多图像分析的用户。

主要亮点

  • 统一的 OCR 框架:将文档解析、文本定位、信息抽取和图文翻译整合到一个模型中。
  • 无损加速:DFlash 指示性解码在不改变输出分布的前提下,显著加速长结构化输出。
  • 广泛硬件支持:兼容 vLLM、transformers 和 llama.cpp,支持多样化部署。
  • 高分辨率支持:支持最高 4K 分辨率图像,上下文窗口达 128K。
  • 开源训练流水线:提供完整的 SFT 和 DFlash 训练流水线,便于社区扩展。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目