Tencent-Hunyuan/HunyuanOCR
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
解决的问题
HunyuanOCR-1.5 是一个轻量级、端到端的视觉语言模型(VLM),旨在统一多种以文本为中心的视觉任务。它解决了长结构化输出(如表格和公式)推理速度慢的问题,以及低资源、古文字 OCR 和多图像文本中心问答缺乏专用能力的问题。
工作原理
该项目采用轻量级 VLM 架构,并引入多项关键优化:
- DFlash 指示性解码:使用轻量级块扩散草稿模型并行预测多个候选 token,再由目标模型一次性验证,从而降低延迟。
- 智能体驱动的数据流:一种由智能体驱动的系统,可识别模型弱点,并自动生成针对长尾能力的定制化训练数据。
- 灵活部署:支持通过 vLLM 和原生 transformers 实现高性能服务,也支持通过 llama.cpp(GGUF 格式)在 CPU 和笔记本电脑等消费级硬件上部署。
- 升级的训练:将图像分辨率扩展至 4K,上下文窗口扩展至 128K,并引入强化学习(RL)以优化 OCR 任务。
适用人群
适合需要高性能、轻量级 OCR 模型,可在服务器级 GPU 和消费级硬件上部署的开发者和研究人员,以及需要处理复杂文档、古文字或进行多图像分析的用户。
主要亮点
- 统一的 OCR 框架:将文档解析、文本定位、信息抽取和图文翻译整合到一个模型中。
- 无损加速:DFlash 指示性解码在不改变输出分布的前提下,显著加速长结构化输出。
- 广泛硬件支持:兼容 vLLM、transformers 和 llama.cpp,支持多样化部署。
- 高分辨率支持:支持最高 4K 分辨率图像,上下文窗口达 128K。
- 开源训练流水线:提供完整的 SFT 和 DFlash 训练流水线,便于社区扩展。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目