Tencent-Hunyuan/HunyuanOCR
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
解決的問題
HunyuanOCR-1.5 是一個輕量級、端對端的視覺語言模型(VLM),旨在統一多種以文字為中心的視覺任務。它解決了長結構化輸出(如表格和公式)推論速度慢的問題,以及低資源、古文字 OCR 和多圖像文字中心問答缺乏專用能力的問題。
工作原理
本項目採用輕量級 VLM 架構,並引入多項關鍵優化:
- DFlash 指示性解碼:使用輕量級塊擴散草稿模型並行預測多個候選 token,再由目標模型一次性驗證,從而降低延遲。
- 智能體驅動的資料流:一種由智能體驅動的系統,可識別模型弱點,並自動產生針對長尾能力的定制化訓練資料。
- 彈性部署:支援透過 vLLM 和原生 transformers 實現高性能量產,也支援透過 llama.cpp(GGUF 格式)在 CPU 和筆電等消費級硬體上部署。
- 升級的訓練:將影像解析度擴展至 4K,上下文視窗擴展至 128K,並引入強化學習(RL)以優化 OCR 任務。
適用對象
適合需要高性能量、輕量級 OCR 模型,可在伺服器級 GPU 和消費級硬體上部署的開發者與研究人員,以及需要處理複雜文件、古文字或進行多圖像分析的使用者。
主要亮點
- 統一的 OCR 框架:將文件解析、文字定位、資訊抽取和圖文翻譯整合到一個模型中。
- 無損加速:DFlash 指示性解碼在不改變輸出分佈的前提下,顯著加速長結構化輸出。
- 廣泛硬體支援:相容 vLLM、transformers 和 llama.cpp,支援多樣化部署。
- 高解析度支援:支援最高 4K 解析度影像,上下文視窗達 128K。
- 開源訓練流程:提供完整的 SFT 和 DFlash 訓練流程,便於社群擴展。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案