Tencent-Hunyuan/HunyuanOCR

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

何を解決するか

HunyuanOCR-1.5 は、さまざまなテキスト中心の視覚タスクを統合する軽量でエンドツーエンドの視覚言語モデル(VLM)です。長大な構造化出力(表や数式など)に対する推論速度の遅さ、および低リソース・古代文字OCRやマルチ画像テキスト中心QAのための専門的機能の不足という課題を解決します。

仕組み

本プロジェクトは軽量なVLMアーキテクチャを採用し、いくつかの重要な最適化を導入しています。

  • DFlash 指示的推論: 軽量なブロック拡散ドラフトモデルを使用して、複数の候補トークンを並列で予測し、ターゲットモデルが一度のパスで検証することで、レイテンシを低減します。
  • エージェント駆動のデータフロー: モデルの弱点を特定し、長尾能力向けのターゲットトレーニングデータを自動生成するエージェント駆動システム。
  • 柔軟なデプロイメント: vLLMおよびネイティブtransformersによる高性能サーバー運用をサポートし、llama.cpp(GGUF形式)によるCPUやラップトップでのコンシューマー向けデプロイも可能。
  • アップグレードされたトレーニング: 画像解像度を4Kまで拡張し、コンテキスト窓を128Kまで拡大。強化学習(RL)を導入してOCRタスクを最適化。

対象ユーザー

サーバー用GPUとコンシューマー機器の両方でデプロイ可能な高性能で軽量なOCRモデルを探している開発者や研究者、複雑な文書、古代文字、マルチ画像分析のための専門的OCRが必要なユーザーに最適です。

主な特徴

  • 統合型OCRフレームワーク: ドキュメント解析、テキストスポット、情報抽出、テキスト画像翻訳を一つのモデルで統合。
  • 損失なしの高速化: DFlash 指示的推論により、出力分布を変更せずに長大な構造化出力を高速化。
  • 広範なハードウェア対応: vLLM、transformers、llama.cppと互換性があり、柔軟なデプロイが可能。
  • 高解像度対応: 4K解像度の画像を処理可能で、128Kのコンテキスト窓をサポート。
  • オープンソースパイプライン: コミュニティによる拡張を可能にする完全なSFTおよびDFlashトレーニングパイプラインを提供。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト