Tencent-Hunyuan/HunyuanOCR
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
해결하는 문제
HunyuanOCR-1.5는 다양한 텍스트 중심의 시각 작업을 통합하는 경량형 엔드투엔드 비전-언어 모델(VLM)입니다. 긴 구조화된 출력(예: 표, 수식)에 대한 느린 추론 속도와 저자원, 고대 문자 OCR 및 다중 이미지 기반 텍스트 중심 QA에 특화된 기능 부족 문제를 해결합니다.
작동 방식
이 프로젝트는 경량 VLM 아키텍처를 채택하고 몇 가지 핵심 최적화를 도입합니다.
- DFlash 사전 추론: 경량 블록-확산 드래프트 모델을 사용해 병렬로 여러 후보 토큰을 예측하고, 타겟 모델이 단일 패스로 검증함으로써 지연 시간을 줄입니다.
- 에이전트 기반 데이터 흐름: 모델의 약점을 식별하고, 장미(장기적) 능력을 위한 타겟 트레이닝 데이터를 자동으로 생성하는 에이전트 기반 시스템.
- 유연한 배포: vLLM과 네이티브 transformers를 통한 고성능 서빙을 지원하며, llama.cpp(GGUF 형식)를 통해 CPU 및 노트북 등 소비자 수준 하드웨어에서도 배포 가능.
- 업그레이드된 트레이닝: 이미지 해상도를 4K까지 확장하고, 컨텍스트 창을 128K까지 확장하며, 강화학습(RL)을 도입해 OCR 작업을 정교화합니다.
대상 사용자
서버급 GPU와 소비자용 하드웨어 양쪽 모두에서 배포 가능한 고성능, 경량 OCR 모델을 찾는 개발자 및 연구자, 복잡한 문서, 고대 문자, 다중 이미지 분석을 위한 특화된 OCR이 필요한 사용자에게 적합합니다.
주요 특징
- 통합형 OCR 프레임워크: 문서 파싱, 텍스트 스포팅, 정보 추출, 텍스트-이미지 번역을 하나의 모델로 통합.
- 손실 없는 가속화: DFlash 사전 추론을 통해 출력 분포를 변경하지 않고도 긴 구조화된 출력을 빠르게 처리.
- 광범위한 하드웨어 지원: vLLM, transformers, llama.cpp와 호환되어 다양한 배포 환경에 적합.
- 고해상도 지원: 최대 4K 해상도 이미지와 128K 컨텍스트 창을 지원.
- 오픈소스 파이프라인: 커뮤니티 확장이 가능한 완전한 SFT 및 DFlash 트레이닝 파이프라인 제공.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트