transcribe.cpp: 수십 가지 모델 패밀리와 GPU 가속을 지원하는 고성능 C/C++ 음성-텍스트 변환 추론 라이브러리

transcribe.cpp: 수십 가지 모델 패밀리와 GPU 가속을 지원하는 고성능 C/C++ 음성-텍스트 변환 추론 라이브러리

무엇 을 해결하는가

transcribe.cpp는 다양한 하드웨어 플랫폼에서 다양한 모델 패밀리를 실행하도록 설계된 고성능 C/C++ 음성-텍스트(STT) 추론 라이브러리입니다. 하드웨어 가속을 통해 전사 모델을 실행하는 통합된 방법을 제공하여 무거운 프레임워크에 대한 의존성을 줄이면서 높은 정확도(WER 테스트)를 유지합니다.

어떻게 작동하는가

이 라이브러리는 추론을 수행하기 위해 ggml 런타임과 GGUF 모델 형식을 사용합니다. Metal(Apple Silicon), Vulkan(Linux/Windows), CUDA(NVIDIA)와 같은 빠른 GPU 가속을 위한 여러 하드웨어 백엔드를 지원하며, tinyBLAS로 가속된 CPU 경로도 제공합니다. 또한 NVIDIA NeMo 체크포인트를 GGUF로 변환하고 모델의 크기를 줄이기 위해 양자화하는 도구(Q4_K_M, Q8_0 등)를 포함합니다.

누구를 위한 것인가

다양한 운영 체제와 하드웨어에서 응용 프로그램에 빠르고 로컬 음성-텍스트 기능을 통합해야 하는 개발자뿐만 아니라, ASR 모델을 위한 가볍고 휴대 가능한 추론 엔진을 찾는 사람들에게도 적합합니다.

주요 기능

  • 광범위한 모델 지원: Whisper, Parakeet, Canary, Qwen3-ASR 등을 포함하여 16개 모델 패밀리와 60개 이상의 변형을 지원합니다.
  • 크로스 플랫폼 가속: Metal, Vulkan, CUDA 백엔드에 대한 네이티브 지원을 제공합니다.
  • 고충실도: 모든 공개 모델은 수치적으로 검증되었으며 참조 구현과 비교하여 Word Error Rate(WER) 테스트를 거쳤습니다.
  • 다중 언어 바인딩: Python, TypeScript/JavaScript, Rust, Swift용 공식 바인딩이 제공됩니다.
  • 유연한 추론: 스트리밍 및 배치 전사를 모두 지원합니다.

요약

GGUF를 통해 ggml 런타임에서 다양한 STT 모델 패밀리를 실행하고 Metal, Vulkan, CUDA에서의 GPU 가속을 제공하는 C/C++ 음성-텍스트 추론 라이브러리입니다.

제목

transcribe.cpp: 수십 가지 모델 패밀리와 GPU 가속을 지원하는 고성능 C/C++ 음성-텍스트 변환 추론 라이브러리

Sources