handy-computer/transcribe.cpp

ggml speech-to-text inference for 16+ model families

해결하는 문제

transcribe.cpp는 다양한 하드웨어 플랫폼에서 다양한 모델 패밀리를 실행하도록 설계된 고성능 C/C++ 음성 인식(STT) 추론 라이브러리입니다. 스트리밍 및 배치 전사(transcription)를 모두 지원하는 가볍고 이식 가능한 런타임을 제공하여 무거운 종속성의 필요성을 제거합니다.

작동 원리

이 라이브러리는 ggml 런타임과 GGUF 모델 형식을 사용하여 추론을 실행합니다. Metal (Apple Silicon), Vulkan (Linux/Windows) 및 CUDA (NVIDIA GPUs)를 통한 하드웨어 가속을 활용하는 동시에, CPU를 위한 tinyBLAS 가속 경로를 제공합니다. 모델 크기를 줄이기 위한 양자화 도구와 NVIDIA NeMo 체크포인트를 GGUF 형식으로 변환하는 컨버터를 포함하고 있습니다.

대상 사용자

클라우드 API나 무거운 ML 프레임워크에 의존하지 않고 애플리케이션에 빠른 로컬 음성 인식 기능을 통합해야 하는 개발자용입니다. Python, TypeScript/JavaScript, Rust 및 Swift를 위한 공식 바인딩을 제공합니다.

주요 특징

  • 폭넓은 모델 지원: Whisper, Parakeet, Canary, Qwen3-ASR을 포함한 16개 모델 패밀리 및 60개 이상의 변형 지원.
  • 교차 플랫폼 가속: Metal, Vulkan, CUDA에 대한 네이티브 GPU 지원.
  • 수치 검증: 모든 게시된 모델은 참조 구현에 대해 수치 검증 및 WER 테스트를 거쳤습니다.
  • 유연한 배포: 오디오의 스트리밍 및 배치 처리 모두 지원.
  • 양자화: 더 작고 효율적인 모델을 만들기 위한 내장 도구 (F16, Q8_0, Q4_K_M 등).