Inflect-Micro-v2 릴리스 노트

Inflect-Micro-v2 릴리스 노트

Inflect-Micro-v2는 로컬 텍스트-파형 음성 합성 시스템으로, 고품질 영어 TTS를 9,356,513개의 파라미터(FP32 기준 37.53 MB)만 차지하는 footprint으로 제공합니다. 저지연과 작은 메모리 footprint가 중요한 자원 제약 환경에 배포하도록 설계되었습니다.

성능 및 평가

Inflect-Micro-v2는 자연스러움과 효율성의 균형을 우선시하며, 인간 선호도와 명료도에서 여러 컴팩트 TTS 베이스라인을 능가합니다.

인간 선호도 및 자연스러움

익명의 커뮤니티 연구에서 Inflect-Micro-v2는 66.2% 선호율을 달성했습니다(21승, 10패, 3무승부). 예측된 자연스러움에 대해 모델은 UTMOS22 척도에서 4.395점을 기록했는데, 이는 인간의 평균 의견 점수(MOS)를 예측하는 학습된 지표입니다.

명료도

두 개의 ASR 의미적 Word Error Rate(WER) 합의(Qwen3-ASR 및 Nemotron 3.5)를 사용하여 모델은 3.99% 의미적 WER를 기록했습니다. 개별 ASR 결과는 다음과 같습니다:

  • Qwen3-ASR: 2.52%
  • Nemotron 3.5: 5.45%
  • Whisper large-v3: 2.73%

CPU 런타임 및 처리량

Inflect-Micro-v2는 CPU에서 실시간보다 znacz하게 빠르게 음성을 합성합니다. 관리된 참조 실행(8 vCPU, 32 GB RAM, 네 개의 프레임워크 스레드)에서 6.28× 실시간 처리량(Steady-state RTF 0.1593)을 달성했습니다.

기술 아키텍처

Inflect-Micro-v2는 end-to-end 텍스트-파형 생성기의 VITS 계열을 기반으로 합니다. 그 아키텍처에는 영어 음소 프론트엔드, 단조 정렬, 확률적 잠재 합성, 잔차 결합 흐름, 그리고 통합된 앨리어스 감소 신경 파형 디코더가 포함됩니다.

파라미터 예산 및 구성

구성 요소 사양
잠재 채널 192
텍스트 숨은 채널 96
인코더 레이어 / 헤드 3 / 2
피드포워드 채널 768
플로우 결합 블록 4
초기 디코더 채널 320
업샘플 비율 8, 8, 2, 2
출력 24 kHz mono waveform

배포 및 로컬 실행

이 모델은 CPU와 CUDA 추론을 모두 지원하며, PyTorch를 사용할 수 없는 환경을 위한 전용 ONNX 런타임을 제공합니다.

PyTorch 설치 및 사용법

사용자는 Hugging Face Hub를 통해 모델을 설치할 수 있습니다:

python -m pip install --upgrade huggingface_hub
hf download owensong/Inflect-Micro-v2 --local-dir Inflect-Micro-v2
cd Inflect-Micro-v2
python -m pip install -r requirements.txt

기본 Python 합성:

from inference import InflectTTS

tts = InflectTTS(" .", device="cpu	ts.save(
    "A small voice can still have something meaningful to say." ,
    "sample.wav" ,
    speed=1.0 ,
    variation=0.667 ,
    seed=7 ,
)

ONNX 런타임

공식 FP32 내보내기는 Inflect-Micro-v2-ONNX 형태로 제공됩니다. 이 버전은 PyTorch 없이 동적 길이 및 제공자 선택(CPU/CUDA/DirectML)을 지원합니다. 신경 모델은 두 개의 그래프로 나뉩니다: duration.onnxdecode.onnx.

컨트롤 및 장문 텍스트 처리

Inflect-Micro-v2는 구두점 인식 분할을 사용하여 긴 passages를 처리하며, 텍스트를 청크로 나누어 제어된 일시停止와 페이드 가장자리로 연결하여 안정성을 유지합니다.

합성 컨트롤

컨트롤 기본값 범위 효과
speed 1.0 0.5–2.0 재생 속도를 조절합니다
variation 0.667 0.0–1.0 잠재 변동을 조절합니다(낮을수록 더 안정적)
seed 0 Integer 같은 런타임 스택에서 반복 가능한 출력을 보장합니다

제한 사항 및 범위

Inflect-Micro-v2는 특정 제약 조건이 있는 추론 우선 릴리스입니다:

  • 언어 및 음성: 영어만 지원하며 하나의 고정된 남성 음성을 제공합니다. 제로샷 음성 복제는 지원하지 않습니다.
  • 안정성: 익숙하지 않은 표현은 평평하거나 덜 안정적인 표현으로 이어질 수 있습니다.
  • 적응: 새로운 음성 및 새로운 언어 적응은 현재 검증되거나 지원되지 않습니다.

커뮤니티 피드백

사용자들은 모델의 크기에 비해 품질을 칭찬했지만, 일부는 인포렉션이 가끔 부자연스럽게 느껴질 수 있다고 지적했습니다:

"인포렉션은 이상하지만 로봇처럼 들리지는 않습니다. 나쁘지 않아!"

다른 사용자들은 모델의 효율성을 강조했는데, 한 개발자는 inflect-speechd를 통해 서버 통합을 구현하여 더 큰 ONNX 모델을 대체했습니다.

Sources