Inflect-Micro-v2 릴리스 노트
Inflect-Micro-v2 릴리스 노트
Inflect-Micro-v2는 로컬 텍스트-파형 음성 합성 시스템으로, 고품질 영어 TTS를 9,356,513개의 파라미터(FP32 기준 37.53 MB)만 차지하는 footprint으로 제공합니다. 저지연과 작은 메모리 footprint가 중요한 자원 제약 환경에 배포하도록 설계되었습니다.
성능 및 평가
Inflect-Micro-v2는 자연스러움과 효율성의 균형을 우선시하며, 인간 선호도와 명료도에서 여러 컴팩트 TTS 베이스라인을 능가합니다.
인간 선호도 및 자연스러움
익명의 커뮤니티 연구에서 Inflect-Micro-v2는 66.2% 선호율을 달성했습니다(21승, 10패, 3무승부). 예측된 자연스러움에 대해 모델은 UTMOS22 척도에서 4.395점을 기록했는데, 이는 인간의 평균 의견 점수(MOS)를 예측하는 학습된 지표입니다.
명료도
두 개의 ASR 의미적 Word Error Rate(WER) 합의(Qwen3-ASR 및 Nemotron 3.5)를 사용하여 모델은 3.99% 의미적 WER를 기록했습니다. 개별 ASR 결과는 다음과 같습니다:
- Qwen3-ASR: 2.52%
- Nemotron 3.5: 5.45%
- Whisper large-v3: 2.73%
CPU 런타임 및 처리량
Inflect-Micro-v2는 CPU에서 실시간보다 znacz하게 빠르게 음성을 합성합니다. 관리된 참조 실행(8 vCPU, 32 GB RAM, 네 개의 프레임워크 스레드)에서 6.28× 실시간 처리량(Steady-state RTF 0.1593)을 달성했습니다.
기술 아키텍처
Inflect-Micro-v2는 end-to-end 텍스트-파형 생성기의 VITS 계열을 기반으로 합니다. 그 아키텍처에는 영어 음소 프론트엔드, 단조 정렬, 확률적 잠재 합성, 잔차 결합 흐름, 그리고 통합된 앨리어스 감소 신경 파형 디코더가 포함됩니다.
파라미터 예산 및 구성
| 구성 요소 | 사양 |
|---|---|
| 잠재 채널 | 192 |
| 텍스트 숨은 채널 | 96 |
| 인코더 레이어 / 헤드 | 3 / 2 |
| 피드포워드 채널 | 768 |
| 플로우 결합 블록 | 4 |
| 초기 디코더 채널 | 320 |
| 업샘플 비율 | 8, 8, 2, 2 |
| 출력 | 24 kHz mono waveform |
배포 및 로컬 실행
이 모델은 CPU와 CUDA 추론을 모두 지원하며, PyTorch를 사용할 수 없는 환경을 위한 전용 ONNX 런타임을 제공합니다.
PyTorch 설치 및 사용법
사용자는 Hugging Face Hub를 통해 모델을 설치할 수 있습니다:
python -m pip install --upgrade huggingface_hub
hf download owensong/Inflect-Micro-v2 --local-dir Inflect-Micro-v2
cd Inflect-Micro-v2
python -m pip install -r requirements.txt
기본 Python 합성:
from inference import InflectTTS
tts = InflectTTS(" .", device="cpu ts.save(
"A small voice can still have something meaningful to say." ,
"sample.wav" ,
speed=1.0 ,
variation=0.667 ,
seed=7 ,
)
ONNX 런타임
공식 FP32 내보내기는 Inflect-Micro-v2-ONNX 형태로 제공됩니다. 이 버전은 PyTorch 없이 동적 길이 및 제공자 선택(CPU/CUDA/DirectML)을 지원합니다. 신경 모델은 두 개의 그래프로 나뉩니다: duration.onnx 및 decode.onnx.
컨트롤 및 장문 텍스트 처리
Inflect-Micro-v2는 구두점 인식 분할을 사용하여 긴 passages를 처리하며, 텍스트를 청크로 나누어 제어된 일시停止와 페이드 가장자리로 연결하여 안정성을 유지합니다.
합성 컨트롤
| 컨트롤 | 기본값 | 범위 | 효과 |
|---|---|---|---|
speed |
1.0 | 0.5–2.0 | 재생 속도를 조절합니다 |
variation |
0.667 | 0.0–1.0 | 잠재 변동을 조절합니다(낮을수록 더 안정적) |
seed |
0 | Integer | 같은 런타임 스택에서 반복 가능한 출력을 보장합니다 |
제한 사항 및 범위
Inflect-Micro-v2는 특정 제약 조건이 있는 추론 우선 릴리스입니다:
- 언어 및 음성: 영어만 지원하며 하나의 고정된 남성 음성을 제공합니다. 제로샷 음성 복제는 지원하지 않습니다.
- 안정성: 익숙하지 않은 표현은 평평하거나 덜 안정적인 표현으로 이어질 수 있습니다.
- 적응: 새로운 음성 및 새로운 언어 적응은 현재 검증되거나 지원되지 않습니다.
커뮤니티 피드백
사용자들은 모델의 크기에 비해 품질을 칭찬했지만, 일부는 인포렉션이 가끔 부자연스럽게 느껴질 수 있다고 지적했습니다:
"인포렉션은 이상하지만 로봇처럼 들리지는 않습니다. 나쁘지 않아!"
다른 사용자들은 모델의 효율성을 강조했는데, 한 개발자는 inflect-speechd를 통해 서버 통합을 구현하여 더 큰 ONNX 모델을 대체했습니다.