gemelo-ai/vocos
Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis
해결하는 문제
Vocos는 음성 특징(예: 멜스펙트로그램 또는 EnCodec 토큰)에서 고품질 음성 파형을 합성하기 위한 신경 보코더입니다. 시간 영역과 푸리에 기반 신경 보코더 사이의 격차를 메우며, 빠르고 고해상도의 음성 재구성을 제공합니다.
작동 방식
전통적인 GAN 기반 보코더가 시간 영역에서 음성 샘플을 모델링하는 반면, Vocos는 스펙트럼 계수를 생성합니다. 이 계수들은 역 푸리에 변환을 통해 음성 파형으로 변환되며, 단일 순전파로 음성을 생성할 수 있어 빠른 재구성이 가능합니다.
대상 사용자
음성 합성 시스템을 개발하는 연구자 및 개발자, 텍스트-to-음성(TTS) 파이프라인을 구축하는 사람, 또는 Bark와 같은 다른 음성 모델과 통합하고자 하는 사람들을 위한 도구입니다.
주요 특징
- 빠른 합성: 단일 순전파로 파형을 생성합니다.
- 스펙트럼 영역 모델링: 시간 영역 모델링 대신 스펙트럼 계수와 역 푸리에 변환을 사용합니다.
- GAN 기반 학습: 생성적 적대망(GAN) 목적 함수를 사용하여 학습됩니다.
- 유연한 입력: 멜스펙트로그램과 EnCodec 토큰 모두에서 재구성 가능합니다.
관련
- 프로젝트
- 프로젝트
RchGrav/claudeboxClaudeBox는 Anthropic의 Claude Code AI 코딩 어시스턴트를 격리된 컨테이너 내에서 실행하는 Docker 기반 도구입니다. 프로젝트별 Docker 이미지, 영구 인증/기록, 사전 구성된 개발 프로필(C/C++, Python, Rust, Go 등)을 제공합니다. 다중 인스턴스 지원, 방화벽 허용 목록, macOS 클립보드 브리지, tmux 통합, 간단한 작업 엔진 등의 기능을 포함합니다. 설치는 자체 압축 해제형 .run 설치 프로그램을 통해 이루어지며, 필요한 경우 Docker도 자동으로 설정합니다. 사용자는 프로젝트별로 '슬롯'(영구적인 Claude 세션)을 생성하고, 프로필을 추가하며, 사용자 지정 플래그로 Claude를 실행할 수 있으며, 이 모든 과정에서 프로젝트 데이터를 격리하고 재현 가능하게 유지합니다.
- 프로젝트
Tencent-Hunyuan/AuKAuK는 음성 생성, 편집, 강화, 소스 분리에 사용할 수 있는 15억 파라미터 오픈소스 기초 모델입니다. 자연어 지시로 작동하며, 고품질 기반 모델과 빠른 4단계 증류된 '플래시' 버전을 제공하고, CLI, Gradio UI, Python API, 파인튜닝 스크립트, ComfyUI 통합 기능을 갖추고 있습니다.
- 프로젝트
Spielewoy/autoprompt-skillAutoprompt-Skill은 여러 LLM 코딩 에이전트(Claude, Codex, OpenCode 등)를 래핑하여 '작성-테스트-검토' 루프를 자동화하는 Node 기반 CLI입니다. npm을 통해 설치하고 공급자를 선택한 후 `autoprompt activate PROVIDER -- "<goal>"`을 실행합니다(선택적으로 `path=` 및 동시성 플래그 사용 가능). Terminal-Bench 2.1 벤치마크 결과, 실행 시간과 토큰 사용량은 증가하지만 실패율이 45% 감소(60/89에서 73/89로 개선)한 것으로 나타났습니다.