Moyf/moys-asr-workflow
Moy 的 ASR 字幕生成工作流及编辑器,简称 MAW
해결하는 문제
로컬 미디어 파일의 자막 생성 과정을 자동으로 음성 인식(ASR)하여 텍스트로 변환하고, 전문적인 편집 환경을 제공함으로써 간소화합니다. 일반적으로 수동 수정이 필요한 원시 AI 음성 인식 결과와 최종 내보내기 자막 파일(SRT, ASS) 사이의 격차를 메웁니다.
작동 방식
이 워크플로우는 세 가지 주요 단계로 구성됩니다: 음성 인식, 편집, 내보내기. 사용자는 Qwen, Fun-ASR, Soniox, OpenAI 등과 같은 선택한 ASR(자동 음성 인식) 서비스의 API 키를 제공하고, 소프트웨어가 미디어 업로드 및 인식을 처리합니다. 결과 데이터는 .mosp 프로젝트 파일로 저장되며, 이는 MAWE Server 편집기에서 파형 위치 조정과 시각적 미리보기를 사용해 정밀한 수정을 수행할 수 있습니다. 마지막으로 자막은 표준 형식으로 내보냅니다.
대상 사용자
비디오 제작자, 영상 편집자, 번역가로서 AI로 인식된 자막을 효율적으로 생성하고 정제해야 하는 사용자들.
주요 기능
- 다중 제공업체 지원: Qwen, Fun-ASR, Soniox, Tencent Cloud, OpenAI 등 다양한 ASR 서비스와 통합 가능.
- 고급 편집 기능: MAWE 편집기는 파형 기반 위치 조정, 세그먼트 분할/병합, 소음 간격 처리 기능을 제공합니다.
- 이중 트랙 자막: 두 번째 자막 트랙을 가져와서 병렬 편집이 가능하며, 트랙 결합/분리 및 트랙 간 스냅 기능을 지원합니다.
- 자동화 준비 완료: 배치 처리 및 AI 기반 자동화를 위한 공개 CLI 포함.
- 로컬 옵션: Qwen3-ASR, FunASR, Faster-Whisper 등의 로컬 ASR 모델에 대한 실험적 지원 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트