modelscope/FunClip
FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.
해결하는 문제
FunClip은 음성 내용, 화자 식별 또는 AI 기반 분석을 기반으로 비디오의 특정 세그먼트를 추출할 수 있는 자동 비디오 클리핑 도구입니다. 긴 비디오를 일일이 탐색하며 특정 인용구나 장면을 찾아 자르는 수동 작업을 제거합니다.
작동 방식
이 도구는 음성 및 비디오 이해 모델의 파이프라인을 사용합니다:
- 음성 인식 (ASR): Alibaba의 FunASR(특히 Paraformer, Fun-ASR-Nano, SenseVoice)를 활용하여 비디오 오디오를 타임스탬프가 포함된 텍스트로 변환합니다.
- 화자 식별: CAM++ 모델을 사용하여 서로 다른 화자를 인식하며, 사용자가 말하는 사람을 기준으로 세그먼트를 클립할 수 있도록 합니다.
- 선택 및 클리핑: 사용자는 전사된 텍스트에서 세그먼트를 수동으로 선택하거나 LLM(Qwen 또는 GPT 등)을 사용하여 프롬프트를 기반으로 관련 타임스탬프를 자동으로 식별할 수 있습니다.
- 시각적 이해: 옵션으로 TwelveLabs Pegasus와 통합하여 시각 및 오디오 모두를 추론함으로써 더욱 정확한 하이라이트 탐지를 수행합니다.
대상 사용자
긴 형식의 비디오 콘텐츠에서 특정 발언 세그먼트나 화자별 클립을 빠르게 분리해야 하는 콘텐츠 크리에이터, 비디오 편집자 및 연구자.
주요 특징
- AI 기반 클리핑: LLM을 통합하여 자연어 프롬프트를 기반으로 비디오 세그먼트를 자동으로 식별하고 추출합니다.
- 화자 기반 트리밍: 자동 인식된 화자 ID를 사용하여 특정 화자의 세그먼트를 클립할 수 있는 기능.
- 다국어 지원: Mandarin, English, Japanese 및 다양한 중국어 방언을 지원합니다.
- 핫워드 커스터마이징: SeACo-Paraformer를 통해 엔티티 단어나 이름을 지정하여 ASR 정확도를 높일 수 있습니다.
- 포괄적인 출력: 전체 비디오 SRT 자막과 대상 세그먼트 SRT 자막을 자동으로 생성합니다.