modelscope/FunClip
FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.
해결하는 문제
FunClip은 긴 동영상에서 특정 순간을 찾기 위해 수동으로 스크러빙할 필요를 없애는 자동 동영상 클리핑 도구입니다. 음성 텍스트, 특정 화자 또는 AI 기반 콘텐츠 분석에 따라 동영상 세그먼트를 추출할 수 있어 하이라이트나 숏폼 콘텐츠 제작 과정을 크게 가속화합니다.
작동 방식
이 도구는 음성 및 비전 모델의 파이프라인을 사용하여 동영상 파일을 분석합니다.
- 음성-텍스트: Paraformer 시리즈(핫워드 커스터마이징용 Paraformer-Large 및 SeACo-Paraformer 포함)를 사용하여 오디오를 전사하고 정확한 타임스탬프를 예측합니다.
- 화자 식별: CAM++ 모델을 통합하여 서로 다른 화자를 인식하므로 누가 말하는지에 따라 세그먼트를 클립할 수 있습니다.
- AI 지원 선택: 전사본을 LLM(OrcaRouter 경유)으로 라우팅하거나 TwelveLabs Pegasus와 같은 동영상 이해 모델을 사용하여 자연어 프롬프트를 기반으로 하이라이트 세그먼트를 식별할 수 있습니다.
- 클리핑: 텍스트 또는 AI를 통해 세그먼트가 식별되면 도구가 자동으로 동영상을 트리밍하고 해당 SRT 자막을 생성할 수 있습니다.
대상 사용자
- 콘텐츠 제작자: 긴 동영상을 짧은 클립으로 빠르게 전환해야 하는 사람.
- 동영상 편집자: 전사 기반 트리밍의 지루한 과정을 자동화하려는 사람.
- 개발자: 자동 동영상 처리를 위해 로컬 배포 가능한 오픈소스 도구를 원하는 사람.
주요 기능
- 산업용 ASR: 정확한 타임스탬프 예측을 갖춘 고성능 중국어 ASR 모델 사용.
- 화자 기반 클리핑: 자동 인식된 화자 ID를 기반으로 동영상을 트리밍하는 기능.
- LLM 통합: 외부 LLM 게이트웨이 및 동영상 추론 모델을 사용한 AI 기반 클리핑 지원.
- 유연한 인터페이스: 자동화를 위한 Gradio 웹 UI와 명령줄 인터페이스를 모두 제공.
- 다국어 지원: 영어, 일본어 및 여러 중국어 방언을 위한 다양한 모델과 호환됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트