modelscope/FunClip

FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.

해결하는 문제

FunClip은 긴 동영상에서 특정 순간을 찾기 위해 수동으로 스크러빙할 필요를 없애는 자동 동영상 클리핑 도구입니다. 음성 텍스트, 특정 화자 또는 AI 기반 콘텐츠 분석에 따라 동영상 세그먼트를 추출할 수 있어 하이라이트나 숏폼 콘텐츠 제작 과정을 크게 가속화합니다.

작동 방식

이 도구는 음성 및 비전 모델의 파이프라인을 사용하여 동영상 파일을 분석합니다.

  1. 음성-텍스트: Paraformer 시리즈(핫워드 커스터마이징용 Paraformer-Large 및 SeACo-Paraformer 포함)를 사용하여 오디오를 전사하고 정확한 타임스탬프를 예측합니다.
  2. 화자 식별: CAM++ 모델을 통합하여 서로 다른 화자를 인식하므로 누가 말하는지에 따라 세그먼트를 클립할 수 있습니다.
  3. AI 지원 선택: 전사본을 LLM(OrcaRouter 경유)으로 라우팅하거나 TwelveLabs Pegasus와 같은 동영상 이해 모델을 사용하여 자연어 프롬프트를 기반으로 하이라이트 세그먼트를 식별할 수 있습니다.
  4. 클리핑: 텍스트 또는 AI를 통해 세그먼트가 식별되면 도구가 자동으로 동영상을 트리밍하고 해당 SRT 자막을 생성할 수 있습니다.

대상 사용자

  • 콘텐츠 제작자: 긴 동영상을 짧은 클립으로 빠르게 전환해야 하는 사람.
  • 동영상 편집자: 전사 기반 트리밍의 지루한 과정을 자동화하려는 사람.
  • 개발자: 자동 동영상 처리를 위해 로컬 배포 가능한 오픈소스 도구를 원하는 사람.

주요 기능

  • 산업용 ASR: 정확한 타임스탬프 예측을 갖춘 고성능 중국어 ASR 모델 사용.
  • 화자 기반 클리핑: 자동 인식된 화자 ID를 기반으로 동영상을 트리밍하는 기능.
  • LLM 통합: 외부 LLM 게이트웨이 및 동영상 추론 모델을 사용한 AI 기반 클리핑 지원.
  • 유연한 인터페이스: 자동화를 위한 Gradio 웹 UI와 명령줄 인터페이스를 모두 제공.
  • 다국어 지원: 영어, 일본어 및 여러 중국어 방언을 위한 다양한 모델과 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트