modelscope/FunClip

FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.

解决的问题

FunClip 是一款自动化视频剪辑工具,无需手动在长视频中拖动进度条寻找特定时刻。它允许用户根据语音文本、特定说话人或 AI 驱动的内容分析来提取视频片段,显著加快制作高光或短视频内容的过程。

工作原理

该工具使用语音和视觉模型流水线来分析视频文件:

  1. 语音转文本:采用 Paraformer 系列(包括用于热词定制的 Paraformer-Large 和 SeACo-Paraformer)来转录音频并预测精确的时间戳。
  2. 说话人识别:集成 CAM++ 模型来识别不同的说话人,允许用户根据谁在说话来剪辑片段。
  3. AI 辅助选择:可以将转录文本路由到 LLM(通过 OrcaRouter),或使用 TwelveLabs Pegasus 等视频理解模型,根据自然语言提示识别高光片段。
  4. 剪辑:一旦通过文本或 AI 识别出片段,工具会自动修剪视频,并可生成相应的 SRT 字幕。

适用人群

  • 内容创作者:需要快速将长视频转换为短视频片段的人。
  • 视频编辑者:希望自动化基于转录的修剪这一繁琐过程的人。
  • 开发者:希望获得一个可本地部署的开源工具用于自动化视频处理的人。

亮点

  • 工业级 ASR:使用高性能中文 ASR 模型,具有准确的时间戳预测。
  • 基于说话人的剪辑:能够根据自动识别的说话人 ID 修剪视频。
  • LLM 集成:支持使用外部 LLM 网关和视频推理模型进行 AI 驱动的剪辑。
  • 灵活接口:提供 Gradio Web UI 和命令行接口,便于自动化。
  • 多语言支持:兼容多种模型,支持英语、日语和多种中文方言。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目