modelscope/FunClip
FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.
解决的问题
FunClip 是一款自动化视频剪辑工具,允许用户根据语音内容、说话人身份或 AI 驱动的分析来提取视频的特定片段。它消除了为了寻找和剪辑特定引用或场景而手动翻阅长视频的繁琐工作。
工作原理
该工具使用语音和视频理解模型流水线:
- 语音识别 (ASR): 利用阿里巴巴的 FunASR(特别是 Paraformer、Fun-ASR-Nano 和 SenseVoice)将视频音频转录为带有时间戳的文本。
- 说话人识别: 使用 CAM++ 模型识别不同的说话人,允许用户根据说话人身份剪辑片段。
- 选择与剪辑: 用户可以从转录文本中手动选择文本片段,或使用 LLM(如 Qwen 或 GPT)根据提示词自动识别相关时间戳。
- 视觉理解: 可选地,它与 TwelveLabs Pegasus 集成,对视觉和音频进行推理,以实现更准确的高光检测。
适用对象
需要从长视频内容中快速分离特定语音片段或特定说话人剪辑的内容创作者、视频编辑师和研究人员。
亮点
AI 驱动剪辑: 集成 LLM,根据自然语言提示词自动识别并提取视频片段。
基于说话人的裁剪: 能够使用自动识别的说话人 ID 从特定说话人处裁剪片段。
多语言支持: 支持普通话、英语、日语和多种汉语方言。
热词定制: 允许用户通过 SeACo-Paraformer 指定实体词或名称,以提高 ASR 准确度。
全面的输出: 自动生成完整的视频 SRT 字幕和目标片段的 SRT 字幕。