modelscope/FunClip
FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.
解决的问题
FunClip 是一款自动化视频剪辑工具,无需手动在长视频中拖动进度条寻找特定时刻。它允许用户根据语音文本、特定说话人或 AI 驱动的内容分析来提取视频片段,显著加快制作高光或短视频内容的过程。
工作原理
该工具使用语音和视觉模型流水线来分析视频文件:
- 语音转文本:采用 Paraformer 系列(包括用于热词定制的 Paraformer-Large 和 SeACo-Paraformer)来转录音频并预测精确的时间戳。
- 说话人识别:集成 CAM++ 模型来识别不同的说话人,允许用户根据谁在说话来剪辑片段。
- AI 辅助选择:可以将转录文本路由到 LLM(通过 OrcaRouter),或使用 TwelveLabs Pegasus 等视频理解模型,根据自然语言提示识别高光片段。
- 剪辑:一旦通过文本或 AI 识别出片段,工具会自动修剪视频,并可生成相应的 SRT 字幕。
适用人群
- 内容创作者:需要快速将长视频转换为短视频片段的人。
- 视频编辑者:希望自动化基于转录的修剪这一繁琐过程的人。
- 开发者:希望获得一个可本地部署的开源工具用于自动化视频处理的人。
亮点
- 工业级 ASR:使用高性能中文 ASR 模型,具有准确的时间戳预测。
- 基于说话人的剪辑:能够根据自动识别的说话人 ID 修剪视频。
- LLM 集成:支持使用外部 LLM 网关和视频推理模型进行 AI 驱动的剪辑。
- 灵活接口:提供 Gradio Web UI 和命令行接口,便于自动化。
- 多语言支持:兼容多种模型,支持英语、日语和多种中文方言。
相关
- 项目
- 项目
- 项目
- 项目
- 项目