modelscope/FunClip
FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.
解決的問題
FunClip 是一款自動化影片剪輯工具,允許使用者根據語音內容、說話者身份或 AI 驅動的分析來提取影片的特定片段。它消除了為了尋找並剪輯特定引用或場景而手動翻閱長影片的繁瑣工作。
工作原理
該工具使用語音與影片理解模型流水線:
- 語音識別 (ASR): 利用阿里巴巴的 FunASR(特別是 Paraformer、Fun-ASR-Nano 與 SenseVoice)將影片音訊轉錄為帶有時間戳的文本。
- 說話者識別: 使用 CAM++ 模型識別不同的說話者,允許使用者根據說話者身份剪輯片段。
- 選擇與剪輯: 使用者可以從轉錄文本中手動選擇文本片段,或使用 LLM(如 Qwen 或 GPT)根據提示詞自動識別相關時間戳。
- 視覺理解: 可選地,它與 TwelveLabs Pegasus 整合,對視覺與音訊進行推理,以實現更準確的高光檢測。
適用對象
需要從長影片內容中快速分離特定語音片段或特定說話者剪輯的內容創作者、影片編輯師與研究人員。
亮點
- AI 驅動剪輯: 整合 LLM,根據自然語言提示詞自動識別並提取影片片段。
- 基於說話者的裁剪: 能夠使用自動識別的說話者 ID 從特定說話者處裁剪片段。
- 多語言支援: 支援普通話、英語、日語及多種漢語方言。
- 熱詞定制: 允許使用者透過 SeACo-Paraformer 指定實體詞或名稱,以提高 ASR 準確度。
- 全面的輸出: 自動生成完整的影片 SRT 字幕與目標片段的 SRT 字幕。