modelscope/FunClip

FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.

解決的問題

FunClip 是一款自動化影片剪輯工具,無需手動在長影片中拖動進度條尋找特定時刻。它允許使用者根據語音文字、特定說話人或 AI 驅動的內容分析來擷取影片片段,顯著加快製作精華或短影音內容的過程。

運作原理

該工具使用語音和視覺模型管線來分析影片檔案:

  1. 語音轉文字:採用 Paraformer 系列(包括用於熱詞定制的 Paraformer-Large 和 SeACo-Paraformer)來轉錄音訊並預測精確的時間戳。
  2. 說話人識別:整合 CAM++ 模型來識別不同的說話人,允許使用者根據誰在說話來剪輯片段。
  3. AI 輔助選擇:可以將轉錄文字路由到 LLM(透過 OrcaRouter),或使用 TwelveLabs Pegasus 等影片理解模型,根據自然語言提示識別精華片段。
  4. 剪輯:一旦透過文字或 AI 識別出片段,工具會自動修剪影片,並可產生相應的 SRT 字幕。

適用對象

  • 內容創作者:需要快速將長影片轉換為短影片片段的人。
  • 影片編輯者:希望自動化基於轉錄的修剪這一繁瑣過程的人。
  • 開發者:希望獲得一個可本地部署的開源工具用於自動化影片處理的人。

亮點

  • 工業級 ASR:使用高效能中文 ASR 模型,具有準確的時間戳預測。
  • 基於說話人的剪輯:能夠根據自動識別的說話人 ID 修剪影片。
  • LLM 整合:支援使用外部 LLM 閘道和影片推理模型進行 AI 驅動的剪輯。
  • 彈性介面:提供 Gradio Web UI 和命令列介面,便於自動化。
  • 多語言支援:相容多種模型,支援英語、日語和多種中文方言。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案