browser-use/video-use

Edit videos with coding agents

解決的問題

透過自然語言聊天介面讓使用者能編輯原始影片素材,自動化繁瑣的影片剪輯流程。使用者無需手動拖曳時間軸或切割片段,只需描述期望的結果(例如:「把這些內容剪輯成一個發布影片」),系統將自動完成切割、清理與潤飾。

工作原理

系統不處理每一幀影片(這將造成高計算成本與雜訊),而是採用雙層方法,為LLM提供結構化的影片視圖:

  1. 音訊轉錄層:使用 ElevenLabs Scribe 生成詞級時間戳與說話人分離資訊,將影片內容壓縮為小型文字檔案,供LLM閱讀以規劃剪輯點。
  2. 視覺合成層:僅當LLM需要驗證特定決策點或檢查剪輯邊界合理性時,才生成「時間軸視圖」(包含膠片條、波形與標籤的PNG影像)。

一旦策略獲得批准,系統將生成編輯決策列表(EDL),使用 ffmpeg 渲染影片,並執行自我評估循環,檢查是否存在視覺跳躍或音訊爆音,然後呈現最終結果。

適用對象

需要製作口播影片、混剪、教學影片或訪談影片,但又不願使用複雜編輯軟體選單的內容創作者、教育工作者與專業人士。

主要亮點

  • 自動清理:自動去除填充詞(如「umm」、「uh」)以及片段間的靜音空白。
  • 製作潤飾:自動應用色彩調校、30ms音訊淡入淡出以防止爆音,並支援可自訂的字幕疊加。
  • 智能動畫生成:可啟動平行子代理,使用 HyperFrames、Remotion 或 Manim 等工具生成動畫覆疊層。
  • 自我糾錯:在每個剪輯邊界評估渲染輸出,若發現問題則自動重新渲染。
  • 會話持久化:將進度儲存於專案檔案中,支援後續恢復編輯會話。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案