browser-use/video-use

Edit videos with coding agents

解决的问题

通过允许用户通过自然语言聊天界面编辑原始视频素材,自动化繁琐的视频编辑流程。用户无需手动拖动时间轴或剪辑片段,只需描述期望的结果(例如:"把这些内容剪辑成一个发布视频"),系统将自动完成剪辑、清理和润色。

工作原理

系统不处理每一帧视频(这将计算成本高昂且噪声大),而是采用双层方法,为LLM提供结构化的视频视图:

  1. 音频转录层:使用 ElevenLabs Scribe 生成词级时间戳和说话人分离信息,将视频内容压缩为一个小型文本文件,供LLM阅读以规划剪辑点。
  2. 视觉合成层:仅当LLM需要验证特定决策点或检查剪辑边界合理性时,才生成「时间线视图」(包含胶片条、波形和标签的PNG图像)。

一旦策略获得批准,系统将生成编辑决策列表(EDL),使用 ffmpeg 渲染视频,并运行自我评估循环,检查是否存在视觉跳跃或音频爆音,然后呈现最终结果。

适用人群

需要制作口播视频、混剪、教程或采访视频,但又不想使用复杂编辑软件菜单的内容创作者、教育工作者和专业人士。

主要亮点

  • 自动清理:自动去除填充词(如"umm"、"uh")以及片段间的静音空白。
  • 制作润色:自动应用色彩分级、30ms音频淡入淡出以防止爆音,并支持可自定义的字幕叠加。
  • 智能动画生成:可启动并行子代理,使用 HyperFrames、Remotion 或 Manim 等工具生成动画叠加层。
  • 自我纠错:在每个剪辑边界评估渲染输出,若发现问题则自动重新渲染。
  • 会话持久化:将进度保存在项目文件中,支持后续恢复编辑会话。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目