browser-use/video-use
Edit videos with coding agents
解决的问题
通过允许用户通过自然语言聊天界面编辑原始视频素材,自动化繁琐的视频编辑流程。用户无需手动拖动时间轴或剪辑片段,只需描述期望的结果(例如:"把这些内容剪辑成一个发布视频"),系统将自动完成剪辑、清理和润色。
工作原理
系统不处理每一帧视频(这将计算成本高昂且噪声大),而是采用双层方法,为LLM提供结构化的视频视图:
- 音频转录层:使用 ElevenLabs Scribe 生成词级时间戳和说话人分离信息,将视频内容压缩为一个小型文本文件,供LLM阅读以规划剪辑点。
- 视觉合成层:仅当LLM需要验证特定决策点或检查剪辑边界合理性时,才生成「时间线视图」(包含胶片条、波形和标签的PNG图像)。
一旦策略获得批准,系统将生成编辑决策列表(EDL),使用 ffmpeg 渲染视频,并运行自我评估循环,检查是否存在视觉跳跃或音频爆音,然后呈现最终结果。
适用人群
需要制作口播视频、混剪、教程或采访视频,但又不想使用复杂编辑软件菜单的内容创作者、教育工作者和专业人士。
主要亮点
- 自动清理:自动去除填充词(如"umm"、"uh")以及片段间的静音空白。
- 制作润色:自动应用色彩分级、30ms音频淡入淡出以防止爆音,并支持可自定义的字幕叠加。
- 智能动画生成:可启动并行子代理,使用 HyperFrames、Remotion 或 Manim 等工具生成动画叠加层。
- 自我纠错:在每个剪辑边界评估渲染输出,若发现问题则自动重新渲染。
- 会话持久化:将进度保存在项目文件中,支持后续恢复编辑会话。
相关
- 项目
- 项目
- 项目
- 项目
- 项目