cclank/lanshu-create-ai-presenter-video
Provider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.
解决的问题
该项目提供了一个通用的工作流程,用于创建由AI驱动的数字人演示视频。它自动化了将主题或脚本以及一个人物的参考图像转换为完整编辑视频的复杂过程,该视频包含一个数字化身,能够同步口型说出文本,并配有字幕和视觉效果。
如何工作
该系统作为 Codex 的一个「技能」运行,协调多种 AI 能力(语音生成、视频生成、口型同步),但不绑定到特定的服务提供商。该流程基于音频轨道遵循严格的时序:
- 准备阶段:输入脚本和授权的参考图像。
- 生成阶段:生成完整的配音,作为整个视频的主时间线。
- 制作阶段:生成数字人视频,确保口型与音频精确同步。
- 后期制作阶段:添加字幕、关键词动画和封面,然后使用 FFmpeg 渲染最终视频。
- 质量保证阶段:在输出最终主版本和共享版本之前,进行技术和人工检查,确保音视频同步和质量。
适用人群
希望在不手动协调多个 AI 工具的情况下,制作专业级数字人演示视频的 Codex 兼容代理环境的内容创作者和用户。
主要亮点
- 供应商中立:不依赖特定模型或私有 API,可自由使用当前环境中可用的任何工具。
- 以音频为中心的时间线:使用完整配音作为主要时间参考,防止口型漂移并实现无缝过渡。
- 自动化流水线:从脚本整理、配音生成到编辑、渲染和 QA 报告,全程自动化处理。
- 安全与成本控制:内置图像/语音授权检查和付费生成前的成本估算功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目