Seedance 2.5 发布说明:长篇叙事与多模态参考
Seedance 2.5 将 AI 视频从片段生成转向完整的创作工作流
ByteDance 正式推出了 Seedance 2.5,这是一款下一代视频创作模型,旨在超越短片段的生成,转向完整创意作品的制作。基于 Seedance 2.0 统一的多模态音视频联合生成架构,2.5 版本在长篇叙事、多模态参考和精确编辑能力方面取得了重大突破。
30 秒单次生成与多轮扩展
Seedance 2.5 将单次视频生成的时长从 15 秒扩展到了 30 秒。与以往经常仅扩展单个瞬间的模型不同,Seedance 2.5 可以在单次生成中组织多个逻辑连接的镜头,从而创建一个包含铺垫、发展、转折和结局的叙事弧线。
长篇叙事的核心能力包括:
- 多轮扩展: 用户可以在保持角色、环境和叙事节奏一致性的同时,在现有输出的基础上追加后续镜头,从而实现分钟级内容的创作。
- 改进的连续性: 该模型在镜头运动之间的过渡更加平滑,并在剪辑时保持主体稳定性。
- 电影级优化: 为了减少 AI 视频的“人工感”,模型优化了物体纹理、皮肤和眼睛特征、光照以及色彩饱和度。
高级多模态参考以实现创意控制
Seedance 2.5 允许在单次生成中引入大量参考资料——最多可达 30 张图像、10 个视频片段和 10 个音频片段。这使得模型能够更好地在涉及多个主体和镜头切换的复杂场景中捕捉创作者的意图。
具体的多模态参考突破包括:
- 角色与场景稳定性: 模型可以同时保留多个角色的外观和声音,即使在群体叙事场景中也是如此。
- Clay Render 参考: 用户可以使用无纹理的 3D 模型来定义空间结构、角色姿态、运动路径和摄像机角度。模型随后将这些结构渲染成最终视频,从而确保精确的调度和构图。
- 物理光照控制: 通过利用 clay renders 的空间信息,模型生成的灯光效果(包括方向、色温和阴影投射)都遵循物理规律。
时间戳级编辑与专业工具
Seedance 2.5 引入了精确的编辑能力,以降低重复生成的成本并提高创作效率。
时间戳控制: 用户可以使用提示词来控制生成过程中特定时间段内的叙事、摄像机视角和节奏。在生成后,可以对特定片段中的角色或情节元素进行针对性修改,同时保持连续性。
绿幕编辑: 模型可以在保持主体完整的同时替换背景,并模拟主体对新环境物理规则的响应(例如,头发的运动和光照交互)。
摄像机视角编辑: 用户可以在不改变角色或动作的情况下,调整现有片段中的摄像机运动(例如 FPV 运动或 whip-pans)。
教育与制造业中的行业应用
除了娱乐领域,Seedance 2.5 正在被集成到专门的生产工作流中:
- 教育: 通过 Doubao Learning app 等平台,该模型将历史背景和科学原理转化为教学视频的沉浸式视觉效果。
- 工业制造: Seedance 2.5 生成合成视频数据来训练机器人感知和操作技能,并利用 clay renders 创建高端、写实的装配序列。
- 自动驾驶: 该模型模拟“长尾”场景,如极端天气和复杂的交通状况,为自动驾驶系统提供多样化的训练样本。
社区洞察与批判性视角
虽然 Seedance 2.5 的技术能力得到了赞誉,但 Hacker News 上的社区讨论突出了几个争议点和观察点:
技术与美学批判
一些用户指出,尽管质量很高,但视频仍表现出“AI 感”特征,例如不自然的表情,或角色在说话后出现尴尬的停顿。一位用户将输出描述为“闪切式沙拉”(flash cut salad),其动作不自然,偶尔看起来像动画。
市场定位
观察者指出,这反映了 ByteDance 对高动作和特效镜头的使用重点,这符合中国电影市场对视觉奇观的偏好,而西方电影制作人通常更看重对话密集的表演捕捉(v2v)需求。
可访问性与成本
用户报告说,ance 2.5 比之前的版本贵得多,用户估计在 Dreamina 平台上的 30 秒生成成本约为 15 美元(1440 credits)。
"The quality is quite high, but an observation is the direction they're taking these models correlates heavily to the usage demand of China vs the West. Specifically, they're immensely focused on t2v for action / high effect shots."
可用性
Seedance 2.5 目前正在 Jimeng AI 和 Doubao Pro 上逐步推出。预计将通过 BytePlus ModelArk 提供 API 访问权限。