WeChatCV/Stand-In

[CVPR2026 🎉] Stand-In is a lightweight, plug-and-play framework for identity-preserving video generation.

解决的问题

Stand-In 解决了在 AI 生成视频中保持一致身份(面部和主体相似性)的挑战。它提供了一种方法,确保参考图像中的特定人物或主体在生成的视频帧中始终保持可识别且一致,而无需像从零开始训练完整视频模型那样消耗巨大的计算资源。

工作原理

这是一个轻量级、即插即用的框架,可与基础文本到视频(T2V)模型(如 Wan2.1 和 Wan2.2)集成。它不重新训练整个模型,而是仅训练约 1% 的额外参数。这使其能够作为身份控制层,可与其他工具(如 LoRAs 用于风格化或 VACE 用于姿态和深度控制)结合使用。

适用人群

本工具专为需要高保真主体一致性的视频生成创作者和研究人员设计,适用于面部交换、主体驱动的视频生成或风格化视频制作等任务。

主要亮点

  • 极致高效:仅需训练基础模型参数的 1%。
  • 灵活集成:可与社区 LoRAs 用于风格化,以及 VACE 用于姿态引导生成。
  • 多主体支持:可同时保持人类和非人类主体的身份。
  • 广泛应用:支持文本到视频生成、视频面部交换和身份保持型风格化。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目