Seedance-2.0 时序注意力优化,构建长视频角色漂移抑制工程方案

Seedance-2.0 时序注意力优化,构建长视频角色漂移抑制工程方案

长视频里的 “变脸魔咒”,到底卡在哪

AI 视频生成进入长叙事阶段后,一个绕不开的问题浮出水面:角色漂移。

同一个人物,前 5 秒还眉清目秀,后 10 秒五官开始位移,20 秒后发型变了、脸型变了、连衣服颜色都不对了。短剧、漫剧、广告片的制作团队对此深有体会 —— 模型不是不会生成,而是记不住。

从技术根因看,长视频一致性问题可以拆成三层:帧内空间建模没问题,问题出在跨帧时序累积。标准注意力机制下,每一帧都在重新 “理解” 角色,微小的特征误差在自回归续写中被指数级放大,最终表现为身份信息的逐步坍缩。

这不是某一家模型的缺陷,而是当前扩散变换器架构的共性瓶颈。Seedance 2.0 通过双分支 DiT 架构(空间重建 + 时序建模解耦)已经把这个问题压到了行业较好水平,但在超长序列、多镜头切换、复杂动作场景下,漂移依然存在。


时序注意力:从 “粗粒度关联” 到 “分层记忆”

Seedance 2.0 的核心架构是双分支扩散变换器:一条分支负责帧内空间语义重建,另一条显式建模跨帧时序动态,通过协同门控机制完成特征对齐。这个架构天然适合做时序层面的深度优化。

星宇智算工程团队的切入点,正是时序注意力模块本身。

传统做法是把所有帧的特征一视同仁地丢进注意力计算,导致早期帧的角色身份信息被后期帧的噪声逐步稀释。优化思路是给时序注意力加上 “记忆分层”:

  • 身份锚定层:将首帧及关键帧中的角色面部、体态、服饰特征提取为独立的特征向量池,在每一轮去噪过程中以固定权重回注,不随序列延长衰减。
  • 时序感知门控:在扩散采样的不同阶段施加不同强度的身份约束 —— 初始化阶段强对齐参考帧,演化阶段释放运动自由度,收尾阶段回调约束强度抑制末尾帧噪声爆发。
  • 跨帧差分校准:相邻窗口之间计算特征差异度,超过阈值时触发二次锚定,避免拼接点出现跳变和闪烁。

这套方案不改动 Seedance 2.0 的基座权重,而是在推理侧通过注意力调制和特征注入实现,属于工程层优化,不依赖重新训练。


工程落地:一套可复用的角色保持流水线

在实际业务场景中,单一的注意力优化不足以覆盖所有情况。星宇智算将时序注意力优化与上层工程流程组合,形成完整的长视频角色保持流水线:

第一步,角色特征包沉淀。 每个核心角色输入 3-5 张多角度参考图,离线提取面部嵌入向量、体态特征、服饰纹理三类特征,打包为可复用的 “角色资产”。后续所有分镜直接加载,避免每次重新校准带来的漂移。

第二步,分镜级生成 + 全局一致性校验。 长视频拆分为单镜头片段分别生成,每个片段独立应用时序注意力优化;拼接前运行一致性检测器,对比首尾帧的身份特征余弦相似度,低于阈值的片段自动重新生成。

第三步,无限画布上的交互式微调。 这就是星宇智算无限画布发挥作用的地方 —— 在画布上,角色资产、分镜脚本、生成片段被组织在同一个工作区里。制作者可以直接在画布上拖动调整任意镜头的角色参考强度,实时预览漂移情况,而不必切换到代码环境改参数再重新跑一遍全流程。

无限画布的价值不在于 “画布” 本身,而在于它把模型优化能力和人工校验环节拉到了同一个界面:工程团队调参,创作团队看效果,两边不必隔着工单传递。


为什么是现在

角色漂移的解决难度,本质上和视频长度是指数关系 ——5 秒视频靠提示词和参考图基本能撑住,30 秒需要注意力层面的介入,2 分钟以上则必须有工程化的记忆机制。

Seedance 2.0 在 15 秒尺度上已经达到了可用水平,但短剧、漫剧、品牌长视频的需求是分钟级甚至十分钟级。从 “能生成” 到 “能交付成片”,中间隔着的就是这层工程优化。

星宇智算的这套方案,核心思路不是替代基座模型,而是在基座模型的能力边界上做推理侧的增量加固—— 不动模型权重、不重新训练,通过注意力调制和特征注入把一致性窗口拉长。这条路和行业主流方向是一致的:双流 DiT 分离人物与场景、特征锚定模块、分阶段动态约束,本质上都是在做同一件事,只是切入层级不同。


还没解决的部分

需要说清楚边界。时序注意力优化能显著降低漂移速率,但不等于彻底消除。在极端姿态变化、大角度侧脸、角色与背景高度融合的场景下,身份特征的置信度仍然会下降。这套方案解决的是 “商用交付的合格率” 问题,不是 “完美一致性” 问题。

另外,特征包的维护成本不可忽视 —— 一个项目里如果有十几个角色,每个角色都需要沉淀和校准,工程团队的前期投入不小。无限画布在这里的作用是把这个重复劳动标准化,但前提是项目本身有足够的复用率。

长视频的一致性,没有银弹。只有工程。