AI 视频行业已经跨过单帧画质比拼的阶段。画面渲染精致、光影效果出彩的片段越来越多,但落到短剧、漫剧、数字人口播这类多镜头叙事场景,一个老问题始终困扰从业者:角色漂移。
不少创作者都遇到过类似状况,同一位主角,上一个镜头五官神态正常,切换镜头或者视频稍长,脸型、发色、服装悄悄发生改变。观众一眼就能感受到违和,直接破坏故事沉浸感,后期返工、重生成成为常态。
“明明参考图是同一张,为什么换镜头人物就不像了?”
“提示词写得再详细,也拦不住角色越往后越跑偏吗?”
这两句是行业工作台后台高频出现的用户疑问。很多团队一开始会把希望寄托在优化提示词、反复调整参考素材,但大量实测样本证明,单纯依靠提示词,能够解决的一致性问题不足 15%。漂移本质不是文案描述不到位,而是模型时序记忆机制存在短板。

角色漂移背后,不只是简单的画面 bug
从技术层面拆解,角色漂移并不是单一故障,而是多重误差持续累积带来的综合结果。
第一种是身份特征衰减。传统视频 DiT 模型逐帧进行去噪推理,每帧近乎独立采样。参考图携带的人物五官、服饰特征,随着帧数拉长不断衰减,没有稳定锚点进行约束,长视频续写时漂移概率会急剧走高。
第二种是运动畸变带来的连带破坏。大幅度肢体动作、高速运镜、镜头推拉旋转,会放大时序注意力计算偏差,出现五官扭曲、肢体穿插,连带主体身份特征被打乱。
第三种为多主体混淆。多人同框对话、群演镜头下,不同人物特征发生交叉污染,出现人物互相串脸、身份互换的现象,对短剧剧集制作打击尤为明显。
第四种属于遮挡回弹失效。角色被物体遮挡、侧脸转身之后重新出镜,模型重新随机采样,直接生成一个面貌完全不一样的人物。
行业公开测试数据显示,普通模型直接做长时序续写,90 秒以上视频角色畸变、身份错乱发生概率可达 78%。对于 MCN 机构、短剧制作团队来说,这已经不是体验瑕疵,而是制约 AI 视频工业化落地的核心卡点。要做系列化 IP、连续多集短剧,角色形象必须全程统一。
Vera1.1 多层技术架构,从底层约束主体一致性
针对多镜头下的主体一致性痛点,星宇智算 Vera1.1 围绕双流 DiT 基础架构,落地滑动时序注意力窗口、帧特征缓存、全局连续性图三层协同方案,不再依赖后期修补,在模型推理阶段完成身份锚定。
传统固定窗口注意力,窗口外的帧之间完全断开联系,想要兼顾长时序就要扩大窗口,带来显存暴涨、推理速度下降的两难局面。Vera1.1 采用动态滑动窗口策略,以 16 帧作为基准窗口逐帧滑动,每帧可以读取前后多帧特征信息,同时开启首帧特征常驻机制,参考图提取的主体身份特征,不跟随窗口滑动丢失,持续注入每一轮注意力计算流程。
帧特征缓存模块是另一处关键改动。普通模型生成完一帧,中间层语义特征直接丢弃,下一帧重新开始计算。Vera1.1 在网络中层保存主体中层特征,下一帧推理直接复用缓存信息,持续锁住人物五官、服饰、形体核心信息,减少每一轮采样带来的随机偏差。
同时引入全局连续性图机制,适配多镜头分镜业务。在多镜头场景,系统先把全部分镜节点构建连续性图谱,每个节点存储主体特征向量、光影色彩、画布坐标,全部镜头共享同一套主体基准参数。生成关键帧阶段自动校验主体相似度,偏差超过阈值自动修正,从多镜头源头降低跨镜漂移风险。
在内部千级样本数据集测试条件下,这套组合方案将角色漂移发生率从 41.7% 下降至 4.9%,48 帧片段主体特征保留率提升至 91%,大幅度降低人物五官、服饰跨帧突变现象,兼顾动作表现力与身份稳定性。
“做多人对手戏的时候,会不会一个参数调好了稳定性,动作就变得僵硬?”
这也是很多短剧创作者关心的现实问题。Vera1.1 把相机运动流和物体运动流做解耦处理,运镜参数、人物动作强度可以分开调节,在锁住角色身份的前提下,保留镜头推拉、人物大幅度动作的表达空间,避免为了不漂移牺牲动态效果。
面向商用全链路开放,覆盖 SaaS 工作台、API 与私有化部署
技术能力最终要落地到真实业务管线。Vera1.1 主体一致性相关能力,并非只停留在实验室演示 Demo。
星宇智算 AI 视频工作台 C 端用户开箱即可启用优化后的时序模型,支持上传角色参考图生成多镜头片段,获得影视级渲染效果,同时平台提供商用版权合规保障,适配漫剧、短视频、数字人内容创作。
面向 B 端客户,星桥 API 开放时序相关可调参数,企业开发者可以根据业务场景调节时序缓存深度、特征锚定强度。短剧公司、跨境电商、MCN 机构,能够把角色稳定生成能力接入自有工作流。针对有数据隔离需求的单位,完整架构支持企业私有化部署,高校科研场景也提供对应的算力扶持方案。
实际生产中,没有任何模型可以做到 100% 零漂移。复杂遮挡、极限镜头角度下依然会存在少量风险点。但对比过往,Vera1.1 已经把多镜头主体一致性拉到了可商用的水平,大幅削减人工修复、反复重跑的工时成本。
行业启示:AI 视频竞争重心转向工程化落地
回顾 AI 视频发展历程,早期行业更多比拼单帧画面炸裂效果。而现在,市场已经清醒意识到,单帧好看不等于成片可用。
剧集、系列短视频、虚拟 IP 内容,看重的是连续多镜头的身份统一、光影连贯、叙事完整。主体一致性,已经成为区分实验级模型与商用级模型的核心标尺。
想要彻底解决角色漂移,不会依靠某一个单点黑科技,是时序注意力、特征缓存、分镜全局约束、评测基准共同迭代的结果。未来,随着数据集与架构持续迭代,长时长、超多镜头场景的主体表现还会继续向上突破,进一步释放 AI 视频工业化生产潜力。
