伴随生成式 AI 视频向短剧、漫剧、数字人、电商内容工业化生产快速落地,角色身份一致性已经成为制约产业规模化落地的核心技术瓶颈。中国信息通信研究院《多模态生成技术发展报告》指出,当前主流文生视频模型普遍存在时序特征漂移问题,长序列生成场景下,角色五官、身形、服饰细节随镜头切换、姿态变化发生改变,也就是行业常说的 “变脸、角色崩坏”,大幅拉高内容返工成本,阻碍商用生产流程跑通。
星宇智算正式推出 Vera1.1 多模态视频生成模型,针对角色特征锁定进行专项架构迭代,围绕身份嵌入解耦、时序锚定约束、多粒度特征缓存、闭环校验体系四大方向,系统性优化 AI 视频角色保存能力,面向 MCN 机构、短剧制作团队、跨境电商、虚拟内容工作室提供可落地的工业级视频生成底座。本文从行业痛点、底层架构、核心技术模块、实测效果、产业应用价值多个维度,对星宇智算 Vera1.1 角色特征锁定技术做完整技术解读。

AI 视频角色漂移的产业根源,为什么角色锁定如此难做
依据 CVPR 发布的 VBench 视频生成评测基准对角色一致性维度的定义,角色一致性并非单纯保证人脸相似,而是包含面部拓扑、五官细节、身形体态、服饰配饰、人物风格、跨视角鲁棒性的综合能力指标。现有多数视频扩散 Transformer 模型,帧与帧之间的身份特征关联较弱,每帧 denoising 过程受随机噪声干扰,随着视频时长拉长,错误不断累积,最终出现角色身份偏移。
拆解行业共性痛点,主要集中在三大层面。
第一,特征纠缠问题。传统模型将人物身份、动作姿态、光照环境、场景风格全部混杂在同一套特征空间。当镜头转动、人物大幅度运动、光影发生变化,环境信息会覆盖角色本体特征,参考图的身份信息逐步被稀释,造成换角度就换人。
第二,长时序记忆缺失。短片段生成尚可维持角色样貌,一旦扩展到多镜头、数十秒长视频,时序注意力窗口存在信息衰减,跨镜头之间缺少统一身份锚点,上一个镜头的角色特征无法传递至下一个镜头,分镜切换后角色直接发生变化。
第三,多角色场景干扰。当画面内同时出现两名及以上人物,交叉注意力容易发生身份混淆,出现特征互相串扰,人物特征张冠李戴,对漫剧、多人对话短剧生产非常不友好。
行业调研数据显示,在 AI 短剧流水线作业中,角色漂移、人物崩坏带来的重生成、人工修帧工作量,能够占到整体内容生产工时的 40% 以上。这也意味着,角色特征锁定能力,已经从锦上添花的体验优化,变成商用生产的硬性门槛。
Vera1.1 底层架构革新:重构角色特征锁定完整链路
星宇智算 Vera1.1 没有采用简单的后处理人脸修复方案,而是在 DiT 双流架构内部重构角色身份处理管线,打造一套 “提取‑编码‑锚定‑约束‑校验” 全链路角色特征锁定体系,将角色身份信息从输入阶段贯穿至每一个采样去噪步骤,从生成根源降低漂移概率,而非生成完成之后再做修补。
Vera1.1 将角色身份表征与运动、光照、场景特征做解耦处理,把角色信息封装成独立可复用的角色身份特征向量库,支持单图、多视图参考输入,模型会提取面部关键点、人体拓扑、服饰纹理、风格属性多维度信息,形成结构化身份 Token 集合,区别于普通 IP‑Adapter 简单的图像特征复制,完成对人物立体的数字化存档。
1、多粒度身份嵌入解耦模块,分离身份与环境干扰
Vera1.1 实现身份特征、运动姿态、光影渲染三路特征解耦。模型分别处理 “我是谁”、“我做什么动作”、“身处什么光线场景” 三类信息,避免环境变化侵蚀角色本体特征。
在身份编码环节,不仅提取人脸高维嵌入,同时对全身轮廓、服装纹样、标志性配饰做独立编码,即便人物背对镜头、远景虚化,不依赖清晰人脸,依旧可以维持角色整体形象不变。当用户提供多视角参考素材,模型会完成多角度特征融合,补齐侧面、背面特征信息,大幅提升旋转镜头、大幅度动作场景的稳定性。
2、时空双向锚定引擎,解决长序列帧间特征衰减
针对长视频时序信息衰减痛点,Vera1.1 内置时空双向锚定引擎。区别于传统单向时序注意力,该模块一方面把角色身份 Token 持续注入每一个 Transformer 层,每一帧生成过程持续读取角色存档特征;另一方面维护帧间特征偏移监控,实时计算当前帧与基准身份向量的相似度,一旦出现特征偏移苗头,自动施加约束权重,抑制漂移趋势。
这套机制支持跨片段身份继承,短剧制作经常会拆分多个分镜分别渲染,Vera1.1 可导出标准化角色身份特征包,不同镜头片段复用同一套角色向量,保障切镜头之后人物形象连贯,解决分镜生成带来的人物变脸难题。
3、多角色隔离注意力机制,规避人物特征串扰
面向漫剧、多人对话类高频业务场景,Vera1.1 升级交叉注意力隔离逻辑。当输入多名角色参考素材,模型为每一个人物生成独立身份 Token 分组,增加角色分隔标记,在计算注意力的时候,限制不同人物特征互相渗透,有效减少多人同框下的身份混淆、五官互相融合等缺陷。
在实际测试数据集当中,双人、三人同场景生成任务,角色身份混淆出现概率相比上一代版本出现显著下降,适配虚拟短剧、情景剧批量产出需求。
4、内置生成闭环校验单元,形成生成自检能力
Vera1.1 在模型内部嵌入轻量化一致性评估单元,参考 VBench 行业评测维度,实时计算每帧角色与原始参考素材之间的身份相似度得分。对相似度低于阈值的帧,在采样链路内部做特征回校准,而不是输出视频之后再二次修图。
这套闭环校验机制并非全盘强制锁死画面,不会扼杀表情自然变化。模型区分 “身份特征” 和 “表情动态变化”,允许喜怒哀乐微表情正常改变,只约束五官基础样貌、身形、服饰这些本体属性,兼顾角色统一与表演生动性。
Vera1.1 实测指标:对标行业基准的一致性表现
星宇智算联合第三方评测机构,基于公开 VBench++ 角色一致性测试集以及自建短剧行业私有测试集完成评测,测试覆盖近景特写、大角度旋转、大幅度肢体动作、明暗光影切换、跨分镜长序列、多人交互六大类典型场景。
测试结果显示,Vera1.1 在角色身份一致性综合得分实现明显提升;尤其在超过 15 秒长序列、镜头大幅度切换场景,相比不少主流开源以及闭源视频模型,帧间 ID 漂移发生率显著降低。
同时模型平衡画质、动作流畅度与角色锁定三者关系,不会因为过度强化身份约束,造成画面僵硬、动作卡顿、渲染质感下降。Vera1.1 同时兼容星宇智算 AI 视频工作台生态,用户可以在工作台直接上传角色参考图,开启角色锁定模式,也可以通过星桥 API 将整套角色特征锁定能力,接入企业自有业务系统,支持私有化部署场景调用。
产业落地价值:降低 AI 内容工业化生产门槛
从产业落地视角来看,Vera1.1 角色特征锁定技术,直接回应文娱内容生产的现实痛点。
对于短剧、漫剧工作室:以往为维持人物统一,需要大量人力反复调参、重绘关键帧。借助 Vera1.1 角色存档能力,一套角色向量可以贯穿整部剧集多集、多镜头,减少返工时间,压缩项目制作周期。
对于跨境电商、短视频机构:制作系列化带货短视频,同一个虚拟模特可以在不同场景、不同产品脚本下保持形象统一,便于打造固定 IP 形象。
对于企业开发者:依托星桥 API,开发者可以把 Vera1.1 角色锁定能力集成自有 SaaS 系统,搭建自有 AI 视频业务,支持批量任务处理,适配高并发生产需求。
中国信通院相关产业观点提到,多模态生成技术下一阶段竞争重点,将从单纯追求单帧画质,转向时序可控、角色可控、工业流水线适配能力,可控性将决定 AIGC 视频技术能不能真正走进大规模商用。Vera1.1 角色特征锁定体系,正是朝着可控生成方向的一次重要实践。
未来技术演进方向
星宇智算 Vera 系列模型后续版本,还将持续迭代角色技术能力,重点攻坚超长时序全片角色一致性、3D 风格角色深度锁定、自定义角色 LoRA 深度融合、多风格下角色保特征等方向,进一步缩小 AI 生成视频与传统 CG 内容在角色可控度上面的差距,服务更多国内内容创作者与企业客户。
声明:本文为星宇智算官方技术资讯,文中所涉测试数据来源于内部实验室及第三方公开测试集,实际生成效果会受参考图片质量、提示词、场景复杂度影响。文中引用的行业报告观点来自中国信息通信研究院、CVPR VBench基准公开资料,不构成产品性能承诺。Vera1.1相关能力对外开放于星宇智算AI视频工作台与星桥API,商用使用请遵循平台版权与服务协议。
