图生视频作为 AIGC 视频赛道核心能力,一直面临主体漂移、人物变形、物体样貌丢失的行业顽疾。输入参考图片后,生成视频过程中出现人物五官走样、物体形态改变、主体轮廓偏移,是多数 AI 图生视频工具的普遍问题,直接限制商业内容生产的落地使用。近日,星宇智算 Vera1.1 完成图生视频模块专项迭代,经过标准化多场景实测,实现94.7% 主体特征保留率,有效缓解图生视频主体漂移现象,为漫剧改编、数字人创作、参考图锁定、短视频二次生成等业务场景提供稳定的技术底座。

一、行业现状:主体漂移,制约图生视频商用落地
图生视频技术的核心诉求,是在图片转动态视频的过程中,最大限度维持原图主体样貌、五官、服饰、物体特征。 现阶段大量 AI 图生视频产品,在动态生成过程中容易出现主体漂移问题。人物类素材会出现五官畸变、脸型改变、发型服饰变化;静物、角色插画素材会发生轮廓扭曲、细节丢失;在长片段视频续写、多镜头连续生成场景下,漂移问题会进一步放大。
该问题带来的影响不只是视觉观感瑕疵。在商业生产环节,一旦主体特征发生偏移,生成的成片无法直接交付,需要人工反复重生成、后期修图修正,大幅增加人力与时间成本。对于漫剧改编、IP 角色二次创作、数字人素材生成等业务,主体样貌发生改变,会直接破坏 IP 设定,造成内容不符合项目要求。
行业现有公开测试数据显示,多数主流图生视频工具主体特征保留率集中在 80%‑88% 区间。想要实现 90% 以上的高保留率,需要同时兼顾图像特征提取、时序动态生成、参考图约束、画面一致性校验多重技术链路,对模型特征锚定、动态渲染、约束算法提出极高的技术门槛。
二、星宇智算 Vera1.1:94.7% 主体特征保留率的技术实现
星宇智算 Vera1.1 针对图生视频漂移痛点,对参考图锁定、特征锚定、动态时序渲染、一致性校验四大模块做底层优化,完成多轮模型调优,实测达成 94.7% 主体特征保留率。
2.1 高精度参考图特征锚定模块
Vera1.1 升级参考图像特征提取逻辑,不再只抓取图片浅层轮廓信息。模型会对人物五官、面部结构、角色服饰、物体纹理、IP 角色标志性细节做精细化特征编码,建立专属特征锚点。在视频逐帧生成的全过程中,持续调用锚点信息作为约束基准,降低动态运动带来的主体样貌偏移。
2.2 动态生成约束机制
针对图片转视频的运动变化,模型加入动态约束策略。在人物肢体动作、镜头位移、画面转场等动态场景下,平衡画面运动表现力与主体特征稳定性。既可以实现自然流畅的动态效果,又避免动作幅度变大后出现人物变形、物体走形的漂移现象,适配人物动态、插画漫剧、静物动态等不同素材类型。
2.3 跨帧一致性校验算法
在视频生成推理阶段,启用跨帧比对校验逻辑。系统对连续输出的每一帧画面,对比原始参考图的核心特征,识别特征偏差。当局部特征偏移超出预设阈值,模型会执行自适应修正,降低连续片段中主体逐步变形的累积漂移问题。适配无限画布长视频创作、视频续写等长时序工作流。
2.4 多模式参考图适配能力
Vera1.1 支持多种输入模式,无论是真人照片、二次元插画、IP 角色原画,都可以启用参考图锁定能力。兼容原生音频生成、节点式创作等配套功能,实现 “参考图 + 音频输入” 一体化生成,在保持主体样貌稳定的同时,同步完成音画适配输出。
实测数据说明:94.7% 主体特征保留率为星宇智算内部标准化多场景测试结果。测试样本覆盖真人肖像、二次元漫剧角色、IP 插画、静物产品图四大类别,包含小幅肢体运动、镜头推拉、长片段续写等多种生成条件,综合计算得出主体特征保留指标。
三、多场景落地,拓宽图生视频商业应用边界
主体特征保留能力的升级,让星宇智算 Vera1.1 能够适配更多商业化内容生产场景。 漫剧与 IP 改编创作:基于原作角色原画生成动态漫剧片段,最大程度保留角色五官、造型特征,减少 IP 形象走样问题,配合无限画布完成多镜头漫剧内容批量产出。 数字人素材制作:输入数字人参考形象,生成动态口播、动作视频,稳定保留人物面部特征,降低后期重新修图调整的工作量。 短视频二次创作:使用原图作为参考,完成视频续写、镜头改写,在画面动态变化的同时,维持主体形象统一,适配自媒体营销、品牌宣传短视频生产。 私有化部署方案:企业客户可在私有化部署环境下完整使用图生视频参考图锁定能力,满足企业内部 IP 内容生产的数据安全合规需求。
四、行业价值:推动图生视频从 “能动” 走向 “可用”
过去行业内图生视频技术,重点解决 “把静态图片变成动态视频” 的基础能力。而商业化落地的核心诉求,是生成视频可以保留原图主体特征,满足项目交付标准。 星宇智算 Vera1.1 实现 94.7% 主体特征保留率,有效缓解图生视频漂移难题,降低 AI 生成内容的返工率,压缩内容生产周期。该能力可以服务自媒体工作室、漫剧制作团队、品牌营销部门、虚拟内容服务商等各类主体。
未来星宇智算将持续迭代 Vera1.1,围绕图生视频、音画同步、节点式创作、无限画布、原生音频生成等核心模块持续打磨,面向各垂直行业输出成熟可用的 AI 视频解决方案。
