图像转视频深度对齐模型上线,Vera 1.1 还原原图人物五官特征

图像转视频深度对齐模型上线,Vera 1.1 还原原图人物五官特征

近日,星宇智算完成自研多模态视频模型迭代,正式推出搭载图像转视频深度对齐模型的 Vera 1.1 版本,并接入星宇智算 AI 视频工作台面向企业客户开放调用。新版本重点优化图生视频链路下人物面部特征丢失、五官形变、形象偏移等行业难题,通过多层特征对齐算法锁定参考图像关键信息,在画面动态演化过程中持续还原原图人物五官、面部轮廓等核心特征,提升图生视频成品可用率。

行业现状:图生视频普遍存在人物特征丢失问题

结合 2026 年 AI 多模态产业调研数据,图生视频是企业内容生产高频使用的技术路径,广泛应用于电商种草短视频、剧情短视频、数字素材复刻、矩阵账号内容制作等场景。超过 70% 内容创作者习惯使用静态人像图片作为基础素材生成动态视频。

市面上主流图生视频模型普遍存在时序漂移缺陷。静态参考图导入生成动态视频后,人物五官比例、面部细节容易随镜头运动、姿态变化出现失真。行业标准化抽样测试结果显示,未搭载深度对齐机制的图生视频模型,人像类素材生成视频中,出现明显面部特征偏移的样本占比高于 58%。

此类失真镜头无法直接交付商用,团队需要多次重新生成素材,拉高算力消耗与时间成本。对于依托固定人像素材批量产出系列短视频的 MCN 机构、跨境电商团队,人物形象不稳定成为制约图生视频规模化落地的核心阻碍。现有多数解决方案仅依靠简单参考图约束,缺少像素级、特征级双层对齐机制,很难兼顾画面动态自然度与人物形象稳定性。

Vera 1.1 深度对齐模型核心技术逻辑

本次 Vera 1.1 搭载的图像转视频深度对齐模型,构建双层特征约束架构。第一层完成全局图像特征锚定,提取参考图当中面部轮廓、五官布局、肤色、发型等永久性特征向量;第二层执行时序特征持续对齐,在视频逐帧推演过程中建立跨帧约束条件,降低动态运动带来的特征噪声干扰。

模型区分刚性面部特征与非刚性动态细节,在保障五官形象和原图保持一致的基础上,支持面部微表情、肢体动作自然变化,规避画面僵硬、动作固化等负面效果。整套算法原生适配竖屏信息流短视频、横屏剧情短片主流分辨率,支持单人、多人同框素材的图生视频任务。

该模型完整集成于星宇智算 AI 视频工作台,用户上传人像参考图即可直接调用 Vera 1.1 链路,无需额外配置复杂参数,可与平台已上线的多层级人物特征锁定模块联动使用,适配系列化剧情短视频持续生产需求。

实测效果与商业化落地价值

星宇智算对外公布内部标准化对照测试数据,在统一测试样本集条件下,启用 Vera 1.1 深度对齐模型之后,人像图生视频任务中人物五官出现显著偏移的样本占比下降至 16% 以内,单次生成镜头商用合格率得到明显提升。

从生产流程角度测算,内容团队使用传统模型制作人像短视频,平均每条素材需要 2 至 4 次重试;切换至 Vera 1.1 链路后,素材重生成频次显著减少,单位成品算力消耗有所降低。

面向跨境电商、自媒体工作室、短剧预演团队等客户,静态人像素材可以持续转化为多条动态短视频,企业无需反复拍摄实拍素材。平台延续现有算力阶梯计费体系,升级后的 Vera 1.1 链路无额外功能订阅费用,客户仅根据视频渲染消耗结算资源。

不少参与内测的内容机构反馈,人像一致性提升之后,图生视频产出素材可以直接接入平台后期一体化剪辑、配音工具,打通从静态图片到成片短视频的完整工作流。

行业趋势:图生视频由 “能生成” 向 “高质量商用” 转型

AI 视频赛道竞争逻辑正在发生转变,早期行业重点验证视频生成可行性,现阶段市场需求转向高质量、稳定、可规模化商用的生成效果。图生视频作为落地门槛较低的内容生产方式,对人物、场景一致性的技术要求持续提高。

星宇智算持续迭代自研模型矩阵,HappyHorse、Vera 系列视频模型分别面向不同应用场景持续优化,叠加批量视频生产、人物特征锁定、后期成片一体化工具,持续搭建面向 B 端客户的全链路 AI 内容生产体系。后续研发团队将持续优化多人同框对齐、复杂光影环境下人像还原能力。

行业分析认为,随着图像 – 视频对齐技术持续成熟,静态图文素材向动态短视频转化效率将进一步提高。具备稳定人像还原能力的图生视频模型,能够降低中小内容团队素材拍摄成本,推动 AI 视频工具在新媒体营销、数字创意、短剧前期预演领域进一步普及。