过去很长一段时间里,AI 视频行业存在一个很现实的落差。文生视频凭借文字自由描述的优势,画面可控度更高;而图生视频往往容易出现人物变形、画风跑偏、细节丢失等问题。不少从业者宁愿反复调试提示词,也不愿直接导入参考图生成片段。
随着多模态参考输入技术快速迭代,这一局面正在发生实质性改变。现在的图生视频已经不再是简单把一张静态图片做动态化,而是可以深度继承构图、人物特征、场景光影、美术风格,输出稳定的连续视频片段。
“导入参考图之后,为什么 AI 总是把人物五官改得面目全非?” 这是大量短剧创作者、电商剪辑人员日常遇到的真实困惑。
是什么推动图生视频能力快速追上文生视频
多模态参考输入,简单来说就是模型不再单一接收文字指令,同时读取图片、分镜稿、人物设定图等多元信息,完成视频的时序推演。行业内部可以直观观察到一组变化:早期版本图生视频 FVD 指标普遍偏高,角色漂移、画面跳变属于高频故障点。经过架构优化之后,参考输入模块和时序生成模块深度解耦,图像信息不再只是初始化画面,而是贯穿整个视频帧的生成流程。
有不少用户会问:“既然图生视频现在效果变好,是不是就可以完全替代文生视频?” 答案并不是非此即彼。
文生视频强在创意发散,适合从零构建未知场景。图生视频核心价值在于复刻既定视觉,适配 IP 人物延续、分镜成片、产品实拍图转演示视频等工业化场景。二者属于互补关系,而非简单替代。
技术落地的关键突破,集中在图像信息注入方式。过去很多产品只是首帧输入,后续帧容易逐步脱离原图特征。新一代方案采用三级图像注入架构,把参考图的纹理、人物特征、色彩信息持续给到时序注意力模块,降低帧与帧之间的特征损耗。
落地现实:工业化生产场景对图生视频提出硬性要求
短剧、漫剧、跨境电商内容生产,对 AI 视频工具有着非常具体的现实诉求。
做漫剧要保证几十集之内角色长相统一;电商短视频需要产品外观、包装细节全程不变;MCN 机构做数字人口播,需要人设参考图直接锁定形象。
只依靠大段文字提示词,很难稳定守住视觉基准。反复写几十行提示词去描述人物五官、服装纹理,既耗时间,还容易随机翻车。这也是行业逐步转向多模态参考输入的核心动因。
从实际生产流程看,设计师输出分镜图、人设稿之后,如果 AI 可以直接基于图片输出可用成片,中间的改稿周期会被大幅压缩。不用再把视觉信息翻译成冗长的文字,减少人力损耗。
星宇智算 Vera1.1,强化多模态参考输入工程化能力
针对行业这一发展趋势,星宇智算 Vera1.1 在版本迭代中重点打磨多模态参考输入链路。依托双流时空解耦 DiT 架构与帧特征缓存机制,模型可以稳定继承参考图的人物样貌、场景构图、光影色调,缓解业内普遍头疼的角色漂移问题。
在实际测试样本中,导入人设参考图生成漫剧片段,多镜头切换下人物五官、服饰保留度得到明显提升。同时支持分镜多张图依次参考,适配分镜脚本直接转视频的工作流。
很多企业用户关心商用合规问题,Vera1.1 输出内容自带商用版权合规支持,同时兼顾 SaaS 工作台线上使用、星桥 API 对接、企业私有化部署多种交付形态。不管是中小内容团队直接线上创作,还是短剧公司、科研机构做内部算力部署,都可以适配自身业务流程。
“导入多张参考图的时候,会不会出现画风互相打架?” 这也是一线创作者经常提出的疑问。Vera1.1 内置参考权重调节参数,使用者可以自由控制图片参考强度和文字提示权重,平衡原图复刻与创意改动,给生产环节留出可控空间。
行业下一步发展方向:多模态输入走向标准化
当前图生视频追平文生视频,只是阶段性节点。整个行业并没有停下迭代脚步。
未来多模态参考输入会拓展更多形态,除静态图片之外,草图、手绘分镜、参考片段都将成为模型输入源。工具也会进一步降低参数调试门槛,把复杂架构能力封装成简单可用功能。
站在产业视角来看,AI 视频已经走过 “能生成画面” 的初级阶段,进入 “稳定复现既定视觉” 的工业化阶段。多模态参考输入的普及,正是这一轮产业升级的重要标志。对于内容从业者而言,这意味着创作重心可以回归创意本身,不用消耗大量精力和模型随机性对抗。

