作为多模态生成技术的重要赛道,AI 视频生成正快速从概念演示走向规模化商用落地。根据中国信息通信研究院相关行业研判,当前国内 AI 视频模型的竞争,已经不再单纯比拼单帧画面渲染效果,而是转向时序一致性、实体身份稳定、场景逻辑可信、工程化落地能力的综合较量。星宇智算自研 Vera 1.1 视频生成模型,聚焦人物主体视频生成场景,针对行业普遍存在的角色漂移、动作失真、多人交互错乱、长片段语义崩塌等现实痛点完成迭代优化。近日,星宇智算核心技术团队对外深度拆解 Vera 1.1 的完整研发思路,从行业痛点、架构选型、数据体系、训练策略、工程落地、商业化约束多个维度,还原面向产业级应用的 AI 视频模型的完整研发链路。

当前 AI 视频产业普遍存在的技术现实困境
行业多家权威机构调研显示,现阶段多数文生视频、图生视频模型在演示样本中可以产出惊艳画面,但迁移到短剧制作、电商内容、数字人叙事等真实业务场景时,会暴露出大量无法忽视的短板,直接制约商业化使用效率。
第一,实体身份漂移问题突出。人物、道具、核心 IP 角色在多帧、多镜头切换过程中,五官特征、服饰细节、外形特征发生无规则改变,单人视频出现容貌跳变,多人场景出现人物特征互相混淆,这也是短剧、漫剧内容生产中最高发的故障点。学术实测数据表明,普通 DiT 架构模型,在超过十余秒连续生成任务中,角色身份失真发生概率会显著抬升,很难支撑连续叙事内容生产。
第二,时序运动与物理逻辑缺陷。帧间动作跳跃、肢体扭曲,物体运动违背基础物理规则,镜头切换之后光影、色调、环境布局出现断层。模型擅长生成静态美学画面,但对连贯动作、人物交互、复杂环境变化的理解能力不足。
第三,数据与训练的矛盾。高质量对齐的图文‑视频配对数据集供给不足,通用公开数据集普遍存在分辨率低、标注粗糙、版权隐患等问题。直接使用通用数据集训练,模型很容易学到噪声、水印、错误画面逻辑,很难适配商用标准的内容输出要求。
第四,算法能力与工程落地脱节。很多实验室模型拥有不错的 demo 效果,但推理开销巨大、吞吐效率低下,缺少完整的容错机制,难以适配企业批量生产、API 调用、私有化部署的真实业务环境,好看但不好用。
星宇智算技术团队表示,Vera 1.1 的研发起点,不是追求对外演示的极限炫酷样片,而是直面以上产业真实痛点,把 “实体稳定优先、时序连贯优先、工程可落地优先” 作为整个项目的顶层设计原则。
Vera 1.1 顶层研发定位:面向产业叙事场景的人物向视频模型
在立项之初,团队就对 Vera 1.1 做出清晰的边界定义:定位人物主体优先的视频生成模型,重点服务 AI 漫剧、短剧分镜、电商人物短视频、数字人辅助创作等叙事类业务场景,而非追求全场景无差别通用生成。
参照头豹研究院 2026 年 AI 视频行业概览报告,广告营销、短剧内容是当前 AI 视频渗透率最高的赛道,这类业务对人物身份一致性、镜头可控性、批量产出能力、商用版权合规均有硬性要求,也是很多开源模型与海外模型难以满足的部分。
基于该定位,团队确立三大研发目标:
- 强化人物实体锚定能力,降低单人、多人场景下角色特征漂移概率,实现跨镜头人物身份保持;
- 优化时序注意力机制,提升动作自然度、帧间运动连续性,减少肢体畸变、画面闪烁;
- 兼顾算法效果与工程性能,实现 SaaS 工作台、星桥 API、私有化部署多形态兼容,控制推理成本,满足企业批量渲染需求。
这一套目标体系,贯穿数据集构建、骨干网络改造、多阶段训练、对齐微调、推理优化全部环节。
架构设计:基于 DiT 骨干做针对性改造,引入身份聚焦监督机制
Vera 1.1 沿用扩散 Transformer(DiT)作为基础骨干架构,但没有直接套用通用开源方案,针对人物身份保持这一核心目标做两处关键改造。
首先引入身份聚焦掩码监督(IFMS)。传统视频扩散训练,对整张画面做均等损失约束,背景、杂物、人物五官服饰使用同等权重,模型容易忽略人物主体细节。Vera 1.1 在训练阶段对人物实体区域施加空间聚焦监督,提升人脸、身形、服饰等身份关键区域的损失权重,降低无关背景噪声带来的学习干扰,引导模型重点学习人物特征的稳定表达,而不是只追求画面整体观感。
其次实现参考感知分层注意力(RALA)。这套机制用于管控参考图特征在 Transformer 各层的传递方式。很多图生视频模型会出现两种极端:要么完全丢失参考人物样貌,要么生硬拷贝参考图全部像素,导致动作僵硬。分层注意力可以调节参考身份线索在网络不同层级的介入强度,底层保留人物身份特征,上层自由生成动作、姿态、镜头变化,实现 “样貌不变,动作灵活” 的效果,同时改善多人场景下不同人物之间特征互相串扰的问题。
与此同时,团队在时序维度补充光流先验约束,把帧间运动信息引入注意力计算链路,抑制无意义的像素跳变,改善长片段生成时的画面闪烁、动作断层现象,平衡生成自由度和时序稳定性。
团队研发人员提到,架构改造并不是一味堆叠模块。每新增一个子模块,都会同步评估显存开销、推理速度,避免为了指标提升,造成线上服务成本不可控,从源头兼顾算法创新与工程落地。
高质量数据集构建:模型能力的底层根基
按照行业共识,视频生成模型能力上限很大程度由数据集质量决定。公开数据集普遍存在水印、低分辨率、标注错位、版权风险,直接拿来训练商用模型会埋下多重隐患。
Vera 1.1 没有直接大规模抓取互联网公开原始视频,采用 “人物级跨片段检索” 方案构建百万级身份对齐图像‑视频配对数据集。核心逻辑是,把同一个人物的不同镜头、不同姿态的图像与视频片段做关联对齐,建立人物身份索引,让训练样本中明确标记 “同一个主体在不同时空下的多种形态”。
在数据处理流程上设置多层过滤链路:剔除水印、模糊帧、畸形画面;清洗版权风险素材;完善文本‑视频精细标注,补充镜头运动、人物动作、光影环境、服饰属性等维度标签。同时划分训练集、验证集、测试集,测试集大量引入短剧、漫剧真实业务样本,而不是只使用网络精美样片,以此更真实地模拟上线之后的用户输入分布,避免出现 “训练集过拟合,真实业务翻车” 的现象。
多阶段分层训练策略,逐步收敛业务目标
Vera1.1 采用多阶段递进式训练路线,不一次性做全量端到端训练,分阶段解锁模型能力,降低训练震荡风险。
第一阶段,通用视频预训练。使用清洗后的大规模通用视频数据,学习基础视觉、时序、镜头常识,让模型掌握物体、光影、镜头运动的基础生成逻辑。
第二阶段,人物身份专项训练。投入身份对齐数据集,启用 IFMS 身份聚焦掩码监督与 RALA 分层注意力模块,重点学习人物主体的特征保持,解决人物乱变脸、多人混淆的核心问题。这个阶段会重点观察身份一致性指标,优先保证实体稳定,再放开动作、场景的生成自由度。
第三阶段,提示词对齐微调。针对中文提示词、分镜脚本输入做对齐优化,适配国内创作者的提示习惯,强化对镜头语言、叙事描述的理解,提升文本指令与输出画面的匹配度。
第四阶段,业务场景对齐与安全对齐。导入短剧、电商人物视频等真实业务测试用例,做小参数微调;同时完成内容安全对齐,建立风险内容过滤机制,适配国内合规要求。
整个训练流程中,团队建立离线量化评估 + 人工业务评测双体系。除 PSNR、SSIM 等通用技术指标外,专门建立人物身份一致性、多人区分度、动作畸变率、提示词匹配度等业务侧指标,避免单纯依靠技术指标,忽略实际创作体验。
从模型权重到可用产品:工程化与商业化约束
实验室权重距离企业可用产品,中间存在巨大工程鸿沟。Vera1.1 作为星宇智算 AI 视频工作台模型矩阵的重要组成部分,研发工作包含大量工程适配工作。
一方面做推理侧优化,通过算子融合、动态 token 调度、自适应分辨率策略,平衡生成画质、速度、显存消耗,既可以在星宇智算 SaaS 工作台面向 C 端创作者直接调用,也支持通过星桥 API 向 B 端客户输出能力,同时适配企业私有化部署的硬件环境。
另一方面,团队重点考量商用版权问题。参照《2026 中国 AI 视频内容生成工具版权风险与监管趋势报告》提出的行业风险提示,AI 视频产品商用必须厘清训练数据、生成内容的版权边界。Vera1.1 在研发阶段就规避受版权保护的影视素材训练,同时配套平台商用授权分级体系,明确不同调用场景下的内容使用权限,给短剧公司、MCN 机构、跨境电商等 B 端客户提供合规使用路径。
团队坦诚,Vera1.1 依旧存在客观局限:超高速复杂格斗动作、极端复杂多人物交互、超长无间断一次性生成仍然存在优化空间。技术团队会持续收集真实业务反馈,迭代后续版本,持续补齐短板。
面向未来:AI 视频模型研发的核心思考
星宇智算技术团队总结,国内 AI 视频赛道已经告别 “以炫技 Demo 论高下” 的早期阶段。未来技术竞争,比拼的不只是单张、单段画面的视觉效果,而是实体一致性、时序逻辑、中文语义理解、工程吞吐、成本可控、版权合规等综合能力。
很多技术难题,不能只靠算法模型单点解决,需要数据集、网络架构、训练策略、推理工程、业务评测体系整套体系协同迭代。脱离真实产业场景做模型研发,很容易出现效果好看,但是无法落地的情况。
Vera1.1 的研发实践,是星宇智算在人物向 AI 视频方向的一次体系化探索。后续团队会持续迭代模型能力,打通分镜解析、角色库持久化、音画同步、数字人联动等上下游链路,为短剧、电商、内容机构提供完整的 AI 视频生产基础设施。
声明:本文为星宇智算官方技术资讯,文中所描述技术特性基于Vera 1.1当前版本,后续迭代版本能力会随研发进展发生变化;文中引用行业报告、机构观点仅作行业背景参考,不构成产品性能承诺;所有模型能力实际效果受提示词、参考素材、硬件环境等多重因素影响。
