双流 DiT 架构持续优化,推动 AI 视频画质与可控性同步升级

双流 DiT 架构持续优化,推动 AI 视频画质与可控性同步升级

伴随数字内容产业高速发展,AI 视频生成已经从概念验证阶段全面转向规模化商用落地。根据高盛 2026 年互联网行业研报预测,全球 AI 视频生成市场规模未来五年将实现十倍级增长,到 2030 年市场规模有望达到 290 亿美元,电商短剧、营销宣传片、数字人内容等 B 端场景成为增长核心驱动力。中国信息通信研究院发布的 AI 视频评测相关标准明确指出,商用级 AI 视频两大核心考核维度,分别是生成画质保真度以及指令可控执行能力,帧间时序一致性、主体特征保留、文本指令对齐被纳入核心评测指标,这也成为行业技术攻关的核心方向。

传统单流 DiT 扩散 Transformer 架构在实际生产场景中,长期面临一组难以调和的矛盾:提升画面细节质感,就容易出现角色漂移、物体畸变、动作逻辑错乱;强化时序约束,又会造成画面细节丢失、渲染质感下降,这一技术痛点限制 AI 视频大规模工业化应用落地。在此产业背景下,双流 DiT(Dual‑Stream DiT)架构凭借空间视觉流与时序运动流解耦计算的技术思路,成为当前行业重点演进的技术路线,星宇智算 Vera1.1 模型深度基于持续优化后的双流 DiT 架构,完成工程化落地,实现画质表现与生成可控能力的双向同步提升。

什么是双流 DiT 架构,解决哪些行业固有痛点

DiT 扩散 Transformer 架构,将扩散模型生成能力与 Transformer 长序列建模能力相结合,对比传统 UNet 视频模型,具备更强的长时空依赖建模能力,是当前主流视频基础模型的技术底座。而双流 DiT 架构核心创新在于,将视频生成拆解为两套并行处理流,一条为空间视觉流,专注处理单帧画面细节、材质光影、主体外观、风格语义;另一条为时序运动流,专门负责帧之间运动逻辑、物体位移、镜头运镜、角色姿态的时序约束,两条分支通过双向交叉注意力完成特征交互融合,而非全部特征混杂在单一网络流中处理。

过往大量商用实践反馈,单流架构网络需要同时承载画面渲染和时序约束双重任务,参数权重互相干扰。当处理高动态动作、长序列片段、复杂运镜镜头时,容易出现主体身份漂移、物体无规则变形、光影闪烁跳变、动作违背物理规律等问题,很多模型单帧截图效果优秀,连续播放就出现明显崩坏,这也是大量 MCN 机构、短剧制作团队、电商商家使用 AI 视频工具时最主要的生产阻碍。

中国信通院在《智能文娱基础设施白皮书》中提到,现阶段制约 AI 视频产业规模化落地的瓶颈,不再是单纯的静态画面生成能力,而是时序一致性、指令跟随精度等动态可控指标,很多实验室模型在人工盲测中 MOS 主观评分很高,但面向真实业务生产时合格率不足六成,无法直接用于商业交付。双流 DiT 架构通过空间、时序任务解耦,把画面渲染和运动约束分开训练、分开调优,从底层架构层面缓解上述冲突,为商用级视频输出提供技术基础。

星宇智算 Vera1.1:基于优化双流 DiT 实现画质可控双升级

依托自研持续迭代的双流 DiT 架构,星宇智算推出 Vera1.1 视频生成模型,针对真实业务场景做大量工程调优,对时序注意力模块、跨流交互机制、多尺度特征注入链路完成深度优化,解决传统双流架构算力开销大、长视频特征衰减、参考图特征丢失等原有短板。

在画质能力层面,Vera1.1 双流 DiT 架构的空间视觉流,采用分层多尺度编码器,完整继承参考图像的像素细节、物体材质、光影色调、美术风格,输出视频能够保留原始素材的高清质感,支持高分辨率输出,在写实宣传片、国风动漫、电商商品素材等场景,减少画面糊化、材质错乱的现象。

在可控性能力层面,时序运动流独立接管运动逻辑,对角色身份一致性、物体形态稳定、镜头运镜参数做专项约束。公开实测数据显示,Vera1.1 将复杂运镜场景的生成合格率从 62% 提升至 89%,支持 6 自由度镜头参数精细化调控,有效抑制角色漂移、物体凭空增减、帧间闪烁等高频问题,文本指令、首尾帧约束、参考图驱动等各类输入条件的执行精度得到显著提升。

区别于实验室原型模型,Vera1.1 完整适配星宇智算产品矩阵,既可以在 AI 视频工作台 SaaS 平台面向创作者直接调用,也支持星桥 API 接口对外输出,同时面向企业客户提供私有化部署方案,时序权重、运动强度、特征保留强度等关键参数全部对外开放,方便短剧公司、跨境电商、MCN 机构根据自身业务需求自定义调节,兼顾普通创作者简单使用与专业团队深度调参的双重需求。

产业落地价值:推动 AI 视频走向工业化生产闭环

中研普华 2026 上半年产业调研显示,国内电商商家 AI 视频工具渗透率已经达到 27.3%,短剧、数字营销行业 AI 素材产出占比持续走高,但大量企业反馈,AI 生成视频后期修正成本过高,很多生成内容需要二次人工重制,抵消 AI 带来的效率优势,根源就是可控性不足带来的无效产出占比居高不下。

双流 DiT 架构持续优化带来的画质、可控性同步提升,恰好击中产业现实痛点。当模型既能够输出高质量画面,又可以稳定遵循用户指令,降低无效生成占比,才能够真正压缩后期修改工时,实现 “输入指令直接产出可用商用素材” 的工业化生产模式。行业测算显示,成熟 AI 视频生产链路,能够将小型团队的产出效率提升至传统模式 8‑10 倍,制作周期压缩 70% 以上,降本增效的价值才能真正释放。

从行业技术演进视角来看,DiT 架构的迭代不会止步于双流设计。未来技术演进方向,会进一步优化双流模块算力开销,完善多模态跨流对齐,打通文本、图像、音频、视频多条件输入,进一步提升长片段生成稳定性。国内厂商正在持续缩小与国际顶尖研究的差距,以 Vera1.1 为代表的落地产品证明,架构层面的深度优化,能够实实在在转化为业务可用的产品能力。

行业发展展望

高盛研报分析指出,AI 视频赛道不会出现单一厂商垄断的格局,技术比拼将从单纯的画面好看,转向综合能力比拼,包括时序一致性、指令可控性、场景适配能力、商用版权合规、API 工程化能力等多个维度共同决定产品竞争力。中国信通院的评测标准也在引导整个行业,把主观观感,转化成一套可量化核验的技术指标,倒逼厂商在架构底层持续打磨,而不只是追求短期的演示效果。

双流 DiT 架构的持续优化,代表 AI 视频行业正在从 “重单帧效果” 迈向 “重完整视频全链路质量”。星宇智算 Vera1.1 的实践证明,通过架构创新结合大规模业务场景调优,可以实现画质与可控性的协同升级,为短剧、电商营销、数字人、虚拟内容等产业提供更可靠的国产 AI 视频生产力底座。