星宇智算 Vera 1.1 架构拆解,双流 DiT 如何赋能国产 AI 视频生产

星宇智算 Vera 1.1 架构拆解,双流 DiT 如何赋能国产 AI 视频生产

随着 AI 视频从概念演示,转向短剧、漫剧、跨境电商、数字人口播的规模化生产,行业正在遇到一道绕不开的现实门槛。很多团队会有这样的疑问:“单帧画面看着画质很好,为什么一连成视频就人物变形、光影乱跳?” 还有从业者经常发问:“明明提示词写得很完整,长片段生成还是会出现主体丢失,难道只能拆成几秒片段反复拼接?”

根据行业对两百余家内容制作团队抽样调研,超过 66% 的一线创作者把帧间主体一致性列为当前 AI 视频生产最大痛点,分段拼接带来的转场瑕疵、角色漂移,会让后期修复工时甚至超过视频生成本身。

过去不少方案依靠不断提升算力、重复采样抽卡来改善效果,但算力成本随之暴涨,中小团队很难承担持续商用开销。国产 AI 视频想要真正落地产业,不能只追求单帧惊艳,更需要一套兼顾画质、时序稳定性与推理效率的底层架构。星宇智算 Vera1.1 正是基于这一产业现实,对双流 DiT 做全链路工程化改造,打通从模型底层到 SaaS 工作台、星桥 API、私有化部署的完整能力链路。

什么是双流 DiT,和传统视频模型架构差异在哪

DiT(Diffusion Transformer)已经成为新一代视频大模型的主流主干,相比早期 U‑Net 卷积架构,Transformer 注意力机制更擅长捕捉长距离时空关联,对长视频叙事、复杂运镜场景具备先天优势。

传统单流 DiT 会把空间画面信息、时序运动信息揉进同一套注意力流处理。这种模式在短片段上表现尚可,但拉长视频时长之后,空间细节与时序运动互相干扰。要么人物五官细节被运动噪声破坏,要么运动动作僵硬卡顿,很难做到细节保真和运动流畅同时兼顾。

星宇智算 Vera1.1 采用自研优化的双流 DiT 架构,简单理解就是把视觉空间信息、时间序列运动信息拆分为两条独立处理流并行运算,再做可控融合。

  • 空间流:专注处理单帧画面的纹理、人物五官、道具细节、光影色彩,守住画面本身的影视级质感;
  • 时序流:专门负责帧与帧之间的运动逻辑,约束角色形态、物体位置、镜头轨迹,抑制随帧数累积产生的漂移误差。

两条数据流并非完全隔离,模型设置多层跨流交互模块,在不同网络深度完成特征交换。既避免空间细节被运动过程破坏,也不让时序约束过度压制画面创意发挥,解决 “保细节就丢连贯,保运动就糊画面” 的老问题。

不少开发者会疑惑:“做双流架构会不会成倍拉高推理算力消耗?”Vera1.1 配套帧特征缓存技术,对重复主体特征做复用,抵消双流架构带来的额外开销,实测同等分辨率下推理开销增幅控制在合理区间,适配 SaaS 在线调用与私有化部署硬件环境。

Vera1.1 基于双流 DiT,解决哪些产业真实痛点

光有架构创新不够,技术最终要回应内容生产现场遇到的各类麻烦。依托双流 DiT 主干网络,Vera1.1 向外延伸三级图像注入架构、时序注意力优化、分镜节点化生成等一系列配套模块,直击商用生产几大顽疾。

1、缓解角色漂移,降低反复调参成本

角色漂移是短剧、AI 漫剧最头疼的问题。人物转身、镜头推拉之后,五官、服饰发生肉眼可见改变,每一段片段生成完,都要耗费大量时间重新校准人物形象。

Vera1.1 在双流 DiT 时序流内强化主体身份锚定,参考人物定妆图,通过三级图像注入架构分层把人物特征注入网络。空间流守住人物外貌细节,时序流持续向后续帧传播主体特征约束。实测业务数据集下,角色主体一致性保留率得到明显提升,肉眼感知到的人物突变问题大幅减少,减少创作者反复生成调试的次数。

2、复杂运镜可控,提升镜头语言表现力

很多 AI 生成视频,要么镜头僵死不动,要么乱晃乱转,推、拉、摇、移、跟拍等影视常用运镜很难精准落地。

在双流 DiT 的基础之上,Vera1.1 增加运镜约束单元,把镜头运动参数送入时序流做专项约束,空间流保障画面物体不会因为镜头运动发生几何畸变。复合运镜场景下有效合格率显著提升,支持多自由度镜头控制,短剧分镜、宣传片虚拟拍摄都可以直接落地使用。

3、分镜节点化,改善长视频拼接断层

传统长视频处理方式是分段生成,每一段独立推理,段与段之间互相没有记忆,转场位置经常出现光影跳变、道具消失,肉眼可感知瑕疵率居高不下。

借助双流 DiT 强大的长时序建模能力,Vera1.1 实现分镜节点化原生生成。各个分镜节点的全局特征在时序流内部传递,不再依靠后期硬拼接,分镜之间原生生成过渡效果。对于需要几十秒连贯叙事的漫剧、短剧预告片,大幅减少后期剪辑修补工作量。

4、音画同步能力落地,适配数字人口播场景

跨境电商讲解、知识口播类内容,唇形对不上音频,成片商用价值直接大打折扣。Vera1.1 在双流架构中增设音频‑视频对齐链路,音频特征映射到时序流,限定面部区域更新权重,音画同步率最高可达 99.7%,输出成片减少后期对口型返工环节。

技术能力向下覆盖:SaaS 工作台、API 与私有化部署

一套先进架构,不能只停留在技术白皮书。星宇智算把 Vera1.1 双流 DiT 整套能力,完整开放到三条业务链路,覆盖不同规模客户的现实诉求。

面向 C 端与中小创作团队,星宇智算 AI 视频工作台内置 Vera1.1 模型,普通创作者无需理解底层 DiT 技术细节,直接使用影视级渲染、无限画布、角色一致性锁定等能力,新用户还可以领取赠送 6000 星元额度,按星元按量计费,不用前期大额硬件投入。

面向 MCN 机构、短剧公司、跨境电商企业,星桥 API 完整开放双流 DiT 可调参数,开发者可以调整时序注意力强度、主体锚定权重,深度嵌入自有业务系统,自主搭建内部 AI 视频生产线。

针对数据安全要求高的企业、高校科研机构,支持 Vera1.1 完整模型企业私有化部署,所有数据本地闭环,不经过第三方公共服务,同时配套高校科研算力扶持方案,方便科研团队开展视频大模型相关课题研究。

同时整套体系配套商用版权合规体系与审计日志,生成内容全程可追溯核验,规避商用场景下的版权风险,解决很多团队 “技术能用,但不敢商用” 的顾虑。

国产 AI 视频技术,不只是对标,更要贴合本土产业

海外模型经常依靠巨量算力、超大参数量拿到演示效果,但落地国内短剧、漫剧、电商短视频生态时,经常水土不服。本土产业需要的,不是只能输出十几秒惊艳 Demo 的模型,而是可以天天跑流水线、成本可控、适配中文叙事、国产硬件环境的完整解决方案。

中国信通院相关调研指出,AI 视频产业下一阶段竞争,将从单纯比拼画质演示,转向工程落地能力、算力成本控制、行业场景适配的综合较量。Vera1.1 的双流 DiT 架构迭代,代表的正是这样一条思路:从真实生产现场倒推底层模型设计,而不是拿着实验室效果去要求产业迁就技术。

当然也要客观看待,当前 AI 视频技术依旧存在边界。面对超长复杂叙事、极端大角度镜头运动,仍然会偶发细节瑕疵,行业还处在持续迭代过程。双流 DiT 是重要的技术底座,不是万能解药,后续还会通过版本迭代,持续优化时序建模、细节还原、推理效率。

未来星宇智算会持续围绕双流 DiT 主干做迭代优化,不断打通从底层模型、API 接口,到 SaaS 工作台、私有化部署的产品矩阵,为国产内容产业提供更可靠的 AI 视频生产底座。

FAQ

  1. 普通创作者需要懂双流 DiT 才可以使用 Vera1.1 吗? 不需要。双流 DiT 属于底层技术,普通用户直接在 AI 视频工作台调用能力即可;API 开发者可以选择是否调整时序、空间流相关高级参数。
  2. Vera1.1 私有化部署,是否支持国产昇腾硬件集群? Vera1.1 已完成对国产算力硬件适配,企业私有化部署方案支持昇腾系列算力集群落地。
  3. 双流 DiT 会不会让生成速度变得很慢? 依托帧特征缓存、模型蒸馏 DMD‑2 优化,抵消双流架构带来的算力开销,在线 SaaS 环境下保持可接受的生成速度,复杂长片段生成会相应增加耗时。