深耕视频生成底层架构,星宇智算 Vera 1.1 优化双流 DiT 模型运行效率

深耕视频生成底层架构,星宇智算 Vera 1.1 优化双流 DiT 模型运行效率

AI 视频产业已经从概念验证转向规模化商用生产,双流 DiT 凭借双分支并行处理的特性,成为现阶段文生视频、图生视频主流底层架构方案。但行业普遍面临现实问题,高分辨率、长时序视频生成过程中,算力消耗高、推理周期长、显存占用压力大,直接抬高短剧、电商短视频批量产出的落地成本。不少企业用户会提出疑问:“DiT 架构效果很好,为什么跑起来算力开销这么大?” 也有开发者关心:“效率优化会不会直接拉低视频生成画面质量?”

针对产业落地的真实痛点,星宇智算发布 Vera 1.1 版本,聚焦双流 DiT 模型底层推理链路开展工程迭代,在保留双流架构多模态协同优势的基础上,优化特征缓存调度、跨模态注意力计算逻辑,平衡生成画质与推理开销,相关技术成果同步落地至星宇智算・AI 视频工作台,面向创作者与企业客户开放调用能力。

双流 DiT 商用落地的现存技术卡点

双流 DiT 架构划分视觉时空分支与条件控制分支,视觉分支负责视频帧空间信息、帧间运动轨迹运算,条件分支独立解析文本、参考图像、音频等输入条件,两个分支依靠跨模态注意力完成信息交互,天然适配多模态联合视频生成任务。

这套架构可以改善传统 3D‑UNet 方案容易出现的主体漂移、属性错乱、音画时序错位等问题,但原生模型存在固有短板。长序列推理时,重复注意力计算带来大量冗余算力消耗;普通特征缓存复用方案会累积时序误差,视频后半段容易出现人物变形、物体细节崩坏;高并发批量生成场景,GPU 资源利用率波动明显,单卡显存压力陡增36氪。

从行业实测数据来看,未经过深度工程调优的双流 DiT 模型,1080P、6 秒视频片段,单 A100 推理耗时普遍在 75‑110 秒区间,批量任务排队时延迟还会进一步放大,很难适配 MCN、跨境电商日均数百条视频的生产需求CSDN博…。

Vera1.1 底层优化核心技术路径

Vera1.1 没有改动双流 DiT 主干网络基础权重,以推理层工程优化为核心,落地三项关键改进,全程不依赖重新预训练大模型,规避训练带来的时间与数据成本。

第一,自适应时序特征缓存校正机制。针对普通缓存方案误差滚雪球问题,对不同去噪步骤做动态缓存策略,区分静态画面与高运动镜头,高动态片段降低缓存复用比例,静态场景提高复用频次,抑制时序偏差累积,降低人物、商品主体变形概率。

第二,跨模态注意力稀疏调度。对双流分支交互过程中非关键 token 做过滤裁剪,保留文本语义锚点、画面主体特征相关计算,削减无效 FLOPs 开销,实测在 1080P 视频任务中,整体计算量下降约 32%。

第三,混合精度动态显存管理。结合 FP8 权重加载与动态显存回收,根据视频分辨率、序列长度实时分配显存资源,避免显存碎片占用,降低硬件门槛,同等任务条件下显存占用下降 27%。

内部基准测试环境采用单张 A100‑80G 显卡,统一测试样本为 1080P、6 秒、30 帧视频。Vera1.1 对比基线双流 DiT 模型,端到端推理耗时由 92 秒缩短至 54 秒,推理速度提升 41%;主观评测与 LPIPS 客观指标验证,画面细节、运动连贯性无明显损失,没有出现为速度牺牲画质的现象。

需要说明,加速效果会受输入提示词复杂度、画面运动强度影响,高动态打斗、多镜头切换场景,提速幅度会出现合理浮动。

技术能力向业务端落地,赋能 AI 视频工作台

底层架构优化成果,直接输出到星宇智算・AI 视频工作台,普通创作者、企业客户无需理解底层模型参数,即可直接使用优化后的推理能力。

工作台承接 Vera1.1 能力之后,文生视频、首尾帧图生视频、短剧分镜生成等任务,整体任务周转效率得到改善。企业批量提交视频任务时,算力调度模块配合优化后的模型推理链路,GPU 集群整体资源利用率得到提升,排队等待时长有所缩短。

平台同时保留原有业务能力:支持多画幅输出、角色一致性锁定、音画同步生成;星桥 API 对外开放 Vera1.1 调用接口,支持企业业务系统对接,也可支持私有化部署方案,满足数据本地留存的合规诉求starverse-…。新接入用户可领取平台赠送星元算力,直接体验优化后的视频生成效果。

不少团队实际使用中会遇到一类现实情况:同样的模型,本地跑和 SaaS 平台跑性能差距很大。这也印证,除模型本身之外,算力调度、显存管理、任务队列整套工程体系,才是决定商用落地体验的关键。

面向产业持续迭代底层推理能力

当前 AI 视频技术迭代,不止要看生成画面上限,更要看规模化生产的综合成本。模型架构创新、推理工程优化、上层业务工作台三者需要打通,才能把实验室技术转化为可落地的生产力工具。

星宇智算 Vera1.1 版本,完成双流 DiT 推理效率的阶段性打磨。后续版本会继续围绕长时序视频、更高分辨率场景,持续迭代缓存策略与注意力算法,持续向 AI 视频工作台输出底层技术红利,服务短剧、电商营销、数字人内容等多类生产场景。