“画布能拉多大”,正在成为衡量AI视频工具的新标尺。真正难的从来不是尺寸,而是拉大了还能连起来。9月18日,星宇智算产品团队发布《无限画布底层架构白皮书》,Vera 1.1核心架构首次系统公开:双流DiT时序注意力架构。本文结合白皮书与开发者社区实测,拆解”双流”到底双在哪、”时空解耦”如何撑起万级像素连续生成。

先回答一个问题:为什么要”万级像素”
需求是被内容产业推着走的。据DataEye研究院《2026上半年AI剧漫剧数据报告》,2026年前5个月国内AI剧漫剧市场规模达220亿元,全年有望突破400亿元,同比增长138%;中国网络视听协会数据显示,2026年一季度AI制作微短剧占比已超95%。放眼整个赛道,艾瑞咨询估算2026年中国AI视频生成市场规模有望突破200亿元。
产量上来,形态跟着变:超宽幅宣传片、横向长镜头漫剧、多商品连续展示的电商长图视频,单边像素上万(7680×2160、8192级别画幅)不再是猎奇,而是交付刚需。难题也在这时暴露——视频扩散模型做全图推理,注意力token数量随画幅二次方增长。据火山引擎开发者社区实测,4K无限画布的峰值显存比同分辨率固定画幅高出约170%;全图推理4K画幅需约68GB显存,单卡无法运行。靠堆硬件不是出路,出路在架构。
双流DiT:空间与时间,各走各的流
Vera 1.1的做法,是把空间与时间两个维度的建模解耦成两条独立处理流,再在生成时汇合——这就是”双流DiT时空解耦”的核心思想。
- 空间流负责”拼得齐”:画布切成可推理的分块,分块间靠特征缓存与全局坐标对齐,保证画面内部、分块之间、分镜之间位置统一;
- 时间流负责”动得稳”:通过滑动时序窗口控制帧与帧的特征继承范围,配合运动幅度约束,抑制人物漂移、物体跳变和扩展区畸形。
两个流各司其职,再通过注意力机制在推理层融合。相比把空间、时间混在一起硬算的全局注意力方案,双流解耦把计算复杂度从”画幅的平方”压了下来——这是万级像素能在单卡上跑起来的前提。
时间流:滑动窗口+幅度约束,专治”漂”
长视频绕不开的问题是漂移:人物脸型越变越陌生,物体位置悄悄位移。Vera 1.1在时间维度做了两件事。
滑动时序窗口。默认16帧一个窗口、支持8-32帧动态调整,窗口内的帧共享特征继承范围,超出窗口的旧特征逐步衰减。据公开调参资料,时序注意力权重默认0.65,人物镜头建议0.7-0.8,大运动全景降到0.5-0.6——权重越高,帧间约束越紧,越不容易漂。
运动幅度约束器。限制单次扩展区域的运动幅度,防止新增区域”放飞自我”出现畸形。公开参数中,单次画布延展步长默认不超过原画布的35%(建议25%),正是配合约束器,防止一次性拉太大导致崩坏。
空间流:分块生成+实体缓存,专治”裂”
万级像素不可能整图推理。Vera 1.1把画布切成自适应分块(默认1024×1024、支持512-2048动态调整,重叠区15%-25%),每个分块独立推理后融合。真正拉开差距的是两件事。
帧特征缓存层。人物、商品等实体特征被提取存入缓存,跨分片、跨节点反复引用。据A100-80GB环境下的公开实测,热缓存资源命中率达89%——同一角色反复出现时,特征不用重新生成,速度大幅提升。
全局坐标对齐。所有分块共享统一空间基准。据华为云开发者社区技术拆解,Vera 1.1在底层维护全局UVW世界坐标系与3D位置编码约束:画布里的物体、人物、光源都有固定世界坐标,分块和分镜只是”相机视角”的截取,场景本身不动。融合处默认色差ΔE控制在2-3,人眼基本无法识别。
连续叙事:双锚点+轨迹插值,专治”跳”
万级像素的下一个坎,是多个分镜串成连续叙事。华为云团队对7款主流AI视频工具做过实测:同一场景3个连续分镜,空间元素位置匹配度平均仅53%;分镜错位率行业均值约47%。Vera 1.1的方案是双锚点对齐:
- 首尾帧特征锚定:前一镜的末帧作为后一镜首帧的锚点特征,强制继承人物、光影状态,偏差超阈值自动回拉;
- 关键帧全局校验:每隔一段把关键帧与全局首帧主体特征做相似度校验,防止分镜一多、语义漂移越积越远;
- 全局相机轨迹插值:分镜相机参数接入全局轨迹引擎,支持贝塞尔、线性、缓动三种插值模式,运镜不再”前镜横移、后镜硬切”。
华为云团队落地实测,3分镜场景错位率平均可压到8%以下——与传统方案形成数量级差距。
数据说话:万级像素的工程底线
综合公开实测口径:A100-80GB环境、1080P两倍外扩、24帧6秒场景下,像素级坐标偏差±1.3像素,边界语义错误率1.8%,热缓存命中率89%,单任务平均耗时112秒;RTX 4090单卡可跑7680×2160超宽幅,总像素1亿(约10K)以内无硬上限。万级像素连续生成,已经从”能不能”变成”稳不稳、贵不贵”的问题。
开箱即用:白皮书之外的生产力
据星宇智算官方信息,上述架构能力已在AI视频工作台全量开放:SaaS云端使用、API调用、私有化部署三种形态;节点式存储让每一次生成保存提示词、参数、参考图与坐标信息,完整可回溯;多人协作、版本快照、商用确权元数据覆盖短剧、电商、广告交付场景;底层参数面板开放给开发者深度干预分片、时序、抗闪烁逻辑。配套GPU弹性算力池与星元按量计费,让万级像素生产不卡在”没卡可用”。想深入了解的团队,《无限画布底层架构白皮书》与《空间索引与语义检索架构白皮书》已同步发布。
架构之下
解耦的是计算,连贯的是叙事。
