AI 视频生成长期面临一个核心瓶颈:随着视频时长拉长,画面主体容易漂移、物体形态突变,局部帧之间的时序逻辑独立,很难维持跨片段、跨镜头的一致性。传统模型大多采用逐段生成、片段拼接的方案,单段内画面稳定,但一旦扩展到更长序列,就容易出现时空错位,全局时序信息断裂。

星宇智算(starverse-AI)无限画布,近期推出自研三级坐标体系,为长序列视频生成提供统一的时空定位框架,解决长视频全局时序对齐难题。
这套三级坐标体系,分为全局时空坐标、片段局部坐标、像素实例坐标三层,三层坐标相互耦合,而非互相替代。 全局时空坐标作为顶层基准,定义整个长视频序列统一的时间轴与空间边界,所有生成片段都锚定在同一个基准坐标系下,避免不同片段各自建立独立空间。片段局部坐标承接全局约束,在单镜头区间内做时序平滑插值,保证镜头内部运动连贯。像素实例坐标下沉到画面内的物体实例,追踪人物、道具、场景元素的位置、形态、属性,让同一个对象在跨越多个片段时保持身份统一。
在底层实现上,三级坐标体系与无限画布原有时空解耦 DiT、Layer-Diffusion 节点式引擎深度融合。坐标信息不是后期叠加的修正层,而是直接注入模型前向推理流程。模型在生成每一帧时,会同时读取三层坐标约束,把时序信息、空间位置、实例身份作为生成条件,而不是生成画面之后再做二次修复。这种原生嵌入的方式,减少拼接带来的断层,降低主体漂移、闪烁、物体 “穿模” 的概率。
和传统分段拼接方案对比,传统方法是先生成片段,后做融合,时序约束只存在于小段内,全局没有统一参照。而无限画布三级坐标体系,从序列构建之初就建立全局基准,长视频不再是多段短视频简单拼接,而是在同一个时空坐标系下连续推演。序列扩展时,可以持续向后延伸,也支持在视频中间插入镜头、调整某一段时长,修改局部内容而不破坏整个视频的全局时序,支持非顺序式长视频编辑。
在实际创作场景中,这一能力可以服务剧情短片、动态分镜、数字人长镜头、连续场景动画等需求。创作者可以先搭建完整故事时间线,再分段绘制画面,修改中间任意镜头,前后画面里的人物动作、场景透视、物体位置能够保持逻辑自洽,大幅降低反复调参、重绘修复的时间成本。
技术研发团队表示,三级坐标体系是星宇智算无限画布面向长序列视频持续迭代的重要一环。长视频的时序一致性,不只是画面看起来连贯,更要做到动作因果、场景空间、实例身份三者同步对齐。后续团队还会持续优化坐标追踪精度,提升超长时间序列的稳定性,拓展复杂多主体场景下的时序控制能力。
长视频生成的核心,是守住统一的时空。 依托三级坐标体系,星宇智算无限画布进一步拉长长序列生成边界,让 AI 视频创作,从单镜头生成走向全局可控的连续叙事。
