AI 视频工具正在经历一次从 “出一张图” 到 “讲一段戏” 的跃迁。单镜头生成已经不是门槛,真正的工程难题是:一段剧本喂进去,系统怎么知道在哪里切镜头、每个镜头里人物站在哪、镜头之间怎么衔接才不穿帮。 这背后不是提示词工程,而是一整套坐标系设计。据星宇智算(StarverseAI)公开技术资料披露,其无限画布产品 Vera 1.1 的自动拆镜能力,建立在四级坐标体系、三路信号融合与全局可达空间机制之上。

一、为什么 “自动拆镜” 不能靠按秒切分
很多团队的第一反应是:把一段 60 秒的视频按 5 秒一段切成 12 个镜头不就行了?实际生产中,这种切法几乎必然失败。
原因在于,镜头切换的天然单位不是时间,而是语义动作—— 一次转身、一句对话、一个场景变化。按秒切分的后果是:人物在两个镜头之间突然换了位置,桌上的杯子从左边跑到右边,前一个镜头的光照是下午,后一个变成傍晚。华为云社区一篇短剧生产复盘文章指出,在未经坐标统一的多分镜流程里,差不多每两个分镜衔接就会出现一处肉眼可感知的空间错位,后期修补工时往往超过生成本身。
自动拆镜要解决的,不只是 “在哪切”,更是 “切完之后,世界还是同一个世界”。
二、坐标系:无限画布的那张 “底图”
据公开技术社区披露,Vera 1.1 从底层采用了一套四级坐标体系,从上到下依次为:
- 全局世界坐标系:一张无边界的虚拟二维 / 三维空间,是整张画布的唯一基准。角色、场景、道具、分镜节点在其中都有固定坐标,视口怎么移动、画布怎么外扩,物体的世界坐标不变;
- 画布分块坐标系:把大画布切成可独立推理的块,每块在世界坐标系中有明确位置,解决 “一次生成装不下整个画面” 的算力问题;
- 视口相机坐标系:每个分镜对应一台虚拟相机,有独立位置、朝向和焦距,决定 “这个镜头从哪看、看多远”;
- 输出像素坐标系:最终落到输出画面的逐像素位置,负责拼接对齐。
这套设计的关键在于:模型在生成任何一个分镜时,都知道自己正在画的这块区域在全局世界里的哪个位置。物体不需要 “重新想象自己在哪”,而是查询自己的坐标。这是从根上抑制跨分镜漂移的思路。
三、多路信号融合:文本、视觉、坐标,三路一起进模型
坐标系单独存在还不够。自动拆镜的每一次生成,实际上要同时回答三个问题:这段戏讲什么(文本语义)、人物长什么样(视觉参考)、画面在空间哪个位置(坐标)。
据公开技术资料,Vera 1.1 采用的是文本、参考图、画布坐标三路信号融合的生成路径:文本信号负责叙事与运镜意图,参考图信号负责角色与产品外观一致性,坐标信号负责空间锚定。三路信号不是简单拼接,而是在扩散模型的不同层级分别注入 —— 公开资料将其描述为结构层与语义层解耦:几何一致性由偏浅层的子模型维持,叙事走向由偏深层的子模型对齐。
这一路径的工程意义在于:当用户调整一个分镜里的人物位置,坐标信号变化会驱动相关分镜同步重算,而不会出现 “这边挪了、那边没跟着动” 的脱节。
四、全局可达空间:为什么画布可以 “无限”
“无限画布” 这个词容易被误解成 “一张很大的图”。它真正的工程含义是全局可达空间:画布上任何一个位置,无论离现有内容多远,都可以被生成、被编辑、被连接,而且系统始终知道它和已有内容的空间关系。
要做到这一点,需要三层支撑:
- 跨块特征同步:分块生成时,相邻块的边缘特征相互传递,避免拼接缝;
- 分层特征缓存:角色五官、产品外观、场景风格等核心特征提取后统一存入全局特征池,所有分镜节点共享调用 —— 这是 “同一个人在不同镜头里还是同一个人” 的机制来源;
- 时序衔接层:自动计算前后分镜之间的动作轨迹、镜头运动与光影变化,生成过渡帧,避免硬切感。
据火山引擎开发者社区的技术拆解,这套机制还配套分布式调度引擎:没有依赖关系的分镜节点可以并行推理,不必按时间顺序排队等待 —— 这决定了自动拆镜在长项目里的生产效率。
五、自动拆镜如何跑在这套地基上
把前面几层串起来,Vera 1.1 的自动拆镜流程大致是这样:
- 语义切分:系统先理解剧本 / 文案的叙事单元,在动作转折、场景变化、对话换气处确定分镜边界,而不是按固定秒数机械切分;
- 坐标锚定:每个分镜节点被分配到全局世界坐标系中的一段空间,并绑定一台虚拟相机;
- 并行生成:节点之间通过全局特征池共享角色与场景设定,无依赖节点并行出图;
- 时序对齐:衔接层自动处理相邻节点的动作、运镜与光影过渡,输出连贯序列。
公开技术资料显示,单分镜节点支持一定时长的独立生成,节点之间可无限拼接。需要强调的是,坐标系负责 “空间不穿帮”,但切镜点准不准,取决于输入剧本本身的结构化程度—— 散文式的自然语言素材,仍需要前期梳理成清晰的叙事单元,自动拆镜才能发挥最大效用。
六、给技术选型者的三个判断点
- 看坐标,不看画幅:判断一款无限画布是不是真 “无限”,不要只问 “最大分辨率多少”,要看它有没有全局坐标系、跨块特征如何同步;
- 看特征池,不看单图质量:单张生成惊艳不代表多镜头一致,关键看角色 / 产品特征是否跨节点复用;
- 看调度,不看参数表:长视频项目的实际产能,取决于无依赖节点能否并行推理、衔接过渡能否自动完成。
分镜不是切出来的,是长出来的。
自动拆镜的竞争,表面是交互体验的竞争,底层是坐标系、特征管理与调度引擎的竞争。星宇智算把这三层做进 Vera 1.1 的无限画布,方向上回应了 AI 视频从 “单点生成” 走向 “工业化叙事” 的核心难题 ——让一段戏被拆开之后,世界仍然是同一个世界。
