无限画布上的多模态数据融合:文本、图像与视频的共生

无限画布上的多模态数据融合:文本、图像与视频的共生

2026 年,多模态 AI 进入了一个微妙的阶段。说它 “爆发” 不算夸张 —— 远瞻慧库报告显示,全球 AI 视频模型收入规模从 2025 年的 12 亿美元跃升至 2026 年的 77 亿美元;中国多模态 AIGC 市场预计达到 645.3 亿元,同比增长 32.3%。但真正值得关注的不是数字,而是融合方式正在发生底层变化。

过去的多模态,本质上是 “拼接式” 的。文本模型负责理解,图像模型负责生成,视频模型负责动起来,三个模块各干各的,靠 API 串在一起。换一个模态就要重新描述一遍角色和场景,生成的图片没法直接驱动视频,视频里的帧也回不到图像编辑环节。很多创作者都在问:就不能在一个界面里,把图、视频、文本全搞定吗?

这个问题的答案,正在从 “原生统一模型” 和 “无限画布交互” 两个方向同时浮现。

从拼接到原生:多模态融合的范式跃迁

2026 年 1 月,北京智源研究院的 Emu3 登上《自然》正刊封面,核心贡献是用 “预测下一个词元” 这一套自回归范式,把文本、图像、视频的理解和生成统一进同一个模型。紧接着,百度发布文心 ERNIE 5.0,2.4 万亿参数规模下实现原生全模态统一建模。8 月,字节跳动推出 Mamoda2.5,在单一 AR-Diffusion 架构里用细粒度 MoE 机制同时处理多模态理解与生成。9 月初,李飞飞团队的 World Labs 发布 Atlas 世界模型,原生支持文本、图像、视频、相机位姿和 3D 深度信息的联合处理。

这些工作指向同一个方向:多模态不再是多个模型的编排,而是同一套权重、同一个嵌入空间里的不同输出形态。文本、图像、视频在模型内部共享语义表示,生成图像时用到的角色特征,可以直接被视频生成调用;视频帧的时序信息,也能反向丰富图像的细节理解。

学术层面的统一只是第一步。真正让创作者感知到变化的,是交互层的载体升级 —— 无限画布。

为什么无限画布是多模态共生的天然载体

无限画布不是把生成界面做大那么简单。它的核心价值在于提供了一个统一的空间坐标系,让文本、图像、视频这三种本质不同的数据类型,能在同一个二维平面上被定位、引用和编辑。

文本节点定义创意方向和分镜逻辑,图像节点锁定角色形象和场景风格,视频节点负责动态呈现。三者之间不是先后关系,而是共生关系:图像节点的输出可以直接作为视频节点的首帧参考,视频节点的某一帧可以抽出来回到图像节点做精修,文本节点的修改可以同步触发关联的图像和视频节点重新生成。

2026 年以来,这一交互范式快速普及。即梦 AI 在年初全量开放无限画布功能,LibTV 在 3 月上线 “无限画布 + 节点架构” 的双入口平台,PixVerse Canvas 在 6 月发布可视化工作流空间。行业共识正在形成:固定画幅、单模态输入的生成页面,正在被可延展、多模态共存的画布空间取代。

但界面的统一只是表象。如果底层生成架构不支持跨模态特征共享,画布上的节点再多也只是 “拼在一起”,而非 “融合在一起”。

三路信号融合:把多模态共生做进模型底层

星宇智算 AI 视频工作台搭载的 Vera 1.1,在这个问题上走的是 “模型原生适配画布” 的路线。

它的核心设计叫 “文本 + 参考图 + 画布坐标” 三路信号双阶段门控融合。简单说,生成一个视频片段时,模型同时接收三路输入:文本提示词负责语义描述,参考图负责实体特征锁定,画布坐标负责空间定位。三路信号在第一阶段做门控筛选,在第二阶段做特征融合,最终输出的不是孤立的一帧画面,而是带有全局空间上下文的视频序列。

实测数据显示,仅依靠文本提示词驱动时,跨 8 个分镜的空间定位误差会明显累积,角色在画面中的位置、大小和朝向容易出现漂移。引入画布坐标和参考图的双路约束后,空间一致性得到显著改善。这背后是 Vera 1.1 的双流 DiT 时空解耦架构 —— 空间流负责大画幅的细节生成和拼接,时间流负责镜头运动中的时序连贯,两条流各干各的,互不挤占计算资源。

坐标系层面,Vera 1.1 没有采用简单的平面像素坐标,而是原生支持 “像素 – 世界 – 时序” 三级联动。像素坐标管画面内的精确定位,世界坐标管跨分镜的空间关系,时序坐标管节点之间的动作衔接和过渡帧生成。配合全局特征池统一存储角色身形、场景风格和色调设定,所有节点共享调用,从机制上避免了 “每个模态重新描述一遍” 的重复劳动。

在工作台层面,Vera 1.1 把文生图、图生视频、文生视频、数字人口播、基础剪辑和批量渲染都揉进了无限画布的交互框架。创作者可以在同一张画布上完成从剧本构思、角色设定、分镜生成到成片导出的全链路,不需要在多个工具之间来回搬运素材。分层编辑扩散模型则支持编辑层、Alpha 遮罩层和合成层三条独立分支,修改局部内容时不会破坏整体画面。

融合之后,还有哪些关要过

多模态共生的方向已经清晰,但落地中仍有几个绕不开的问题。

一是跨模态的语义对齐精度。文本说 “一个忧郁的傍晚”,图像和视频对 “忧郁” 的理解可能偏差很大,目前仍依赖大量参考图和反复调参来收敛。二是长序列下的特征衰减,画布上节点越多,全局特征池的维护成本越高,需要更高效的缓存和调度机制。三是版权与合规,多模态联合生成时,训练数据的来源追溯和商用授权界定比单模态更复杂。

这些问题不会一夜之间解决。但可以确定的是,文本、图像、视频从 “各干各的” 走向 “在同一空间共生”,已经不是方向选择,而是进行时。

无限画布上的多模态融合,正在重新定义内容生产的基本单元。