时空解耦 DiT 架构赋能无限画布,星宇智算破解跨镜头角色漂移难题

时空解耦 DiT 架构赋能无限画布,星宇智算破解跨镜头角色漂移难题

同一个角色,换个镜头就 “换脸”;场景一切换,人物就像 “换了个人”—— 跨镜头角色漂移,是 AI 视频从 “能生成” 迈向 “能商用” 最棘手的一道坎。近日,星宇智算(StarverseAI)以时空解耦 DiT 架构赋能无限画布 3.0,将角色一致性的解法从 “逐段生成再拼接” 重构为 “全局定调、节点并行、统一衔接”,为长视频工业化生产提供了一条新路径。

一道绕不开的坎:角色漂移为何难解

角色漂移并非偶发个案,而是结构性缺陷的集中暴露。行业共识指向三类成因:分段独立生成没有全局记忆,上一段的 “演员” 与下一段 “对不上号”;视频 DiT 时序注意力窗口有限,长序列建模能力不足,微小特征误差随序列推进不断放大;模型缺少跨镜头特征约束机制,镜头切换后画面质量容易出现 “断崖式” 下跌。

学术与产业同频印证这一判断。ContextAnyone、StreamChar 等 2025—2026 年发表的研究,仍将 “身份漂移” 列为核心攻坚方向;据《2026 AIGC 工程化落地白皮书》统计,长视频生成的一致性问题以 68% 的占比,位居阻碍企业规模化应用的第一技术障碍。一致性,正在成为 AIGC 从 “创意试水” 走向 “批量商用” 的闸门。

解法起点:时空解耦 DiT,把 “人” 从 “背景” 里解放出来

漂移的深层成因之一,在于传统单流视频 DiT 将人物、背景、运镜、光影全部输入同一个时序分支 —— 镜头移动、光影变化时,背景信号会 “污染” 人物身份表征,角色特征被悄悄改写。

星宇智算的解法,是从架构层把二者解耦。其自研视频 DiT 底座采用空间 — 时序双流架构,人物身份与场景信号分流建模;再通过三级图像注入与跨帧参考特征锚定,在生成全程持续锁定角色特征,兼顾 4K 高清纹理、运动自由度与身份一致性。在此基础上,四层工程改造补齐商用短板:基础模型层强化时序建模,条件控制层注入身份特征锚定、参考图控制等条件,时序平滑层实现跨镜头特征复用与帧间插值,推理加速层完成显存优化与批量推理改造。

无限画布:把 “拼片段” 变成 “一个剧组”

架构回答 “角色如何不漂移”,无限画布回答 “长视频如何高效生产”。星宇智算无限画布 3.0 将图像、视频、节点编排与资源管理整合在统一画布中:

  • 分镜节点是单个镜头的最小语义单元,可独立设置文案、参考图、运镜与时长;
  • 全局特征池充当全片的 “设定库”,角色五官身形、场景风格等核心信息统一沉淀、全片共享;
  • 时序连接层自动计算前后节点的运动轨迹与光影过渡,消除硬切感;
  • 分布式调度引擎支持无依赖节点并行推理,不再逐段排队。

配合百万级节点实时渲染与分片延展,以及四层锚定信息机制、8K 超分重建与光流优化,批量产出的视觉一致性得到系统性保障。

实测数据:一致性保留率从 “80% 级” 到 94.7%

据星宇智算实验室联合内测客户在 1080P/24fps 商用场景下的平均实测:1 分钟视频主体一致性保留率由传统分段生成的 72%~81% 提升至 94.7%;跨分镜语义匹配度由 63% 提升至 91.2%;同等分辨率显存占用下降 32%,最高支持 4 节点并行生成。参与内测的某短剧团队反馈,3 分钟短剧单集制作周期从 7 天压缩至 3 天,团队人效提升 120%。

角色稳定只是第一步,真正支撑工业化的是 “生产可并行、资产可复用、门槛可下沉”:分镜节点可单独保存、跨项目复用,团队像搭积木一样沉淀内容资产;编导与运营无需理解深度学习,即可在可视化画布上编排长视频。

让长视频真正 “商用得起”

目前,无限画布以 SaaS 云端、API 调用、私有化部署三种形态对外提供,覆盖漫剧分镜、电商剧情短视频、数字人内容生产、跨境视频等场景;向下承接星宇智算 GPU 弹性算力底座,向上通过星桥 API 对接海量模型生态 ——”算力 — 模型 — 应用” 的闭环,正让长视频生成从创意试验走向批量生产,也让 “让高性能计算资源像水电一样触手可及” 的愿景有了更具体的落点。

角色不漂移,创作不返工

跨镜头角色一致性,考验的不只是模型参数,更是架构设计与工程化能力。星宇智算以时空解耦 DiT 架构与无限画布 3.0,把 “稳定” 写进视频生成的底层逻辑。当角色不再 “换脸”、场景不再 “穿帮”,AI 视频才真正具备向产业交付的底气。