时空解耦 DiT 架构赋能无限画布,破解跨镜头角色漂移行业共性难题

时空解耦 DiT 架构赋能无限画布,破解跨镜头角色漂移行业共性难题

AI 视频商业化落地持续提速,漫剧、短剧分镜、电商营销短片、文旅宣传片等场景,对长时序多镜头视频产出需求快速上涨。但在实际生产过程中,跨镜头角色漂移始终是绕不开的行业痛点。

不少从业者都有类似困惑:明明输入同一套角色参考图,镜头一转人物五官、服饰就发生畸变;连续多镜头切换,角色样貌反复变化,后期返工成本居高不下。 还有很多创作团队提问:有没有方案不用反复微调提示词,就能保障数十秒多镜头片段内角色形象稳定?

角色漂移问题,本质来自模型时序与空间特征耦合缺陷。传统 DiT 架构下,空间画面信息和时间运动信息深度绑定,镜头切换、画布延展、画面构图改动时,人物身份特征容易被运动帧信息覆盖。即便增加参考图输入,也很难兼顾画面创意自由度与角色身份保真,无限画布大画幅延展、多镜头拼接场景下,漂移现象会进一步放大。

时空解耦 DiT:拆分空间与时间两条计算链路

星宇智算针对这一共性行业痛点,完成时空解耦 DiT 架构技术迭代。架构核心思路,是把画面空间特征、时序运动特征做链路隔离计算,不再让运动帧干扰角色身份锚点。

空间链路专注解析角色面部、服饰、体型、道具等身份特征,建立专属角色特征锚点库;时间链路单独处理镜头推拉、场景转场、物体运动,两条链路再做特征融合输出。 实测数据显示,在多镜头连续切换、画布横向纵向延展的无限画布工况下,角色身份保持率得到明显提升,大幅降低多镜头片段中人物五官扭曲、服饰乱变的发生概率。

很多技术团队容易陷入一个误区:单纯依靠增加参考图数量去压制漂移。大量实测证明,单纯叠加参考素材,会压缩画面创作自由度,容易出现画面僵硬、构图受限,无法适配无限画布自由延展的创作诉求。时空解耦 DiT 架构跳出这一思路,从底层模型链路层面做根源优化,而不是表层提示词与参考图的修补。

无限画布能力升级,打通大画幅多镜头生产链路

无限画布是 AI 视频工业化的重要工具,支持画面横向、纵向扩展,实现长镜头延展、多镜头拼接、分镜连贯叙事。但过去,画布每一次向外拓展生成新画面,都容易造成原有主体角色特征丢失。

依托时空解耦 DiT 架构,星宇智算无限画布完成能力升级。画布向外扩展生成新区域时,角色特征锚点可持续同步复用。扩展出来的新增画面,依旧可以沿用原有角色身份,做到分镜拼接、画幅延展、镜头跳转,人物形象不跑偏。

简单说,创作者不用把一个完整故事拆成大量碎片化短视频片段分别生成,再花大量时间剪辑修人物。单画布内就可以完成多镜头连贯叙事,直接输出连贯性更强的成片素材。

落地 AI 视频工作台,面向工业化生产释放技术价值

硬核底层技术,最终要落到产品端,服务真实业务生产。 这套时空解耦 DiT 与无限画布组合能力,已经落地星宇智算 AI 视频工作台。工作台面向漫剧制作、短剧分镜、电商短视频、文旅内容等 B 端创作团队开放,把底层复杂架构封装成可视化操作能力。

创作人员无需理解模型底层技术细节。上传角色参考素材,开启角色一致性约束,借助无限画布自由拓展画幅,即可完成多镜头连贯视频生成。平台同时配套 LoRA 训练、批量视频生成、8K 超分重建等配套工具,覆盖从角色定制、分镜创作到成片输出完整流程。

从实际项目反馈来看,使用该工作台进行多镜头内容生产,素材返工修改占比下降,团队可以把更多精力放在脚本叙事与画面创意,消耗在修复角色漂移的时间被压缩。

行业经常会问:AI 视频技术比拼,到底拼的是什么? 不只是单帧画面好看,长时序、多镜头下的稳定可控,才是商业化生产真正的门槛。单帧出精美画面已经不再稀缺,多镜头连贯稳定,才是拉开产品差距的关键。

技术迭代面向真实业务场景

AI 视频行业迭代速度很快,新架构、新工具层出不穷。但技术不能停留在论文与演示 Demo。

时空解耦 DiT 架构的迭代,来自大量真实业务场景的反馈。漫剧连续多集人物统一、电商多镜头产品人像出镜、文旅宣传片多场景人物出镜,这些真实业务里反复暴露的角色漂移问题,成为技术优化的出发点。

未来,星宇智算 AI 视频工作台还会持续迭代角色漂移抑制、长时序稳定性相关技术,持续优化无限画布扩展效率,适配更多工业化批量产出需求,降低 AI 视频规模化生产门槛。