单流架构实现音画同生,口型同步准确率刷新行业纪录

单流架构实现音画同生,口型同步准确率刷新行业纪录

数字人短视频、剧集配音、跨境多语种口播,已经成为 AI 视频最高频的商用场景。

很长一段时间里,行业普遍沿用 “音频生成‑视频生成‑后期对齐” 的分离式流水线。先产出语音,再单独渲染人物画面,最后依靠外部插件做口型拟合。

这套流程能用,但痛点非常突出。

不少一线创作者都会遇到这类现实问题:

“语音换了一版,人物嘴部动作就要全部重新调一遍吗?”

“语速快、大段对白的时候,为什么口型经常错位、嘴部扭曲变形?”

这是工作台后台反复出现的用户提问。分离式方案存在天然的信息断层,音频特征和人脸视觉特征不在同一个模型空间。即便后期反复微调,遇到快语速、连读、多语种发音,错位概率会显著抬升。

行业公开评测样本显示,传统双流拼接方案,在连续长对白场景,有效口型匹配合格率普遍集中在 65%‑72% 区间。后期剪辑、逐帧修嘴,占据数字人内容接近三成的制作工时。对于 MCN 机构、跨境电商、短剧团队,这是实实在在的成本消耗。

分离式流水线,为什么很难做到高质量口型对齐

很多人误以为口型不准只是算法小 bug,实际上是架构层面带来的固有约束。

第一,音视信息割裂。音频编码器、视频生成模型两套独立模块,音频语义无法深度参与每帧人脸渲染,只能事后映射嘴部关键点。声音节奏一变,画面跟不上。

第二,动作冲突。面部表情、头部转动、眨眼、肢体动作和口型解耦不足。经常出现人物转头的时候,嘴巴完全乱跳。

第三,长时序衰减。对白持续时间拉长,时序特征逐步漂移,越到视频后半段,口型错位越明显。

第四,多语种适配短板。小语种、口音、快速连读场景,关键点映射容易失效,嘴部出现无意义抖动。

简单说:靠后期补对齐,属于 “亡羊补牢”,没办法从源头把声音和面部动作协同生成。想要本质改善,需要改变模型输入输出的底层范式。

Vera1.1 单流音画同生架构,音频深度参与视频推理

星宇智算 Vera1.1 落地单流音画同生端到端架构,不再采用音频、视频分开生成再拼接的旧路线。

音频梅尔频谱特征直接嵌入主生成流,音频语义特征和视觉帧特征在同一推理链路同步迭代。音频不再是生成结束之后拿来做对齐的外部附件,而是从第一帧开始就参与人脸、唇部、表情的联合渲染。

为了解决唇部细节崩坏问题,模型增设唇部细节约束分支,专门对口部区域做特征强化,抑制无意义抖动。同时和时序注意力模块联动,把语音节奏、停顿、重音映射到面部微表情,不止做到 “嘴对上声音”,还还原说话时的神态起伏。

内部标准化测试集覆盖中文、英语、东南亚多语种,包含快语速对白、长段独白、情绪台词等多种工况。实测数据显示,Vera1.1 口型同步综合准确率达到 99.7%;长对白片段口型有效匹配合格率提升至 92.3%。

“音画一起生成之后,会不会人物画质、面部细节被拉低?”

这也是商用客户十分关心的现实顾虑。

单流模式很容易出现的副作用,就是为了匹配口型,牺牲人物五官清晰度,面部糊化。Vera1.1 通过区域分层权重控制,平衡唇部约束与全局画面质量。唇部区域强化对齐权重,人脸其余部位维持原有渲染精度,兼顾口型准确度与影视级画面质感,规避顾此失彼。

完整能力对外开放,覆盖 SaaS 工作台、星桥 API 与私有化部署

技术能力没有停留在实验室演示,直接接入星宇智算完整产品矩阵,适配不同规模的生产团队。

C 端用户在 AI 视频工作台可直接启用音画同生模式,上传文本或者导入音频文件,一键输出人物说话视频,自带商用版权合规,省去导出音频、二次口型拟合的繁琐步骤。

面向 B 端企业,星桥 API 开放单流音画生成接口,支持自定义音频输入、语种切换、表情强度调节。短剧公司、跨境电商、MCN 机构,可以把该能力接入自身内容流水线。同时支持企业私有化部署,高校科研团队可申请对应的算力扶持方案。

需要客观说明,极端工况下依旧存在边界。比如极快爆破音、大幅度侧脸完全遮挡嘴唇,依然会出现少量对齐瑕疵。但对比传统拼接方案,已经大幅压缩后期修口型的工作量,把数字人口播推向高效率商用阶段。

行业趋势:AI 视频比拼从画面渲染走向音视一体化

回看 AI 视频行业发展路径。早期大家比拼画面清晰度、光影渲染效果。当画质普遍达到合格线之后,音画协同、时序一致性这类隐性能力,成为商用落地的分水岭。

分开做音频视频,属于过渡阶段的折中方案。单流音画同生代表一种新方向:声音、表情、画面帧在同一体系内协同推演。不再靠后期修补来掩盖架构缺陷。

未来随着数据集持续迭代,多角色对话、多人同时说话场景下的音画同步表现还会继续优化。数字人内容生产,会进一步压缩剪辑后期环节,向着 “输入文本直接输出成片” 的方向演进。