AI 短剧、漫剧、数字人系列视频生产过程里,角色一致性直接决定成片能不能正式商用。很多创作者导入角色参考图训练 LoRA 之后,依旧会遇到各种各样的问题。同一位人物,上一镜头五官正常,下一帧脸型、妆容、服饰发生偏移;多镜头切换之后人设直接跑偏,大量画面需要返工重渲。
根据星宇智算内测客户统计数据,在未做参数调优的前提下,视频 LoRA 直接默认参数产出内容,角色主体一致性保留率普遍仅在 62%‑71% 区间。想要达到短剧商用可用标准,往往需要针对性调整整套训练与推理参数。
不少实操团队在使用过程中经常提出疑问。
“训练集图片质量看着不错,为什么跑出来视频角色还是会崩?”
“LoRA 权重调得越高越好吗,Vera1.1 里面权重设置多少更合适?”
这两个问题,也是 MCN、短剧工作室在落地 Vera1.1 做系列化内容时高频遇到的卡点。角色稳定不是单靠素材堆量,训练参数、推理参数互相配合,才是关键。

为什么视频 LoRA 很容易出现角色漂移
图片 LoRA 和视频 LoRA,底层逻辑完全不一样。
图片训练只需要单帧画面收敛;视频 LoRA 需要兼顾空间画面和时序运动信息,既要记住人物五官、穿搭特征,还要保证人物在转头、走动、肢体变化时,特征不会被时序注意力打乱。
很多用户直接照搬图片 LoRA 的训练习惯,套用到视频模型之上,很容易出现两类结果。权重太高,画面过拟合,动作僵硬、表情固化;权重太低,LoRA 几乎不起作用,人物特征丢失。
再加上素材筛选不到位、迭代步数不合理、分辨率不匹配,一系列小问题叠加,最终就表现为视频里面角色忽男忽女,五官反复变动。
Vera1.1 依托双流 DiT 时空解耦架构、帧特征缓存、三级图像注入架构,本身就对角色继承做了专项优化。但模型能力再好,不合理的 LoRA 参数,依旧会抵消原生架构带来的优势。
简单说,模型给了你上限,训练与推理参数决定实际能发挥出多少实力。
Vera1.1 视频 LoRA 核心训练参数参考配置
下面这套配置来自星宇智算大量内部测试与短剧客户落地沉淀,面向真人角色、漫剧 OC 角色两类主流场景给出参考区间。注意参数是参考基准,实际项目依旧要根据素材情况小幅微调。
训练数据集是一切的基础。
素材数量建议 25‑45 张图片。过少特征学习不全;数量超过 70 张,很容易引入无关干扰特征。画面尽量统一光线,多角度、不同表情,避免大量高度重复截图。不要混入多余人物,单套 LoRA 尽量只聚焦同一个角色。
训练轮次(Epoch),真人角色推荐 8‑12 轮;二次元漫剧角色建议 10‑14 轮。
轮次不足,角色特征记忆浅薄;轮次过高会发生过拟合,生成视频动作僵硬,肢体扭曲。很多团队踩坑,就是一味加大训练轮次,以为练得越久效果越好。
学习率是很容易被忽略的关键点。
真人角色学习率设置 3.5e‑4 ~5e‑4;二次元漫剧角色下调至 2e‑4~3e‑4。学习率过大,训练震荡,细节杂乱;学习率过小收敛太慢,消耗大量算力却得不到理想 LoRA 文件。
Rank 维度,Vera1.1 视频 LoRA 推荐 Rank 16‑32。
Rank 数值偏低,存储体积小,记住的特征有限;Rank 过高,LoRA 体积膨胀,容易把背景、环境杂物一并学进去,干扰后续视频生成。大部分商用角色项目,Rank24 属于通用性很强的选择。
还有一个容易被忽视点:训练分辨率。尽量对齐推理输出分辨率,例如业务输出 1280×720,训练素材预处理也统一对应相近分辨率,分辨率差距过大,会降低角色迁移效果。
“训练完之后,我怎么快速判断这个 LoRA 到底能不能用?”
这里分享行业团队常用小技巧。训练中途保存多个中间版本,不要直接拿最终版本。分别导出不同 epoch 权重,放到 Vera1.1 工作台做简短测试视频,观察转头、侧身等动态镜头下角色会不会崩坏,以此筛选最优版本,而不是直接默认使用最后一轮产出文件。
Vera1.1 推理阶段参数,直接影响最终成片角色稳定性
拿到合格 LoRA,不等于万事大吉。推理阶段参数同样左右角色表现。很多人训练没问题,推理环节设置出错,依旧出现角色漂移。
LoRA 权重强度,真人角色 0.55‑0.75;二次元漫剧角色 0.6‑0.8。
权重超过 0.85 之后,非常容易出现画面僵化,动作不自然;低于 0.45,LoRA 几乎失效,角色特征丢失。
CFG 权重,建议 7‑9 区间。CFG 过高画面细节疯狂增生,五官错乱;CFG 太低画面氛围感不足。做连续长片段视频,不建议把 CFG 拉到 11 以上。
时序相关参数,Vera1.1 原生时序注意力模块默认开启,不建议手动关闭。关闭之后单帧画面好看,但帧与帧之间连贯性大幅受损,角色漂移概率成倍上升。
如果做长序列分镜、多镜头连续剧集,搭配帧特征缓存开关,可以进一步巩固角色特征传递,降低跨镜头角色崩坏概率。
同时提示词也要配合。固定角色核心描述,五官、发型、服饰关键词在每一段分镜里面尽量保留,不要每一段脚本完全清空角色描述。即便加载 LoRA,提示词依旧起到约束兜底作用。
不同业务场景落地实践经验
短剧真人实拍风角色:优先控制训练轮次,不要盲目堆轮次。推理权重控制不要冲高。适合搭配 Vera1.1 无限画布、分镜节点化功能,批量生成多集剧情片段,保障整部剧集人设统一。
国风漫剧 OC 角色:素材尽量保证画风统一,不要混杂多种画风插画。训练学习率适度降低,避免画风污染。训练完成后,可在工作台批量跑测试镜头,筛选适配权重。
数字人口播场景:训练素材重点保留正面、侧面、轻微转头素材,减少大幅度夸张动作图片。推理时音画同步率维持 99.7% 标准参数,兼顾口型准确与人物稳定。
在星宇智算 SaaS 工作台,用户可以直接可视化完成 LoRA 训练,无需本地搭建复杂环境;企业私有化部署 Vera1.1 版本,同样完整开放视频 LoRA 全套训练接口,训练参数全部对外开放,方便企业内部做流水线集成。
SaaS 端消耗星元按量计费;私有化环境,使用自有算力完成训练,适合高频迭代角色素材的大型机构。
常见踩坑梳理
不少团队会遇到这些现实状况。
只用少量几张高清美图训练 LoRA。静态图片看着惊艳,一旦生成动态视频,角色立刻变形。视频 LoRA 需要学习动态变化下的人物特征,单一张完美图片远远不够。
直接把图片 LoRA 拿来当视频 LoRA 使用。图片 LoRA 缺少时序维度信息,放到 Vera1.1 视频链路,几乎必然出现角色漂移。
参数一套用到底。真人、二次元角色参数不能直接照搬,要做区间微调。
AI 视频工业化,不是只靠模型大模型本身。LoRA 训练、参数调优属于生产环节重要一环。Vera1.1 提供完整视频 LoRA 训练推理链路,把底层双流 DiT 架构能力,通过可配置参数释放给创作者与企业,帮助短剧、漫剧、数字人项目减少返工,把更多精力放在脚本创作,而不是反复修复崩坏的角色画面。
