← AI 漫剧:从 0 到分账
AI 漫剧AI 漫剧:从 0 到分账

画面生产:角色一致性是唯一的硬科技

AI 漫剧从 0 到分账系列第 4 篇:崩坏的四种形态与触发条件、Character Bible 规格书写法、Reference Lock 四步循环与各模型接口实测、LoRA 微调的投入产出判断,以及 5–10% 崩坏率下的抽卡预算与兜底剪辑梯。

AI 漫剧角色一致性LoRAReference Lock出图

“这人怎么每集都在整容”——这是 AI 漫剧评论区最致命的弹幕,没有之一。观众可以原谅背景简陋、动作僵硬、配音机械,唯独不能原谅第 10 个镜头里主角换了张脸:人脑对人脸一致性的敏感度,碾压对画面其他一切维度的敏感度。第 2 篇把角色一致性列为选型的一票否决项;本篇是它的施工手册——崩坏的形态学、Character Bible 的写法、参考图锁定的实测数据、LoRA 的算账,以及接受“抽卡必然存在”之后的预算与兜底。

先认清敌人:崩坏的四种形态

一致性崩坏不是玄学,它有稳定的分类学和触发条件:

  • 跨镜头漂移:主角五官在镜头间缓慢变形。触发条件:单段超过 5 秒、频繁切镜、没有参考图锚定。
  • 表情漂移:同一段内笑变成哭、嘴型错位。触发条件:prompt 里表情词权重不稳,或一段里塞了两个情绪指令。
  • 服装变化:上半段红裙下半段白裙。触发条件:服装没写死进每条 prompt,或中途换了模型/风格词。
  • 性别/年龄漂移:模型对模糊描述的“自由发挥”——“一个女孩”这种写法等于邀请模型重新掷骰子。

还有第五种、双人戏专属的奇美拉效应:两个角色牵手、拥抱、打斗时模型把特征互相串味。2026 年的可靠解法仍然是拆开生成、后期合成,别指望一条 prompt 出双人接触戏。

Character Bible:把角色写成规格书

所有一致性工作的起点不是模型,是文档。Character Bible(角色规格书)是项目的宪法,它应该占整个项目 15–20% 的工时——这个比例是被反复验证的,省掉它的人会在返工里加倍偿还。

四个组成部分:身份一句话(完整复写进每一条 prompt,逐字,永不改写——机械才一致);外貌字段(脸型、眼睛、发型发色、体型、标志性特征——一颗痣、一根发簪,这些是跨镜头的识别锚点);服装锁(按剧情弧线锁定:第 1–8 集红裙,意味着第 1–8 集每条 prompt 里都有红裙);禁忌清单(所有模型会自由发挥的模糊词:“女孩”“漂亮”“年轻”,一律禁用)。写完 Bible 再生成第一张正式图——顺序反了,几百张废图就是学费。

Reference Lock:四步循环与实测接口表

Bible 之后是执行循环,四步:写 Bible → 按模型接口锁参考图 → 逐场景生成(只换场景变量)→ 每批人工校验。关键在第三步:每条 prompt 只有“场景变量”一行不同,身份句、风格词、服装、画幅全部锁死复用。

2026 年 5 月的一组实测(同一份 character bible、24 个分段、统计 8 帧脸部特征向量余弦相似度均值):Veo 3 以 0.91 领跑(3 张参考,$0.50/条),海螺 02 达 0.88(1 张主参考,$0.15/条),可灵 2 达 0.86(最多 4 张,$0.20/条),即梦 3.0 达 0.84(1 张 + 身份句,$0.10/条),Wan 2.7 首帧链式 0.83。纯参考图方案(不训练任何模型)的普遍水位是 85–90% 一致性、零训练成本——对漫剧的二次元画风,Vidu/即梦/可灵三件套用 Veo 十分之一的价格覆盖主力需求。

LoRA:值不值,看连载长度

当参考图方案的天花板(85–90%)不够用时,LoRA 微调是下一级台阶:5–20 张多角度角色图、SDXL 训练 15–30 分钟(云端约 ¥50、本地 6GB 显存起步),一致性可到 95% 以上。但账本要算全:

  • 成本:不止训练本身。素材准备(多角度覆盖不全就会“正面完美、侧面崩坏”)、过拟合调参、每个角色一套——换主角等于重开。角色设定阶段的总投入约 15–20% 项目工时,LoRA 是其中大头。
  • 收益:跨镜头一致性从“够用”到“稳定”,批量化时校验成本下降,主角 IP 化(周边、衍生)有了资产基础。

判断规则很直接:单主角、30 集以上的连载,值得;试水期、单元剧、多配角,不值得。 中间档是平台内置方案——即梦/可灵的付费角色锁定,用会员费换掉训练工时,适合月产 20 集以内的大多数个人创作者。路线选择按第 2 篇的预算档对齐:¥0 档用免费参考图,¥500 档用平台角色锁定,¥2000 档再上 LoRA。

抽卡预算与兜底剪辑梯

接受一个现实:2026 年所有模型的崩坏率下限是 5–10%,这不是你 prompt 不够好,是技术的当前水位。工程化的应对是把失败计入成本、把抢救做成梯子:

成本公式:单条真实成本 = 基础价 ×(1 + 崩坏率 × 重抽次数)。¥0.40 基础价、8% 崩坏率、重抽 2 次,留存一条的真实成本约 ¥0.46——第 2 篇每秒成本表里的每个数字,都应该乘上这个系数再做预算。抢救梯三级:① 同 prompt 重抽 2–3 次挑最优(成本最低,首选);② 崩坏段前后加 0.3 秒交叉淡化,观众的潜意识会把它读成“电影感转场”;③ 救不了的段落直接换成反应镜头或空镜/可视化段——主角不出现,就不会崩。底线原则:观众看不见的崩坏成本为零,观众看见的崩坏成本是整集。

行动清单,以及第 5 篇

  1. 写一份 Character Bible:为你的主角完成四个部分(身份句/外貌字段/服装锁/禁忌清单),然后故意用一条禁忌词生成 3 张图——亲眼看一次“自由发挥”长什么样,比读十篇教程记得牢。
  2. 跑通四步循环:用同一身份句 + 1 张主参考图,在 4 个不同场景生成主角,逐张核对脸型与服装。记录通过率——这就是你的基线一致性水位。
  3. 测一次抢救梯:从第 2 步的产物里挑一张最崩的,分别在剪辑里试 0.3 秒交叉淡化和换反应镜头两种救法,问三个朋友能不能看出来。建立“崩坏可救率”的手感。

第 5 篇把静止的角色放进时间轴:动效与配音。图生视频的运镜控制(首尾帧、运镜词、运动幅度)、TTS 的情绪与多角色音色管理、音画对齐与口型同步的工程做法,以及一条“先音后画还是先画后音”的路线之争。

guest@swangnice:~$