AI短剧这两年火到什么程度从单集播放破亿的爽剧到品牌定制的竖屏剧几乎所有新兴内容团队都在尝试用AI生成工具做短剧。但真正入局玩过的人都清楚AI短剧制作有一个绕不过去的天坑人物一致性。同一个角色第3集还是冷峻霸总第8集就换了一张脸演到一半观众已经分不清谁是谁再好的人设和剧情都直接崩盘。作为把AI短剧从测试阶段一直做到成片交付的从业者今天我就把这套“同一个角色贯穿全集”的完整方案拆开讲讲内容覆盖方案选型、模型训练、逐镜生成和常见翻车点想入局AI漫剧、AI生成短剧的朋友应该都能直接用上。1. AI短剧创作浪潮下人物一致性为什么是生死线1.1 短剧的内容特性对“同一张脸”的要求先明确一个前提AI短剧和传统动画、真人剧不一样的地方在于它是在“没有真实演员”的情况下用生成模型造出连续可信的视觉角色。也就是说短剧里所有的“演员”本质都是AI生成的一张又一张图再通过镜头切换、口型驱动和运动控制把它们变成可叙事的内容。这种生产方式天然面临一个难题每一帧都是独立生成的模型并没有一个“记忆库”来保证上一集里的男主角在第100个镜头里依然长着同一张脸。短剧的内容特性又恰恰放大了这个难题。竖屏短剧的观众观看场景通常很碎片化地铁上、睡前刷手机没有人会耐心去分辨“这个穿黑西装的人是不是换了演员”。一旦角色面部特征发生明显漂移观众的注意力会直接从剧情中抽离。短剧要求在极短的时间内建立人物印象同时还要保证几十集内容里人物脸、服装、气质的一致性这相当于给生成模型提出了一个高度定制化的“固定演员”需求。更关键的是短剧通常有强烈的类型化角色比如霸总、娇妻、战神、神医。这些角色的面部结构、肤色质感、发型和穿搭本身就承担了叙事功能。角色如果从“高冷禁欲”突然漂移成“邻家暖男”不仅画面穿帮整个IP的商业价值也会被稀释。这也是为什么越往头部走制作方越愿意在人物一致性上投入时间和算力。1.2 人物漂移带来的连锁崩坏人物一致性崩掉之后影响的绝不仅是“脸变了”这么简单。我最早试做AI短剧时第一集花了三天训练出来的一个男主角到了第四集因为换了标签词眼睛颜色从深棕变成了蓝色。当时我还没意识到问题的严重性直到评论区连续出现“男主换人了”的弹幕才被迫停下来返工。我把人物漂移的危害总结成三个层面叙事层面观众无法建立稳定的角色认知情感卷入断裂。明明是同一个人观众却以为是失散多年的双胞胎兄弟。制作层面一旦返工涉及场景、灯光、表情、姿态的生成都要重新来过之前沉淀下来的分镜资产全部作废。商业化层面品牌方投放短剧时最看重的是角色的辨识度和延展性。角色形象不稳定IP周边、联动、系列续集都无从谈起。所以人物一致性不只是一个“画质问题”它实际上是AI短剧项目的底层地基。地基没打牢后面所有环节都像在流沙上盖楼。2. 方案选型控制角色一致的几条主流路线怎么选2.1 基于LoRA微调的“固定演员”路线目前业内最主流也最稳妥的方案是用LoRALow-Rank Adaptation微调来训练一个专属的角色模型。LoRA最初是大语言模型里用来高效微调的技术后来Stable Diffusion社区把它引入图像生成通过冻结底层大模型的权重只训练一小部分低秩矩阵来“学会”一个新概念。落到短剧场景你可以把LoRA理解成给AI“签了一个专属演员”这个演员的脸、发型、服装风格从此被固化在一个小文件里。用LoRA的好处非常显眼模型体积小一个角色LoRA通常只有几十到两百MB便于多角色管理。训练成本相对低普通创作者用一张消费级显卡也能跑。角色效果稳定只要训练素材质量在线角色脸型、五官比例、肤色能保持得非常统一。这条路线适合有明确角色设定、需要大量镜头产出的短剧项目。缺点是每个核心角色都要单独训练一个LoRA男女主加重要配角光训练环节就够你忙一阵。另外如果角色设定中途要改动发型或造型还需要补充素材重新训练灵活性不如其他路线。2.2 角色参考图姿态控制的轻量路线如果你只想快速出片、不追求完美贴合人设可以用更轻量的路线参考图Reference Image 姿态控制。具体来说就是找一张或多张角色设定图作为参考图在生成每一帧时把它嵌入提示词上下文里同时用ControlNet等姿态控制模块锁定人物动作。这条方案的本质是让生成模型“看着这位演员演”。它不需要训练任何专属模型上手速度极快。我第一次用WebUI的参考图模式做测试时从零到出一组成片只花了半天。对预算有限、试水阶段的创作团队来说用这条路线验证剧本和叙事节奏完全够用。但轻量路线有它天然的短板参考图对生成结果的约束是“软性”的只要提示词里有一点冲突信息比如加了某种风格的形容词角色脸型就可能悄悄跑偏。另外参考图控制很难跨镜头保持精细的服装细节和面部微表情。所以它更适合预算低、对精度要求不高的项目真正要做到“贯穿全集”我依然建议最后落到LoRA或更重度的方案上。2.3 多模态大模型驱动的数字分身路线现在一些多模态大模型也支持通过简单Prompt来“扮演”固定角色甚至可以在对话中保持身份设定直接输出带角色形象的图像或视频。这条路线听起来很理想不需要训练模型自己理解了“角色是穿红裙子的短发女生别变”。但就我实际测试的感受来看通用型多模态模型在长叙事稳定性上还不太可靠。你前20秒聊得很好人物特征也跟住了一旦对话内容变复杂涉及动作切换、场景切换、多人交互模型很容易出现特征衰减。而且完全依赖云端大模型来生成整部短剧成本会非常惊人节奏也难以控制。所以我的判断是多模态大模型路线适合做短期的角色演示、互动式内容但用于工业化短剧生产还为时过早。真正适合现在落地的核心方案依然是LoRA为主、参考图辅修、ControlNet控制动作的组合拳。3. 从零到一建立一套可复用的角色一致性生产管线3.1 第一步制作一张“演员证标准照”不管选哪条路线第一步都是定义“这个角色到底长什么样”。很多新手一上来就丢几张网图给模型训练结果角色一会儿像A一会儿像B本质上是训练素材太乱了。我的做法是给每个核心角色建立一份素材规范先产出30到50张高质量的角色参考图再从里面挑出最像、最清晰、角度最全的一组做训练集。实际操作上可以先用Midjourney或者Stable Diffusion把角色概念图做好然后通过手动筛选去重保证画面里只有一个角色、背景干净、光线统一。素材的丰富度同样重要。不能只有正脸还要包含侧面、半侧面、低头、抬头、走路、坐下表情也要覆盖日常状态、愤怒、惊讶、悲伤。因为短剧有大量对话镜头脸部角度和表情变化非常频繁如果训练集里全是大头照那模型一遇到“两人餐桌对话”这种中景镜头就容易崩。很多人会忽视服装的一致性。同一个角色在剧情里可能换几套衣服我建议要么在训练时把角色常穿的2到3套主服装各来一批素材要么干脆把每个角色拆成“角色LoRA服装LoRA”两个独立模块生成时叠加使用。这个后面会详细说。3.2 第二步训练角色LoRA的完整参数训练环节直接决定角色一致性的上限。我以Stable Diffusion生态最常用的训练流程来举例。先准备训练环境建议直接用秋叶启动器或者Stable Diffusion WebUI自带LoRA训练脚本显卡至少8GB显存。训练素材统一裁切到512x512或768x768确保每一张图清晰度一致。然后是打标环节。最省事的做法是用WD14 Tagger自动打标把人物特征类标签如发型、瞳色、服装手动保留同时加上一个唯一的触发词。触发词很关键比如我给一个角色定的触发词是tianyi那生成时只要提示词里带上tianyi模型就会激活这个角色LoRA。训练参数方面我这边实测比较稳的配置是参数推荐值说明训练轮数10-20 epoch素材太杂或图太少时加轮数但要小心过拟合学习率1e-5到1e-4太高人物会过拟合太低学不到特征网络维数32-64维度越高模型容量越大但过大容易丢稳定性批次大小2-4显存不够就降到1用梯度累积兜底采样方式固定seed多次测试建议每轮都存权重方便后面挑最优档位训练完成后一定要做抽卡测试。把训练好的LoRA复制到WebUI里用不同提示词批量生成人物图看脸型是否还原、表情是否自然、换场景时是否还稳定。不要只测好看的图要从50张生成结果里随机挑10张出来看平均质量避免被个别高分图骗了。3.3 第三步用ControlNet锁住姿态与镜头有了LoRA角色脸能稳定了但短剧是有剧情的角色要走路、转身、递东西、拥抱这就需要把每一帧的姿态和构图固定下来。ControlNet是目前最成熟的方案它通过额外输入姿态骨架、深度图或边缘图来约束生成画面的结构。我的主力用法是OpenPoseDepth混合先用OpenPose生成人物的骨骼关键点锁住整体动作和镜头方向。再用Depth深度图约束前后景关系避免在复杂场景里角色突然“穿墙”或者跟背景融为一体。涉及物体交互比如拿杯子、开门时额外用Canny边缘图把物体的轮廓也约束住。这里要特别提醒ControlNet的权重不要拉满一般控制在0.6到0.8之间比较合适。权重太高画面会被骨架图彻底锁死生成的细节会发灰、像描了一遍线稿权重太低角色动作又会跑偏。我用下来最稳的策略是“高LoRA权重中等ControlNet权重”这样既能锁住角色特征又能保留模型的自然生成感。分镜阶段还要注意“帧间一致性”。短剧不是生成一堆孤立图片拼在一起而是要通过对话和动作把两个镜头连起来。我的做法是先做关键帧再做中间帧。比如一个推门的镜头先定好推门前、门推开一半、完全推开这三张关键帧的姿态再让模型用图生图方式补出过渡帧。这样比直接文生图一张张碰运气要可控得多。3.4 第四步单场景多角色协同调度短剧里很少只有一个人男女主角同框是标配。多角色同时出现时一致性难度是几何级上升的因为两个LoRA叠加使用会互相干扰。我最开始处理双人镜头时直接把两个人物的LoRA都塞进提示词结果崩得一塌糊涂。后来总结出几个可复用的技巧分层生成先用一个角色LoRA生成主要角色完整画面再用图生图方式把第二个角色LoRA通过局部重绘“放”进去。这样可以避免两个LoRA在全局生成时特征争夺。叠加区域重绘在WebUI里用ControlNet的Inpaint功能把第二个角色出现的区域单独做重绘重绘时只让第二个角色的LoRA生效。只要mask画得准两个角色都能保持各自特征。批次做跑分多角色镜头必须固定seed和CFG并生成多批次候选图人工挑选面部最稳的结果。不要指望一次生成就完美多角色镜头的返工率我一般在30%到50%之间。多人镜头的另一个坑是ID混淆。角色A和角色B如果都是年轻女性人脸特征相似模型很容易互相“传染”。解决办法很简单训练时让素材里两个角色穿着完全不同色系的服装生成时把颜色词高权重嵌入提示词让颜色成为现阶段最强势的区分锚点。4. 实操避坑人物一致性最常见的五个翻车点4.1 同镜头双角色互相污染这是我踩过最经典的坑。两个角色LoRA同时启用时经常出现A角色的眼睛长到了B角色脸上的诡异效果。排查的第一件事是看两个LoRA是否共用了一些高频特征标签。比如两个角色都打了“long hair”那么在推理时模型会把长发改到双方身上。解决办法是把特征标签尽量差异化比如A打“straight hair”B打“wavy hair”。训练素材也尽量拉开区分度不要让两个角色撞发型、撞发色、撞服装色系。如果剧情设定必须让两个本该相似的角色存在那就要在推理阶段做区域隔离而不是依赖全局生成。4.2 表情过度变化导致人物崩坏短剧演员的表情强度很高怒目圆睁、痛哭流涕都是高频画面。但AI生成模型在表情权重拉高时往往会把脸部结构一起拉变形。一个愤怒表情眉毛上扬的幅度失控之后角色脸型会被扯得面目全非。我的习惯是把表情提示词的权重控制在0.7以内同时用区域性重绘来优化面部细节。遇到极端表情镜头先生成一张面部结构稳定的底图再用局部重绘专门处理眉眼和嘴巴区域这样既保留表情张力又护住了人脸结构。表情是短剧的加分项但前提是人脸不能崩这个优先级要排清楚。4.3 参考图信息过载很多朋友看到“参考图方案”不用训练就觉得赚到了于是一次性塞了十几张参考图希望模型把角色“吃透”。这个思路恰恰很容易翻车。参考图越多模型越不知道应该重点跟谁最后生成出来的是一个平均脸谁都不像。参考图方案的正确用法是挑一张最标准的正面形象照作为核心参考最多再配一张侧面照辅助。把剩余图放进负面提示词里是非常愚蠢的做法。模型不是人类它没法从“别像这张”里提炼出特征。所以宁可参考图少而精不要贪多贪全。4.4 分镜生成后才发现脸不够“演”还有一个隐蔽的坑是分镜阶段看静态图觉得还行一旦配合口型驱动和镜头运动开始做视频角色面部哪里不对劲就暴露出来了。原因很简单静态图生成时只关注单帧美感但视频生成需要连续帧之间保持动作和表情的平滑过渡。应对这个问题我每次在分镜阶段就强制用“开口说话”测试。让生成的角色像默片一样张闭嘴若干次观察口型变化是否牵动面部结构。如果口型一拉动颧骨位置就变说明LoRA在面部动态表达上的学习还不够充分需要补充说话状态下的大头照素材重新训练一轮。虽然听起来烦琐但这一步能省掉后期合成阶段大量的修补工作。4.5 风格化与真实感的取舍AI短剧目前百花齐放有些团队追求“AI质感”明显的幻想风格有些则努力向真人短剧的写实质感靠拢。风格不一致的问题往往被误判为“人物不一致”比如同一角色在一个镜头里像动漫下一个镜头像真人油画。这个问题本质是基础模型选型太杂。同一个角色LoRA只能在同一套底座模型上发挥稳定你不能前20集用写实模型后20集换一个二次元大模型还指望角色脸一致。做项目之前就要定好“整体画风”并且把所有角色的LoRA都基于同一个底模训练和推理。底模锁定之后再统一设置CFG、采样器、步数等推理参数人物一致性才有稳定的基础。5. 藏在流程里的几个效率心得5.1 预生成角色资产库我做大项目的习惯是在正式分镜之前先给每个核心角色批量生成一批“可复用素材”比如走路、转身、点头、坐下这些日常动作的连续帧。这些素材不一定都能直接用但可以作为后续ControlNet姿态参考、局部重绘底图、甚至关键帧变体来用。真正到逐镜生成时很多镜头其实可以直接从资产库里拼装大大减少文生图的时间消耗。资产库要定期整理按角色、动作、镜头类型、服装分类建文件夹。短剧动辄几十上百集素材越攒越多如果一开始不建立归档规范后面找一张合适的底图会花掉比生成更多的时间。5.2 固定推理参数不要随意调优人物一致性包含两层含义一是同一角色内部一致二是多个镜头放在一部剧里风格一致。后者经常被忽略。很多制作者喜欢今天测一套参数明天觉得效果不好又换个采样器最后全剧画面质感割裂。我在项目启动时会先用一组参考镜头做参数实验确定采样器、步数、CFG、放大算法之后整个项目尽量不做大的改动。LoRA权重可以微调但核心参数一旦定下来就锁死。这种“保守式创作”虽然看起来不够灵活但对一个几十集体量的连载短剧来说稳定的输出比偶尔的惊艳重要得多。5.3 别把所有希望押在一次生成上最后说个心态层面的经验。任何AI短剧项目都逃不掉筛选环节一张成片背后往往有几十张淘汰稿。刚入门的朋友容易沮丧觉得是不是自己哪里配置不对导致成功率这么低。其实即便流程完全正确AI生成一批图里能用的也只占一小部分这是生成模型的通病不是你的问题。正确的做法是建立“批量生成、快速筛选、失败归因”的工作流。每次生成都保留提示词和seed方便回溯失败的结果不要直接删分组存好反复看是什么因素导致的失败下一次生成时才有针对性地调参数。时间久了你会形成一套属于自己的“判图直觉”一眼就能看出这张能不能用、要修哪里到那个阶段AI短剧人物一致性就不再是困扰你的难题了。我在实际项目里感受到AI短剧的成败往往不在模型多强而在流程是否足够工业化。把角色素材标准化、训练参数固定化、镜头生成模块化之后人物一致性就是一个可以被稳稳掌控的工程问题。希望这篇硬核拆解能帮你少走弯路。