1. 先聊思路为什么“真人漫剧”混做反而成了短剧团队的新解法这段时间我接触了不少短剧项目发现一个挺明显的变化以前团队做AI短剧要么老老实实走仿真人路线要么就做纯漫剧两类内容井水不犯河水。但今年开始越来越多人尝试把两种画风塞进同一部作品里比如真人感开场、梦境或回忆段落切成漫剧最后再切回真人感收尾。甲方给的理由也很直接观众对单一AI画风容易疲劳混着来反而能把完播率拉上去。这个思路听起来像噱头实际操作之后我才意识到它背后其实是一套很务实的内容策略。真人感短剧的优势是代入感强观众会把角色当成“真实的人”情绪跟着剧情走漫剧的优势是制作自由度大场景、特效、视觉奇观都能放开做而且风格化的画面天然有“二次元滤镜”能掩盖一部分AI生成的细节瑕疵。把两者放在一起等于用真人的情感浓度去托住漫剧的想象力再用漫剧的视觉冲击去给真人段落制造记忆点互补关系非常明显。不过理想归理想真要在一部片子里同时跑通两条画风问题马上就来了真人感和漫剧两种风格对AI工具的要求其实是对着干的。做真人感视频我最怕的是角色皮肤发假、动作僵硬所以工具得在写实质感、运动控制、光影细节上下足功夫做漫剧我更在意的是线条稳定性、色彩氛围和角色辨识度工具得能把风格锁死不能换几个镜头人物就变成另一个人。换句话说一个偏“物理真实”一个偏“美术统一”根本没有哪个AI工具能一碗水端平。这次我搭了一套组合工具断断续续测了一个多月基本把“真人开篇漫剧回忆真人结尾”这种最常见的混做结构跑通了。下面这套方案我都标注了使用场景、踩过的坑和可以直接照抄的参数适合正在做AI短剧的编导、漫剧作者以及想在视频号、抖音、B站做风格混搭内容的朋友参考。我需要先说明一下以下内容是我基于项目中常见流程做的方案复盘工具版本随时在更新但选型和调参的思路短期内不会过时。2. 仿真人短剧的核心真人感画面的AI工具与参数调法2.1 主力工具怎么选可灵、海螺、Runway谁更合适先专门讲真人感这条线。做仿真人短剧很多新手上来就打开文生视频模型输入一段描述直接生成片段结果出来的东西要么像塑料模特要么人物五官在镜头里飘来飘去。我的经验是真人感这条线必须把“图生视频”当成主角文生视频只用来做氛围测试和背景空镜。主力工具我首推可灵AI。国内能用、生成速度可接受、最关键的是它对人物皮肤质感的处理比较自然不会动不动就给你磨皮磨成蜡像。可灵我一般用来跑人物中近景和情绪戏配合图生视频功能把定妆照变成动态片段效果最稳定。它的缺点是动作幅度偏保守遇到大场景调度、快速运动镜头偶尔会露出“AI味”。第二梯队是海螺AI。我试过用它的视频生成模块做一些爆发力强的镜头比如角色摔东西、奔跑、情绪崩溃它的动作流畅度比可灵激进一些但整体画面调性偏“网红滤镜感”真人质感略弱。所以我只拿它补可灵不擅长的戏份不当作主力。Runway的Gen系列真人感一直在线尤其Motion Brush可以指定画面局部进行运动控制细节表现很惊喜。但实际用下来有两个现实问题一是访问和支付对国内团队不友好二是网络不稳定会打断制作节奏。如果你人在海外或者有稳定的企业账号可以拿来精修几个关键镜头否则不建议把它放进日常流水线成本收益不划算。我做了一个简单的对比表方便你根据项目情况快速决策工具真人感表现动作幅度稳定可用性适合场景可灵AI强皮肤质感自然中等高国内流畅日常主力人物对白、情绪戏、定妆动态化海螺AI中上略带网红滤镜较大高情绪爆发、大幅度动作镜头Runway强细节控制好中等偏上中网络成本高精修镜头、指定区域运动控制2.2 真人画面最容易翻车的三个细节做仿真人短剧镜头翻车的点其实非常集中记住这三个就够少踩一半坑。第一个是手部。AI生成的手在快速运动或握持动作时手指很容易多一根、少一根或者交叉成诡异形状。解决方式很粗暴不要让角色长时间展示手部特写镜头给到中景和近景时尽量安排手部有支撑比如握着杯子、扶着栏杆实在避不开就多抽几次卡选手指正常的版本。如果角色要做手势表达情绪我会把提示词里明确写成“双手自然垂放”“手拿手机”这种有约束条件的描述生成成功率会高很多。第二个是眼部与情绪。仿真人最怕瞳孔空洞、眼神发呆。生成人物特写时我会在提示词里强调眼神方向、表情细节比如“眼神看向镜头左侧”“微微皱眉眼眶泛红”。不要只写“一个悲伤的女人”这种抽象情绪AI很难吃透要给具体的面部肌肉信号。图生视频模式下首帧人物的眼神如果就没对焦后面基本全废所以定妆图阶段就要盯住眼睛。第三个是光影连续性。真人感视频最怕前后两个镜头里光源方向不一致观众说不出来哪里怪但就是觉得跳戏。同一个场景的所有镜头我会在提示词里统一写清楚光线信息比如“右侧窗光照明暖色调下午四点的阳光”生成首帧后如果光线不对直接在参考图阶段重画不要拖到视频生成阶段再去补救。混剪的时候再加一层统一的调色LUT能把大部分光影偏差抹平掉。2.3 图生视频才是保持“仿真人质感”的关键路径直接文生视频为什么不容易出真人感因为文字描述是模糊的模型不清楚演员长什么样、穿什么衣服、站在什么场景里只能靠概率生成结果就是每次出来的都是“一个像人的东西”但前后不连贯。而图生视频相当于你先把演员定妆照、场景照片全部准备好了视频模型的任务只是让这张照片合理地动起来自由度小了稳定性就高了。实际操作时我的流程是先出图再让图动起来。第一步用即梦AI或者Midjourney生成角色的定妆照要求是半身或全身、表情中性、光线干净背景可以简单一点第二步把这张定妆照丢进可灵的图生视频提示词只写人物动作、镜头运动和环境反应不再去描述长相和服装第三步如果这一版动作不对我会重新调整提示词再生成而不是换一张参考图。还有一个进阶技巧是首尾帧控制。比如我要做一个从真人感画面切到漫剧画面的过渡镜头可以让可灵生成一段“从真人角色A缓慢转身变成漫剧角色A”的视频首帧放真人图尾帧放漫剧图中间的运动过程交给模型自己发挥。这个功能对混做内容来说太重要了它能直接生成一个“画风转换”的镜头省掉后期大量剪辑工作。3. 漫剧部分的AI工具搭配从画面到配音一步到位3.1 漫剧画风生成即梦、Vidu、Pika的取舍聊完真人感再来看漫剧这条线。漫剧的制作逻辑和真人感完全不同它不需要“以假乱真”反而要追求鲜明的美术风格。也正因为如此它对AI工具的要求集中在风格稳定性上而不是物理真实度。我这次漫剧片段的主力是即梦AI。它有一个很突出的优点中文提示词理解能力强风格化画面生成稳定。我写“日式赛璐璐动画风格”“韩漫厚涂风格”“国风水墨风格”它基本能给出符合预期的结果不用翻来覆去调整英文措辞。漫剧日常镜头量很大即梦的出图速度很快批量跑分镜效率很高一部短剧的分镜底图基本可以一天之内出完。另一个我经常搭配使用的是Vidu。Vidu的参考生视频功能很优秀你可以给它一张角色图它能在保持角色特征的基础上生成连续动作。漫剧最怕角色五官跑偏Vidu在这方面给了我不少惊喜。它的缺点是整体风格选择性不如即梦丰富更偏向3D渲染或者写实动漫感适合特定项目。Pika我也试过它做局部修改很方便比如画面里某个物体想改成别的东西或者想给某个区域增加特效直接框选修改就行。但Pika的会员价格不低漫剧这种需要大量镜头的项目如果全用它成本会很难看。我的建议是Pika只用来修几个关键镜头日常量产还是即梦Vidu的组合更划算。工具风格丰富度角色一致性中文支持推荐用法即梦AI高多风格可选中等强分镜底图、批量生成、风格探索Vidu中偏3D渲染和写实动漫强中连续动作、角色一致性要求高的镜头Pika中支持局部编辑中等中局部修改、关键镜头精修3.2 角色一致性漫剧比真人更容易控制也更容易崩这里说一个反直觉的发现漫剧的角色一致性按理说风格化明显、更容易保持但实际操作中反而比真人更容易崩。原因也很简单真人脸的约束来自现实世界模型生成真人再怎么变还是人的底子但漫剧角色一旦风格化稍微多一点线条、换一个眼型观众一眼就看出“这不是同一个人”。解决这个问题我总结了一套“角色卡”打法。第一步为每个主要角色生成一张标准立绘包含正面、侧面、半侧面三个角度动作简单、表情中立第二步把这张立绘图作为所有后续生成的首帧或参考图第三步在提示词里固定角色的关键视觉特征不要用抽象词要用具体词比如“红褐色短发刘海遮住右眼身穿黑色风衣左耳戴银色耳钉”每个镜头都带上这段描述。这样做之后角色的辨识度会提升很多。但要注意如果某个镜头里角色换了衣服、换了场景、换了情绪你把参考图和文字描述一起给它有些模型会在“跟随参考图”和“跟随文字描述”之间纠结结果两边都不讨好。我的习惯是衣服可以换但脸部和发型尽量保持一致必要的时候我会在生成后再用局部重绘修一下五官这一步虽然耗时但对漫剧的质量提升非常明显。3.3 漫剧的声音与动效配音、BGM和镜头的统一漫剧的情绪很大程度靠声音撑起来。AI生成的画风再精美如果配音是毫无情绪波动的机械音观众一样会划走。所以我的漫剧配音基本锁定两条路线一是剪映的音色库里面有不少网感和情感化的音色直接输入台词即可生成配合剪映的情绪语气分段调节能快速做出有起伏的配音二是对音色要求更高的项目我会用魔音工坊做声音克隆把指定配音员的声音训练成专属音色后续所有集数都统一使用沉浸感更强。BGM方面我现在的习惯是直接用Suno生成。以前做短剧找BGM很痛苦网易云、QQ音乐翻半天找不到合适的版权还容易出问题。用Suno的好处是可以指定情绪和风格比如“紧张悬疑的电子配乐90秒带明显节奏变化”生成之后自己再在剪映里裁剪适配度比现成音乐高很多。动效也不能忽略。AI视频生成之后画面里的镜头运动往往比较有限这时候就要靠后期动效救场。剪映的文本动画、转场音效、画面缩放都可以用起来尤其在漫剧里我习惯给关键对白加一个轻微的画框震动对应角色情绪或者给镜头切换配上一段“嗖”的转场音这些小细节会让漫剧的“制作感”一下子提升不少。4. 两种画风同场混做的全流程实操4.1 脚本阶段就要先拆“画风镜头表”两种画风混做的项目最忌讳在剪辑台上临时决定“这段用真人还是漫剧”。我吃过的亏告诉我脚本阶段就必须把画风定死用一张镜头表把所有镜头拆好后面所有工具才能对齐。这张镜头表我一般按六列来建场次、内容概述、画风类型、镜头描述、情绪要点、使用工具。举一个我实际做过的例子一部都市情感短剧的第一集开篇女主角在办公室被领导训斥这段用真人感画面女主角深夜回家后陷入回忆回忆里学生时代的校园恋爱这段切漫剧最后女主角从回忆中醒来眼角流泪切回真人感特写。整个结构用镜头表拆完总共不到五十个镜头但每个镜头该用什么画风、该用哪个工具生成一目了然。这个步骤最大的价值是防止返工。有一次我偷懒没拆表结果漫剧回忆段落的角色服装和真人段落里是一致的描述但实际生成出来的衣服材质完全不同观众一眼就能看出穿帮。如果前期镜头表里已经画好角色设定和服装要求这类低级失误就能从源头上避免。4.2 分镜参考图让AI先出视觉锚点脚本定了之后下一步不是直接生成视频而是先出分镜参考图。这一步相当于给AI项目先做一套“概念设计”所有参与协作的人包括AI工具都先看清楚每一场戏的构图、光影、角色状态应该是怎样的。我的做法是把镜头表里每一个关键镜头都用即梦AI生成一张静态分镜图。比如“女主在办公室挨训”我会生成一张偏真人写实的图片构图是女主垂着头领导在画面左侧手指指点点到了“校园回忆”我会生成一张日式漫画风格的图男女主角在樱花树下逆光画面偏清新。这些分镜图在后续生成视频时有两个用途一是作为可灵图生视频的首帧二是作为提示词的视觉参照让人工审核也有一杆尺子。出分镜参考图的时候不用太纠结细节重点是定色调、构图和风格方向。我一般一个镜头最多生成三到四版挑一版最顺眼的进入下一步。如果连参考图阶段都感觉风格不对那大概率是提示词里的风格词没用对赶紧返工不要等到视频生成了再后悔。4.3 真人片段生成实操从首帧到视频真人感片段的生成我现在已经形成了一套固定的操作节奏。第一步定妆照。用即梦AI或Midjourney生成角色定妆照一般出一张正面、一张半侧面、一张全身。这一步是整条流水线的基石所以宁可多花时间也要确保角色形象准确、光线干净、五官清晰。第二步进可灵图生视频。把定妆照拖进可灵提示词专注写动作和镜头运动比如“她缓缓抬起头眼眶含泪镜头缓慢推进”不要再啰嗦任何外貌描述。时长方面我一般先跑5秒因为镜头越短AI露馅的概率越小如果5秒表达完一个完整动作就不强行上10秒。第三步参数设置。运动幅度我习惯放在中低档太高容易导致人物形变。生成模式选“标准”或“专业”如果镜头里有明显的物体运动和环境交互选“专业”模式会更稳但耗时也更长。这里要提醒一句生成视频和抽卡一样很多人是抽到不能用为止但我建议反过来一次生成四到五版全部看一遍从中选最顺的一版而不是盯着某一版反复重抽。同样的种子参数下模型每一次都有随机性扩大多样性反而更容易出好结果。第四步筛选和拼接。选中的片段我会在剪映里做初剪把多余的头尾切掉再在关键帧上做微调。真人感片段的后期处理比漫剧更重要因为观众对真人的面部和动作瑕疵更敏感宁可镜头短一点也不要露出明显的AI破绽。4.4 漫剧片段生成实操风格化提示词怎么写漫剧片段的生成流程和真人感不太一样我刚才在第三部分讲过一部分这里重点讲提示词模板。我的漫剧提示词结构可以拆成五个要素顺序基本固定镜头描述 角色描述 风格描述 光线氛围 画质强调举个例子我生成校园回忆的一个镜头会写“全景樱花树下的两名学生男生侧身递给女生一本书。红褐色短发的女生身穿白色校服黑色短发的男生身穿深蓝色校服。日式赛璐璐动画风格线条干净色彩明快逆光下花瓣飘落柔和的春日午后光线。高细节背景虚化唯美浪漫氛围。”这个模板的要点是把角色信息写得足够具体风格词放在中间位置让模型在生成时有一个“先理解内容、再套风格”的逻辑。如果你把风格词放在最前面有些模型容易被风格带跑导致构图混乱。另外漫剧可以频繁使用文生视频不必像真人感那样完全依赖图生视频。但关键角色首次出场、需要保持形象的镜头我还是建议先出角色图再走图生视频流程保证观众对角色第一眼的印象是稳定一致的。4.5 混剪阶段画风切换不突兀的三个转场手段到了剪辑台两种画风放在一条时间线上最担心的事情就是“硬切违和”观众会觉得像两部片子硬拼在一起。我实践下来有三个转场手段最值得常用。第一个是匹配剪辑。找一个真人画面和漫剧画面在形状、动作上有共同点的位置切过去。比如真人感画面里女主推开一扇门下一个镜头漫剧画面里也是推开一扇门动作相似会让人觉得两个世界之间有一条通道。这种匹配剪辑是最自然的画风转换方式不需要任何特效只需要在前期分镜时有意安排。第二个是音效先入。画面还没变声音先变。比如真人感画面里女主愣神这时候先插入漫剧风格的环境音或主题音乐观众会潜意识里感觉“接下来要进入另一个世界”然后你再切到漫剧画面违和感会大大降低。这也是剪映里最常见的“J-cut”用法操作上就是音轨比画面提前一点。第三个是闪白噪点处理。回忆、梦境这类画风切换直接用闪白过渡非常简单有效。在转场处加一个白场闪烁再加一点胶片噪点观众就会默认这是“记忆闪回”是内容表达的一部分而不是制作事故。如果想让质感更好可以在漫剧片段整体上加一层轻微噪点和胶片滤镜让它的视觉质感往真人片段靠拢这样两边看起来更像是同一个“电影宇宙”。5. 混做过程中的常见翻车与排查技巧5.1 角色“换个镜头就换张脸”怎么救这是混做项目里最让人抓狂的问题真人感和漫剧都会遇到漫剧尤其严重。排查的时候先别着急重新生成按顺序检查三个地方。第一检查参考图是否统一。每个角色我都在本地建了一个文件夹定妆照、半侧照、表情参考图全放在里面每次生成前都从文件夹里取图而不是在聊天记录里随便翻一张。参考图不统一生成结果必然五花八门。第二检查提示词里的角色描述是否完全一致。我从定妆阶段就固定了一段“角色描述卡”每次复制粘贴绝不打字修改因为手一抖改了一个词出来的可能就是另一个人。第三检查生成参数。同一部片子尽量保持画面比例、采样规格一致不要上一集用横构图下一集用竖构图角色在画面里的比例也会跟着变化。如果这三项都检查过了还是有小部分镜头崩掉那就只能靠后期局部重绘修复。把崩掉的镜头截图放到即梦AI里做局部重绘重新把区域里的角色脸部框出来再用角色参考图引导生成修完导回剪映替换原片段。这个动作虽然费事但总比重拍整个镜头成本低。5.2 AI味太重、动作僵硬的处理思路AI视频做得多了你会发现“AI味”其实是一个可以拆解的问题主要来自两个原因一是动作过于平滑缺少真人运动时的微小抖动二是镜头调度太规矩没有手持感。针对第一点我现在的做法是生成提示词里尽量写“手持摄影轻微晃动”让模型在动作中加入一些不稳定性。如果生成出来还是太顺滑就在剪映里手动加一个微小的缩放关键帧模拟呼吸感。还有一个笨办法就是多切镜头把完整的动作切成两三个短镜头拼接每个镜头只完成一个简单动作AI在短镜头里的表现会稳健很多。针对第二点AI生成的镜头通常没有景别变化一个镜头从头到尾都是同一个远近。我会在剪辑时用一些缩放、位移来表达镜头的呼吸感或者直接通过剪映的“运镜”功能给静止画面加推拉效果。另外给画面加一点真实的镜头抖动预设比如“手持抖动”“跟拍抖动”会让整片质感往“实拍”方向靠拢不少。5.3 画面与配音对不上字幕的解决这个问题看起来是剪辑环节的事但我发现根源往往在生成阶段就埋下了。AI视频生成的时候人物口型动作是随机的和配音台词的节奏没法天然对齐。如果你强行让人物开口说话结果就是嘴型乱飞观众立刻出戏。我的解决方案是“宁可无声不对口型”。AI短剧最好用旁白配音角色不开口的表演方式或者让角色说话时只给侧脸、背影、远景不给清晰的正面口型。如果必须给正面特写我会在剪映里用“文本朗读”和音频波形做对齐再用手动剪辑把画面停留时间精确匹配到台词说完那一刻。效果虽然不是真正的对口型但配合运镜和情绪大多数观众不会介意。如果项目预算允许还可以用数字人技术做口播片段。剪映的数字人功能、HeyGen等工具都能把文字转成自然说话的画面口型基本能对上适合剧中角色对着镜头讲述的情况。不过数字人目前的表情丰富度有限不建议用在需要复杂情绪戏的场景里。5.4 关于成本与效率的一点实话最后聊一个大家都很在意的话题这套方案到底要花多少钱、多少时间我自己做一个混做短剧系列的节奏是这样的一部约三分钟的短片预算偏紧的话漫剧和真人感各占一半真实成本大概在几百元到两三千元之间具体差异取决于AI工具会员等级和抽卡次数。主力工具订阅月费加起来并不高最烧钱的是时间——准确说是“抽卡时间”。一个关键镜头生成四五个版本加上后期筛选、修复、重剪时间成本往往比工具费用高得多。所以我会给团队立一个规矩每个镜头最多抽五次卡五次之内没有满意版本就回到脚本层面对齐问题出在哪里而不是无限制地抽下去。另外每天先花时间整理“素材库”把生成效果好的镜头、提示词、参考图全部归档下次同类场景直接调用效率能提升一半以上。关于成本这块我给新手一个比较现实的起步建议先别急着开全功能会员用免费额度跑完整个流程确认自己真能稳定产出内容再考虑升级付费。我的经验是刚开始做AI短剧最大的瓶颈往往不是工具功能限制而是对提示词和流程的掌控度不够这个只能通过大量实际操作练出来。我在实际做这个混做流程时最大的体会是不要试图让一个视频模型从头干到尾而要把“策划—出图—生成视频—配音—剪辑”拆成五条线每条线选最顺手的工具再用统一的镜头表和角色卡把五条线串起来。看起来多了一步整理工作但实际省下的返工时间远超投入。希望这套方案能给正在做AI真人短剧、AI漫剧或者想尝试混做画风的朋友一些参考。目前这套流程还在不断更新中后续如果我在角色一致性和镜头转换方面有更好的工具和方法也会再整理出来分享给大家。