我去年年中开始正儿八经用AI做漫剧前前后后做了三部完整的加起来快一百集。到今天身边还有朋友问我同一件事新手想用AI做漫剧到底该从哪一步开始这篇我尽量把从剧本到成片的完整路径讲清楚哪些工具值得用哪些步骤能省哪些坑我替你踩过了。先纠正一个最大的误解AI漫剧不等于“AI画动画”。漫剧是把静态AI图片、动态镜头、配音和字幕组合起来的短视频连续剧本质上更像“有声漫画”。AI在里面扮演的角色不只是画画剧本它能帮你搭人物形象它能帮你统一配音它能帮你念连分镜它都能帮你规划和写提示词。整个过程说穿了就三件事想清楚故事、生成图片、拼成视频。这套流程适合谁你没学过画画不懂动画软件但脑子里有故事想快速验证自己的剧本能不能跑通也适合做短视频账号的人不需要养团队一个人加一个账号就能稳定出片。下面按我自己的实操顺序拆给你看每一步都给出具体能用上的写法。1. 漫剧不是动漫理解这件事能少走两个月弯路1.1 漫剧的核心玩法与商业逻辑很多人第一次听说漫剧会下意识把它归类成“动画短片”。但这个理解会让你在后面的制作里特别痛苦因为你会拿动画的标准去要求它然后发现AI根本做不到。漫剧真正的定位是短视频内容是短剧的一种形态只不过演员换成了AI生成的漫画角色。你在平台刷到的那些“追妻火葬场”“重生复仇”配音漫画基本都是这个路子。它为什么能成立两个原因。第一个是信息密度一集60到90秒剧情推进极快三句话一个冲突五句话一个反转观众在地铁上通勤时就能看完一整段情节第二个是连续追更属性结尾永远留钩子看完这一集想看下一集账号的完播率和关注转化率就靠这个撑起来。所以漫剧的创作逻辑和传统动画完全不同它更像“用画面演的网文”编剧思维优先绘画精细度反而不是第一位的。理解这一点之后你的制作标准会变得很清晰画面不需要达到动画电影的精度但剧情节奏必须快人物关系必须一眼能看懂情绪必须靠配音撑住。我见过不少新手把精力全花在“这张图光影是不是完美”上结果连更三集就断更了因为节奏垮了。漫剧拼的是持续生产能力不是单张壁纸质量。1.2 AI到底解决了漫剧生产里的哪些痛点传统漫剧如果靠人工画成本高到没法做。一张彩色漫画插画外包起码几十块钱一部60集的漫剧光画面就要上千张再加上分镜构思、台词润色、配音剪辑一个人根本扛不住。AI真正改变的是把“生产成本”压到了接近于零的边际成本同时把“生产速度”拉起来了。拆开算一笔账。传统方式下一集60秒的漫剧画师需要先画分镜草稿再逐张出精稿工作量大概相当于七八页漫画熟练工也要两三天。用AI做出图环节一张成熟画面基本是一分钟以内的事一集需要的8到12张主镜头图加上筛选重做的时间两三个小时就能搞定全套素材。如果再用图生视频工具给关键画面做一点动态效果半天时间足够完成一集成片。但AI没有解决所有问题它解决的是“生产能力”没有解决“判断能力”。选题选得准不准、人物设定吸不吸引人、节奏拖不拖、画面风格能不能保持一致这些仍然需要人的判断。我的体会是AI把漫剧的门槛从“会画画”降到了“会表达”你只要能把脑子里的画面描述清楚剩下的脏活累活它来。所以新手真正要练的不是学软件是学会把一个故事拆成具体的、机器能理解的需求。2. 工具选型别一上来就堆一堆软件2.1 剧本与分镜用一个长上下文AI对话工具做漫剧第一步不是打开绘画软件而是先打开AI对话工具。市面上主流的几个大模型对话产品都能用我自己的选择标准就三条上下文够长、中文理解够好、能稳定输出结构化文本。长上下文特别重要因为你要把世界观设定、人物小传、前几集剧情一次性丢给它让它后续生成的内容不会前后矛盾。我实际操作时会在第一天就把“项目档案”喂给AI内容包括题材类型、主角性格、基础设定、目标平台、单集时长、目标观众画像。之后每一次让它写剧本或写分镜开头先提醒一句“根据项目档案”它生成的内容就会稳定很多。直接开口就是“帮我写个剧本”是新手最容易踩的坑没有约束条件的AI写出来的东西十篇有九篇是流水账。分镜阶段要善用对话工具的结构化输出能力。我常用的一句话是“请输出Markdown表格包含镜号、景别、画面描述、台词、预估时长”它每次都能规规矩矩给你一张表。拿到表格之后我会手动检查一遍逻辑连贯性尤其是画面描述和台词的匹配度AI经常会出现台词说“他生气了”但画面描述却是“微笑”这种低级矛盾。这一部分不能用AI输出直接替代思考但它确实把最费时间的流水账工作包掉了。2.2 画面生成静态图和动态生成分开用画面生成是漫剧的核心环节也是最容易把新手搞晕的地方。市面上的AI绘画工具分两类一类是纯文生图、图生图比如Midjourney、Stable Diffusion、国内的即梦、豆包另一类是图生视频比如可灵、即梦视频生成、海螺。漫剧制作中两类都要用但分工完全不同。我带新人的推荐组合是“一个国内平台出图 一个国内平台生视频”。出图用即梦或豆包操作门槛低网页端直接可用中文提示词支持也比较好动态生成用可灵把做好的关键画面传上去生成两三秒的动态镜头人物的呼吸感、发丝飘动、背景云层流动都能模拟出来比纯静态图观感强一大截。有些朋友会用Stable Diffusion做本地部署好处是可控性强、可以训练角色LoRA、批量出图效率高但需要一台配置还行的电脑还要装环境、下模型、调试插件新手第一周很容易消耗在环境问题上。我建议先把网页端流程跑通做出两集成品之后如果你发现对角色一致性的要求特别高再回头研究本地部署也来得及。工具是服务的不是用来供着的。2.3 配音、音乐和剪辑剪映是新手唯一需要的终点站配音和剪辑环节可以打包在一起说因为剪映几乎全干了。AI配音直接用剪映里自带的“文本朗读”功能音色选择里有很多年轻化、情绪化的声音足够漫剧使用。如果你想更精致一点可以用魔音工坊这类独立配音工具颗粒度和情绪控制更好但我的经验是新手阶段剪映的音色完全够用省掉来回导出的麻烦更重要。背景音乐我建议先从剪映的曲库里面挑它的音乐库直接标注了商用范围漫剧这种账号内容用它最不会踩侵权线。如果你对配乐有更高要求可以用Suno这类AI音乐生成工具做原创BGM但需要额外处理版权归属问题前期没必要。剪辑流程本身更简单把图片导入剪映按分镜顺序排好拖入配音自动生成字幕调整每张图的时长让它对应台词加上背景音乐导出。就这些没有什么高深操作。3. 剧本与分镜AI只是白板你得懂一点镜头语言3.1 从一句话到一集大纲漫剧的剧本是“强情节”导向的一句话就能说清楚的事情不要用三句话说。我刚开始做的时候让AI写正经小说式的剧本现场感觉文笔很好放进漫剧里就废了信息密度太低观众十几秒就划走。后来我固定了一个格式世界观三句话、主角核心目标一句话、本集核心冲突一句话、结尾钩子一句话。给AI的指令大概长这样“你是漫剧编剧请设计一集60秒的短剧大纲。背景是现代都市复仇题材主角是被家族赶出去的养女。本集目标是让主角第一次回到家族晚宴。要求有明确冲突和结尾悬念。先给大纲再展开成300字以内的剧本。” 你会发现AI一旦知道时长限制它输出的对话密度会明显提升因为它知道没时间铺垫了。大纲确定后我会自己再做一次“谁在做什么、想要什么、阻碍是什么”的检验。任何一集如果没法回答这个问题剧情就是散的。漫剧制作很快这个缺点在生成素材后才会暴露返工成本远高于多花五分钟想清楚。AI写出来的东西绝大多数时候都是合格的“初稿”但没有你的判断它永远是初稿。3.2 把剧本拆成“可绘画”的分镜脚本分镜是连接“文字故事”和“画面素材”的桥梁这步做不好后面所有AI绘画的工作都会白费。以60秒一集为例语速正常的中文配音大概能说150到200个字我会把它拆成8到12个镜头每个镜头对应一到两句台词时长大概5到8秒。镜头太少画面会显得呆板镜头太多生成工作量又太大这个范围是我试出来最舒服的。拆的时候遵循一个原则人物说这句话时观众的注意力应该落在谁身上这个镜头的画面主体就是谁。两人对话的戏我通常交替使用“带关系的中景”和“发言人的近景”这样剪辑出来有对话感。每个镜头我会在分镜表里写清楚景别、画面内容、台词、是否生成动态。比如“镜号03近景女主冷笑背景是宴会厅灯光台词你以为我还是当年的我动态是”。这个表就是你的项目施工图。下面是我常用的分镜表模板你可以直接抄镜号景别画面内容台词动态01全景雨夜女主撑伞站在别墅门口无台词脚步声是02中景管家开门表情惊讶小姐您怎么回来了是03近景女主抬头眼神冷静我说过我会回来的。是04特写家族众人围坐餐桌表情各异低语声她怎么来了否你可能会发现用表格写分镜还有一个附加好处AI按表生成提示词时不会弄丢信息。这是我做了十几集之后才体会到的前期用纯文本写分镜经常漏掉景别或形象描述改成表格之后出错率直线下降。3.3 提示词的两种写法与稳定模板漫剧提示词不需要像AI绘画发烧友那样写一堆魔法词。我实践下来最稳定的写法是“主体 动作表情 场景 景别 镜头语言 风格 画质”顺序不要乱。举例一个近景镜头我会写“年轻女性黑色长发穿红色晚礼服嘴角上扬露出嘲讽表情站在奢华宴会厅中近景侧面45度视角背景虚化暖色灯光动漫风格高细节高质量”。针对性更强的做法是用“角色描述符”替代“角色名称”因为AI不认识你的女主角叫什么它认识的是“黑色长发、红色晚礼服、眼角有泪痣”这一组特征。这套特征描述要在所有镜头里反复使用这是保证角色一致性的底层技术。不要每次随机写我会在项目文档里固定一个角色描述模板每张图的提示词都从里面复制主体部分。负面词部分网页端平台一般有单独输入框如果平台没提供就在提示词末尾加上“no deformed hands, no extra fingers, no blurry”这类文字大致有用。但说实话与其指望负面词修细节不如多生成几次挑一张最正常的。AI绘画出图快筛选比修复高效得多。4. 画面生成角色一致性是新手最大的一道坎4.1 选对模型与风格漫剧风格最好选“动漫风”而不是“写实风”。原因很简单写实风格最容易崩脸稍微错一点观众就会觉得“恐怖谷”动漫风格容错率高脸崩一点观众也不至于立刻出戏。我用得最多的是动漫、国漫、厚涂这类风格标签生成出来的画面有叙事感也有情绪张力。定了风格之后尽量不要在制作过程中频繁更换。同一集里如果混了三种画风哪怕每张单独看都很好看拼起来也会散架。我的项目文档里会存一个固定风格描述比如“韩漫风格线条干净色彩饱和光影柔和半身构图居多”每一张图的提示词都追加这一段。这是最便宜的一致性保障。4.2 定角色参考图锁脸法新手最容易犯的错是让AI“重新想象”同一个角色结果每张图都长不一样。翻车之后开始怀疑AI能力其实是方法不对。正确做法是先用文生图定妆做出一张你觉得满意的角色正面照或半身像把它保存下来之后的所有镜头都通过“参考图 动作表情描述”的方式生成。具体操作很简单在你用的绘画工具里选择“图生图”或“角色参考”功能上传定妆照然后只描述动作、表情、场景和景别不再单独描述长相。比如上传定妆照后输入“她皱眉看向前方咖啡馆窗边中景”。工具会自动保留参考图里的人物特征只改变姿势和环境。我试过很多次用参考图生成的镜头角色相似度能稳定保持在八成以上纯文字生成的话三张图之后基本就换人了。如果你用的是即梦这类推荐制工具可以把定妆照传上去再让AI生成变体和动作效率更高。角色锁定之后每一集的定妆照也不要变除非剧情需要换装。换装时也用原定妆照做参考图在描述里加“穿黑色夹克”之类的服装描述脸型不会飘太远。4.3 批量出图与筛选标准出图阶段不要追求一张过。我的习惯是每个镜头至少生成4张图一起对比选一张表情最自然、肢体不错乱、构图最稳的。刚开始的时候我会舍不得删觉得“这张虽然手有点怪但整体氛围好”结果放到成片里观众第一眼就看到那只畸形的手。后来我的标准变成只要脸部或手部有明显问题直接淘汰氛围再好也不留。同一场景的多镜头处理也有技巧。我会先出一张全景确定场景氛围和布局然后基于这张全景去出中景、近景这样前后镜头的背景元素能对得上。比如说女主走进宴会厅全景里她是站在大厅中央的那后面她的近景背景也应该有宴会厅的灯光和人影而不是凭空多出一面墙。这个细节不是每个观众都能说清但画面别扭的感觉是能感受到的。文件管理也要认真对待。我的文件夹结构是“集数/镜号_版本”比如“EP03/05_v2.jpg”把备选的图也留在里面。这习惯让我返工时不用翻聊天记录也不会把上一版的图用到新片子里。别笑真到了做几十集的时候这一步能省你大量找图的时间。5. 配音与成片把一堆静态图变成能看的剧5.1 AI配音的节奏与情绪控制素材集齐之后第一步是配音因为后面的剪辑节奏都要跟着配音走。AI配音最大的问题是“平”念什么都像播新闻。我的解决办法是用标点符号控制断句用括号标注情绪。比如“你竟然还敢回来”这句话我会写成“你竟然还敢回来……呵看来是长本事了。” 省略号能制造停顿感“呵”字能带出冷笑的语境AI配音的呈现效果立刻不一样。更要紧的是每一句不要太长。AI配音一口气念超过十五个字气息感就很假。所以剧本阶段就要把长句拆成短句到配音阶段再检查一遍发现句子太长就手动加逗号让它断一断。剪映的AI配音支持导入文本后局部调整我一般是整段文本导入后逐句试听感觉情绪不够就加标注速度太慢就调整全局变速到1.05倍左右。音色选择上一个角色尽量固定一个音色到底。多人对话时我习惯把不同角色安排成有明显区分的音色比如女主是清冷女声反派是低沉男声这样观众靠耳朵就能区分人物不需要每句话都盯字幕。剪映里可以先分别给每个角色生成整段的配音再一次性导入到不同轨道上省得一句一句对。5.2 剪辑合成流程纯实操步骤我给新手的剪辑流程永远是同一套按顺序做不会乱在剪映里新建16:9横屏项目。把分镜图按镜号顺序全部拖入轨道。先把所有图片的默认时长设为2.5秒占满全轨。把配音文件拖到音频轨试听整体时长。根据每句台词的起止时间把对应镜头的图片时长拉长或缩短让画面和台词对位。对需要动态感的镜头在这个阶段替换为之前用图生视频生成的动态片段。给每个镜头加微小的画面缩放关键帧起点缩放1.0终点1.06到1.08模拟镜头缓慢推进。第5步是最花时间的但也最重要。图片时长不是平均分配的台词多的镜头停留久一点没台词的镜头两秒就切走。如果某一镜头画面信息量很大比如全景交代场景我会给它留3秒以上让观众看清楚近景对话镜头则可以压到2秒以内保持节奏。整集看完如果连续三个镜头都纹丝不动显得呆板就回去调整缩放或替换成动态片段。导出格式我建议1080p、30帧即可。漫剧不是特效大片4K导出的文件体积大、上传慢观众在手机上看到的实际画质差异几乎为零。5.3 字幕、音效与转场字幕用的是剪映自动识别功能识别完成后我会逐条对照台词文本校对AI识别错字概率不低尤其在人名、地名这些生僻词上。字幕样式我习惯用纯白字体加黑色描边字号大一点放在画面下方三分之一的安全区内。不要用花哨的艺术字体漫剧的信息密度高字幕要一眼能读完。音效是新手最容易忽略但性价比最高的环节。漫剧不需要全程铺音效但在几个关键位置加上会有质的提升场景转换时加一声“砰”或者白噪声过渡拳头打斗时加撞击声手机铃声响起前加震动声惊悚反转时加低音隆隆声。剪映自带的音效库搜“转场”“打斗”“心跳”能找到大部分常用素材。转场效果我建议克制。淡入淡出是最稳妥的闪白用来表现回忆或震惊冲击转场用于动作戏不超过两处。慕一下这些效果一集用多了就油腻。我见过很多新手把转场当玩具什么效果都来一下结果观众注意力全被转场吸走剧情反而没人看了。6. 常见问题排查清单与我的经验6.1 问题速查表做完几部漫剧我把自己和周围人踩过的坑整理成一张速查表遇到问题照着对就行。问题现象主要原因解决方案同一角色每张图都不一样没有用参考图生成定妆照全程用图生图锁脸图生视频后五官变形画面主体太大、运动幅度过大改小主体比例让人物动作幅度减小只生成轻微动态配音节奏太平句子太长、没有情绪标注拆短句加标点和表情括号字幕错字多语音识别能力有限逐条对照台词手动修改画面节奏拖沓图片时长一律过长无台词镜头压到2秒台词结束立刻切背景音乐盖住人声音乐音量过高BGM音量降至-25dB以下开启人声增强成片看起来像PPT缺乏动态用图生视频生成关键动态镜头或加缩放关键帧续集画风突变提示词风格描述不一致项目文档保存统一风格描述每张图都追加这张表里的每一个问题我都真实遇到过其中“PPT观感”和“面部变形”是劝退新手最多的两个。记住一个原则优先保证角色能认出来再去追求画面的炫酷。6.2 踩坑心得最后分享几条比较碎但很值钱的经验。第一条先做三集再决定是不是要继续做长。我见过太多人第一周热情高涨做了十几集然后发现选题根本没流量全部作废。三集是一个能验证数据和手感的最小单位用它去测观众反应比闷头做五十集稳妥得多。第二条每集的关键词、提示词和定妆图一定保留好。不要全部存在AI工具的对话记录里工具升级换代很快记录说没就没。我在本地维护一个简单的项目文件分类放“角色描述”“风格描述”“提示词模板”“分镜表”换工具或换电脑都能无缝接上。第三条在脚本阶段就想清楚版权和合规问题。漫剧最好做原创剧本不要直接改编还在版权期的小说、漫画或影视作品角色形象也不要刻意模仿真人明星或知名IP角色。各平台对AIGC内容有不同的标注和审核要求投发之前先看清楚平台规则。AI降低了创作门槛但它没有豁免创作责任该守的底线一样要守这也恰恰是漫剧能长久做下去的前提。最后说一个我个人的习惯每集成片导出前我会先静音看一遍画面确认节奏和转场再只听配音看一遍字幕确认信息完整最后全开完整看一遍确认没有低级错误。这轮检查能筛掉一半以上的翻车问题。AI把工具门槛降得很低但把成品从“能看”推到“能追”靠的还是你对故事节奏的那点判断力。这一点工具永远替代不了。