每次刷到AI生成的短视频后台总有人问同一个问题AI视频到底是怎么做出来的我也踩过不少坑最开始以为随便输入一段文字就能生成整条片子后来发现完全不是这么回事。AI视频的真正玩法是把传统视频制作拆成剧本、分镜、画面、配音、剪辑几个环节每个环节用对应的AI工具辅助最后拼合成片。今天就把这套我自己反复跑通的完整流程整理出来零基础的朋友也可以直接照做。先说清楚一件事这条流程不是“一键出片”而是“半自动流水线”。AI负责把最费时的画面生成和配音部分接过去但剧本结构、镜头节奏、素材挑选这些决定成品质量的工作还是得自己把关。整套流程走下来一条30秒左右的短视频熟练之后差不多一两个小时能完成。下面按实际制作顺序从思路到实操一步步拆开讲。1. 内容整体设计与思路拆解1.1 为什么选“剧本-分镜-图生视频-剪辑”这条链路目前AI视频生成有两个路线可选文生视频和图生视频。文生视频就是你输入一句话描述AI直接生成一段视频快是快但问题也很明显——角色长相不固定、场景变化随机、风格飘忽不定。你让AI生成“一个女生在街头喝咖啡”它可能给你生成三个完全不像同一个人物的片段。对零基础用户来说这种随机性会让后续剪辑根本没法接。图生视频走的路线不一样先让AI生成一张静态图片再把这张图片“动起来”。相当于你手里有一张剧照让导演喊了一声“Action”画面里的角色才开始移动。这种方式最大的优势是可控——画面主体、构图、色调在生成图片的时候就已经确定视频阶段只是在图片的基础上加运动角色不会突然“换脸”。所以对没有剪辑经验的新手来说图生视频是更稳的起点。我用一个生活化的类比解释这件事把做AI视频想象成做饭。文生视频等于把一堆食材扔进自动炒菜机按一个键等它出菜但做出来什么完全靠运气。而图生视频相当于你先把菜切好、摆好盘再开火翻炒AI只负责最后那一下“烹饪”味道基本能预判。零基础阶段我们不需要追求自动化程度多高稳定可复现才是第一位的。这整条链路本质上就是把传统视频制作流程拆成六个环节剧本、分镜、画面、动态化、配音剪辑、成片。传统剧组拍一条片子需要编剧、导演、美术、摄影、录音、剪辑一组人现在这些角色都由你一个人加几个AI工具完成。结构不变只是每个位置都有了替代方案。1.2 零基础友好的工具选型与分工工具不用多关键是每一环都有明确分工。我按流程顺序整理了实际在用的搭配剧本与分镜Kimi、豆包这类大模型对话工具用来头脑风暴和写分镜描述。文生图即梦AI、通义万相负责生成静态画面。图生视频可灵、即梦的AI视频功能让静态图动起来。配音与剪辑剪映内置AI配音、字幕识别、音乐音效库一个软件搞定。这组搭配的好处是门槛低除剪映外基本都是网页端或手机App操作不需要高性能电脑。后面每个环节我会单独讲操作细节这里先提醒一句所有工具都去官方应用商店或官网下载不要碰来路不明的“免费版”“破解版”轻则用不了重则设备中招完全没必要冒这个风险。关于版权也要特别注意文生图生成的画面如果带明显品牌标识、名人肖像或者模仿某个还在版权期内的IP角色尽量不要直接商用。剪映自带的音乐和字体库已经解决了大部分版权问题比你自己去网上随便下载靠谱得多。我用AI做视频这么久最深的体会是技术上的坑都能填版权意识才是新手最容易忽略的雷区。2. 从剧本到分镜先想清楚再动手2.1 用AI生成剧本但别照单全收很多人一上来就直接打开视频生成工具输入一句话然后抱怨效果差。原因很简单AI视频生成是有成本的你给它一条模糊指令它就还你一条模糊视频。就像一个建筑师没有施工图就直接盖楼盖出来什么歪瓜裂枣都不奇怪。所以第一步必须先有一个能用的剧本。写剧本这件事对新手来说有心理门槛总觉得要“会编故事”。其实短视频剧本根本不需要多复杂30秒的片子只需要三件事一个简单场景、一个人物、一个小变化。我给一个可以直接抄的prompt模板你把它复制到Kimi或者豆包里替换里面的关键词就行“你是一位短视频编剧请帮我写一个约30秒的竖屏故事。主题是这里填你的主题比如一只猫帮主人找回了丢失的钥匙。要求开头3秒内出现冲突或悬念中间展示解决问题的过程结尾给一个意想不到的小反转全程不超过2个角色、不超过3个场景每句台词控制在15个字以内。”AI给出来的结果通常都比较啰嗦这时候需要你自己动手删。判断标准很简单删掉之后故事还通不通通就删。我实际用过几次后发现AI生成的剧本里真正有用的往往只有核心创意比如“猫叼着钥匙跳到主人面前”这个画面剩下的对话和细节都需要人工精简。别偷懒这一步是在给后面的分镜省事。如果你暂时没有主题想法可以直接告诉AI“随便给我5个适合AI视频的30秒小故事创意”让它帮你做头脑风暴。但记住AI提的是选项拍板的是你。最后定稿的剧本不用多长列清楚“谁、在哪、遇到什么事、结局是什么”就够了。2.2 分镜脚本视频制作的“施工图纸”剧本解决“讲什么故事”分镜解决“每个镜头拍什么”。分镜脚本是整个流程里最重要的中间产物AI视频能不能顺利剪出来基本都靠分镜表撑着。我见过太多人跳过这一步直接生成素材结果素材之间根本接不上最后只能重来比老老实实做分镜慢多了。对零基础来说分镜不需要画得多专业一个表格就够了。每行写清楚一个镜头的信息。我先给一个示例后面你直接套用镜头号景别画面描述台词/配音时长1全景傍晚的城市天台一个穿米色卫衣的女生站在围栏边看向远方环境音3秒2近景女生低头看手机屏幕亮起显示一条未读消息旁白“就是这一刻她的生活被打乱了。”4秒3特写手机屏幕上出现一个陌生地址旁白“她决定去看一眼。”3秒4远景女生走出小区门街道上行人稀疏脚步声3秒画面描述要满足一个要求每个镜头都必须有一个明确的动作词。你可以写“女生从椅子上站起来拿起包”这样具体的动作但不要写“女生看起来很迷茫”这种抽象状态。AI生成画面时是根据描述里的名词和动词来反应的动作越具体生成结果越准确。景别决定画面里主体的大小远景拍环境、全景拍全身、中景拍半身、近景拍脸部、特写拍细节这个表格里写好景别后面文生图的时候才能让画面有变化剪辑起来才不单调。30秒的视频8到12个镜头比较合适。单个镜头时长控制在2到4秒太短画面没看清就切了太长又容易让观众走神。分镜表做完之后整个片子其实已经在脑子里放完一遍了。3. 画面生成与动态化从静态图到能动的素材3.1 文生图角色一致性是最大难点分镜表完成之后最难的一步就来了让AI生成一组看起来像是同一个故事里的画面。这一步的核心不是画质而是角色一致性——就是说镜头1里的女生和镜头4里走在大街上的女生必须长得像同一个人否则故事直接塌掉。我总结出一套文生图的描述公式基本能覆盖大多数场景。一个完整的画面描述应该包含这六个要素主体、动作、环境、风格、光线、画幅。举个例子“一个二十多岁的女生齐肩黑色短发穿米色卫衣站在城市天台围栏边低头看手机傍晚金色阳光电影感摄影风格浅景深暖色调竖版9:16。”注意看这里面主体特征非常具体——短发、卫衣、米色这几个关键词在后面所有镜头里都必须原样保留。换环境可以但发型和衣服不能换这就是角色一致性的基本盘。我建议你先单独生成一张“角色定妆图”从AI给你的七八张结果里挑一张最满意、最清晰的作为参考图后续所有镜头都用这一张做基准。实际操作中有几个细节值得留意。第一同一个人物在不同镜头里的服装如果确实需要变化比如进房间后脱掉外套那就在分镜表中提前标注好颜色和款式否则AI很容易自由发挥。第二画幅比例一定在文生图阶段就固定下来竖屏就全部用9:16横屏就全部用16:9中途切换画幅是新手最常见的失误后期剪辑时比例不统一画面要么留黑边要么裁掉主体。第三多生成几个备选不会亏一个镜头生成四到六张图挑一张构图最合适的用比反复重试效率高得多。3.2 图生视频让静态画面动起来图片确定之后进入图生视频环节。以可灵、即梦这类工具为例操作路径基本一致上传刚才选好的图片输入运动描述选择参数生成视频。运动描述和文生图的描述写法不一样。文生图描述的是“画面里有什么”图生视频描述的是“画面里发生了什么变化”。比如前面的天台镜头运动描述可以这样写“镜头缓慢推进女生抬起头视线看向远方发丝轻微飘动背景云层缓缓移动。”这里的关键词是“缓慢”和“轻微”。我不是在客气是真心的建议。AI图生视频最典型的问题就是人物脸部变形而变形几乎都发生在运动幅度太大的情况下。你把运动描述写成“快速转头、大步奔跑”AI就会在关键帧之间疯狂脑补结果人脸直接扭曲成一团。所以零基础阶段运动描述的通用模板是动作动词加“缓慢”“微微”“轻轻”这类限制副词。时长参数要特别注意。大多数图生视频工具支持生成3秒、5秒、8秒甚至更长但我的实操经验是3到5秒最稳。超过8秒画面越往后越容易失控角色开始出现诡异的手指数、脸的形状也会飘。剪辑本来就要切成短镜头没必要让单段视频太长生成多段3秒片段拼接的效果远好于一段8秒的长镜头。再说一个容易被忽视的点运动描述里也可以加镜头语言。你想让镜头从远到近就在描述里写“镜头缓慢推进”。想让镜头平移就写“镜头从人物左侧缓慢移到右侧”。AI视频工具在很大程度上能理解这些镜头术语提前掌握这个技巧能让你的片子看起来像正经拍出来的而不是一镜到底的监控录像。3.3 画面统一与内容红线画面统一这件事我在实际做项目的过程中发现很多新手根本不重视。单独看每一张图都挺好的拼在一起就说不出的别扭。原因是风格不统一。解决办法是在所有画面描述里共用同一组风格词比如“电影感”“柔和光线”“暖色调”“35mm镜头摄影风格”这四个词写进每一个镜头的描述里出来的画面就基本处于同一个视觉世界。内容红线这里必须单说。AI生成工具对内容的审核比人类创作者更严格也更容易误判生成前就自觉避开暴力、惊悚、血腥、色情、政治敏感、名人恶搞、品牌标志、儿童非正常场景等内容。不只是为了通过审核也是保证视频能正常发布、长期留存。我见过有人拿AI生成幼态人物视频平台直接封号完全没有申诉余地。AI视频创作的红线意识怎么强调都不过分。4. 配音、配乐与剪辑成片让素材真正成为一条视频4.1 AI配音语速与情感的平衡画面素材全部生成之后接下来就是声音部分。剪映的AI配音功能已经非常成熟不需要单独安装任何软件。操作流程是这样的把分镜表里的台词列整理成一段文本粘贴进剪映的文本朗读功能选择一个合适的音色生成后用“朗读”方式拖到时间轴上对位置。新手最容易踩的坑是语速。AI配音默认语速往往偏快自动生成的字幕还没看清就过去了。我的建议是把语速拉回1.0倍甚至0.9倍短视频的观众不会因为你语速慢划走但看不懂字幕是真的会划走。另外一句话里如果有关键信息比如一个地名、一个数字最好在文本里用标点符号隔开AI朗读时会自动停顿听感会自然很多。音色选择也有一点讲究剧情类视频用青年男声或女声比较中性口播类视频可以选更有辨识度的音色。剪映里每种音色都有试听多试几个挑一个和画面气质最接近的。情感表达方面AI配音能实现的基本是语气层的区别——疑问句末尾“吗”字会抬高感叹句会用加重音写作台词的时候把这些标点写清楚AI就会自动帮你处理情绪。如果你想让某句话带明显的哭腔或笑声那就得靠配音演员了AI暂时做不到别在这上面浪费时间。4.2 配乐与音效节奏决定观感配乐是整个流程里最“玄学”的一环但也最有规律可循。先说结论音乐决定镜头切换的节奏感所以你最好先定音乐再对镜头。剪辑软件里导入音乐后波形图上的波峰会规律性地出现这些波峰对应的就是重拍。传统剪辑技巧里有个“卡点”的概念就是在音乐重拍的那一帧切换画面观众会觉得整个片子非常流畅。零基础不需要精确到帧。你只需要做到两点第一30秒的视频配30秒到40秒的音乐导出前把音乐尾音裁干净第二切换镜头的时机尽量落在你能听到的节拍上不用数拍子凭“咚—咚—哒”的感觉就行。剪映的音乐推荐算法比大部分人自己选歌靠谱直接用它的推荐挑一首带清晰鼓点的。音效是常被忽略的加分项零基础可以先不加但如果你想进阶就从最基础的三个音效开始脚步声、环境底噪、物体碰撞声。比如前面分镜表里的“女生走出小区门”你配上一段轻微的脚步声画面就立刻从“PPT”变成了“视频”。剪映音效素材库里这些都有搜索关键词就能找到。4.3 剪映成片六步走完最后流程素材齐了声音有了最后一步是把所有东西组装起来。剪映的完整操作流程我拆成六步照着做就行导入所有图生视频生成的片段按分镜表顺序拖入时间轴。粗剪把每段视频掐头去尾保留画面稳定的核心部分。这里删掉的是AI生成视频里典型的“前摇后摇”——开头和结尾画面相对静止、甚至轻微变形的部分。拖入配音文件对准对应的画面位置。如果某句台词对应的画面偏长或偏短优先调整画面对齐配音不要反过来迁就画面。使用“智能字幕”功能自动识别字幕然后逐句检查。AI识别会把“钥匙”听成“要是”人名和地名更是重灾区一定要手动修改错别字和断句。加转场和调色。转场统一用“叠化”或“闪白”时长不超过0.3秒花里胡哨的转场会让片子显得廉价。调色只需要做一件事对比度加5到10饱和度加3到5AI生成的画面普遍偏灰微调后质感会有明显提升。导出时选择1080P、30帧、最高码率。竖屏选9:16横屏选16:9不要用软件默认的“智能”选项手动固定画幅。这一步完成一条从剧本到成片的AI视频就算真正出炉了。5. 高频问题排查与实操心得5.1 新手最容易踩的坑速查表我在做了十几条AI视频之后整理了这份常见问题清单基本都是新手必踩的坑建议收藏备用。问题表现常见原因解决办法角色换个镜头就变样文生图时没有锁定参考图和固定关键词选一张角色定妆图作为参考图所有镜头共用发型、服装、颜色关键词人物脸部扭曲变形运动描述幅度太大或视频时长过长运动描述用“缓慢”“轻微”单段生成控制在3到5秒画面模糊生成分辨率偏低或运动速度太快生成时选最高分辨率运动描述避免“快速奔跑”“剧烈晃动”这类词配音和画面节奏对不上先剪画面后配配音导致画面时间被配音牵着走先按分镜时长粗剪画面再拖入配音微调必要时裁剪画面段落字幕错别字、断句错误AI语音识别能力有限尤其人名和同音词导出前逐句人工核对字幕文本同一批素材风格差异大每个镜头的文生图描述没有共用风格关键词所有镜头描述统一加入“电影感、暖色调、柔和光线”等风格词视频比例不统一导出后画面被裁切生成时画幅没固定或导出时选了自动匹配从文生图阶段就固定9:16或16:9导出时手动指定比例生成结果被平台拦截或审核不通过描述里包含违规内容、品牌标识、名人肖像生成前自查描述词删除品牌名、真实人物姓名、敏感场景词5.2 我跑通这条流程后的几条实操心得最后说几个没法放进表格里的真实体会全是从一次次返工里总结出来的。第一中间文件一定要分类保存。我的工作文件夹结构是这样的00_剧本、01_分镜表、02_生成图、03_生成视频、04_配音、05_剪辑工程每个文件夹按镜头号命名。别嫌麻烦AI视频制作是迭代型工作角色侧脸才好看、某个镜头要重生成、配音要换音色这些情况随时会发生没有清晰的目录结构找素材就能耗掉半条命。第二批量生成比精雕细琢效率高得多。同一个镜头我一口气生成三到四个版本然后从中选一个最稳的。与其反复调整一个失败的结果不如让AI多出几个选项你来挑。这是AI视频制作和传统视频制作思维上最大的不同传统拍摄NG重来代价高AI生成重来几乎零成本所以要多“拍几条”择优录取。第三AI视频的工具更新速度很快。我现在用的这套工作流半年后可能就有更顺手的替代方案。但流程框架不会变——先有剧本再有分镜然后生成画面最后配音剪辑。工具可以换思路才是根本。第四也是最重要的别追求太长的视频。我见过不少新人一上来就做60秒甚至90秒的片结果生成素材几百个、剪辑一头雾水、最后成品节奏拖沓。从10到20秒的极短片开始先把“剧本到成片”这条链路完整跑一遍再逐步加时长、加复杂度。做出来一条10秒的完整精品比做出来一条90秒的烂片有价值得多。我自己第一支完整的AI视频只有12秒内容就是“一只猫把主人的钥匙从沙发底下叼出来”但就是这12秒让我把整个流程彻底跑通了。之后再做30秒、40秒的片子都只是在这个骨架上加肉而已。AI视频的制作门槛已经很低了但尊重流程、稳扎稳打才是零基础少走弯路的最好方式。