简介这是一份手把手的本地化AI图文视频生成网站搭建教程面向想上手Stable Diffusion/Midjourney的AI绘画爱好者与开发者解决从环境部署到生成真人图片、动画视频及让图片开口说话的全流程问题。整套教程打包为1个PDF文档压缩包大小约6.45MB内容结构清晰附有源码链接与详细操作指引。目前已有719人浏览学习教程按5个目录展开搭建AI网站、模型下载安装、汉化插件、生成模拟真人图片含不同风格与动画视频、图片开口说话并提供了GitHub仓库、Civitai模型下载与插件地址等实用资源。从创建conda虚拟环境、克隆部署stable-diffusion-webui、安装GPU版PyTorch到配置ChilloutMix模型与汉化界面每一步都有直观说明适合零基础读者按步骤实操读者还可将生成的图片结合语音合成实现“开口说话”探索更具创意的多媒体玩法同时注意遵循相关开源许可与隐私规范。1. 本地化图文视频生成网站从零部署一套能跑图的 Stable Diffusion WebUI很多人一听到“本地化 Midjourney”就以为要有一张几万块的显卡其实把一套 Stable Diffusion WebUI 搭起来最难的不是出图而是把 Python、CUDA、模型和扩展在本地串成一条能跑的链路。这份教程资源的价值在于它把整个搭建过程拆成了 5 个可复现的目录环境部署、模型下载、汉化、生成真人风格图片、生成动画最后还带了一步让图片开口说话。也就是说它覆盖的不只是“出一张图”而是静态图、风格化、动画、数字人全流程。适合两类人一类是受不了在线服务隐私限制、想把生成记录留在本机的从业者另一类是刚接触 Stable Diffusion、想在 C 站Civitai模型生态里试水的新手。下面按我实际复现的顺序讲命令是原教程的坑是我自己踩的。2. 搭建基础环境Python 3.10.6、conda 虚拟环境与 GPU 版 PyTorch2.1 为什么版本卡得这么死Python 3.10.6 是兼容性基准线原教程第一步就让装 Python 3.10.6很多人不理解为啥不能直接用系统里最新的 3.12。这里有个实际原因stable-diffusion-webui 的依赖树里transformers、torchvision、xformers 这些库对 Python 版本的适配是滞后的3.10.x 是官方社区里兼容性最好的基准。你如果拿 3.11 或 3.12 硬跑大概率会在安装某个依赖时碰上“找不到对应 wheel”然后编译报错最后浪费时间在修环境上而不是出图上。所以别嫌版本老这是社区用脚投票选出来的。如果你机器上已经装了其他 Python 版本最常见的方法是开一个 conda 虚拟环境把版本锁定在 3.10.6不要动系统级 Python。命令如下conda create -n novelai python3.10.6这里-n novelai是给这个环境起名你可以随意换成sd-webui或sd-localpython3.10.6是精确锁版本注意是两个等号。创建完之后激活conda activate novelai python --version代码里的conda activate会切换当前 shell 到该环境python --version用来确认版本确实是 3.10.6。我一般习惯在创建后先跑这一步因为偶尔 conda 会解析到 3.10.x 的最后一个小版本虽然差异不大但锁死最稳妥。激活后后续所有安装命令都要在这个环境下执行否则容易装到系统 Python 里。2.2 克隆仓库与 GPU 版 PyTorch先确认 CUDA 再选安装命令环境准备好之后把 WebUI 的前端工程克隆到本地。原教程用的是 AUTOMATIC1111 的 stable-diffusion-webui这也是目前插件生态最全的一个实现git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui cd stable-diffusion-webuigit clone会把整个仓库拉到你当前目录下cd进入工程根目录。注意这个仓库体积不小加上历史提交可能几百 MB网络不好的时候很容易 clone 到一半失败后面第 5 章我会单独说这个问题。接下来是安装 GPU 版 PyTorch。这一步最关键的是先搞清楚你的显卡驱动支持哪个 CUDA 版本。原教程给的是 PyTorch 官方站点pytorch.org/get-started/locally自动生成的命令页面上会让你选操作系统、包管理器和 CUDA 版本。我建议你先在命令行里确认一下本机 CUDAnvidia-sminvidia-smi输出的右上角会显示CUDA Version: 12.1之类的字样这是驱动支持的最高 CUDA 版本。你安装的 PyTorch 只要 CUDA 版本 这个值就行不必完全一致。对应关系大致如下显卡驱动 CUDA 版本PyTorch 安装时可选的 CUDA推荐命令片段11.8cu118--index-url https://download.pytorch.org/whl/cu11812.1 及以上cu121 / cu124--index-url https://download.pytorch.org/whl/cu121然后在激活的 conda 环境里执行安装比如 CUDA 12.1 的版本python -m pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121--index-url指定从 PyTorch 官方 wheel 源安装保证拉到的是带 CUDA 的编译版本如果直接pip install torch默认装的是 CPU 版后面跑图会慢到怀疑人生。装完验证一次import torch print(torch.__version__, torch.cuda.is_available())输出里torch.__version__应该类似2.1.0cu121torch.cuda.is_available()必须是True。如果这里显示False说明 PyTorch 没识别到显卡先别继续往下走回头核对 CUDA 版本或驱动。这一步是整个搭建过程里最值得停下来检查的点因为它直接决定后续所有生成任务的可用性。2.3 安装第三方依赖与首次启动耐心等第一轮加载PyTorch 就绪后进入工程目录安装 requirements.txtcd stable-diffusion-webui python -m pip install -r requirements.txt-r requirements.txt会按文件里锁定的依赖列表逐一安装。这个文件里的依赖都是 WebUI 运行时必需的包括 gradio网页界面框架、transformers、 safetensors 等。安装过程可能会比较久尤其是当你没有用 conda 而直接用系统 Python 时容易出现权限问题或版本冲突。启动主程序有两种方式原教程直接用了launch.pypython launch.py不过我更推荐用工程自带的启动脚本webui-user.batWindows或webui.shLinux/macOS因为脚本里会预设一些常用参数并且会自动检查依赖是否完整。首次启动时launch.py 会做两件事一是把 models 目录下的基础模型文件补齐二是编译部分 CUDA 算子。这个过程可能持续十几分钟命令行会滚动输出大量信息属于正常现象不要中途 CtrlC。等命令行里出现Local URL: http://127.0.0.1:7860时就说明服务起来了浏览器打开这个地址就能看到 WebUI 界面。如果启动时报显存不足可以在启动脚本里加启动参数8GB 显存加--medvram6GB 加--lowvram这能显著降低显存峰值占用。另外如果 xformers 装不上也可以改用--opt-sdp-attention效果接近且省去一个编译环节。3. 模型与汉化让 WebUI 能画真人和看得懂中文3.1 模型决定画风上限从 C 站获取 ChilloutMixWebUI 本身只是个空壳默认不带任何模型你得自己下载别人训练好的权重文件。原教程指向的是 Civitai被社区称为“C 站”地址是 civitai.com上面有大量已经训练好的模型每个模型页会附带生成示例图和对应提示词。真人风格目前社区用的比较多的是 ChilloutMix 这个模型它是以写实人像为方向训练的搭配适当的提示词能生成相当逼真的肖像。下载时注意两点优先选.safetensors格式而不是.ckpt因为前者不会包含恶意代码安全性更好文件名保留英文和数字不要改成一堆中文名否则 WebUI 模型列表里可能显示乱码。下载完成后把模型文件放到stable-diffusion-webui/models/Stable-diffusion/放进去之后回到 WebUI 页面左上角模型下拉框里点击刷新按钮才能看到新模型。如果刷新后还是没有八成是路径放错了确认一下目录名大小写WebUI 对Stable-diffusion这个目录名是敏感的。有一点要提醒Civitai 在部分网络环境下访问不稳定如果你打不开可以去 Hugging Face 搜同名模型按模型卡说明下载下载完核对一下文件大小是否一致。不要从来源不明的网盘下载模型文件被植入后门的事在社区里发生过不止一次。3.2 LoRA在不换底模的前提下切换画风底模决定整体风格基底但你想在同一套底模下画不同风格的图就要靠 LoRA。LoRA 是一种小体积的微调模型通常几十到几百 MB作用是在出图时给特定的风格、人物或物体特征加权。原教程举的例子是原神风格 LoRA从 C 站下载后放进models/Lora目录。stable-diffusion-webui/models/Lora/在 WebUI 的文生图页面里点击生成按钮下方的小图标会弹出一个 LoRA 列表选中后提示词框里会自动插入一段文本类似lora:genshin:0.8。这段文本里的0.8就是权重表示 LoRA 对画面的影响程度。权重调太高容易画风过饱和、人物油腻调太低则几乎看不出效果。我的经验是先从 0.7 起步不满意再以 0.05 为步进微调。3.3 汉化插件三分钟让界面变中文stable-diffusion-webui 的默认界面是全英文的官方没有内置中文需要安装第三方汉化插件。原教程用的是 dtlnor 的 stable-diffusion-webui-localization-zh_CN安装方式有两种一种是在 WebUI 的 Extensions 选项卡里搜索安装另一种是直接从 GitHub 克隆cd stable-diffusion-webui/extensions git clone https://github.com/dtlnor/stable-diffusion-webui-localization-zh_CN注意这里是克隆到extensions目录不是顶层目录克隆错位置插件不会被识别。装完后重启 WebUI依次点击 Settings - User interface - Localization在下拉框里选zh_CN然后点页面顶部的 Apply settings 并重启界面。如果汉化只生效了一部分或者菜单还是英文先检查是不是在扩展列表里禁用了该插件有时候新装的扩展默认是关闭的需要在 Extensions - Installed 里勾选 Enabled。4. 生成模拟真人图片提示词、参数与 LoRA 的配合实战4.1 从 C 站复制提示词的正确姿势模型装好、界面汉化完成之后最难的部分实际上是提示词。纯靠自写达到 C 站示例图的效果不太现实更高效的方式是直接参考别人已经验证过的提示词。原教程的方法很直接在 C 站找到一张你喜欢的真人风格图片点开详情把作者公开的正向 Prompt 复制到「提示词」输入框把反向 PromptNegative Prompt复制到对应的负向提示词框然后点生成。值得强调的是负向提示词的重要性。负向提示词的作用是告诉模型“不要画什么”你通常会看到别人填的是lowres, bad anatomy, bad hands, missing fingers, extra digits这类词组。这些词是有顺序讲究的靠前的关键词对画面约束力更强。如果你生成的人脸出现手指畸形或者背景糊成一团先检查负向提示词是不是漏了bad hands和bad anatomy。另外C站图片详情页里的提示词往往是别人直接从 WebUI 导出的里面可能包含lora:xxx:0.8这类标签。如果你没下载对应的 LoRA复制过来后这部分是不会生效的甚至可能出现红色报错。复制的提示词一定要先扫一遍有没有不认识的 LoRA 标签再决定要不要下载对应的小模型。4.2 参数设置采样器、步数、CFG 与分辨率的关系原教程里没有细讲参数但这恰恰是新手最容易翻车的地方。参考 C 站示例时每个图片详情页通常也会展示生成参数可以直接照搬。如果对方没给我一般用下面这套参数项推荐值说明Sampling methodDPM 2M Karras真人写实风格收敛快细节好Sampling steps20~30步数太少图发糊太多不会显著提升CFG Scale7~11控制提示词服从度太低图散太高过曝Width × Height512×768 或 768×512竖构图人像选前者横构图场景选后者Denoising strength0.4~0.7图生图时才用到重绘幅度采样器这一项最容易踩坑。ChilloutMix 这类真人模型在训练时大多用了特定的采样器预设原教程评论区有人反馈“换了个采样器出图就变得灰蒙蒙的”。这是正常现象不同采样器对噪声轨迹的处理方式不同如果你复现不出示例图的效果把采样器换成示例图同款试试往往能解决大半问题。步数方面20 步和 30 步的差异其实很小超过 30 步基本是徒增等待时间。分辨率的选择要结合你的显卡显存。1024×1024 的图在 6GB 显存上会比较吃力容易爆显存或者生成时间极长我一般在 8GB 显存上跑 768×1024再开启高分辨率修复Hires. fix让画面细节更锐利。Hires. fix 的放大倍数建议 1.5~2 倍再高容易产生塑料质感。4.3 实战用底模 LoRA 组合生成一张真人风格图把前面的环节串起来一次完整的生成操作是这样的。先选好底模我以 ChilloutMix 为例然后在正向提示词框里填基础描述再插入 LoRA 标签masterpiece, best quality, 1girl, solo, looking at viewer, soft lighting, detailed face, realistic skin texture, lora:gensiIn:0.75负向提示词框里填lowres, bad anatomy, bad hands, missing fingers, extra digits, worst quality, jpeg artifacts, blurry, watermark这里masterpiece, best quality是常见的质量前缀词用来提升整体画面完成度1girl, solo限定主体数量和构图looking at viewer让视线朝向镜头适合做肖像类素材realistic skin texture是真人风格的关键词能避免皮肤像塑料一样光滑。lora:gensiIn:0.75是 LoRA 的调用格式中间的模型名要和models/Lora目录下的文件名对应权重0.75是画风介入程度。如果生成结果偏暗或者人脸不正先检查一下是不是提示词里缺少soft lighting这类光照描述如果画面有过曝倾向把 CFG Scale 从 11 降到 8 试试。生成不是一次到位的事通常要调三五次才能逼近想要的效果这部分耐心比技术重要。5. 避坑环境、模型与出图最常见的五个问题5.1 Git clone 中途失败或速度极慢现象git clone仓库时卡在某个进度不动或者直接报fatal: early EOF。原因stable-diffusion-webui 仓库体积大普通网络下长连接容易被中断git 没有完整接收数据包就会报错。解决我一般先试一次完整 clone失败后改用镜像仓库或直接下载 zip 包。具体做法是进入 GitHub 仓库页面用 Code - Download ZIP 下载压缩包解压到本地同样能得到完整的工程文件。注意下载 zip 的方式后续没法用git pull更新代码但对你本地跑通流程没有影响。另外也可以把原仓库导入到 Gitee 这类国内代码托管平台再从 Gitee 克隆速度会快很多。5.2 Python 版本不对导致依赖安装编译失败现象安装 requirements.txt 时日志里出现Failed to build xxx或No matching distribution found。原因新版 Python 下某些依赖没有预编译的 wheel 包pip 只能尝试本地编译源码然而编译环境缺工具链或依赖版本不匹配。解决回退到 Python 3.10.6 的 conda 环境。检查当前环境的 Python 版本是否真的是 3.10.6如果 conda 里配的源找不到这个精确版本通常会退到最近的 3.10.x问题不大但不要用 3.11 及以上。确认后重新激活环境再执行安装不要把命令跑到系统 Python 里。5.3 模型放进去了但 WebUI 下拉框里不显示现象下载的模型文件已经放到models/Stable-diffusion目录刷新后列表里还是空的或者只有默认模型。原因一种是路径写错放到了其他目录另一种是 WebUI 的模型缓存没有刷新或者模型文件本身损坏。解决先确认路径然后点模型下拉框旁边的刷新图标。如果还不行关掉 WebUI 进程重新启动启动时 launch.py 会重新扫描模型目录。再不行就检查模型文件大小ChilloutMix 这类底模一般 2GB 以上如果你下载的文件只有几百 MB大概率是下到了预览图或者下载没完成删掉重新下载。5.4 出图脸部崩坏或画面灰蒙蒙现象生成的人像脸糊成一团像打了马赛克整个画面发灰、对比度低像蒙了一层雾。原因脸崩通常是显存不足导致 WebUI 自动降低了部分精度或步数太少、负向提示词没填画面发灰一般是采样器和模型不匹配或者 CFG 设置过低。解决先加--medvram启动参数再看看脸部细节不足就把步数提到 25~30并确认负向提示词里有bad hands, bad anatomy。发灰的问题把采样器换成示例图同款如果示例图也没标采样器就优先试 DPM 2M Karras。如果两种调整都没效果检查一下是不是同时加载了太多 LoRA每次用不着的 LoRA 先关掉。5.5 Deforum 插件装完后导航栏没有出现对应选项现象按照教程把 deforum-for-automatic1111-webui 克隆到 extensions 目录并重启后WebUI 顶部的导航栏里没有 Deforum 标签。原因Deforum 默认不会在导航栏显示因为它属于独立的生成 Tab需要在 WebUI 设置里手动启用显示。解决进入 Settings 页面找到 Deforum 相关的设置项勾选启用保存设置后重启 WebUI。另外有些版本需要先在 Extensions 列表里确认插件处于激活状态再重启一次。这个坑最迷惑人的地方在于插件明明显示“已安装”但入口就是没出来其实只是设置开关没打开。5.6 别拿真实人物肖像乱跑模型现象用真实人物的照片喂给 WebUI 或训练 LoRA生成换脸类的图片。原因技术上是可行的但这涉及肖像权和数据合规问题尤其是未经本人授权使用他人照片训练模型已经有不少纠纷案例。解决只用自己的照片或已获授权的素材做实验C 站上的真人模型大多是基于虚构人物或授权素材训练的直接用来生成原创图像没问题。另外生成的虚拟人物图片如果要公开发布建议在描述里标注“AI 生成”避免被误解为真实拍摄。这条不是技术问题但比技术问题更能让你避免麻烦。6. 进阶动画视频与开口说话把静态图变成动态内容6.1 Deforum 关键帧用 JSON 控制动画演进Deforum 插件的核心思路是把你的一段提示词拆分成多个关键帧然后在关键帧之间插值生成连续动画。原教程给了一个非常直观的模板{ 0: tiny cute swamp bunny, highly detailed, intricate, ultra hd, 12: same bunny, cyberpunk style, neon lights }这个 JSON 里0和12是关键帧编号表示动画在第 0 帧和第 12 帧分别使用的提示词。Deforum 会在帧与帧之间做语义插值让画面从“可爱沼泽兔子”逐渐过渡到“赛博朋克霓虹兔子”。如果你想控制中途的负向提示词可以在帧内容里加--neg分隔{ 0: portrait of a girl, soft lighting, realistic --neg lowres, blurry, 30: portrait of the same girl, cyberpunk city background }--neg后面的内容会被当作这一帧的负向提示词。关键帧写得越详细动画过渡越平滑但也要注意帧跨度别太大默认 12 帧一组的插值强度拉太长容易出现形变。第一次跑 Deforum 建议用 30 帧试水生成完成后插件依赖 FFmpeg 合成视频。如果你的机器没装 FFmpeg启动时会有提示装好后要在 Deforum 设置里指定 FFmpeg 路径否则到最后一步会卡在“导出视频”上。6.2 让图片开口说话D-ID 数字人生成视频做好之后最后一步是让静态人像开口说话。原教程用的是 studio.d-id.com一个在线数字人生成工具。操作流程很直观上传一张你生成的人像图在文本框里输入想让“人物”说的话选择合适的语音音色点生成就行。平台会把人像嘴型和你输入的话做对齐最终产出一个几秒钟的说话视频。这里有个使用技巧上传的人像最好是正面视角、脸部清晰、光线均匀的图侧面或遮挡过多的图生成效果会明显变差。另外输入文本不要太长D-ID 对单句长度有限制长内容分成多个小段分别生成再拼接更可控。这条链路走通之后你的本地化图文视频生成网站就从“能出图”升级到了“能出动态人像内容”。从那以后我每次搭这套环境都强制自己先确认 Python 版本和 CUDA 状态再往下走流程每换一个新模型也一定先看示例图参数而不是凭感觉调。这套本地化方案的边界也清楚它跑在本地意味着隐私和安全但计算资源始终受限于显卡不存在一张 8GB 显存的卡生成 4K 视频这种好事。希望这次从环境到模型的完整复现能帮你在搭建时少走几步弯路把时间留给出图而不是出 bug。需要源码和完整教程目录的直接按资源页提供的源码包自取就行。本文还有配套的精品资源点击获取