Pixelle-Video零基础 5 分钟生成一条 AI 短视频【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video一条 60 秒的竖版短视频手工路线是写脚本 40 分钟找素材 90 分钟时间线上剪 2 小时——一天根本剪不出 3 条。Pixelle-Video 是开源的 AI 全自动短视频引擎你只负责给一句主题文案、AI 配图、配音、背景音乐、成片拼接它全包5 个分镜的成品通常 2-4 分钟就能出炉零剪辑基础也能跑通。5 步流水线主题进、成片出的拆解点下「 生成视频」之后后台pixelle_video/pipelines/里的标准流水线会按 5 步走脚本引擎LLM负责写文字的大语言模型把你的一句主题拆成默认 5 个分镜每段旁白对应一帧画面产物是一份结构化分镜脚本。画面描述师为每段旁白生成一句英文画面描述并自动拼上你在配置里写的风格前缀产物是 5 条生图提示词。AI 生图员按你选的工作流逐张出图可以走本地 ComfyUI免费、RunningHub 云端或直连 DashScope、OpenAI 等 API产物是 5 张配图。TTS 配音员Edge-TTS 或 Index-TTS 把 5 段旁白念出来产物是 5 段 mp3 语音。合成器把配图、语音按你选的 HTML 模板排版成帧再叠上 BGM、用 ffmpeg 拼成 1080x1920 成片。整条链路里你唯一要做的事就是盯进度条中间产物都留在output/的任务文件夹里哪一步不满意都可以单独复用。第一次跑通从 0 到出片的完整路径两个入口一句话区分Windows 直接下载官方一键整合包内置 Python、ffmpeg 等全部依赖解压后双击start_web.batmacOS / Linux 从源码启动先装好uv和ffmpeg再在仓库目录运行uv run streamlit run web/app.py。启动并等浏览器打开 http://localhost:8501。看到三栏布局左栏输入内容、中栏语音和视觉设置、右栏生成按钮就说明起来了。卡住先看终端有没有报错最常见的是 ffmpeg 没装或 PATH 没配对。展开「⚙️ 系统配置」配 LLM。从预设下拉里选通义千问页面会自动填好 base_url 和 model你只需补上 API Key 并点「保存配置」。看到配置面板下方出现绿色保存提示即成功。同一面板里配图像工作流。选runninghub/image_flux.json就填 RunningHub 的 API Key想用本地 ComfyUI 就选selfhost/前缀的工作流并填http://127.0.0.1:8188点「测试连接」绿灯后再走下一步。左侧输入主题。保持「AI 生成内容」模式输入「为什么要养成阅读习惯」分镜数保持默认 5中栏模板保持1080x1920/image_default.html。点「 生成视频」并让出去 3 分钟。进度条依次走过「生成文案 → 生成配图 → 合成语音 → 合成视频」中途会看到「分镜 3/5 - 生成插图」这类字样5 个分镜大约 2-4 分钟跑完。完成后右侧自动播放成片视频文件落在output/目录的任务文件夹里文案、配音、配图等中间产物也都在。三种典型用法博主、电商、教师各取所需小林的知识号她运营小红书读书号每周要 3 条视频手动做一条 4 小时一周就是 12 小时坐在时间线前。每周三晚上她把 5 个主题一行一个塞进批量模式的输入框模板固定1080x1920/image_modern.htmlTTS 里上传了自己 30 秒的试读录音做音色克隆然后关电脑睡觉。早上打开历史页5 条 60 秒左右的竖屏成片整齐躺着单条 API 成本约 2-5 分钱一条 12 小时的剪辑时间被压到 0。发布后评论区有人问「小林你是不是换了配音」——那声音本来就是她自己只是被 Index-TTS 克隆了一遍。电商团队的方形产品卡用1080x1080/image_minimal_framed.html模板切到「固定文案内容」模式直接粘贴现成的卖点文案图像尺寸设 1024x1024。一条 15 秒产品卡大约 90 秒出炉晚上排 10 个 SKU第二天早上 10 条卡全在历史页。教师的横屏课件片段知识点讲给投影看选1920x1080分组的模板如image_film.html分镜数调到 3 控制时长一条 90 秒的课件片段 2 分钟左右跑完比录屏剪辑快得多。三套配置方案 最容易翻车的 3 处方案名适用条件核心参数组合单条时间成本一句话点评完全免费本地有 NVIDIA 显卡Ollamallama3.2 ComfyUI 本地工作流3-6 分钟0 元 API数据不出门显卡不够就别硬上云端经济无显卡、预算敏感通义千问qwen-max RunningHub 云端工作流2-4 分钟API 约 2-5 分/条新手默认选这档最稳专业混合追求画质与出片速度GPT 文案 DashScope / Kling 直连 API 媒体模型2 分钟左右按量付费效果上限最高账单也得跟着算LLM 只填了 api_key→ base_url 漏了请求打到错误地址文案阶段直接报 connection error → 在 WebUI 里用预设下拉选模型它会自动带出 base_url别手动半填。卡在「生成配图」不动→ 工作流前缀和密钥类型不匹配selfhost/需要本地 ComfyUI 在跑runninghub/需要 RunningHub Key → 回到「⚙️ 系统配置」核对前缀与密钥是否对应。画面空白或文字堆叠→ 模板类型和素材类型对不上比如选了video_模板却只配了图像工作流 → 换回image_模板或补一个视频生成工作流。进阶解锁3 个超出预期的玩法你本来以为配音只能用机器味音色其实你可以上传一段 30 秒参考音频做声音克隆——在「 语音设置」里选支持克隆的 TTS 工作流如 Index-TTS拖进 MP3 点「试听」开口就是「你」本人的声音连鼻音都保留。你本来以为每个分镜的配图风格会飘其实你可以用提示词前缀锁死全片画风——在config.example.yaml复制出的config.yaml里给image.prompt_prefix写一句英文风格描述比如 minimalist black-and-white matchstick figure style, clean lines再点「预览风格」试一张整条片子就像出自同一个设计师之手。你本来以为静态照片只能当背景其实图生视频和动作迁移流水线能把一张产品图变成会动的镜头——在扩展工作流里传一张照片和一段参考视频参考视频里的动作会「搬」到照片上跳舞的小猫、开口的人物都做得出来。资源导航4 个关键入口官方文档 docs/zh/装依赖、配 Key 遇到问题时先翻这里安装、配置、快速开始都有中文教程。模板库 templates/30 多套 HTML 模板按1080x1920、1920x1080、1080x1080分文件夹存放想改品牌色就动手改 CSS。预置工作流 workflows/runninghub/与selfhost/两个目录放齐了图像、视频、TTS 的 JSON 工作流会 ComfyUI 的可以直接往里加自己的。音色清单 pixelle_video/tts_voices.py配语音前先来这挑全部支持的 TTS 音色都列在这里。官方 Issue 区跑不动、报错信息贴出来前先看看是不是已有同样问题被解答过。现在就动手10 分钟出第一条成片把这条命令拷进终端git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器跳开后选一个 LLM 预设填 Key、敲一个你早就想讲的主题、点「 生成视频」。去泡杯美式等那杯咖啡凉透之前你的第一条成片应该已经在output/目录里了。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考