Pixelle-Video 指南如何从一个主题自动生成完整短视频【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-VideoPixelle-Video 是一款开源的 AI 全自动短视频引擎输入一个主题它自动完成文案撰写、AI 配图、语音合成、背景音乐添加和视频合成五道工序几分钟内输出一条可直接发布的成品短视频。项目采用 Apache 2.0 协议本地部署方案可以做到零成本运行。一句话主题到成片中间发生了什么很多人以为这类工具只是把文字念出来配上图片Pixelle-Video 的实际流程比这完整得多。整条流水线分为四步文案生成LLM 根据主题写出解说词并按分镜一段解说对应一个画面拆分配图规划为每个分镜生成 AI 图片或直接用 AI 视频模型如 WAN 2.1生成动态背景逐帧处理把文案、配图、模板排版渲染成帧画面视频合成叠加语音解说与 BGM用 ffmpeg 合成最终 MP4保存到output/文件夹生成过程中 Web 界面会实时显示当前步骤例如分镜 3/5 - 生成插图。按官方快速开始文档的说明生成一个 5 分镜的视频大约需要 2-5 分钟具体取决于 API 响应速度和图像生成速度。两种输入方式AI 生成内容只输入主题如为什么要养成阅读习惯文案由 AI 创作固定文案内容粘贴现成脚本还支持按段落、按行、按句子三种方式拆分成分镜适合已有稿件的场景核心能力四个可替换的 AI 环节Pixelle-Video 把文案、图像、语音、视频四类能力拆成可独立替换的模块你可以按自己的硬件条件混搭。各环节支持的选项环节可选方案文案LLM通义千问、GPT-4o、DeepSeek或本地 Ollama图像本地 ComfyUI 工作流、RunningHub 云端、直连 DashScope / OpenAI / Seedream 等 API视频片段WAN 2.1、Kling、Seedance 等工作流或直连 API 模型语音TTSEdge-TTS、Index-TTS支持声音克隆等多语言音色这种设计的好处是有显卡就全本地跑没显卡就全走云端甚至图文走云端、语音走本地也行。所有工作流都是 workflows/ 目录下的 JSON 文件分selfhost/本地和runninghub/云端两组放一个新的 JSON 进去Web 界面的下拉菜单就会出现新选项。三条扩展流水线除了标准流水线仓库的web/pipelines/下还内置了三条扩展流水线对应最近几个版本的更新记录数字人口播digital_human生成虚拟人物讲解视频示例包括韩语口播图生视频i2v静态图片转动态片段动作迁移action_transfer上传参考视频和图片把动作迁移到新内容上此外还有自定义素材模式上传自己的照片和视频AI 分析后生成匹配脚本历史记录页面支持批量创建视频任务。一条命令启动本地 Web 界面前置条件源码方式运行只需两样东西Python 包管理器uv和ffmpeg。Windows 用户也可以直接用官方的一键整合包里面已含全部依赖解压后双击start.bat即可无需安装任何环境。git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501。项目也提供了 Dockerfile 和 docker-compose.yml容器用户按 docs/ 中的说明部署即可。首次配置的三组密钥界面是三栏布局左侧内容输入、中间语音与视觉设置、右侧生成与预览。首次使用需展开系统配置面板LLM下拉选预设模型如通义千问自动填充 base_url 和 model填入 API Key媒体生成填本地 ComfyUI 地址默认http://127.0.0.1:8188并点测试连接或填 RunningHub API Key直连供应商时再配 OpenAI、DashScope、ARK、Kling 的密钥模板默认是1080x1920/image_default.html完整配置项可参考 config.example.yaml其中还包括 RunningHub 并发限制1-10和提示词前缀prompt_prefix用来统一控制配图画风等可调参数。竖屏、横屏、方形三种尺寸的模板怎么选模板是这套系统的另一个核心。templates/ 目录按尺寸分了三个文件夹模板文件用 HTML 写画面排版配合 Jinja2 变量{{ title }}、{{ text }}、{{ image }}注入内容。尺寸模板数量适配平台1080x1920 竖屏20抖音、快手、小红书1920x1080 横屏5YouTube、B站1080x1080 方形1Instagram、微信朋友圈从文件名判断模板类型命名规则直接告诉你它需要什么资源static_*.html静态模板纯文字排版不需要任何 AI 生成服务速度最快新手可以零配置先跑通image_*.html图片模板每个分镜需要 AI 生成一张配图video_*.html视频模板需要 AI 视频模型生成动态背景效果最重但耗时也最长竖屏模板风格覆盖较全卡通、治愈、电影感、图书解读、养生科普、霓虹、极简黑底、80 年代讽刺漫画等Web 界面里可以点预览模板自定义参数测试效果。想自己加模板照 docs/zh/user-guide/templates.md 里给的 HTML 示例改个样式、放进对应尺寸目录就行。进阶玩法声音克隆、BGM 与成本控制声音克隆与背景音乐选择支持声音克隆的 TTS 工作流如 Index-TTS后上传一段参考音频MP3/WAV/FLAC生成的解说就会用这个声音朗读支持上传后直接试听BGM 有三档无 BGM、内置音乐如 default.mp3、自定义音乐——把 MP3/WAV 文件丢进bgm/文件夹即可在界面中试听选用三档成本方案官方 FAQ 里给出了明确的费用参考组合成本说明Ollama 本地 LLM 本地 ComfyUI0 元完全免费需要显卡通义千问 本地 ComfyUI约 0.01-0.05 元/视频官方推荐性价比高OpenAI RunningHub 云端较高无需本地环境有本地显卡直接上免费方案没有显卡就用通义千问配本地 ComfyUI 跑配图成本基本可以忽略。生成失败或效果不佳时的排查顺序先确认连接再调效果ComfyUI 连接失败确认服务已启动、URL 正确Docker 环境下 Mac/Windows 要用host.docker.internal:8188在界面点测试连接LLM 调用失败核对 API Key 和网络连接看终端错误提示TTS 不稳定项目曾锁定 edge-tts 版本修复过该问题更新到最新代码通常能解决效果不满意时的四个调节旋钮官方给出的改进路径换 LLM 模型文案风格会不同、改图像尺寸和提示词前缀换配图画风、换 TTS 工作流或上传参考音频换声音、换模板和尺寸换版式。另外注意提示词前缀需要写成英文不同模型对图像尺寸限制也不同默认 1024x1024 是安全值。接下来做什么克隆仓库并按上文命令启动 Web 界面确认 8501 端口可访问在系统配置面板先填 LLM 密钥新手可先用 Ollama 本地方案用static_静态模板 一个简单主题跑通第一条视频验证整条链路需要 AI 配图时再配置 ComfyUI 或 RunningHub换成image_模板重新生成深入模板开发或 API 用法查阅 docs/ 目录下的模板开发指南和 API 文档【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考