
Duix.Avatar开源AI数字人10秒视频本地生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是由 Duix 出品的免费开源数字人工具支持本地部署与 API 调用。它只需一段 10 秒左右的视频即可克隆人物形象与声音输入文案或上传音频就能在本地离线生成口型同步的口播视频素材与算力均不出本机。Duix.Avatar 的能力清单形象与声音克隆提交一段 10 秒左右的视频系统同时提取五官轮廓等外貌特征与人声样本生成数字人模型克隆所用的声音样本必须来自视频内真实的人声。口播视频生成输入文本或上传音频驱动数字人口型输出音画同步的视频文本经语音合成服务转为语音后再与画面合成。全离线运行服务端基于 3 个 Docker 容器全部算力在本地 GPU 完成素材与数据不经过外网数据目录约定为D:\duix_avatar_data。多模型管理可导入多个数字人模型在客户端统一管理并按场景选择模型与作品记录保存在本地数据库。多语言界面客户端支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语 8 种语言切换。商用授权方面README 声明支持全球免费商用用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议见 LICENSE。Docker 部署走读环境、命令与验证前置条件系统与硬件清单项目要求操作系统Windows 10 19042.1526 或更高版本Ubuntu 22.04 Desktop内核 6.8.0-52-generic其他 Linux 未做兼容性测试显卡英伟达 GPU 并正确安装驱动必要项无驱动三个服务无法启动内存32GB 及以上必要磁盘WindowsD 盘空闲 30GB 以上存放模型与作品C 盘空闲 100GB 以上存储服务镜像Ubuntu空闲空间 100GB 以上推荐配置i5-13400F、32GB 内存、RTX 4070依赖Nodejs 18、Docker三个镜像guiji2025/fun-asr、guiji2025/fish-speech-ziming、guiji2025/duix.avatar执行按系统选择路径Windows 侧先检查 WSL 是否已安装wsl --list --verbose未装则wsl --install网络不佳时多试几次再执行wsl --update更新随后从 Docker 官网下载 Docker Windows 版并按 CPU 架构安装。服务端配置在 deploy/docker-compose.yml 中进入deploy目录执行docker-compose up -d如需轻量版仅启动视频生成一个服务改用docker-compose -f docker-compose-lite.yml up -dNVIDIA 50 系列显卡5090 已测试通过30/40 系列 CUDA 12.8 用户也可用使用docker-compose -f docker-compose-5090.yml up -dUbuntu 侧先安装 Dockersudo apt update sudo apt install docker.io docker-compose再安装英伟达驱动装完执行nvidia-smi能显示显卡信息即为成功与 NVIDIA Container Toolkit然后cd /deploy docker-compose -f docker-compose-linux.yml up -d。验证成功信号判断拉取镜像耗时约半小时取决于网速消耗约 70GB 流量建议连 WiFi。判断标准Docker 中出现duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务且均为 Running 状态lite 版本只有一个duix-avatar-gen-video。客户端从 GitHub Releases 下载对应系统的安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 直接运行Duix.Avatar-x.x.x.AppImageroot 用户需加--no-sandbox参数启动。创建第一个数字人从素材到成片素材要求一段 10 秒左右的视频人物面部清晰、视频中有人正在说话——声音克隆直接取材于这段视频的音轨静音素材会直接报错。关键操作在主界面创建数字人上传视频后等待系统完成形象与声音特征提取几分钟视硬件而定随后在 My Avatars 中选中该模型输入要说的文案或上传音频点击生成数分钟后得到口型同步的口播视频。幕后原理三个服务与一条数据流客户端是 Electron 33 Vue3 桌面程序模型与作品记录存于本地 SQLitebetter-sqlite3文件落盘在D:\duix_avatar_data。guiji2025/fun-asr语音识别服务基于 FunASR负责把参考音频转成文本容器端口 10095。guiji2025/fish-speech-ziming语音合成服务基于 fish-speech负责文本转语音与声音克隆对外端口 18180。guiji2025/duix.avatar数字人视频合成引擎负责口型与画面的对齐生成对外端口 8383。数据流视频先转 H264 并用 ffmpeg 分离音频音频送 TTS 服务做克隆训练与后续合成合成后的音频再与模型视频送入 8383 端口的合成引擎产出最终口播视频。踩坑手册现象、原因与处理拉镜像报Client.Timeout exceededDocker Hub 连接不稳定。处理配置国内镜像源修改 Docker 配置文件的registry-mirrors详见 doc/常见问题.md。新增模特报错素材视频没有说话声。声音克隆依赖视频内人声换一段人物口播视频重新创建即可。克隆形象报Connection refusedASR 服务启动慢服务端刚拉起来就操作了。处理服务端启动后等几分钟再克隆内存小于 32GB如 16GB可能直接起不来。服务起不来或状态异常按自查顺序排查——三个服务是否 Running是否有英伟达显卡且驱动正常nvidia-smi验证服务端是否重新执行docker-compose up -d更新到最新版Issue 列表里是否已有相同问题。磁盘不足C 盘放不下镜像时安装 Docker 后可在其设置中把镜像存储改到其他空闲大于 100GB 的磁盘。进阶用法API 调用、批量任务与多语言API 调用Docker 启动后在本地暴露 HTTP 端口可用http://127.0.0.1直接调用完整流程分三步——模特训练调用http://127.0.0.1:18180/v1/preprocess_and_tran先把参考音频放入与 TTS 服务约定的目录D:\duix_avatar_data\voice\data记下返回的asr_format_audio_url与reference_audio_text音频合成调用http://127.0.0.1:18180/v1/invoke带上一步的返回值作参考音频视频合成调用http://127.0.0.1:8383/easy/submit用http://127.0.0.1:8383/easy/query?code${taskCode}轮询进度。请求参数结构可对照 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。批量任务客户端内部对合成任务做排队处理My Works 列表按等待顺序显示进度通过 API 同理可循环提交任务、按code轮询实现批量视频生产。多语言客户端界面支持 8 种语言在设置中切换即可。其他NVIDIA 50 系列显卡使用deploy/docker-compose-5090.yml方案基于 torch 官方预览版官方另提供云端克隆 API 服务适合不想自购 GPU 服务器的业务场景两者取舍对比见 README_zh.md 的开发者说明。适合谁用自媒体创作者用它批量产出数字人口播视频无需真人出镜也能维持更新频率。企业与培训团队用它制作产品介绍、客服讲解、标准化教学等数字人视频。开发者用它本地部署或调用 API把数字人形象克隆与视频合成集成进自有系统。更多细节见 doc/常见问题.md部署与使用中的问题可查阅官方 FAQ 与项目 Issue 单入口见 README_zh.md 末尾。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考