如何在本地免费跑通 AI 数字人:Duix.Avatar 开源分身部署与出片指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
拍一条口播视频,先纠结文案,再纠结光线机位,NG 一次就是半天。Duix.Avatar 把这个流程砍掉了:开源的 AI 数字人工具,用你一段 10 秒视频克隆外貌和声音,之后贴文字就能生成口播视频,全程跑在本地,素材不出电脑。
本地数字人适合谁用,谁该直接跳过
- 常做口播短视频、课程讲解、产品介绍,需要稳定产出画面的人
- 企业或培训场景要反复露出品牌口播,又不想把真人素材交出去
- 开发者,想给自己的产品接上数字人 API 能力
- 如果你的需求是"打开网页、上传素材、一键生成"的纯云服务,这个工具帮不上忙——它需要你在本地跑一套 Docker 服务,且电脑必须有英伟达显卡
Duix.Avatar 的三项能力:每样都有明确的输入和输出
形象克隆|一段正面说话的视频,变成可反复使用的数字分身|输入只要 10 秒左右的视频声音克隆|克隆形象时声音一并克隆,音色和语调都保留|不需要单独再录语音样本文字转视频|贴一段脚本,自动合成语音、对口型,输出成片|脚本支持中、英、日、韩等 8 种语言
三步串起来就是完整链路:先克隆形象,声音跟着形象一起生成,最后用文字驱动视频。全程不用打开任何剪辑软件。
和云端数字人服务最大的差别在于:这三件事都发生在你的电脑上,素材不上传任何服务器,不用订阅,也不按分钟计费。模型克隆一次之后,后续出片基本零成本,想改文案就重新贴一遍文字。
本地数字人最低配置要求:三档硬件自检表
| 档位 | CPU | 内存 | 显卡 | 能做什么 |
|---|---|---|---|---|
| 最低 | 10 代 i5 或同级 | 16GB | 6GB 显存(RTX 3060) | 720p 训练与合成 |
| 推荐 | 13 代 i5-13400F 起 | 32GB | 12GB 显存(RTX 4070) | 1080p 日常出片 |
| 高性能 | i9 级别 | 64GB | 24GB 显存(RTX 4090) | 批量任务、4K 合成 |
两条实操经验:内存是硬门槛,官方推荐 32GB,16GB 的机器三个服务可能都拉不起来;英伟达显卡加官方驱动是前提,所有算力都在本地,没有显卡服务直接起不来。Windows 用户另需预留 D 盘 30G 以上、C 盘 100G 以上空闲空间,分别存作品数据和 Docker 镜像。
Docker 五步部署:跑通本地数字人服务
确认 WSL 已就绪
wsl --list --verbose wsl --update安装 Docker Desktop
下载 Docker Desktop 的 Windows 版正常安装即可,首次启动接受协议、跳过登录。C 盘不足 100G 时,进 Settings → Resources → Advanced,把 Disk image location 用 Browse 挪到空闲 100G 以上的盘。
克隆项目代码
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar启动三个服务
cd deploy docker-compose up -d首次拉镜像约 70G,建议连 WiFi 等半小时左右。RTX 50 系显卡(如 5090)改启动 deploy 目录里带-5090的 compose 文件;Ubuntu 22.04 用户则用带-linux的 compose 文件。内存吃紧时可以改用-lite精简版,只起视频合成服务。
验证服务状态
docker psduix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个容器都是 "Up" 即成功。最后安装官方桌面客户端(releases 里的 exe 安装包,下载后双击),打开就能看到首页。
从 10 秒素材到成片:一次口播视频的生产流程
准备素材(约 5 分钟):正面说话视频,10 秒左右,720p 以上,光线亮、人脸居中、背景干净。注意视频里必须有人在说话,程序靠这段音频做声音克隆,静音素材会直接报错。
执行操作(约 30 分钟):客户端里点 "Create Avatar" 上传素材,等形象训练完成;然后进 "Create Video",选中刚建好的分身,把脚本文字贴进去。
拿到成品(几分钟到几十分钟,取决于文案长度):合成完成后,一条口型对上的口播视频出现在 "My Works" 里,可直接预览和导出。
首次全流程大约 40 到 60 分钟。之后每出一条新片,就是"贴文字 → 等出片"两步,几分钟到几十分钟一条,素材一次准备长期复用。
⚠️ ## 部署踩坑速查:三个高频卡点
拉镜像失败,报连接超时 / context canceled→ Docker Hub 官方源不稳定 → 在 Docker Desktop 的 "Docker Engine" 配置里给 JSON 加 registry-mirrors 国内镜像源,Apply & restart
创建形象报 Connection refused 或训练失败→ asr 服务启动较慢,或机器内存不足 → 服务起来后等几分钟再操作;仍报错就在 deploy 目录重新执行 docker-compose up -d
docker ps 里有服务没处于 Up→ 英伟达驱动没装或没装好 → 终端执行 nvidia-smi 验证,不显示显卡信息就先装官方驱动再重启服务
实在定位不了原因,在 Docker 里点开对应容器看 Logs,找带 ERROR 或 Exception 的行,基本能锁定是哪个环节出的问题:
延伸阅读:项目内资源索引
- deploy/ — 三个服务的 Docker 编排配置
- doc/常见问题.md — 官方排障自查指南
- src/main/service/ — 模特训练与视频合成 API 调用源码
- LICENSE — 许可协议说明
收尾
服务跑通、分身克隆好之后,下一条口播视频就只差一段文字了。项目仓库与桌面客户端安装包,见上文"五步部署"里的 clone 地址。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考