Duix.Avatar 免费本地部署:一段10秒视频克隆数字人,全离线生成 AI 视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
断网了还能做口播视频吗?可以。Duix.Avatar 是一个完全开源的数字人项目:上传一段你自己说话的 10 秒视频,它就能在本地机器上克隆你的形象和声音;之后输入一段文案,即可生成口型同步的 AI 口播视频。整个流程在自己的电脑上完成,不需要联网,也不按条收费。
它到底能产出什么
这个项目的输入输出非常直白:
你要喂给它什么
- 一段 10 秒左右的说话视频——用来做数字人的素材
- 一段文案或音频文件——用来出成片的素材
你能拿到什么
- 一个长得像你、声音像你的数字人,保存在本地,可以反复驱动
- 一条声音口型对齐的成片视频;脚本支持八种语言:中、英、日、韩、法、德、阿拉伯、西语
所有算力都跑在本地,你的素材、声音、成片不会离开这台机器——这就是离线私有化部署的核心价值。
装之前,你的电脑够不够格
唯一硬性要求:NVIDIA 显卡
这个项目没有 CPU 兜底:语音识别、语音合成、视频合成全跑在显卡上。没有英伟达显卡或没装驱动,三个服务端服务起不来。用nvidia-smi查一下,能看到显卡信息就算通过。
磁盘与硬件清单
- CPU:第 13 代 Intel i5 或更高
- 内存:32G,必要(16G 可能带不动三个服务)
- 显卡:NVIDIA 显卡并装好驱动,推荐 RTX 4070 级别
- 磁盘:Windows 需 D 盘空闲 30G+(模型与成片)、C 盘空闲 100G+(Docker 镜像);Linux 空闲 100G+
- 系统:Windows 10 19042+ 或 Ubuntu 22.04
C 盘紧张的话,装完 Docker 后可以把镜像存放位置改到空间更大的盘上:
一条命令拉起服务端,怎么判断活着
首次运行要多久
Windows 先装好 WSL 和 Docker Desktop:终端里依次执行wsl --install、wsl --update,再安装并启动 Docker Desktop。服务端是 Docker 部署,deploy 目录下备好了四份配置,对应 Windows 默认版、轻量版、50 系显卡版、Linux 版。拉取仓库后,在 deploy 目录执行:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy && docker-compose up -d首次下载约 70G 镜像,网络正常的话半小时左右。Docker 列表里看到三个服务全部 Running,即代表启动成功;轻量版只有一个服务,叫 Duix.Avatar-gen-video。
拉取失败或 50 系显卡怎么调
拉镜像报request canceled、Client.Timeout exceeded,是连不上 Docker Hub:要么走稳定网络通道,要么在 Docker 的 registry-mirrors 配置项里加国内镜像源,重启 Docker 后再拉。
5090 这类新卡走的是更新的 CUDA,不要用默认配置,在 deploy 目录改用 docker-compose-5090.yml 启动即可,30/40 系显卡也可以用它。
客户端打开后,第一条片怎么出
把 10 秒素材变成数字人
客户端是独立的桌面程序(Windows 是安装包,Linux 是单文件 AppImage),不用写代码。第一个入口是"Create Avatar":上传一段 10 秒说话视频,程序自动把视频拆成静音视频加音频,识别语音内容,再训练出音色模型,完成后列表里就多了一个长得像你、声音像你的形象。注意素材必须有人在说话,声音要用来做克隆,静音片段会直接失败。
文字或音频进,成片出
第二个入口是"Create Video":选一个数字人,输入文案(程序替你朗读)或上传音频文件,提交。等待后得到一条口型与声音对齐的成片。同一个数字人用八种语言里的任意一种文案都能驱动,成片全部存在本地。
出错了怎么办,跑通之后能走多远
自查:先问自己三个问题
- 三个服务是否全部 Running?有反复重启的,先看它的日志。
nvidia-smi是否通过?没有英伟达显卡或驱动没装好,是服务起不来的最常见原因。- 是不是刚启动就急着克隆?ASR 服务冷启动慢,服务端刚起来就做首次克隆可能报 Connection refused,等几分钟再试通常就正常了。
两个日志入口:客户端在右上角菜单点"Open Log";
服务端在 Docker 对应服务的 Logs 页签,右侧复制按钮可以整段带走。
更常见的坑已经整理在常见问题文档里,排障前先看它。
用 API 接到自己的业务里
客户端可以导入并管理多个模型,在"你"和"同事"之间自由切换着出片。想接进自己的系统,服务端暴露了模特训练、音频合成、视频合成三个本地接口,都通过 127.0.0.1 调用,请求与返回示例在 model.js、voice.js、video.js 里,直接照抄即可。
授权方面,全球免费商用,仅用户量超 10 万或年营收超千万美元的企业需签署商业许可协议,细则见 LICENSE。
三个服务在 Docker 列表里安静地 Running,你的素材、声音和成片都留在自己机器上,私有化的数字人产线就通了。下一步:打开客户端,点 Create Avatar,上传一段 10 秒的说话视频,十分钟后你就拥有第一个数字人。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考