Duix Avatar开源AI数字人:30分钟跑起离线视频生成
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix Avatar是一款完全免费、开源的AI数字人工具包,跑在你自己的NVIDIA显卡上,全程不需要联网。它解决的问题很直接:用一段真人出镜的视频和录音,做出会开口说话的数字人视频。
一句话讲清楚:这个开源AI数字人是什么
Duix Avatar用一段说话视频克隆你的脸和声音,再用文字或音频驱动这个数字人输出成片,素材全程不出本机。 两个数字可以锚定它:传统3D数字人方案要几十万美元,AI生成路线把成本压到约1000美元;脚本支持中、英、日、韩、法、德、阿拉伯、西语共8种语言。 商用免费,但员工超10万人或年营收超千万美元的公司需要另签商业授权。
它能做什么:三个场景一次说清
克隆形象和声音
- 上传一段真人说话的视频,程序自动拆出视频和音频,用音频训练语音模型。
- 面部特征和轮廓被提取成2D数字人模型,声音克隆保留语调和语速。
- 训练完可试听:用你自己的声音朗读任意文本,不满意就重传素材。
用文字或音频驱动视频
- 文字输入:先转成语音,数字人按文本节奏说话,唇形自动对齐。
- 音频输入:直接喂一段现成录音,形象跟着语调做表情和口型。
- 支持导入多个模特模型,不同场景切换不同形象。
本地离线生成
- 训练、合成全程不联网,音视频都存在本地磁盘。
- 数据落在D盘(Windows)或用户主目录(Linux),Windows的D盘需留30GB以上。
- 适合个人创作者、课程制作和企业内部培训片;不适合没有NVIDIA显卡的用户,也不做实时对话,只产非实时视频。
部署前先算一笔硬件账
32GB内存是起步线,NVIDIA显卡是硬门槛,驱动不装好三个服务都起不来。
| 项目 | 参考配置 |
|---|---|
| CPU | 13代 Intel i5-13400F |
| 内存 | 32GB及以上 |
| 显卡 | RTX 4070,需N卡并装好驱动 |
| 磁盘 | Windows:D盘30GB+、C盘100GB+;Ubuntu:100GB+ |
Windows一键安装步骤
- 确认WSL是否已装,没有就先装。
- 执行
wsl --update更新WSL。 - 安装Docker Desktop,首次运行跳过登录。
- 在 deploy/ 目录执行
docker-compose up -d,拉镜像约30分钟、70GB流量。 - 看到3个服务全部Running,服务端即就绪;再装官方客户端安装包。
Ubuntu 22.04安装步骤
- 执行
sudo apt install docker.io docker-compose装好Docker环境。 - 按官方说明装NVIDIA驱动,用
nvidia-smi看到显卡信息即成功。 - 安装NVIDIA Container Toolkit,配置Docker走NVIDIA运行时并重启Docker。
- 在 deploy/ 目录执行
docker-compose -f docker-compose-linux.yml up -d。 - 客户端为AppImage,双击启动;root用户登录桌面时需加no-sandbox参数。
装完后本地API怎么用
Docker起来后,127.0.0.1上暴露4个端点。客户端走的就是同一套,你也可以自己调用搭流程,真实调用代码在 src/main/service/ 目录里。
http://127.0.0.1:18180/v1/preprocess_and_tran:语音模型训练,上传参考音频,拿到后续合成要用的参数。http://127.0.0.1:18180/v1/invoke:语音合成,输入文本,返回wav格式的朗读音频。http://127.0.0.1:8383/easy/submit:视频合成,提交音频路径和数字人视频路径,返回任务编号。http://127.0.0.1:8383/easy/query?code=任务编号:查询合成进度,轮询到完成取成片。
本地部署和云端API怎么选
官方并行提供两条路:自己部署这套Duix Avatar开源AI数字人,或者直接用云端API服务。
| 维度 | 自己本地部署 | 云端API服务 |
|---|---|---|
| 适合谁 | 技术开发者 | 商业用户 |
| 硬件 | 需自购GPU服务器 | 不用买GPU |
| 自定义 | 可改源码扩展 | 只能通过API扩展 |
想改参数、接自己的业务流程,就本地部署;想快速出货、不想维护服务器,就选云端,且云端唇形效果更细腻。
常见问题
- compose拉镜像超时、连接被拒:是Docker Hub在国内不稳定,到Docker设置里加镜像源。
- 定制模特报Connection refused:ASR服务启动慢或16GB内存不够,等服务几分钟再试,内存升到32GB。
- 创建模特失败、声音克隆报错:上传的视频里没有连续人声,换一段真人说话的视频。
想自己搭数字人应用的开发者,可以clone仓库(https://gitcode.com/GitHub_Trending/he/Duix-Avatar)后按部署章节动手。踩坑先看 doc/常见问题.md,照着自查步骤过一遍。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考