news 2026/9/11 16:22:58

Duix-Avatar数字人本地部署零基础上手

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix-Avatar数字人本地部署零基础上手

Duix-Avatar数字人本地部署零基础上手

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix-Avatar是一款本地部署的开源数字人工具。上传一段10秒的说话视频,它就能克隆你的形象和声音,之后输入文案就能自动生成带口型的口播视频,全程离线,数据不出本机。

比如你要给一门课程录100条口播视频。每次都真人出镜,光排期就够呛。用Duix-Avatar克隆一次形象之后,你只管写文案,声音、口型、成片它都替你搞定。

快速上手:从零跑通第一个数字人

先确认硬件:NVIDIA显卡(必须是,其他卡跑不动)、32GB内存、C盘100GB以上空余、D盘30GB以上空余。这是三个服务能起来的基本线。

第1步:装好WSL和Docker

WSL(可以理解为Windows里套的一台轻量Linux),Docker靠它来跑服务。按顺序执行:

wsl --install wsl --update

如果已经装过,第一条命令会直接列出已有系统,跳过即可。然后到Docker官网下载Windows版安装,首次启动时接受协议并跳过登录。

成功标志:任务栏Docker图标显示"Running"。

第2步:拉取项目代码

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

成功标志:目录下能看到deploy/文件夹,里面躺着docker-compose.yml

第3步:启动三个后端服务

cd deploy docker-compose up -d

首次会下载约70GB的镜像,网速一般的话半小时起步,耐心等。✅ 成功标志:Docker Desktop里出现三个容器(tts、asr、gen-video),全部显示Running。

第4步:安装客户端

从官方releases下载Duix.Avatar-x.x.x-setup.exe,双击安装并运行,同意用户协议。

成功标志:进入主界面,能看到形象管理和作品管理两个入口。

第5步:训练第一个数字人并出片

先等3到5分钟再动手,语音识别服务起得慢,太早操作会报错。然后上传一段10到15秒、人物正面出声说话的视频,起个名字,开始训练。

成功标志:形象状态变为"训练完成"。接着选它输入一段50字以内的文案,点生成,等几分钟拿到第一条口播视频。

能力拆解:它到底能做什么

三个用例,正好对应它内部的三个服务:

服务端口负责的事
duix-avatar-tts18180语音合成,文字变成你的克隆音
duix-avatar-asr10095语音识别,把素材里的话转成文字
duix-avatar-gen-video8383视频合成,口型对齐产出成片

用例1:形象和声音一次克隆。训练时程序会自动把视频拆成画面和声音,分别建模型,产出的数字人说的是你自己的音色。

用例2:文案直接变成片。在编辑页输入文案,它先合成语音,再驱动形象对口型。脚本还支持中、英、日、韩等八种语言。

用例3:不想用界面就调API。三个服务启动后就在本机暴露了端口,合成接口是http://127.0.0.1:8383/easy/submit,调用示例可以看src/main/service/下的源码。

先判断机器档位,再绕开四个高频报错

档位怎么选:标准三服务版本要求32GB内存加RTX 4070级别的显卡;50系列显卡(如5090)改用docker-compose -f docker-compose-5090.yml up -d;已经有形象、只想合成视频,用docker-compose -f docker-compose-lite.yml up -d,只起一个容器。16GB内存大概率起不来,先别硬试。Ubuntu 22.04用户则用docker-compose-linux.yml

四个高频卡点,各一行解法:

  • ⚠️ 拉镜像报Client.Timeout连接失败:给Docker加国内registry-mirrors镜像源,设置方法见常见问题文档。
  • 新建模特直接报错:素材视频没有声音。训练视频必须是人出声说话,静音视频做不了声音克隆。
  • 克隆语音报Connection refused:ASR服务启动慢,等服务全部Running后再等几分钟重试。
  • 容器反复重启:用nvidia-smi确认驱动装好了,再确认内存到32GB。

跑通之后往哪走

形象训好只是起点。可以一次训练多个不同形象做切换,也可以照着easy/submit接口写脚本批量出片,把Duix-Avatar接进你自己的发布流程。哪条路更顺,取决于你想用它接住多大的量。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 16:21:10

如何用 OCRmyPDF 的 --mode strip 移除 PDF 中已有的不可见 OCR 文字层

如何用 OCRmyPDF 的 --mode strip 移除 PDF 中已有的不可见 OCR 文字层 【免费下载链接】OCRmyPDF OCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched 项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF 当你手里的扫描 P…

作者头像 李华
网站建设 2026/9/11 16:19:27

用Matlab搭建SIRS传染病模型:从微分方程到参数标定与随机模拟

简介:SIRS传染病学模型Matlab完整仿真资源,面向从事数学模型仿真、传染病动力学研究的学生与科研人员,用于描述易感(Susceptible)、感染(Infectious)、康复(Recovered)、免疫(Immune)四种人群状态的动态转化过程。模型遵循易感个体接触感染者…

作者头像 李华
网站建设 2026/9/11 16:17:48

expo-font 完全指南:在 Expo 与 React Native 中运行时加载字体

expo-font 完全指南:在 Expo 与 React Native 中运行时加载字体 【免费下载链接】expo An open-source framework for making universal native apps with React. Expo runs on Android, iOS, and the web. 项目地址: https://gitcode.com/GitHub_Trending/ex/exp…

作者头像 李华