news 2026/9/12 11:24:15

Duix.Avatar 数字人本地部署完整指南:克隆你的形象与声音,从零生成 AI 口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar 数字人本地部署完整指南:克隆你的形象与声音,从零生成 AI 口播视频

Duix.Avatar 数字人本地部署完整指南:克隆你的形象与声音,从零生成 AI 口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个可以完全离线运行的数字人视频合成工具:提交一段 10 秒左右的说话视频,即可克隆你的形象和声音;之后输入文案或上传音频,就能驱动这个数字人自动对口型、生成口播视频。整个过程都在你自己的电脑上完成,视频不上传云端,也不限生成次数。本文带你走通从环境准备到产出第一条视频的全流程,以 Windows 为主线,Ubuntu 22.04 的步骤放在文末。

先看成果:装完你会得到什么

安装完成后你手里会有两样东西:

  1. 一套本地 AI 服务:视频合成、声音克隆(TTS)、语音识别(ASR)三个服务,全部跑在 Docker 容器里,由你的 NVIDIA 显卡提供算力;
  2. 一个桌面客户端:图形化界面,用来上传视频创建数字人模型、输入文字生成视频、管理已生成的作品。

客户端主界面如下:顶部是"Create Video(创建视频)"和"Create Avatar(创建数字人)"两个入口,下方列表管理你的作品和数字人。

开工前自查:系统与硬件要求

本项目所有算力都在本地,NVIDIA 显卡是硬性要求,集显无法运行。对照下表检查你的机器:

项目要求说明
系统Windows 10(19042.1526 及以上)或 Ubuntu 22.04 桌面版其他系统未验证
显卡NVIDIA 显卡 + 已装驱动推荐 RTX 4070 级别,8G 显存可用
内存32GB 推荐16GB 可能有个别服务起不来
磁盘(Windows)D 盘 30G 以上 + Docker 镜像目录所在盘 100G 以上首次拉取镜像约 70GB

⚠️ 如果你的 C 盘剩余空间不足 100G,安装 Docker 后可以在 Docker Desktop 的资源设置里把 "Disk image location" 改到别的盘,如下图所示:

开工前还需要准备好两个软件:Git(拉取项目代码用)和Docker Desktop(运行 AI 服务用),去各自官网下载安装即可。

确认 NVIDIA 驱动已安装

去 NVIDIA 官网下载并安装显卡驱动,装完后在终端执行nvidia-smi,能显示显卡信息就说明驱动正常,这是三个服务能启动的前提。

安装 WSL 与 Docker Desktop(Windows 用户)

Docker Desktop 在 Windows 上依赖 WSL(Windows 子系统 Linux,可以简单理解为在 Windows 里跑的一个轻量 Linux)来运行容器,所以要先把 WSL 装好。

  1. 打开终端,执行检查命令,看 WSL 是否已安装:
wsl --list --verbose

报错或没有任何发行版输出,说明还没装,执行下面的命令安装(网络不好时可能失败,多试几次即可):

wsl --install

安装过程中会让你设置用户名和密码,记好它们。装完后再执行一次wsl --update把 WSL 更新到最新版本。

  1. 到 Docker 官网下载 Windows 版 Docker Desktop,按 CPU 架构选对应安装包,安装完成看到主界面即成功。
  2. 首次启动时接受协议、跳过登录,不需要注册账号。

一条命令启动服务端

先拉取项目代码并进入目录:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

deploy/目录下放的是开箱即用的 compose 配置文件:默认完整版包含 asr / tts / gen-video 三个服务,docker-compose-lite.yml精简版只启动视频合成一个服务,占用更少资源。

进入 deploy 目录启动服务:

cd deploy docker-compose up -d

这条命令会先从镜像仓库拉取三个镜像(合计约 70GB,耗时从半小时到几小时不等,取决于网速,建议用有线网络),拉完自动启动容器。完成后打开 Docker Desktop 的 Containers 页面,看到三个服务全部处于 Running 状态即成功:

两种特殊情况的启动命令:

# 只需要"已有音频 + 已有数字人 → 出片"的场景,用精简版 docker-compose -f docker-compose-lite.yml up -d
# RTX 50 系显卡(5090/5080 等)用专属配置 docker-compose -f docker-compose-5090.yml up -d

安装客户端,产出第一条口播视频

客户端使用官方构建好的安装包,不需要自己编译:Windows 双击Duix.Avatar-x.x.x-setup.exe安装;Ubuntu 用户下载 AppImage 版本,双击Duix.Avatar-x.x.x.AppImage即可运行(root 用户下需要用命令行加--no-sandbox参数启动)。

打开客户端就能看到开头那张主界面,第一次使用的完整流程是:

  1. 创建数字人:点 "Create Avatar",上传一段 10 秒左右的视频。注意素材必须有清晰的人声——程序会用它做声音克隆,无声视频会直接报错;
  2. 生成视频:点 "Create Video",选中刚创建的数字人,输入口播文案并选择音色,提交合成;
  3. 查看作品:成片出现在 "My Works" 列表里,可以直接播放和保存到本地。

💡 服务端刚启动后,ASR(语音识别)服务就绪最慢,建议等几分钟再操作客户端;如果日志里看到 Connection refused,等一会儿重试即可。

卡住了怎么办:常见问题与解法

问题可能原因解法
docker-compose up -d报 context canceled / 连接超时Docker Hub 官方源连接不稳定配置国内镜像加速器,见下文
服务起不来或起来后立刻退出没有 NVIDIA 显卡或驱动没装好重装驱动,用nvidia-smi验证
新增模特时报错素材视频没声音,或不是人在说话换一段 10 秒左右、语音清晰的人像视频
定制模特报 Connection refusedASR 服务还没就绪,或内存不足服务端启动后等几分钟再操作;16GB 内存可能起不来,建议 32GB

排查镜像下载慢

打开 Docker Desktop → Settings → Docker Engine,在 JSON 配置里加入registry-mirrors字段(镜像源清单,可用哪个选哪个,失效了自行搜索最新的),点 "Apply & restart" 生效:

学会看日志

排障基本靠两份日志:

  • 客户端日志:客户端右上角齿轮菜单 → Open Log,日志文件main.log在 AppData 的 logs 目录里;
  • 服务端日志:在 Docker Desktop 里点开对应容器的 Logs 页签,点右侧复制按钮即可带走整段日志。

提问前建议先翻一遍仓库里的 常见问题 文档,里面有更多报错样例和对应解法。

玩得更深:精简版、开放 API 与多系统

  • 精简版(lite):如果你已有数字人模型和音频、只需要出片,用精简版命令(见第四章)只跑一个容器,省资源也省流量。
  • 开放 API:Docker 启动后,各服务会在本地暴露端口(如 18180 语音合成、8383 视频合成,通过http://127.0.0.1调用),可以接进自己的程序;接口调用示例可参考src/main/service/下的 model.js、voice.js、video.js。
  • 多模型管理:客户端支持保存多个数字人模型,创建视频时按需切换,互不干扰。
  • Ubuntu 22.04 部署:先用sudo apt install docker.io docker-compose装 Docker,再装 NVIDIA 驱动和 nvidia-container-toolkit(关键一步是sudo nvidia-ctk runtime configure --runtime=docker后重启 Docker),最后在 deploy 目录执行docker-compose -f docker-compose-linux.yml up -d,思路与 Windows 一致。

到这里,你的本地数字人合成环境就齐了——回到客户端主界面,创建第一条口播视频试试吧。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 11:24:07

文本相似度计算算法与应用实践

1. CSP第二题相似度计算概述CSP(Content Security Policy)第二题的相似度计算是一个典型的文本处理与算法设计问题。这类题目通常要求参赛者设计算法来量化两个文本片段之间的相似程度,在信息安全、内容过滤和文本分析等领域有广泛应用。相似…

作者头像 李华
网站建设 2026/9/12 11:22:29

n8n自动化工作流开发:Plivo、PostBin与Postgres节点实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 11:22:08

Prescan与Simulink联合仿真开发LKA和AEB系统

1. 项目概述:PrescanSimulink实现LKA与AEB系统开发在智能驾驶系统开发领域,车道保持辅助(LKA)和自动紧急制动(AEB)是两项关键的ADAS功能。这个项目展示了如何利用Prescan仿真平台与Simulink控制模型的联合仿真环境,实现完整的LKA和AEB系统开发…

作者头像 李华
网站建设 2026/9/12 11:20:28

OpenClaw企业级自动化平台架构与RAG集成实战

1. 项目概述:OpenClaw企业级技术栈解析OpenClaw作为新一代企业级自动化平台,正在重塑传统办公流程。这个看似简单的工具名称背后,实际上整合了文档处理引擎、任务调度系统和智能分析模块三大核心技术组件。在企业级部署场景中,它需…

作者头像 李华
网站建设 2026/9/12 11:19:28

好人困境:如何在人际关系中建立健康边界

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华