news 2026/9/11 15:04:57

Duix.Avatar 免费本地部署:一段10秒视频克隆数字人,全离线生成 AI 视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar 免费本地部署:一段10秒视频克隆数字人,全离线生成 AI 视频

Duix.Avatar 免费本地部署:一段10秒视频克隆数字人,全离线生成 AI 视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

断网了还能做口播视频吗?可以。Duix.Avatar 是一个完全开源的数字人项目:上传一段你自己说话的 10 秒视频,它就能在本地机器上克隆你的形象和声音;之后输入一段文案,即可生成口型同步的 AI 口播视频。整个流程在自己的电脑上完成,不需要联网,也不按条收费。

它到底能产出什么

这个项目的输入输出非常直白:

你要喂给它什么

  • 一段 10 秒左右的说话视频——用来做数字人的素材
  • 一段文案或音频文件——用来出成片的素材

你能拿到什么

  • 一个长得像你、声音像你的数字人,保存在本地,可以反复驱动
  • 一条声音口型对齐的成片视频;脚本支持八种语言:中、英、日、韩、法、德、阿拉伯、西语

所有算力都跑在本地,你的素材、声音、成片不会离开这台机器——这就是离线私有化部署的核心价值。

装之前,你的电脑够不够格

唯一硬性要求:NVIDIA 显卡

这个项目没有 CPU 兜底:语音识别、语音合成、视频合成全跑在显卡上。没有英伟达显卡或没装驱动,三个服务端服务起不来。用nvidia-smi查一下,能看到显卡信息就算通过。

磁盘与硬件清单

  • CPU:第 13 代 Intel i5 或更高
  • 内存:32G,必要(16G 可能带不动三个服务)
  • 显卡:NVIDIA 显卡并装好驱动,推荐 RTX 4070 级别
  • 磁盘:Windows 需 D 盘空闲 30G+(模型与成片)、C 盘空闲 100G+(Docker 镜像);Linux 空闲 100G+
  • 系统:Windows 10 19042+ 或 Ubuntu 22.04

C 盘紧张的话,装完 Docker 后可以把镜像存放位置改到空间更大的盘上:

一条命令拉起服务端,怎么判断活着

首次运行要多久

Windows 先装好 WSL 和 Docker Desktop:终端里依次执行wsl --installwsl --update,再安装并启动 Docker Desktop。服务端是 Docker 部署,deploy 目录下备好了四份配置,对应 Windows 默认版、轻量版、50 系显卡版、Linux 版。拉取仓库后,在 deploy 目录执行:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy && docker-compose up -d

首次下载约 70G 镜像,网络正常的话半小时左右。Docker 列表里看到三个服务全部 Running,即代表启动成功;轻量版只有一个服务,叫 Duix.Avatar-gen-video。

拉取失败或 50 系显卡怎么调

拉镜像报request canceledClient.Timeout exceeded,是连不上 Docker Hub:要么走稳定网络通道,要么在 Docker 的 registry-mirrors 配置项里加国内镜像源,重启 Docker 后再拉。

5090 这类新卡走的是更新的 CUDA,不要用默认配置,在 deploy 目录改用 docker-compose-5090.yml 启动即可,30/40 系显卡也可以用它。

客户端打开后,第一条片怎么出

把 10 秒素材变成数字人

客户端是独立的桌面程序(Windows 是安装包,Linux 是单文件 AppImage),不用写代码。第一个入口是"Create Avatar":上传一段 10 秒说话视频,程序自动把视频拆成静音视频加音频,识别语音内容,再训练出音色模型,完成后列表里就多了一个长得像你、声音像你的形象。注意素材必须有人在说话,声音要用来做克隆,静音片段会直接失败。

文字或音频进,成片出

第二个入口是"Create Video":选一个数字人,输入文案(程序替你朗读)或上传音频文件,提交。等待后得到一条口型与声音对齐的成片。同一个数字人用八种语言里的任意一种文案都能驱动,成片全部存在本地。

出错了怎么办,跑通之后能走多远

自查:先问自己三个问题

  1. 三个服务是否全部 Running?有反复重启的,先看它的日志。
  2. nvidia-smi是否通过?没有英伟达显卡或驱动没装好,是服务起不来的最常见原因。
  3. 是不是刚启动就急着克隆?ASR 服务冷启动慢,服务端刚起来就做首次克隆可能报 Connection refused,等几分钟再试通常就正常了。

两个日志入口:客户端在右上角菜单点"Open Log";

服务端在 Docker 对应服务的 Logs 页签,右侧复制按钮可以整段带走。

更常见的坑已经整理在常见问题文档里,排障前先看它。

用 API 接到自己的业务里

客户端可以导入并管理多个模型,在"你"和"同事"之间自由切换着出片。想接进自己的系统,服务端暴露了模特训练、音频合成、视频合成三个本地接口,都通过 127.0.0.1 调用,请求与返回示例在 model.js、voice.js、video.js 里,直接照抄即可。

授权方面,全球免费商用,仅用户量超 10 万或年营收超千万美元的企业需签署商业许可协议,细则见 LICENSE。

三个服务在 Docker 列表里安静地 Running,你的素材、声音和成片都留在自己机器上,私有化的数字人产线就通了。下一步:打开客户端,点 Create Avatar,上传一段 10 秒的说话视频,十分钟后你就拥有第一个数字人。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 15:03:21

贴入序列十秒出图:AlphaFold 蛋白质结构预测与可视化实战指南

贴入序列十秒出图:AlphaFold 蛋白质结构预测与可视化实战指南 【免费下载链接】alphafold Open source code for AlphaFold 2. 项目地址: https://gitcode.com/GitHub_Trending/al/alphafold 一条氨基酸序列,换回可旋转的 3D 结构 把一条氨基酸序…

作者头像 李华
网站建设 2026/9/11 15:02:57

AlphaFold 结构预测可信吗?用 4 个指标快速做一轮质量控制体检

AlphaFold 结构预测可信吗?用 4 个指标快速做一轮质量控制体检 【免费下载链接】alphafold Open source code for AlphaFold 2. 项目地址: https://gitcode.com/GitHub_Trending/al/alphafold AlphaFold 结构预测跑完后,先别急着盯丝带图&#xf…

作者头像 李华
网站建设 2026/9/11 14:54:30

告别 2 小时等待:public-image-mirror 一步搞定国内 Docker 镜像加速

告别 2 小时等待:public-image-mirror 一步搞定国内 Docker 镜像加速 【免费下载链接】public-image-mirror 很多镜像都在国外。比如 gcr 。国内下载很慢,需要加速。致力于提供连接全世界的稳定可靠安全的容器镜像服务。 项目地址: https://gitcode.co…

作者头像 李华
网站建设 2026/9/11 14:53:42

CMSIS-5不是库而是嵌入式宪法:接口契约与编译期治理

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华