10秒视频克隆你的专属数字人:Duix.Avatar本地部署实战
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
下周一要交10条口播视频,你还在排档期、订棚拍吗?开源AI数字人项目 Duix.Avatar 可以把这件事搬回你自己电脑:上传一段10秒左右的正脸视频,本地完成数字人克隆,之后输入文案就能自动生成口型匹配的播报视频。适合自媒体创作者、教师和企业培训负责人——素材全程不出本机,不依赖外网服务,属于真正的数字人视频生成本地部署方案。
部署前的硬件体检:先确认这台电脑跑得动
数字人克隆的算力全部在本地,显卡是第一道门槛:
- 必须有 NVIDIA 显卡并装好驱动(
nvidia-smi能显示显卡信息才算通过),核显和 AMD 显卡暂不支持 - 驱动版本建议不低于 535,CUDA 不低于 12.1;50 系显卡请走专门的
docker-compose-5090.yml方案 - 内存 32G 起步,官方推荐配置约为 i5-13400F + RTX 4070 这一档
- Windows 需 10/11 较新版本且启用 WSL2;硬盘方面,存 Docker 镜像的分区(通常是 C 盘)要留足 100G 以上,存数字人素材和作品的分区留 30G 以上
C 盘不够用不用换电脑——在 Docker Desktop 的 设置 → Resources 里可以把磁盘镜像位置迁移到别的盘:
❌ 别在机械硬盘上跑,镜像下载和模型加载都会被拖慢 ❌ 别跳过驱动检查,没有可用 GPU 时三个容器都起不来 ✅ 首次拉取镜像会消耗约 70G 流量,连 WiFi 比用热点稳 ✅ 镜像下载慢时,给 Docker 配置国内镜像源(daemon.json 的 registry-mirrors)
5分钟拉起三个容器:服务端一键启动
服务端就是三个 Docker 镜像,分工很清晰:fun-asr负责语音识别,fish-speech-ziming负责语音克隆合成,duix.avatar负责视频合成。项目里的 deploy/ 目录已经配好了编排文件,clone 下来照着执行即可:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar cd deploy docker-compose up -d首次启动要耐心等待(镜像下载约半小时),看到 Docker 里三个服务都是 Running 就算成功。显存或配置吃紧的机器可以改用 lite 版:docker-compose -f docker-compose-lite.yml up -d,只起一个服务;Ubuntu 22.04 则用docker-compose-linux.yml。
❌ 首次启动别中途打断,模型初始化需要时间 ❌ 服务异常时反复up只会越堆越多,先docker-compose down清理 ✅ 用docker ps确认三个容器状态,卡住的用docker logs看具体报错 ✅ 端口别动:TTS 在 18180,视频合成在 8383,客户端默认连http://localhost:18180
客户端装好连上本地服务
服务端跑起来后,装客户端(桌面端):
- 从项目 release 页下载对应系统安装包
- Windows 双击
Duix.Avatar-x.x.x-setup.exe安装;Ubuntu 下双击.AppImage直接启动,root 用户需加--no-sandbox参数 - 打开客户端,默认就会连接本机 18180 端口,看到首页的 Create Avatar / Create Video 入口即代表连通
❌ 路径带空格或特殊字符时安装容易出怪问题,装到干净的英文路径最稳 ❌ 连不上服务端时先查 Windows 防火墙,放行 18180 和 8383 ✅ 同时只开一个客户端实例 ✅ 版本更新频繁,遇到问题先升级到最新版,很多坑官方已经修了
10秒素材训练:克隆你的第一个数字人
素材质量决定克隆上限。录制一段 10~30 秒的视频,然后在客户端点 Create Avatar 上传,训练完成后会出现在 My Avatars 列表里。典型场景下 RTX 4070 训练一个模型约 15 分钟。
❌ 视频里戴眼镜、帽子或让头发遮挡五官,特征提取会翻车 ❌ 多人入镜、频繁转头、光线忽明忽暗的素材不要用 ✅ 正对镜头、背景简单、光线均匀,分辨率不低于 720P ✅ 推荐 MP4 格式;训练失败时点右上角 Open Log 看客户端日志定位原因
生成第一条数字人视频
训练完成后切到 Create Video:选择数字人模型 → 输入文案(或上传自己的音频)→ 生成。口型由服务端自动对齐,产物会出现在 My Works 作品列表里,可在线播放或查看文件位置。
❌ 单次文案控制在 500 字以内,超长文本容易把合成任务拖垮 ❌ 合成进行中别关客户端,任务状态跟着会话走 ✅ 走音频驱动模式时,音频采样率保持 44.1kHz 效果最稳 ✅ 合成失败优先查显存:视频合成就发生在 8383 端口的duix.avatar服务里
原理速览:10秒是怎么"克隆"出你的
知道它在做什么,出问题时你就知道该查哪里:
- 三维面部重建:基于 3DMM(把人脸参数化成一套可计算的三维模型)分析你的视频,提取面部关键点与表情动态,这样数字人不是"贴图换脸",而是能跟着语气做微表情
- 两阶段语音克隆:先用 FunASR 把参考音频转成文本并做声纹预处理,再交给 Fish-Speech 学习你的音色,之后输入任意文案都能用"你的声音"读出来
- 文本到口型同步:生成的音频逐帧驱动嘴部动作,画面与声音在合成服务里对齐输出,所以你听到什么它"说"什么
- 容器化编排:ASR、TTS、视频合成三个模型各自独立成容器,互不干扰。哪个环节报错,日志也只会出现在对应容器里,排查路径很直白
三种玩法:教育、培训与自媒体怎么用
批量课程制作(教育场景):录一次教师形象,之后不同课程共用同一个数字人。脚本支持八种语言,多语种课件可以复用同一套口型管线。进阶用法是直接调用本地 API 打通你的课程系统,比如让 LMS 自动把讲义丢给服务端出片:
import requests resp = requests.post( "http://127.0.0.1:18180/v1/invoke", json={ "speaker": "teacher-001", "text": "今天我们学习微积分的基本定理……", "format": "wav", "topP": 0.7, "reference_audio": "<preprocess_and_tran 接口返回值>", "reference_text": "<preprocess_and_tran 接口返回值>", }, )口播稿批量喂进去,出片时间就从"一天录几条"变成"一天能过完几十条脚本",具体吞吐取决于显卡和文案长度。
客服/培训分身(企业场景):录一段客服标准形象做训练素材,把常见问题做成固定视频预生成,高频问题直接调缓存,长尾问题才走实时合成;配自动字幕后,一套分身可以多语言分发。
自媒体口播(个人场景):文案 API 产稿 → 数字人配音 → 自动合成,一个人就能跑完过去需要摄制小组的流水线。典型体验是产能提升数倍、单条制作时间缩到原来的几分之一,具体幅度随硬件与内容复杂度浮动。
进阶与求助:调优、二开入口和社区资源
- 性能:显存紧张就降到 720P 出片,速度能明显提升;低配机器直接用 lite 版编排;定期清理无用镜像释放磁盘
- 二次开发:客户端是 Electron + Vue 3 写的,服务调用逻辑在 src/main/api,各业务的接口封装在 src/main/service,界面组件在
src/renderer/src/views下,想加个按钮或换个交互,入口都很直白 - 排查顺序:先确认三个容器 Running → 再确认
nvidia-smi正常 → 客户端/服务端都升到最新 → 翻日志。完整问答见 doc/常见问题.md
Duix.Avatar 把数字人克隆的完整链路开源并放到本地运行,意味着隐私敏感的团队和个人创作者都能零门槛起步:有 NVIDIA 显卡、愿意折腾 Docker 的话,今晚就能克隆出你的第一个数字分身;只想要结果、不想维护服务的,也可以关注其官方 API 服务作为备选路径。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考