news 2026/9/11 9:47:44

Duix.Avatar 数字人本地部署与视频合成全流程指南:离线克隆、口型驱动一次讲透

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar 数字人本地部署与视频合成全流程指南:离线克隆、口型驱动一次讲透

Duix.Avatar 数字人本地部署与视频合成全流程指南:离线克隆、口型驱动一次讲透

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

如果你想在本地跑一个数字人克隆 + 口播视频合成的方案,又不想把形象和声音交给任何云端 API,Duix.Avatar 就是为你准备的:提交一段 10 秒左右的说话视频,它就能克隆你的形象和声音,之后输入文案即可自动生成口型对齐的播报视频,全程离线、不限次数。这篇文章不讲功能清单,而是带你把一个视频任务从头走到尾,再把部署和合成中最常见的"卡住"按症状逐个拆掉。

📦 先拆清楚:三个服务各管哪一段

Duix.Avatar 的服务端是三个跑在 GPU 上的 Docker 容器,定义在 deploy/docker-compose.yml。它们职责边界非常清晰,理解这个分工,后面排障就不会晕:

服务干的事开放端口
duix-avatar-asr(fun-asr)语音识别,把说话转成文本10095
duix-avatar-tts(fish-speech)声音克隆 + 把文案变成克隆人声的音频18180
duix-avatar-gen-video(face2face)音频 + 模特视频驱动口型,产出成片8383

客户端是一个 Electron 壳,它不碰模型,只干四件事:用内置 ffmpeg 把视频转 H.264、分离音频轨(见 util/ffmpeg.js)、轮询任务进度、用本地 SQLite 记录模特和作品。每个接口在 src/main/api/ 里都只有一两行,你完全可以照着它自己拼批量调用。

🎬 走一个完整任务:从一段视频到成片

假设你上传了一段 10 秒的说话视频,整条链路是这样的:

上传视频 → 转 H.264 + 分离音频 → 声音克隆 → 存入模特库

具体发生了什么:视频先被转成标准 H.264,再抽出音频轨;然后客户端调 TTS 服务的克隆接口18180/v1/preprocess_and_tran,它返回两个关键值——参考音频路径和参考文本,必须记下来,后面每次合成都要带。最后模特信息连同声音 ID 一起写进本地库(见 service/model.js)。到这一步,"克隆"就完成了,后面换多少文案都不用再动它。

接着你填一段文案点合成,链路变成:

选模特和文案 → TTS 生成音频 → 提交合成任务 → 每 2 秒轮询进度 → 成片入库

  • 客户端先调 TTS 的18180/v1/invoke,把文案变成克隆人声的 WAV,参数里就是克隆时存下的那两个值;
  • 再调 face2face 的8383/easy/submit,拿到一个唯一任务码;
  • 之后任务进入等待队列,客户端的轮询器每 2 秒查一次状态,成功就用 ffprobe 读出时长写进作品列表,失败则把错误信息落到记录里——所以你永远能在界面上看到"卡在哪一步"(完整逻辑见 service/video.js)。

📌关键规则:合成任务是异步的,"点了没反应"不等于失败,先确认三个服务都 Running,再给合成几分钟时间。

🔍 卡住了?按症状排障

部署和合成阶段最容易出现"服务起不来""克隆报错""合成卡住"三类故障,先看症状,再按顺序检查:

症状病灶检查顺序
docker-compose up -d拉镜像超时Docker Hub 官方源连不通给 Docker 配置国内镜像源,见 常见问题
克隆报Connection refusedASR 服务启动慢,或内存不足服务端起来后等几分钟再克隆;16G 内存可能根本拉不起 ASR
新增模特报错视频里没有声音克隆素材必须是"人在说话"的视频,程序要拿这段声音做声音克隆
合成一直不完成任务其实还在队列/计算中查三个容器状态;打开容器 Logs 看服务端日志

排障时只有两个可靠信源:客户端日志(设置入口可导出)和三个 Docker 服务的日志。拿到日志再提问,比自己猜快得多。

另外,项目为不同硬件备了几套编排文件:deploy/ 下docker-compose.yml是完整版,docker-compose-lite.yml是单服务精简版,docker-compose-5090.yml专给 50 系显卡。选错文件也会表现为"服务起不来"。

适合谁,下一步问它什么

一句话总结:Duix.Avatar 把"声音克隆 + 口型驱动"整条链路搬到了你的显卡上——一条 10 秒的说话视频就能克隆形象和声音,之后任何文案都能生成口型对齐的视频,全程不上网、不限次数。

  • 适合谁:有 NVIDIA 独立显卡、在意数据隐私或想长期跑量、不想按次付费的个人和小团队;
  • 下一步可以问它:怎么只暴露 8383 端口做批量合成脚本?lite 版和完整版差在哪?克隆效果不理想,是先换素材视频还是调preprocess_and_tran的语言参数?

这三问的答案,仓库里都有现成的路:开放 API 说明、常见问题 和 服务编排 目录,照着走一遍就通了。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 9:44:26

AI搜索优化效果评估指南:从收录校验到引用跟踪的标准化方法

AI 搜索正在改变流量分配的逻辑,这一点做内容的人应该都有体感。以前大家盯的是关键词排名、点击率、停留时长,现在打开 ChatGPT Search、Perplexity、Gemini AI Mode 这类产品,用户问一个问题,AI 直接给出整合后的答案&#xff0…

作者头像 李华
网站建设 2026/9/11 9:43:35

2026低代码选型实测:免费、私有化与AI搭建能力深度对比

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 9:42:05

OpenProject 实战:从甘特图排期到看板跟踪的项目管理

OpenProject 实战:从甘特图排期到看板跟踪的项目管理 【免费下载链接】openproject OpenProject is the leading open source project management software for product, project and portfolio management. A powerful Jira alternative with agile planning, issu…

作者头像 李华
网站建设 2026/9/11 9:39:51

STC51单片机直连机智云实战:AT指令、串口时序与MQTT协议深度解析

简介:本资源是一套基于STC单片机与ESP8266串口WiFi模块实现云平台远程控制的完整嵌入式开发工程,面向嵌入式初学者、物联网课程实践者及硬件创客,解决传统单片机设备接入互联网并实现手机/网页端远程控制的核心问题。压缩包共21个文件&#x…

作者头像 李华
网站建设 2026/9/11 9:39:40

括号生成与回溯算法:从剪枝到卡特兰数的完整推导

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华