news 2026/9/11 23:26:16

HeyGem.ai 数字人本地部署完全指南:10 秒素材克隆出会说话的口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
HeyGem.ai 数字人本地部署完全指南:10 秒素材克隆出会说话的口播视频

HeyGem.ai 数字人本地部署完全指南:10 秒素材克隆出会说话的口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

HeyGem.ai(Duix.Avatar)是一套可完全离线运行的开源数字人视频生成工具:给它一段 10 秒左右的出镜视频,它就能克隆你的形象和声音,之后只要输入文字或音频,就能驱动这个数字人口型对轨,产出口播视频。整个数字人本地部署流程不需要上传任何素材到云端,隐私和算力都留在自己的机器里。

动手前:确认你的电脑跑得动

在装任何东西之前,先对照这份清单,缺了硬件是省不掉的——本项目的全部推理算力都在本地 GPU 上跑。

项目要求
显卡英伟达 N 卡 + 正确安装的驱动(nvidia-smi能看到显卡信息才算数)
内存32G 及以上,16G 机器连 ASR 服务都可能起不来
系统Windows 10 19042+ 或 Ubuntu 22.04(其他 Linux 未验证)
磁盘Docker 镜像约 100G 空闲,作品数据目录 30G+ 空闲
运行时Docker(Windows 上走 WSL2 后端)+ Node.js 18(仅自己构建客户端时需要)

一个容易踩的坑:Windows 上 Docker Desktop 的镜像默认存在 C 盘,如果你 C 盘不够,安装 Docker 之后要提前把存储位置改到别的盘,否则拉镜像会直接把 C 盘撑爆。

跑通服务端:三步起三个 Docker 服务

服务端由三个容器组成:duix-avatar-tts(语音合成,端口 18180)、duix-avatar-asr(语音识别,端口 10095)、duix-avatar-gen-video(视频合成,端口 8383),定义都在 deploy/docker-compose.yml 里。

Windows 流程:先用wsl --install装好 WSL2,再装 Docker Desktop,然后在仓库目录下执行:

cd deploy docker-compose up -d

Ubuntu 22.04 流程:装好 Docker 和 NVIDIA Container Toolkit(让容器能用上显卡)后执行:

cd deploy docker-compose -f docker-compose-linux.yml up -d

配置文件对应 deploy/docker-compose-linux.yml。首次拉取镜像大约消耗 70G 流量,建议连 WiFi 等半小时左右。

怎么算成功了?Docker 里三个容器都变成 Running 状态,服务端就就绪了。接下来打开客户端(下载官方构建的安装包直接装,或在仓库里npm installnpm run dev跑开发版),能看到首页并成功创建第一个数字模特,说明端到端全通了。

打开客户端,产出第一条口播视频

客户端首页就两块区域,对应两条主线任务:

  • Create Video(制作视频):选择已克隆的数字人 + 输入文案或上传音频 → 生成口播视频。
  • Create Avatar(定制模特):上传一段出镜视频 → 克隆形象 + 声音,得到一个可重复使用的数字模特。

推荐先走第二条:准备 10 秒左右的视频,要求画面里的人在说话(声音会用于克隆音色),背景安静、人脸清晰。训练完成后,"My Avatars" 列表里就会出现你的数字模特,之后每次生成视频只需换文案,形象不用重新训。

它能替你干的活儿

把功能名词翻译成实际能交付的东西,大概是这四件事:

  1. 口播视频量产:写一段稿子,几十秒后得到一条人物口型对轨的播报视频,适合短视频、课程、产品介绍这类"真人出镜但懒得拍"的场景。
  2. 声音克隆:10 秒声音样本就能复刻音色,之后合成语音都带你的声线,脚本支持中、英、日、韩、法、德、阿、西 8 种语言。
  3. 多模特管理:客户端支持导入多个模型,不同栏目、不同出镜人分开管理,一键切换。
  4. 接口化集成:服务端 Docker 起来后在127.0.0.1上暴露了模特训练、音频合成、视频合成和进度查询四组接口,可以直接接进自己的业务系统。调用逻辑参考 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。

让它跑得更快更稳:版本选择与调优

  • 50 系显卡专用方案:RTX 5090 等新卡默认 compose 可能起不来,官方提供了基于 torch 预览版 CUDA 的 deploy/docker-compose-5090.yml,30/40 系使用 cuda12.8 的机器也可以借用这套:

    cd deploy docker-compose -f docker-compose-5090.yml up -d
  • 轻配机器用 Lite 版:显存吃紧时执行docker-compose -f docker-compose-lite.yml up -d,只启动视频合成一个服务(配置见 deploy/docker-compose-lite.yml)。

  • 磁盘规划:Docker 镜像放 C 盘空间充足的位置,数字人和作品数据放独立盘(默认约定D:\duix_avatar_data)。需要搬家时,在 Docker Desktop 的 Settings → Resources → Advanced 里改 "Disk image location":

  • 拉镜像慢:给 Docker 配置 registry-mirrors 加速(Linux 改/etc/docker/daemon.json,Windows 在 Docker Engine JSON 里加同名字段),可用镜像源列表见 doc/常见问题.md。
  • 视频质量:源素材决定上限——照片/视频越清晰、声音越干净,克隆效果越好;批量生成时按条排队提交,避免多条任务挤占同一块显存。

遇到报错怎么修

docker-compose up -d拉镜像超时Get "https://registry-1.docker.io/v2/": request canceled

官方源连接不稳定。打开 Docker Desktop 的 Settings → Docker Engine,在 JSON 里加入registry-mirrors字段,Apply & restart 后重试:

② 新增模特时训练失败

上传的视频必须包含人声且人在说话——程序要从这段声音里做声音克隆,纯画面视频会直接失败。

③ 定制模特报Connection refused或 asr 相关错误

ASR 服务冷启动偏慢,服务端刚拉完容器别急着建模特,等几分钟再操作;内存只有 16G 的机器可能根本拉不起来,建议 32G 起步。

④ tts 容器日志刷File not exists

一般是数据卷挂载路径不对(比如非 Windows 环境照抄了d:/duix_avatar_data/...的卷映射),检查 compose 文件里的 volumes 是否指向了真实存在的数据目录:

⑤ 问题难定位时,先取日志

客户端日志在设置菜单 "打开日志" 里,文件位于Roaming\heygem.ai\logs\main.log;服务端日志直接在对应容器的 Logs 页签复制:

更多报错和解决方案,翻 doc/常见问题.md 基本都有覆盖。

下一步

部署跑通之后,值得花时间的方向有三个:用 API 把"文案进、视频出"接进自己的发布流程,实现无人值守的批量生产;针对常用出镜场景沉淀 2~3 个固定模特,减少重复训练;显存充裕的话,试试完整版与 Lite 版在生成速度上的差距,给自己的机器定一个最优配置。整套流程走完你会发现:一段 10 秒素材,换来了一个随时能开口说话的数字分身,而且全程数据不出本机。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 23:26:01

GitHub镜像站搭建指南:提升访问速度与稳定性

1. GitHub镜像站搭建的必要性与应用场景国内开发者在使用GitHub时经常遇到访问不稳定、下载速度慢等问题。这主要源于跨国网络传输的物理限制和网络策略的影响。一个典型的场景是:当你尝试克隆一个大型仓库时,下载速度可能只有几十KB/s,甚至频…

作者头像 李华
网站建设 2026/9/11 23:22:24

恶意URL识别:XGBoost+手工特征的轻量级工业方案

简介:本资源是一套完整的基于机器学习的恶意URL识别系统实现方案,面向高校计算机专业本科生、网络安全方向毕业设计学生及机器学习初学者,解决Web安全领域中恶意链接实时检测的实际问题。压缩包共2000个文件,主体为1890个Python脚…

作者头像 李华
网站建设 2026/9/11 23:22:02

Homepage 集成 MySpeed 测速 Widget:配置详解与源码级原理分析

Homepage 集成 MySpeed 测速 Widget:配置详解与源码级原理分析 【免费下载链接】homepage A highly customizable homepage (or startpage / application dashboard) with Docker and service API integrations. 项目地址: https://gitcode.com/GitHub_Trending/h…

作者头像 李华
网站建设 2026/9/11 23:21:16

Vue3自定义Tabs组件实现与翻页交互优化

1. 项目概述:自定义Tabs组件的翻页交互设计在前端开发中,Tabs(标签页)组件是最常用的UI控件之一。当标签数量超出容器宽度时,传统的滚动条方案既不美观也不符合移动端交互习惯。我最近在Vue3项目中实现了一个带翻页按钮…

作者头像 李华
网站建设 2026/9/11 23:20:10

YOLOv8老鼠检测实战:从数据集处理到PyQt界面部署全流程

简介:这套面向老鼠目标检测任务的YOLOv8权重与数据集整合包,适合计算机视觉初学者、算法工程师或动物行为研究者快速搭建检测系统,包内直接给出训练好的权重,并附上5000多张老鼠图像数据,免去自行采集与标注的耗时工序…

作者头像 李华