VoiceStudio 安装后如何用参考音频完成第一次声音克隆?
【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio
VoiceStudio 是一款开源、完全本地运行的声音工具:给它一段参考音频,就能用同一个声音朗读任意文本,无需账号、API key 或云端服务。安装完成后,默认 TTS 引擎(OmniVoice)开箱即支持 zero-shot 声音克隆,所以第一次克隆不需要再装任何模型,核心流程只有三步:准备一段干净的参考音频 → 在 Voice Clone 工作区合成 → 试听并保存为 Voice Profile。
安装前提
各平台的安装入口见 README.md,最低要求覆盖的是默认本地工作流:
| 最低 | 推荐 | |
|---|---|---|
| 系统 | Windows 10 x64 · macOS 13.3 Apple Silicon · Linux x86_64(glibc 2.39+) | 当前受支持的 OS 版本 |
| 内存 | 8 GB | 16 GB+ |
| 磁盘 | 10 GB 可用 | 20 GB+ SSD |
| GPU | 可选,支持 CPU 模式 | NVIDIA CUDA 或 Apple Silicon;用 GPU 时建议 8 GB+ VRAM |
平台要点:
- macOS:Apple Silicon 才能跑本地后端;Intel Mac 只有 UI,无法运行本地 Python 后端(PyTorch 不再提供 Intel-Mac wheel)。首次启动若被 Gatekeeper 拦截,右键
VoiceStudio.app→Open即可,属一次性确认。详见 macOS 安装文档。 - Windows:x64;无管理员权限时选择
Current_User版本 MSI。AMD GPU 在 Windows 上只能跑 CPU。详见 Windows 安装文档。 - Linux:AppImage,x86_64 + glibc 2.39+。详见 Linux 安装文档。
- Docker:镜像仅
linux/amd64。详见 Docker 文档。
首次启动会自动完成三件事:创建受管的 Python 环境、同步依赖、下载默认模型权重(macOS 源码构建约 2.4 GB)。启动画面会显示每一步的实时进度,之后启动复用这些环境,不再重复下载。
准备一段合格的参考音频
克隆是 zero-shot 的:参考音频只是"提示",不是训练数据。参考音频的声学特征会被原样复刻——带混响或噪音的片段会克隆出带混响、带噪音的结果。项目文档给出的参考音频标准(见 real-time-voice-cloning 迁移指南 与 generation-parameters.md):
- 长度:3 秒就能工作;5–15 秒连续干净的单人语音是最佳区间(约 8 秒最理想)。更长并不会提升质量。
- 内容与形式:单人、无背景音乐、近距离收音、安静环境;WAV、MP3、M4A、FLAC、OGG 均可直接拖入,无需转码或提取嵌入。
- 有背景音的素材:应用内置的人声分离(Demucs)和说话人分离可以先拆分,但干净的单人片段仍是最好的输入。
在应用内录音也可以:Voice 面板里选择麦克风和 Mono/Stereo,录音时输入电平表会确认是否收到了可用信号(监视是可视的,不会从扬声器回放麦克风)。
第一次克隆的操作步骤
- 启动 VoiceStudio,在 Launchpad 选择Voice Clone卡片;或在 Voice 工作区把 "Define voice" 设为From audio(工作区有三个标签:From audio用于克隆、By design用于设计声音、Convert用于语音转换)。
- 拖入参考音频,或点Record读两三句。
- 输入要朗读的文本、选择语言,点Generate/Synthesize Audio。
- 满意的话点Save as Voice Profile——这个声音之后可在生成、配音、有声书和 API 中直接复用,无需重新上传。
默认引擎是 OmniVoice,无需任何配置。它有几点行为需要提前知道(见 OmniVoice 引擎文档):
- 权重首次使用时才下载并共享给配音、听写等场景,不会二次加载;
- 输出为 24 kHz 单声道音频,自动应用统一的高通 + 压缩 mastering 链;
- 参考片段如果没配文本,应用会在首次使用时自动转写并保存转录结果;配了转录的片段限 20 秒,无转录时可在最多 75 秒内搜索检测到语音的片段,更长的片段需要先裁剪;
- 编码后的声音引用会缓存在数据目录的
prompt_cache/,重启后同一声音的首次生成会跳过重新编码。
如果参考声音仍不够像且你拥有大量录音,升级路径不是加长参考音频(zero-shot 条件输入超出短窗口后不再利用额外音频),而是对内置模型做离线微调,参见 training 与 data preparation。
判断生成是否成功与常见问题
- 第一次生成很慢:多半不是卡死,而是首次调用在下载数 GB 的权重。想避免首次等待,可以提前在Model Catalogue(TTS 标签页 → 对应引擎的 Weights)安装模型。
- 引擎显示不可用:展开该行Why?面板并点Learn more,会跳转到对应引擎的文档页查看实际要求;若你之前切换过引擎,可用Model Catalogue或
OMNIVOICE_TTS_BACKEND=omnivoice切回默认引擎。 - 小显存 GPU(4 GB 级别):OmniVoice 的显存下限是 6 GB,低于该值的 CUDA/ROCm 卡会回落到 CPU 级别的计算预算,渲染可能从几秒变几分钟;可换 OmniVoice GGUF 等轻量引擎。
- 模型下载慢或网络受限:文档见 downloading-models.md,包括受限网络下的镜像选择与分段下载机制。
- 安装层面出错:运行Settings → About → Run self-check,或查 install troubleshooting;应用内错误界面有Open docs for this error按钮可直接跳转到对应文档段落。
生成结果可以直接在应用内试听;仓库里也提供了本地生成的 克隆示例音频(对应参考音频backend/assets/samples/demo_voice.wav)可供对照。确认满意并保存 Voice Profile 后,同一声音即可用于生成、配音、多角色剧本和http://localhost:3900/v1的 OpenAI 兼容 API(voice字段填保存的 profile ID)。
【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考