【免费下载链接】speaker-diarization-community-1
speaker-diarization-community-1是 pyannote 社区推出的新一代说话人日志(speaker diarization)预训练 pipeline,它接收单声道 16kHz 音频,输出"谁在什么时候说话"的分段结果。本文基于仓库根目录 README.md 与 config.yaml,完整覆盖从环境准备、快速推理、GPU/内存优化、说话人数量控制,到专属说话人日志(exclusive speaker diarization)与离线部署的全套实战方案,并深入 pipeline 内部组件与配置参数,帮助读者在本地复现并二次定制这一主流说话人日志方案。
一、Community-1 是什么:输入输出与核心改进
从 README.md 的定位来看,community-1pipeline 的核心契约非常简单:
- 输入:单声道(mono)音频,采样率 16kHz;
- 输出:说话人日志结果,即一系列"说话人 × 时间段"的片段。
为降低使用门槛,pipeline 对输入做了两层自动预处理,用户无需手动转码:
- 多声道自动降混:立体声或多声道音频文件会被自动平均各声道,混音为单声道;
- 采样率自动重采样:非 16kHz 采样率的音频在加载时会被自动重采样到 16kHz。
相比此前的speaker-diarization-3.1,Community-1的主要改进集中在四点(见 README 的 "main improvements" 一节):
- 更好的说话人分配与计数(improved speaker assignment and counting):在学术基准上的说话人错误率(DER)全面下降,详见下文基准测试;
- 专属说话人日志(exclusivespeaker diarization):简化与转写时间戳(transcription timestamps)的对齐,该能力从最新商用模型 backport 而来;
- 易离线使用(offline use):无需联网即可完成加载与推理;
- (可选)云端托管:可托管在 pyannoteAI 云上,通过 API Key 一行代码切换。
二、仓库结构与组件构成:一个 pipeline 的三段式解剖
在阅读使用文档之前,先看一眼当前仓库的目录结构,它会告诉我们community-1内部由哪些模型部件拼装而成:
speaker-diarization-community-1/ ├── README.md # 官方使用文档(本文主体) ├── config.yaml # pipeline 配置:组件与超参数 ├── configuration.json # 仓库元数据(framework/task) ├── segmentation/ # 说话人分割模型权重 │ └── pytorch_model.bin ├── embedding/ # 说话人嵌入模型权重 │ ├── README.md │ └── pytorch_model.bin ├── plda/ # PLDA 得分归一化与 x-vector 变换 │ ├── README.md │ ├── plda.npz │ └── xvec_transform.npz └── diarization.gif # 演示动图对应 config.yaml 中的三段式结构,这正是经典"分割(segmentation)→ 嵌入(embedding)→ 聚类(clustering)"的说话人日志架构:
dependencies: pyannote.audio: 4.0.0 pipeline: name: pyannote.audio.pipelines.SpeakerDiarization params: clustering: VBxClustering segmentation: $model/segmentation segmentation_batch_size: 32 embedding: $model/embedding embedding_batch_size: 32 embedding_exclude_overlap: true plda: $model/plda三个核心组件对应仓库中的真实文件:
| 组件 | 配置引用 | 仓库文件 | 出处 |
|---|---|---|---|
| 说话人分割模型 | $model/segmentation | segmentation/pytorch_model.bin | 基于 Plaquet & Bredin 的 Powerset 多类交叉熵损失(见 README 引用 1) |
| 说话人嵌入模型 | $model/embedding | embedding/pytorch_model.bin | Wespeaker VoxCeleb ResNet34-LM(见 embedding/README.md 与 README 引用 2) |
| PLDA + x-vector 变换 | $model/plda | plda/plda.npz、plda/xvec_transform.npz | BUT Speech@FIT 训练的 PLDA,VBx 集成(见 plda/README.md 与 README 引用 3) |
各部件职责简述:
- 分割模型:逐帧预测"谁在说话",采用 Plaquet23 提出的Powerset multi-class cross entropy loss训练,能够显式建模重叠语音;
- 嵌入模型:对每个说话人片段提取固定维度的说话人表征(embedding),用于后续聚类;Wespeaker 工具包训练的 ResNet34-LM 架构,遵循其数据集(VoxCeleb)的 CC-BY-4.0 许可;
- PLDA + VBx 聚类:将嵌入向量投影、打分并聚成不同的说话人簇。VBx(Bayesian HMM clustering of x-vector sequences)由 Landini 等人提出,其 PLDA 模型由 BUT Speech@FIT 团队训练并集成进 pyannote.audio。
仓库根目录的 configuration.json 记录了该仓库的元信息:framework: pytorch、task: automatic-speech-recognition,并允许远程拉取(allow_remote: true)。
三、环境准备与安装
按照 README 的 Setup 一节,使用前需要完成三步:
安装 pyannote.audio:
pip install pyannote.audio注意 config.yaml 声明
dependencies.pyannote.audio: 4.0.0,即该 pipeline 面向 pyannote.audio 4.x 设计,建议使用 4.0.0 及以上版本以获得完整功能(尤其是专属说话人日志与离线加载)。接受用户条款:访问模型主页并接受其使用条件(该 pipeline 以 CC-BY-4.0 许可证发布,始终免费可访问)。
创建访问令牌:在 Hugging Face 的令牌设置页面生成一个 Access Token,用于
Pipeline.from_pretrained下载时的身份认证。
四、快速上手:三行代码完成说话人日志
README 给出了最小可运行的快速开始示例:
# download the pipeline from Huggingface from pyannote.audio import Pipeline pipeline = Pipeline.from_pretrained( "pyannote/speaker-diarization-community-1", token="{huggingface-token}") # run the pipeline locally on your computer output = pipeline("audio.wav") # print the predicted speaker diarization for turn, speaker in output.speaker_diarization: print(f"{speaker} speaks between t={turn.start:.3f}s and t={turn.end:.3f}s")关键点说明:
token="{huggingface-token}"处替换为第二步创建的 Access Token;pipeline("audio.wav")支持传入文件路径,也支持{"waveform": ..., "sample_rate": ...}字典(见下文"从内存处理");- 返回的
output.speaker_diarization是一个可迭代对象,每个turn具有start与end属性(秒),speaker为说话人标签,直接遍历即可打印"谁在什么时间段说话"。
五、基准测试:Community-1 与 legacy 3.1 的量化对比
README 的 Benchmark 一节明确给出结论:开箱即用(out of the box)下,Community-1明显优于speaker-diarization-3.1。
评测口径为:在大规模学术基准集合上、全自动处理、无 forgiveness collar(不设容错圈)、不跳过重叠语音,报告的指标为说话人错误率 DER(%)。下表来自 README(数据更新于 2025-09):
| Benchmark(最近更新于 2025-09) | legacy(3.1) | community-1 | precision-2 |
|---|---|---|---|
| AISHELL-4 | 12.2 | 11.7 | 11.4 |
| AliMeeting(channel 1) | 24.5 | 20.3 | 15.2 |
| AMI(IHM) | 18.8 | 17.0 | 12.9 |
| AMI(SDM) | 22.7 | 19.9 | 15.6 |
| AVA-AVD | 49.7 | 44.6 | 37.1 |
| CALLHOME(part 2) | 28.5 | 26.7 | 16.6 |
| DIHARD 3(full) | 21.4 | 20.2 | 14.7 |
| Ego4D(dev.) | 51.2 | 46.8 | 39.0 |
| MSDWild | 25.4 | 22.8 | 17.3 |
| RAMC | 22.2 | 20.8 | 10.5 |
| REPERE(phase2) | 7.9 | 8.9 | 7.4 |
| VoxConverse(v0.3) | 11.2 | 11.2 | 8.5 |
观察要点:
- 在绝大多数基准上,
community-1相比 3.1 有 1~4 个百分点的 DER 下降(如 AliMeeting 从 24.5 → 20.3,Ego4D 从 51.2 → 46.8); precision-2进一步压低 DER(如 RAMC 低至 10.5,CALLHOME 低至 16.6),属于商用级模型;- 唯一例外是 REPERE(phase2),
community-1(8.9)略高于 3.1(7.9),评测时应留意这种个别基准的浮动。
README 同时给出了"一行代码"体验更优的precision-2的方式:先在 pyannoteAI 仪表盘创建 API Key(含免费额度),然后修改from_pretrained的模型标识即可,推理仍走pipeline("audio.wav")同一接口,只是请求会运行在 pyannoteAI 服务器上:
from pyannote.audio import Pipeline pipeline = Pipeline.from_pretrained( - 'pyannote/speaker-diarization-community-1', token="{huggingface-token}") + 'pyannote/speaker-diarization-precision-2', token="{pyannoteAI-api-key}") diarization = pipeline("audio.wav") # runs on pyannoteAI servers六、进阶使用:GPU、内存、进度监控与说话人数量控制
README 提供了四个高频实战场景,全部围绕同一个pipeline对象展开。
6.1 在 GPU 上推理
pyannote.audio的 pipeline 默认在 CPU 上运行。若本机有 CUDA 环境,可用torch.device("cuda")将整个 pipeline 迁移到 GPU:
import torch pipeline.to(torch.device("cuda"))迁移之后继续调用pipeline("audio.wav")即可,接口不变。
6.2 直接从内存处理(预加载加速)
将音频预先读入内存再传给 pipeline,可以省去重复的磁盘 I/O,通常能获得更快的处理速度:
waveform, sample_rate = torchaudio.load("audio.wav") output = pipeline({"waveform": waveform, "sample_rate": sample_rate})注意此时传入的是字典,键固定为waveform与sample_rate,与上一节"快速上手"中的文件路径传参等价。由于内部会自动重采样,sample_rate不必是 16kHz。
6.3 监控处理进度(ProgressHook)
长音频的推理耗时较长,pyannote.audio 提供了进度钩子接口:
from pyannote.audio.pipelines.utils.hook import ProgressHook with ProgressHook() as hook: output = pipeline("audio.wav", hook=hook)hook作为关键字参数传入pipeline(),可在处理过程中上报各阶段的进度,适合集成到 CLI 工具或 Web 服务中做进度条展示。
6.4 控制说话人数量
当场景中说话人数已知时,可直接传入num_speakers:
output = pipeline("audio.wav", num_speakers=2)当只知道大致范围时,可用min_speakers/max_speakers指定上下界:
output = pipeline("audio.wav", min_speakers=2, max_speakers=5)这两个选项会约束内部聚类环节的说话人簇数量:num_speakers为精确值;min_speakers/max_speakers则在给定区间内做最优选择,是修正聚类结果最直接的手段。
七、专属说话人日志(Exclusive Speaker Diarization)
community-1在常规说话人日志之外,额外返回一份专属(exclusive)说话人日志,通过output.exclusive_speaker_diarization访问:
output = pipeline("audio.wav") exclusive = output.exclusive_speaker_diarization根据 README 的说明,该特性是从最新商用模型(precision-2)backport 到社区版的能力,核心价值在于简化细粒度说话人日志时间戳与(有时并不精确的)转写时间戳之间的对齐:
- 常规说话人日志允许同一时刻出现多个说话人(重叠语音),时间片段可能互相交叠;
- 专属说话人日志保证时间轴上的每个时刻至多只有一个说话人,片段互斥、连续,因此与 ASR(自动语音识别)输出的转写片段做"谁说了哪句话"的映射时无需处理重叠与冲突。
对于"会议纪要生成、语音助手多轮对话、客服质检"这类需要把转写文本归到具体说话人的下游任务,直接使用exclusive_speaker_diarization可以显著降低后处理复杂度。
八、离线使用:完全无网络推理
community-1支持将 pipeline 完整复制到本地磁盘,之后完全离线加载与推理,适合内网环境或对数据出境敏感的场景。
第一步:把仓库克隆到磁盘(需要先安装 git-lfs,克隆时提示输入密码处,填入具备写权限的 Access Token):
# make sure git-lfs is installed git lfs install # create a directory on disk mkdir /path/to/directory # when prompted for a password, use an access token with write permissions. git clone https://hf.co/pyannote/speaker-diarization-community-1 /path/to/directory/pyannote-speaker-diarization-community-1克隆到本地后,仓库目录中的segmentation/、embedding/、plda/权重与 config.yaml 都会被一并带上,构成一个自包含的 pipeline 目录。
第二步:离线加载并推理:
# load pipeline from disk (works without internet connection) from pyannote.audio import Pipeline pipeline = Pipeline.from_pretrained('/path/to/directory/pyannote-speaker-diarization-community-1') # run the pipeline locally on your computer output = pipeline("audio.wav")注意此处from_pretrained的参数是本地磁盘路径而非模型 ID,且不再需要token参数——pipeline 从本地加载,完全不依赖网络。其余用法(GPU、内存输入、进度钩子、说话人数量控制、专属日志)均与在线版本一致。
九、深入 config.yaml:理解 pipeline 内部超参数
config.yaml 是理解community-1行为的关键文件,除了上文展示的组件装配外,还包含以下可调超参数:
params: clustering: threshold: 0.6 Fa: 0.07 Fb: 0.8 segmentation: min_duration_off: 0.0clustering.threshold(默认 0.6):聚类得分阈值,用于决定说话人片段是否归属同一说话人簇。阈值越低,聚类越"宽容",倾向于合并为更少的说话人;阈值越高,越容易把相近片段拆成不同说话人。配合num_speakers/min_speakers/max_speakers可对该值进行补偿性调整。clustering.Fa(默认 0.07)/clustering.Fb(默认 0.8):VBx 聚类(Bayesian HMM 说话人聚类)的两个核心先验参数。VBx 通过 HMM 对 x-vector 序列建模,Fa控制说话人转移相关先验,Fb控制说话人发射分布相关先验;两者共同影响片段划分的粒度与重叠语音的处理方式。它们是 VBx 方法论文(Landini2022)中定义的超参数,调参时建议小步微调并观察 DER 变化。segmentation.min_duration_off(默认 0.0):对"无人说话"(off)片段的最短持续时长过滤。设为 0 表示不合并短暂停顿;若调大,例如设为 0.2,则小于该值的非语音间隙会被合并到相邻语音片段,使输出时间轴更平滑。segmentation_batch_size: 32/embedding_batch_size: 32:分割与嵌入模型推理的批大小。显存充足时可适当调大以提升吞吐;显存紧张时调小可降低峰值占用。embedding_exclude_overlap: true:提取说话人嵌入时排除重叠语音区域。由于重叠区间的帧同时包含多个说话人,混叠的嵌入会污染聚类,因此默认排除;若任务中重叠语音占比很高且希望保留这些帧,可改为false观察效果。
从实现上看,$model/segmentation、$model/embedding、$model/plda中的$model前缀指向仓库自身的子目录,即上文第二节列出的三个权重目录,读者在本地克隆仓库后即可直接按此结构修改 yaml 做定制实验。
十、引用与致谢
若在论文或产品中使用本 pipeline,README 提供了三份核心引用:
说话人分割模型:Plaquet, A. & Bredin, H.,《Powerset multi-class cross entropy loss for neural speaker diarization》,Proc. INTERSPEECH 2023。
@inproceedings{Plaquet23, author={Alexis Plaquet and Hervé Bredin}, title={{Powerset multi-class cross entropy loss for neural speaker diarization}}, year=2023, booktitle={Proc. INTERSPEECH 2023}, }说话人嵌入模型:Wang, H. 等,《Wespeaker: A research and production oriented speaker embedding learning toolkit》,ICASSP 2023。
@inproceedings{Wang2023, title={Wespeaker: A research and production oriented speaker embedding learning toolkit}, author={Wang, Hongji and Liang, Chengdong and Wang, Shuai and Chen, Zhengyang and Zhang, Binbin and Xiang, Xu and Deng, Yanlei and Qian, Yanmin}, booktitle={ICASSP 2023, IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)}, pages={1--5}, year={2023}, organization={IEEE} }说话人聚类(VBx):Landini, F. 等,《Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: theory, implementation and analysis on standard tasks》,Computer Speech & Language, 2022。
@article{Landini2022, author={Landini, Federico and Profant, J{\'a}n and Diez, Mireia and Burget, Luk{\'a}{\v{s}}}, title={{Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: theory, implementation and analysis on standard tasks}}, year={2022}, journal={Computer Speech \& Language}, }
此外,README 的致谢部分说明:模型的训练与调优得益于 GENCI 提供的 Jean Zay 超算资源。
总结
speaker-diarization-community-1是一个"开箱即用、细节可调、可完全离线"的说话人日志 pipeline:安装 pyannote.audio 并配置 Access Token 后,三行代码即可对任意单声道音频输出说话人分段;需要更高精度时可通过num_speakers/min_speakers/max_speakers约束聚类、通过exclusive_speaker_diarization简化与转写的对齐;生产环境中则可利用 GPU 迁移、内存输入与 ProgressHook 优化吞吐,并借助 git-lfs 克隆仓库实现零网络依赖部署。结合 config.yaml 中 VBx 聚类阈值、Fa/Fb 与批大小等参数,读者完全可以在本地二次调优出适合自身业务数据的说话人日志方案。
【免费下载链接】speaker-diarization-community-1
相关推荐
Nemotron-3-Diarization 实战指南:基于 NVIDIA NeMo Speech 的流式与离线八说话人日志(Speaker Diarization)
Nemotron 3 Diarization 实战指南:基于 NVIDIA NeMo Speech 的流式与离线八说话人日志(Speaker Diarizati
人工智能语音音频3 步跑通 PaperQA2:安装、配置与文献问答完整指南
3 步跑通 PaperQA2:安装、配置与文献问答完整指南 有一堆论文 PDF,想直接向它们提问,还要拿到带页码引用的答案?PaperQA2 就是为这个场景做的
RAGAI AgentAI 应用NLPGHelper 奥创替代:3 处设置,把风扇噪音和续航焦虑降下来
GHelper 奥创替代:3 处设置,把风扇噪音和续航焦虑降下来 奥创刚弹完更新提示,任务管理器里已经躺着五个它的进程。GHelper 是单 exe 的华硕笔记
桌面应用系统编程
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考