
10分钟跑通Nemotron-3-Diarization从NeMo安装到首次说话人分割的完整教程【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-DiarizationNemotron-3-Diarization 是 NVIDIA 开源的说话人分割Speaker Diarization模型专门回答谁在什么时候说话。它最多支持 8 位说话人同时支持离线与流式推理最低推荐延迟仅 0.32 秒并开放商用许可。本文带你从 NeMo 环境安装开始10 分钟跑通首次说话人分割直接拿到带时间戳的说话人标签。一、模型能力速览为什么说它能打项目规格最大说话人数8 人推理模式离线 流式最低延迟输入缓冲低至 80 ms推荐配置 0.32 s模型参数1 亿31 层 Transformer 编码器音频格式16 kHz 单声道 .wav / .flac / .opus / .mp3音频时长上限分块推理下无限制商用授权OpenMDW 1.1商用与非商用均可它采用 Sortformer 思路8 个输出通道按说话人首次出现顺序排列从根上解决了多说话人的身份混淆问题流式推理则依靠 Arrival-Order Speaker CacheAOSC和 FIFO 队列让说话人身份在整段音频中保持稳定。二、NeMo 环境安装3 条命令搞定依赖环境要求Linux NVIDIA GPUAmpere / Ada / Hopper / Blackwell 全系支持 Python 3.12 较新版本的 PyTorch。apt-get update apt-get install -y libsndfile1 ffmpeg uv pip install Cython packaging uv pip install nemo-toolkit[asr]安装完成后nemo工具包即可加载本模型无需额外配置。三、5 分钟跑通首次说话人分割附完整脚本把下面的脚本保存为run_diarize.py替换音频路径后运行python run_diarize.pyfrom nemo.collections.asr.models import SortformerEncLabelModel # 1. 加载模型首次运行自动下载权重 diar_model SortformerEncLabelModel.from_pretrained(nvidia/Nemotron-3-Diarization) diar_model.eval() # 2. 配置为离线模式chunk 参数对应 30.4 s 输入缓冲精度最高 diar_model.sortformer_modules.chunk_len 340 diar_model.sortformer_modules.chunk_right_context 40 diar_model.sortformer_modules.fifo_len 40 diar_model.sortformer_modules.spkcache_update_period 300 diar_model._check_streaming_parameters() # 3. 执行说话人分割 predicted_segments diar_model.diarize(audio[/path/to/your/audio.wav], batch_size1) for segment in predicted_segments[0]: print(segment) # 输出形如: [speaker1, 0.51, 12.62]输出中每一行表示一个语音段speaker1从 0.51 秒说到 12.62 秒。多段交替出现说明分割成功 ✅ 如果本地已有权重文件即本仓库的 Nemotron-3-Diarization.nemo可改用restore_from加载diar_model SortformerEncLabelModel.restore_from( restore_path/path/to/Nemotron-3-Diarization.nemo, map_locationcuda, strictFalse)四、流式推理按业务延迟选对参数组合所有流式参数均以80 ms 帧为单位官方推荐四档配置配置延迟SPKCACHE_LENFIFO_LENCHUNK_LENRIGHT_CONTEXTUPDATE_PERIOD高延迟离线30.4 s2644034040300低延迟1.04 s26426494222超低延迟0.64 s26426462222极致低延迟0.32 s26426431222⚠️ 延迟 CHUNK_LEN RIGHT_CONTEXT× 80 ms不含计算耗时。选择建议批量处理、播客归档 → 离线档30.4 s直播字幕、实时会议 → 0.32 s 或 0.64 s 档。延迟越低精度略降按业务取舍。配置方法只需把上表参数逐一赋给diar_model.sortformer_modules对应字段再调用_check_streaming_parameters()校验即可。五、输入音频要求与格式转换采样率必须16 kHz单声道支持.wav/.flac/.opus/.mp3也支持传入路径列表或逐行 JSON manifest 批量推理。不符合格式时用 ffmpeg 一条命令转换ffmpeg -i input.mp3 -ac 1 -ar 16000 -c:a pcm_s16le conversation.wav六、进阶分割 流式 ASR输出谁说了什么分割模型只回答谁在何时说话。若要生成完整的说话人归属转写可搭配流式 ASR 模型Multitalker Parakeet 或 Nemotron 3.5 ASR。仓库中的 ASR_INTEGRATION_GUIDE.md 给出了完整双模型集成指南包括安装步骤、一条命令启动推理以及如何搭建设备端麦克风实时流式服务。最终效果类似Speaker 0: Welcome, everyone. Let us begin. Speaker 1: I have the latest numbers.注意Speaker N是会话内按出现顺序发现的匿名编号若要显示真实姓名需在应用层另行完成身份注册映射。七、常见问题排查清单现象解决办法模型下载失败模型仓库需要具备读取权限的 Hugging Face token设置HF_TOKEN环境变量结果明显偏差先把音频转成 16 kHz 单声道见第五节传 numpy 数组报错必须以整数形式显式传入sample_rate如 16000CUDA 显存不足调小batch_size或max_num_of_spks断线重连后说话人编号变了正常现象标签是会话局部的重连即重置八、延伸阅读与参考资料README.md完整模型卡——架构细节、训练数据、DER 基准成绩与硬件兼容清单ASR_INTEGRATION_GUIDE.md与流式 ASR 的说话人归属转写集成diarization_evaluation.mdDER / SCA / MAE 评估规范bias.md、privacy.md、safety.md、explainability.md模型合规与透明度说明性能参考在多语种基准 DIHARD III 上30.4 s 延迟配置的 DER 为 12.73%上一代 4 人基线模型为 19.09%在 5–7 人会议场景 NOTSOFAR1 上DER 仅 6.77%在 RTX PRO 5000 上批量推理可达 12000 倍以上的实时加速比。从安装到跑通10 分钟足够——现在就可以动手了。【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考