NVIDIA于2026年9月下旬发布开源权重模型Nemotron 3 Diarization。该模型仅100M参数,可在实时流式与离线批处理模式下识别最多8位重叠说话人,输出“谁在何时说话”的时间戳。据多个独立来源报告,其以14.72%的说话人错误率登顶VoiceArena榜单。权重与Demo已开放,可配合NeMo工具包搭建带说话人标签的转写流水线。
在语音AI产业链中,NVIDIA此次发布的Nemotron 3 Diarization并非一个通用的语音识别模型,而是聚焦“说话人日志(diarization)”的专精组件。它不负责把语音转成文字,而是回答一个更基础的问题:在一段多人对话的音频中,谁在什么时间开口说话?
这一任务的难点在于“重叠语音”。当多人同时说话时,普通语音识别系统很难区分声音归属;而该模型通过按首次出现顺序固定说话人编号,并配合AOSC长期说话人缓存与FIFO短期上下文,能在跨时间、跨音频分块的情况下维持说话人标签的一致性。
据NVIDIA开发者页面及多个媒体报道,Nemotron 3 Diarization的参数量仅有100M(1亿),属于轻量级模型。支持的最大说话人数量从前代nvidia/diar_streaming_sortformer_4spk-v2.1的4人提升至8人,实现能力翻倍。在处理重叠语音时,模型会为每位发言人切分时间戳,并输出对应的说话人ID。
该模型同时覆盖实时流式推理与离线批处理两种模式。据官方信息,输入缓冲延迟可在0.32秒至30.4秒之间调节,用户可以根据场景在“实时性”与“准确性”之间做取舍。
在第三方评测方面,多个独立来源报告称,Nemotron 3 Diarization在VoiceArena说话人分离榜单上以14.72%的说话人错误率(DER)位列第一。需要注意的是,这一数字来自第三方评测,并非NVIDIA官方测试指标。
目前,该模型的权重与试玩Demo已在Hugging Face开放,属于开源权重(open-weight)模式。配合NVIDIA NeMo工具包,开发者可以快速搭建一条带说话人标签的语音转写流水线。但有技术博主提示,该模型只输出“谁+何时”的说话人与时间戳信息,文本转写仍需另行配置ASR模型。这与同一时期阿里Qwen推出的分角色转写ASR方向相同,但分工不同。
在作者看来,NVIDIA刻意将“说话人日志”做成一个独立的小模型,而非塞进更大的多模态模型中,是一种务实的工程选择。语音转写流水线本身是由VAD(语音活动检测)、说话人日志、ASR等多个环节组成的;把每个环节模块化,能够降低集成难度,也便于针对单一瓶颈单独升级。Nemotron 3 Diarization以100M参数换来8说话人追踪和竞品级的DER,印证了这一“小即快、专即准”的路径。当然,它也留下了一个明确的短板:用户必须自己搭配ASR,才能得到完整的分角色转写文本。