NVIDIA发布首个开放全双工语音模型NemotronLabs VoiceChat,支持实时工具调用
NVIDIA发布11B参数开放全双工语音模型VoiceChat,支持边听边说、打断与实时工具调用,为需要数据不出域、低延迟本地部署的医疗、金融、教育等场景提供了开源替代方案;进一步推动NVIDIA GPU在实时语音推理市场的渗透。
这是NVIDIA在Hugging Face平台上线的11B参数级开放权重全双工语音大模型,支持边听边说的实时交互,可在对话过程中同步完成工具调用,面向数据中心级GPU部署场景。
发布方:NVIDIA 发布时间:2026年8月4日 产品/模型名称:NemotronLabs VoiceChat 11B 核心定位:首个开放权重的全双工实时语音交互大模型
一、发布背景
当前主流语音交互产品普遍存在对话停顿、工具调用时出现长段静默的问题,行业内此前缺少可公开获取的全双工语音模型,NVIDIA依托已有的Nemotron系列开源模型技术积累,推出了这款面向语音Agent场景的专用模型。
二、核心升级
1.交互模式
此前多数开源语音模型采用“说完再听”的半双工设计,升级后支持真正的全双工交互,用户可在AI输出语音的过程中随时打断,无需等待回复结束。
2.工具调用
传统语音模型将工具调用流程嵌入主对话链路,容易引发对话卡顿,该模型将工具调用分流至独立通道处理,从结构上减少了交互过程中的静默时长。
3.关键指标
端到端延迟低至450ms,在面向实时语音交互的VoiceBench榜单中位列开源模型第一,在FullDuplexBench 1.0榜单中位列开源模型第二,BFCL-v3工具调用基准测试得分56.1%,支持vLLM推理框架加速。
4. 硬件适配
仅支持数据中心级GPU运行,兼容A100、H100、H200、B100、B200、RTX-6000系列显卡,普通消费级笔记本无法直接运行。
5.运行模式
同时提供离线批量处理、WebSocket流式交互两种部署模式,覆盖批量语音转写、实时在线对话两类不同生产场景需求。
三、技术原理
公开资料未提及完整技术实现细节,现有信息显示其核心突破点为将工具调用流程从主对话链路中分离,通过独立通道异步处理外部接口请求,避免工具调用环节阻塞语音流输出,从架构层面降低了全双工交互的延迟门槛。
四、应用场景
1.实时语音客服
解决传统客服系统查询订单、库存时出现的对话停顿问题,用户无需等待系统返回结果即可继续表达需求。
2.智能语音助手
支持边交互边完成日程查询、设备控制等操作,如适配车载复杂噪音环境,支持用户在AI播报导航路线的过程中随时修改目的地,不用等播报结束再发起指令。大幅提升自然对话流畅度。
3.行业语音Agent
面向预约确认、信息检索等需要频繁调用外部系统的场景,减少交互过程中的无效等待。
五、定价与开放策略
1. 权重开放渠道
Hugging Face平台公开下载
2. 许可协议
OpenMDW License Agreement version 1.1
3. 使用限制
模型卡标注为“仅面向研究用途”,商用需提前核对许可协议全文
4. 部署门槛
仅支持Linux系统运行,需搭配指定数据中心级GPU
- 工具调用分流的架构设计,需要关注是否会成为后续开源语音Agent的主流技术选型
- 56.1%的BFCL-v3得分仍有明显提升空间
- 仅支持数据中心级GPU的部署门槛较高
- 全双工语音的自然交互体验,会大幅拉长用户单轮对话时长,改变现有语音产品的交互逻辑