⚡ 前沿动态

NVIDIA发布首个开放全双工语音模型NemotronLabs VoiceChat,支持实时工具调用

🕐 2026.08.05 星期三 来源 · 媒体 🔥 4 次点击

NVIDIA发布11B参数开放全双工语音模型VoiceChat,支持边听边说、打断与实时工具调用,为需要数据不出域、低延迟本地部署的医疗、金融、教育等场景提供了开源替代方案;进一步推动NVIDIA GPU在实时语音推理市场的渗透。

这是NVIDIA在Hugging Face平台上线的11B参数级开放权重全双工语音大模型,支持边听边说的实时交互,可在对话过程中同步完成工具调用,面向数据中心级GPU部署场景。

发布方:NVIDIA 发布时间:2026年8月4日 产品/模型名称:NemotronLabs VoiceChat 11B 核心定位:首个开放权重的全双工实时语音交互大模型

一、发布背景

当前主流语音交互产品普遍存在对话停顿、工具调用时出现长段静默的问题,行业内此前缺少可公开获取的全双工语音模型,NVIDIA依托已有的Nemotron系列开源模型技术积累,推出了这款面向语音Agent场景的专用模型。

二、核心升级

1.交互模式

此前多数开源语音模型采用“说完再听”的半双工设计,升级后支持真正的全双工交互,用户可在AI输出语音的过程中随时打断,无需等待回复结束。

2.工具调用

传统语音模型将工具调用流程嵌入主对话链路,容易引发对话卡顿,该模型将工具调用分流至独立通道处理,从结构上减少了交互过程中的静默时长。

3.关键指标

端到端延迟低至450ms,在面向实时语音交互的VoiceBench榜单中位列开源模型第一,在FullDuplexBench 1.0榜单中位列开源模型第二,BFCL-v3工具调用基准测试得分56.1%,支持vLLM推理框架加速。

4. 硬件适配

仅支持数据中心级GPU运行,兼容A100、H100、H200、B100、B200、RTX-6000系列显卡,普通消费级笔记本无法直接运行。

5.运行模式

同时提供离线批量处理、WebSocket流式交互两种部署模式,覆盖批量语音转写、实时在线对话两类不同生产场景需求。

三、技术原理

公开资料未提及完整技术实现细节,现有信息显示其核心突破点为将工具调用流程从主对话链路中分离,通过独立通道异步处理外部接口请求,避免工具调用环节阻塞语音流输出,从架构层面降低了全双工交互的延迟门槛。

四、应用场景

1.实时语音客服

解决传统客服系统查询订单、库存时出现的对话停顿问题,用户无需等待系统返回结果即可继续表达需求。

2.智能语音助手

支持边交互边完成日程查询、设备控制等操作,如适配车载复杂噪音环境,支持用户在AI播报导航路线的过程中随时修改目的地,不用等播报结束再发起指令。大幅提升自然对话流畅度。

3.行业语音Agent

面向预约确认、信息检索等需要频繁调用外部系统的场景,减少交互过程中的无效等待。

五、定价与开放策略

1. 权重开放渠道

Hugging Face平台公开下载

2. 许可协议

OpenMDW License Agreement version 1.1

3. 使用限制

模型卡标注为“仅面向研究用途”,商用需提前核对许可协议全文

4. 部署门槛

仅支持Linux系统运行,需搭配指定数据中心级GPU

  1. 工具调用分流的架构设计,需要关注是否会成为后续开源语音Agent的主流技术选型
  2. 56.1%的BFCL-v3得分仍有明显提升空间
  3. 仅支持数据中心级GPU的部署门槛较高
  4. 全双工语音的自然交互体验,会大幅拉长用户单轮对话时长,改变现有语音产品的交互逻辑
← 返回 [前沿动态]