腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview
腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview,基于最新一代大语言模型Hy3的语言理解能力,提升复杂真实输入中的转写准确性。
腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3大语言模型,采用端云协同双架构,在通用场景、方言场景、低信噪比场景下实现准确率全面跃升,同时大幅降低端侧部署门槛,覆盖从手机端到工业设备的全品类硬件。 能有效提升复杂场景转写准确率与意图理解能力,能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果。该模型将进一步提升腾讯混元在会议、客服、内容创作等场景的语音AI能力。
一、发布背景
传统语音识别模型长期存在明显短板:嘈杂环境下识别准确率骤降,小众方言识别支持差,轻声、远场、带口音的语音经常出现错漏,且高准确率模型普遍体积庞大,无法在低算力端侧设备流畅运行,大量真实场景的识别需求始终无法被满足。
二、核心升级
1.前代行业主流方案痛点
通用场景识别准确率约97%,方言覆盖不足20种,嘈杂环境下准确率直接跌至80%以下,高参数量模型无法在普通端侧设备部署。
2.通用场景性能升级
标准普通话场景字错率降至1.2%,达到行业全新顶尖水平,远超此前主流商用模型的表现。
3.方言覆盖能力升级
支持37种方言的端侧实时识别,新增晋语、徽语等此前几乎没有商用方案覆盖的小众方言,方言识别平均准确率提升至95%以上。
4.复杂环境鲁棒性升级
在KTV、工地、闹市等强噪声场景下,识别准确率仍保持92%以上,针对轻声耳语、远场5米拾音、带浓重口音的语音场景做了专项优化,错字率下降60%。
5.端侧部署能力升级
最小版本仅180MB,可在手机、智能手表、工业语音设备等低算力硬件上流畅运行,端侧识别延迟低于100毫秒,完全无需上传音频数据,保障隐私安全。
6.多语言混合识别升级
支持普通话与英语、粤语等语言的自然混合对话识别,无需手动切换语种,自动完成无缝转写。
三、技术原理
Hy ASR 3.0 preview基于混元大模型的多模态语义理解底座,采用语音-文本联合预训练架构,把海量无标注语音数据与万亿级文本语料的语义知识深度打通,解决了传统语音模型在生僻词、专业术语场景下的识别短板;同时通过结构化剪枝与知识蒸馏技术,在几乎不损失准确率的前提下,把模型体积压缩到端侧硬件可承载的级别,实现端云双版本能力对齐。
该版本能实现性能突破,一方面依托腾讯混元大模型的通用语义理解能力,把语音识别从“听清楚声音”升级为“理解语义内容”;另一方面依托腾讯在微信、会议等亿级产品中积累的海量真实语音场景数据,完成了复杂环境下的专项针对性优化。
四、应用场景
1.日常社交场景
适配微信语音转文字功能,嘈杂环境下语音转写准确率大幅提升,解决用户在户外、聚会场景下发语音转文字经常出错的痛点。
2.会议办公场景
腾讯会议全量适配后,多人混合发言、背景有噪声的场景下,会议转写准确率大幅提升,自动生成的会议纪要错漏率几乎清零。
3.方言地区公共服务场景
面向国内方言普及的县域地区,政务窗口、社区服务设备可直接支持方言语音交互,降低老年群体的数字服务使用门槛。
4.工业现场场景
工厂车间的强噪声环境下,工人可直接通过语音录入设备巡检数据,无需手动操作屏幕,大幅提升工业场景的操作效率。
五、开放与落地策略
| 项目 | 详情 |
|---|---|
| 当前版本状态 | Preview预览版,面向开发者开放测试 |
| 部署形态 | 同时提供云端API与端侧SDK两种接入方式 |
| 适配硬件 | 支持手机、智能穿戴、智能汽车、工业语音设备等全品类硬件 |
| 后续计划 | 正式版将于2026年Q4发布,同步开放全部37种方言的商用授权 |
| 落地产品 | 后续将逐步在微信、腾讯会议等全系腾讯产品中完成灰度上线 |