⚡ 要闻简报
阿里发布Qwen-Audio-3.0语音识别大模型
🕐 2026.08.03 星期一
来源 · 阿里Qwen
🔥 8 次点击
阿里重磅发布Qwen-Audio-3.0语音识别大模型:1.7%错字率全球登顶,行业词"免教即会",将语音识别从"把字听对"推向"把话听懂、把文写好"。
发布方 :阿里巴巴(通义千问团队)
发布时间 :2026年7月31日
模型名称 :Qwen-Audio-3.0-ASR-Flash(及系列)
评测成绩 :Artificial Analysis 全球权威评测平台 1.7%错字率,全球第一
开放平台 :阿里云百炼(Bailian)
覆盖语言 :30余种
一、一句话定义
Qwen-Audio-3.0-ASR-Flash不是又一个"听得准"的语音识别——它是阿里首次让ASR模型在长音频中"记住上下文"、在行业场景中"免教即会"、在热词更新中"百发百中"的新一代大模型,并将语音润色与结构化输出合为一步,直接把语音变成可用的文字产品。
二、核心能力全景
| 错字率 | 1.7% (Artificial Analysis 全球第一) |
| 最长单次识别 | 5分钟 (Flash版本) |
| 覆盖语言 | 30余种(中/英/日/韩等) |
| 行业词召回(医疗) | 95.36% |
| 热词定制准确率 | 多数场景 >99% |
| 语音润色 | ✅ 去填充词、修正口误、自动结构化,一步完成 |
| 支持版本 | Flash(短音频)/ Filetrans(离线文件)/ Streaming(实时流) |
三、三大核心突破(对比上一代)
1️⃣ 长音频上下文记忆:说过的词不再认错
| 传统ASR | Qwen-Audio-3.0-ASR-Flash |
| 逐句独立识别,同音词靠概率猜 | 转写当前片段时 回溯近期上下文 ,延续关键词与语义线索 |
| 跨段落后人名/术语易错 | 数小时会议中,同一发言人的名字与技术概念 不会被忘记或认错 |
💡 本质 :模型不再"听一句忘一句",而是像人类速记员一样带着记忆听完整场。
2️⃣ 行业词免教即会:无需人工维护词表
| 传统方案 | Qwen-Audio-3.0-ASR-Flash |
| 依赖人工逐一录入行业词表 | 内化为模型自身能力 ,基于多行业高质量词库+合成训练数据持续进化 |
| 新领域上线需数周人工标注 | 医疗/IT编程/股票/名人等领域 开箱即用 |
| 领域行业词召回率 |
| 医疗 | 95.36% |
| IT编程 | 显著提升 |
| 股票/金融 | 显著提升 |
| 社会名人 | 显著提升 |
3️⃣ 热词定制:快、准、不误触
| 传统痛点 | Qwen-Audio-3.0-ASR-Flash |
| 热词加越多,误触发越多,结果反而被带偏 | 在传入热词条件下, 所有测试集准确率>90%,多数>99% |
| 品牌名/产品名/行业黑话无法预装 | 支持实时传入低频长尾词, 精准识别不污染全局 |
四、语音润色:ASR一步到位,不再外挂大模型
能力示例
| 去填充词 | "那个……嗯……我们下周三评审" → "我们下周三评审" |
| 自我修正合并 | "我们下周三评审,不对,是周四" → "我们下周四评审" |
| 散乱口述→结构化 | 口语化零散表达 → 自动整理为条理清晰的段落/纪要 |
⚡ 关键优势 :润色在ASR识别环节一步完成,无需再调用下游文本大模型, 链路更短、延迟更低、成本更低 。
五、三版本定位与适用场景
| 版本名称 | 核心场景 | 输入方式 |
| 🔹 Flash | Qwen-Audio-3.0-ASR-Flash | 会议纪要、课程转写、直播字幕 | 短音频(≤5分钟) |
| 📄 Filetrans | Qwen-Audio-3.0-ASR-Filetrans | 长视频/播客批量转写 | 离线文件上传 |
| 🔴 Streaming | Qwen-Audio-3.0-ASR-Streaming | 实时字幕、智能客服、直播 | 实时音频流 |
六、与Qwen-Audio-3.0-Realtime的关系
| 维度 | Qwen-Audio-3.0-ASR(7.31发布) | Qwen-Audio-3.0-Realtime(7.15发布) |
| 定位 | 语音 识别 (语音→文字) | 语音 对话 (语音↔语音,理解+生成) |
| 核心能力 | 长音频上下文、行业词、热词、润色 | 智商、Agent调用、共情、双工交互 |
| 版本 | Flash / Filetrans / Streaming | Plus / Flash |
| 评测 | Artificial Analysis 1.7%错字率第一 | Artificial Analysis 语音推理+对话流畅度第一 |
🔗 两者共同构成阿里Qwen-Audio 3.0语音全栈能力 :一个听得准、一个说得好 。
七、技术底座亮点
| 长上下文建模 | 在转写当前片段时可参考近期已识别内容,延续语义线索 |
| 多行业实体词库 | 从医疗/IT/股票/名人等领域持续挖掘,合成高质量训练数据 |
| 热词动态注入 | 支持运行时传入低频词,且不污染全局识别分布 |
| 一体化润色 | 填充词去除+口误修正+结构化,端到端训练 |
| 30+语言支持 | 多语言混合识别,中英文无缝切换 |
八、定价与开放
| 开放平台 | 阿里云百炼(Bailian) |
| 调用方式 | API开放,按Token计费 |
| 企业接入 | 支持通过阿里云FC函数计算一键部署 |
| 生态定位 | 与通义千问大模型家族协同,可作为语音入口对接下游文本/Agent能力 |
九、落地场景矩阵
| 会议纪要 | 长音频上下文+语音润色+结构化 → 出纪要无需人工整理 |
| 在线教育录播 | 5分钟Flash+行业词(学术术语)→ 课程转写精准可用 |
| 实时直播字幕 | Streaming版本+低延迟 → 直播间实时上屏 |
| 智能客服 | 行业词(金融/电商)+热词(产品名)→ 精准理解用户意图 |
| 医疗问诊记录 | 医疗词召回95.36%+润色 → 病历转写可靠 |
| 播客/视频批量转写 | Filetrans离线版 → 长内容批量处理 |
十、市场反响
- 资本市场 :阿里巴巴-W(09988.HK)股价在7月31日发布当日表现活跃
- 行业评价 :1.7%错字率被视为ASR领域里程碑级指标,意味着机器转写质量首次逼近专业人工速记水平
- 开发者社区 :阿里云百炼平台调用量预计将在短时间内显著增长
十一、已知限制(官方坦诚披露)
| ⚠️ 极端噪声 | 极高背景噪声环境下识别率仍有下降空间 |
| ⚠️ 超长音频 | Flash版本单次上限5分钟,更长需Filetrans分片 |
| ⚠️ 超低频新词 | 热词需显式传入,完全未见过的新造词仍需一次学习 |
十二、一句话总结
Qwen-Audio-3.0-ASR-Flash以"上下文记忆+行业词免教+热词百发百中+一步润色"四把利刃,将语音识别从"把字听对"推向"把话听懂、把文写好"——1.7%全球最低错字率不只是一个数字,它标志着ASR正式跨过行业落地的"最后一公里"。
信息综合自2026年7月31日阿里巴巴官方发布、阿里云百炼平台公告及Artificial Analysis评测数据。模型已在阿里云百炼平台开放API调用。
← 返回 [资讯]