⚡ 要闻简报

阿里发布Qwen-Audio-3.0语音识别大模型

🕐 2026.08.03 星期一 来源 · 阿里Qwen 🔥 8 次点击

阿里重磅发布Qwen-Audio-3.0语音识别大模型:1.7%错字率全球登顶,行业词"免教即会",将语音识别从"把字听对"推向"把话听懂、把文写好"。

发布方 ‌:阿里巴巴(通义千问团队)
发布时间 ‌:2026年7月31日
模型名称 ‌:Qwen-Audio-3.0-ASR-Flash(及系列)
评测成绩 ‌:Artificial Analysis 全球权威评测平台 ‌ 1.7%错字率,全球第一
开放平台 ‌:阿里云百炼(Bailian)
覆盖语言 ‌:30余种

一、一句话定义

Qwen-Audio-3.0-ASR-Flash不是又一个"听得准"的语音识别——它是阿里首次让ASR模型在长音频中"记住上下文"、在行业场景中"免教即会"、在热词更新中"百发百中"的新一代大模型,并将语音润色与结构化输出合为一步,直接把语音变成可用的文字产品。

二、核心能力全景

错字率1.7% ‌(Artificial Analysis 全球第一)
最长单次识别5分钟 ‌(Flash版本)
覆盖语言30余种(中/英/日/韩等)
行业词召回(医疗)95.36%
热词定制准确率多数场景 ‌ >99%
语音润色✅ 去填充词、修正口误、自动结构化,一步完成
支持版本Flash(短音频)/ Filetrans(离线文件)/ Streaming(实时流)

三、三大核心突破(对比上一代)

1️⃣ 长音频上下文记忆:说过的词不再认错

传统ASRQwen-Audio-3.0-ASR-Flash
逐句独立识别,同音词靠概率猜转写当前片段时‌ 回溯近期上下文 ‌,延续关键词与语义线索
跨段落后人名/术语易错数小时会议中,同一发言人的名字与技术概念‌ 不会被忘记或认错
💡 ‌ 本质 ‌:模型不再"听一句忘一句",而是像人类速记员一样带着记忆听完整场。

2️⃣ 行业词免教即会:无需人工维护词表

传统方案Qwen-Audio-3.0-ASR-Flash
依赖人工逐一录入行业词表内化为模型自身能力 ‌,基于多行业高质量词库+合成训练数据持续进化
新领域上线需数周人工标注医疗/IT编程/股票/名人等领域‌ 开箱即用
领域行业词召回率
医疗95.36%
IT编程显著提升
股票/金融显著提升
社会名人显著提升

3️⃣ 热词定制:快、准、不误触

传统痛点Qwen-Audio-3.0-ASR-Flash
热词加越多,误触发越多,结果反而被带偏在传入热词条件下,‌ 所有测试集准确率>90%,多数>99%
品牌名/产品名/行业黑话无法预装支持实时传入低频长尾词,‌ 精准识别不污染全局

四、语音润色:ASR一步到位,不再外挂大模型

能力示例

去填充词"那个……嗯……我们下周三评审" → "我们下周三评审"
自我修正合并"我们下周三评审,不对,是周四" → "我们下周四评审"
散乱口述→结构化口语化零散表达 → 自动整理为条理清晰的段落/纪要
⚡ ‌ 关键优势 ‌:润色在ASR识别环节一步完成,无需再调用下游文本大模型,‌ 链路更短、延迟更低、成本更低 ‌。

五、三版本定位与适用场景

版本名称核心场景输入方式
🔹 ‌ FlashQwen-Audio-3.0-ASR-Flash会议纪要、课程转写、直播字幕短音频(≤5分钟)
📄 ‌ FiletransQwen-Audio-3.0-ASR-Filetrans长视频/播客批量转写离线文件上传
🔴 ‌ StreamingQwen-Audio-3.0-ASR-Streaming实时字幕、智能客服、直播实时音频流

六、与Qwen-Audio-3.0-Realtime的关系

维度Qwen-Audio-3.0-ASR(7.31发布)Qwen-Audio-3.0-Realtime(7.15发布)
定位语音‌ 识别 ‌(语音→文字)语音‌ 对话 ‌(语音↔语音,理解+生成)
核心能力长音频上下文、行业词、热词、润色智商、Agent调用、共情、双工交互
版本Flash / Filetrans / StreamingPlus / Flash
评测Artificial Analysis 1.7%错字率第一Artificial Analysis 语音推理+对话流畅度第一
🔗 两者共同构成阿里Qwen-Audio 3.0语音全栈能力‌ :一个听得准、一个说得好 ‌。

七、技术底座亮点

长上下文建模在转写当前片段时可参考近期已识别内容,延续语义线索
多行业实体词库从医疗/IT/股票/名人等领域持续挖掘,合成高质量训练数据
热词动态注入支持运行时传入低频词,且不污染全局识别分布
一体化润色填充词去除+口误修正+结构化,端到端训练
30+语言支持多语言混合识别,中英文无缝切换

八、定价与开放

开放平台阿里云百炼(Bailian)
调用方式API开放,按Token计费
企业接入支持通过阿里云FC函数计算一键部署
生态定位与通义千问大模型家族协同,可作为语音入口对接下游文本/Agent能力

九、落地场景矩阵

会议纪要长音频上下文+语音润色+结构化 → 出纪要无需人工整理
在线教育录播5分钟Flash+行业词(学术术语)→ 课程转写精准可用
实时直播字幕Streaming版本+低延迟 → 直播间实时上屏
智能客服行业词(金融/电商)+热词(产品名)→ 精准理解用户意图
医疗问诊记录医疗词召回95.36%+润色 → 病历转写可靠
播客/视频批量转写Filetrans离线版 → 长内容批量处理

十、市场反响

  1. 资本市场 ‌:阿里巴巴-W(09988.HK)股价在7月31日发布当日表现活跃
  2. 行业评价 ‌:1.7%错字率被视为ASR领域里程碑级指标,意味着机器转写质量首次逼近专业人工速记水平
  3. 开发者社区 ‌:阿里云百炼平台调用量预计将在短时间内显著增长

十一、已知限制(官方坦诚披露)

⚠️ ‌ 极端噪声极高背景噪声环境下识别率仍有下降空间
⚠️ ‌ 超长音频Flash版本单次上限5分钟,更长需Filetrans分片
⚠️ ‌ 超低频新词热词需显式传入,完全未见过的新造词仍需一次学习

十二、一句话总结

Qwen-Audio-3.0-ASR-Flash以"上下文记忆+行业词免教+热词百发百中+一步润色"四把利刃,将语音识别从"把字听对"推向"把话听懂、把文写好"——1.7%全球最低错字率不只是一个数字,它标志着ASR正式跨过行业落地的"最后一公里"。

信息综合自2026年7月31日阿里巴巴官方发布、阿里云百炼平台公告及Artificial Analysis评测数据。模型已在阿里云百炼平台开放API调用。

资料来源
  1. 阿里云
← 返回 [资讯]