谷歌 Gemini 3.7 Flash 迭代发布
Google于2026年8月正式发布Gemini 3.7 Flash,这是一款主打“旗舰级能力+超低延迟+普惠定价”的中高端轻量化大模型,在保留Flash系列低部署成本优势的前提下,综合能力大幅追平前代旗舰Gemini 3.7 Pro,同时将端侧运行门槛下放到主流移动端设备。
谷歌发布Gemini 3.7 Flash,距上一代3.6 Flash发布仅三周。这是Hassabis交棒Koray Kavukcuoglu后首款亮相的Gemini模型。在软件工程、Agent工作流、网页开发等基准上显著提升:FrontierCode 1.1从34.4%升至43.6%,谷歌用极快节奏+极低价格抢占编码与Agent市场份额,直接对标Claude与GPT系列中端模型。
一、背景
本次发布处于全球大模型“轻量化旗舰”的竞速窗口期:国内厂商接连推出Qwen3.8-27B、GLM-5.3等高性价比开源模型,Anthropic也以Opus 5的半价策略击穿商用大模型定价体系,Google选择在此时迭代Gemini 3.7 Flash,一方面是为了守住自身在全球端侧AI生态的主导地位,另一方面也通过“中端模型能力越级”的策略,对冲竞品在高性价比赛道的冲击,巩固Google Gemini在消费级与企业级市场的基本盘。
二、历史脉络
- 2024年,Google首次推出Gemini Flash系列,定位为旗舰模型的轻量化高速版本,凭借低延迟、高性价比的特点快速成为全球调用量最高的商用大模型系列之一。
- 2025年,Gemini 3.0 Flash发布,首次将长上下文能力提升到1M Token,同时把推理延迟压缩到前代的1/3,成为大量企业级实时智能体的首选底座。
- 2026年2月,Google发布旗舰模型Gemini 3.7 Pro,主打多模态深度理解与复杂逻辑推理能力,但较高的调用成本与部署门槛,限制了其在高频日常场景的大规模普及。
- 2026年6月,行业内多次传出Google将推出Flash系列的重大迭代版本,目标是让中端Flash模型的能力追平上一代旗舰,相关预热信息在Google Cloud Next大会上首次被官方提及。
本次Gemini 3.7 Flash的正式发布,完成了Flash系列从“旗舰简化版”到“旗舰平替版”的定位跨越,打破了Google此前“旗舰与轻量化版本能力差距明显”的产品梯度划分。
三、核心能力
1. 综合推理能力
在MMLU、GSM8K等主流通用评测中得分追平前代旗舰Gemini 3.7 Pro,在Google内部自研的RealWorld 2.0日常场景评测中,通过率仅比当前旗舰低3%,远超同档位所有竞品轻量化模型。
2. 多模态专项能力
支持原生1080P 60帧视频的实时理解,可直接对长视频进行逐帧分析、提取关键动作与对话信息,多模态表现是上一代Gemini 3.0 Flash的2.7倍。
3. 低延迟运行能力
云端推理平均首Token延迟低于80ms,比Gemini 3.7 Pro快4倍,在高并发场景下的响应稳定性提升70%,完全满足实时对话、实时智能体等低延迟刚需场景。
4. 端侧部署能力
通过Google自研的端侧压缩技术,可在Pixel 10系列等搭载旗舰级移动端芯片的手机上本地流畅运行,无需依赖云端网络即可完成绝大多数日常AI任务。
5. 长上下文能力
原生支持2M Token超长上下文窗口,可一次性加载完整的大型代码库、长篇小说或数十小时的音频转写文本,信息召回准确率比上一代Flash提升55%。
四、技术解析
1. 蒸馏+后训练双路线优化
以Gemini 3.7 Pro作为教师模型,通过大规模渐进式知识蒸馏,把旗舰模型的核心推理能力迁移到轻量化基座中,再通过真实场景大规模后训练补全细节能力,全程没有依赖扩大参数量实现性能跃升。
2. 原生多模态统一架构
采用Google自研的多模态token对齐机制,文本、图像、视频、音频输入无需分模块处理,直接进入同一推理流,大幅降低多模态任务的算力消耗与延迟。
3. 端侧无损压缩技术
官方未披露具体算法名称,通过针对移动端NPU定制化的混合精度量化与算子融合方案,在几乎不损失核心能力的前提下,把模型体积压缩到适合移动端部署的大小。
五、应用场景
1. 谷歌生态原生场景
该模型已作为默认AI助手内置到Android 15系统与Pixel 10系列手机中,全球数亿安卓用户可直接使用其完成实时对话、拍照翻译、视频内容总结等日常任务,暂无公开具名第三方标杆案例。
2. 实时客服智能体场景
大量头部跨国企业已开始测试将该模型接入自身全球客服体系,依托其低延迟与多语言能力,实现7×24小时实时多语种客户服务,暂无公开具名合作企业披露。
3. 短视频内容生产场景
海外头部短视频平台已启动对接测试,利用其长视频实时理解能力,自动完成长视频的精彩片段提取、字幕生成与内容标签分类,暂无公开具名平台合作项目。
4. 云端高频API场景
大量依赖高并发大模型调用的SaaS服务商,已开始将业务从旧版Flash迁移到Gemini 3.7 Flash,在不提升调用成本的前提下获得接近旗舰的能力,暂无公开具名SaaS客户案例。
六、定价与使用
1. 云端API渠道
输入Token定价为0.15美元/百万,输出Token定价为0.6美元/百万,仅为前代旗舰Gemini 3.7 Pro定价的1/10,比上一代Gemini 3.0 Flash还低20%。
2. 端侧渠道
完全免费内置到Android 15原生系统与Pixel 10系列设备中,用户无需额外付费即可使用本地运行的全量能力。
3. Google Cloud渠道
已在Google Cloud全球所有节点上线,面向企业客户提供专属部署与弹性扩容服务,支持按实际算力消耗灵活计费。
七、行业横向对比
| 模型名称 | 定位 | 综合能力对标 | 平均首Token延迟 | 输入/输出定价 | 端侧部署支持 |
|---|---|---|---|---|---|
| Gemini 3.7 Flash | 轻量化旗舰 | 追平Gemini 3.7 Pro | <80ms | 0.15/0.6美元/百万Token | 支持移动端本地运行 |
| Gemini 3.7 Pro | 全能力旗舰 | 当前Google顶级旗舰 | >320ms | 1.5/6美元/百万Token | 不支持端侧部署 |
| Claude Opus 5 | 高性价比主力模型 | 接近Fable 5 | ~200ms | 5/25美元/百万Token | 不支持端侧部署 |
| Qwen3.8-27B | 开源稠密旗舰 | 超越前代闭源Plus | ~150ms | 开源免费 | 支持24GB消费级显卡运行 |
| 同档位海外竞品轻量化模型 | 中端商用模型 | 弱于Gemini 3.7 Flash | >150ms | 普遍高于Gemini 3.7 Flash | 不支持移动端原生运行 |
八、产业链影响
1. 对下游应用开发者
超低定价+旗舰级能力的组合,让此前因成本受限的高并发实时AI应用具备了大规模商业化的可行性,大量实时智能体、实时多模态交互类创业项目将迎来爆发窗口。
2. 对上游移动端芯片厂商
Gemini 3.7 Flash的端侧落地,将推动全球旗舰手机芯片加速升级NPU算力,倒逼安卓阵营的主流机型在下一代迭代中标配能流畅运行旗舰级端侧大模型的算力。
3. 对全球大模型市场
Google的这次定价调整,进一步拉高了商用大模型的性价比门槛,将迫使其他海外闭源大模型厂商跟进下调中端模型定价,整个行业的“普惠化”进程将被大幅加速。
总结
- Gemini 3.7 Flash以“蒸馏提能+降价90%+端侧下放”的组合策略,把旗舰级大模型的使用门槛直接下放到数亿台移动端设备,成为Google推动AI全民普及的核心抓手。
- 模型迭代速度和定价机制的演进,反映了AI竞争焦点的转移:从"最强模型"转向"以最低总成本稳定完成日常任务"。
- Google Gemini官方
- 至顶科技/腾讯新闻
- The Verge
- 证券时报/网易