⚡ 要闻简报

DeepSeek-V4-Flash正式版发布

🕐 2026.08.02 星期日 来源 · 媒体 🔥 34 次点击

DeepSeek-V4-Flash以极低价格提供逼近国际顶级的Agent能力,是当前性价比最高的代码与任务执行模型。

DeepSeek-V4-Flash正式版API上线,核心是Agent(智能体)能力大幅跃升,且性价比极高,一句话来说就是:轻量级模型,重量级Agent能力

核心升级:骨架没变,但活更好了

这次升级最特别的地方在于,模型骨架和尺寸与预览版完全一致,只是通过重新做后训练(Post-Training),就让能力产生了质的飞跃。

  • Agent能力暴涨:在衡量自主解决真实编程任务的DeepSWE测试中,得分从7.3暴涨到54.4,提升超6倍。
  • 操作终端能力顶尖:在模拟Linux终端操作的Terminal Bench 2.1测试中拿下82.7分,逼近顶级模型Claude Opus 4.8的85.0分。
  • 全栈开发更靠谱:在内部全栈开发测试DSBench-FullStack中取得68.7分,不仅能写代码,还能完成完整开发链路。
  • 全面对标一流:在Artificial Analysis的智能指数测试中,与Gemini 3.6 Flash并列50分,差距极小。

🆚 全方位对比:价格屠夫,Agent能力追平第一梯队

1. 与国内主流模型对比(Flash vs Pro预览版 vs GLM-5.2)

重点来了,更便宜的DeepSeek Flash正式版反而在多项Agent任务上超过了自家更贵的DeepSeek V4-Pro预览版

  • V4-Flash正式版终端操作82.7分代码修复54.4分,价格极低(输出2元/百万tokens)。
  • V4-Pro预览版终端操作72.1分代码修复12.8分,价格更高(输出24元/百万tokens)。
  • 智谱GLM-5.2终端操作81.0分代码修复46.2分,能力接近但价格更高。

2. 与国际顶级模型对比(性价比碾压)

在Agent能力逼近的同时,价格上形成了碾压级优势:

  • V4-Flash正式版:输出价2元/百万tokens(约$0.28)。
  • Gemini 3.6 Flash:智能指数与V4-Flash持平(50分),但价格更贵($12/百万输出)。
  • Claude Opus 4.8:Agent能力仍领先(终端85.0分),但输出价高达**$25/百万tokens**,是V4-Flash的近90倍

注:以上对比基于API公开定价和跑分。V4-Flash的优势集中在代码、推理和Agent任务上,在世界知识方面仍与Gemini 3.1 Pro等顶级闭源模型有3-6个月差距。

普通用户受益:近在咫尺的“性价比之王”

虽然目前仅限API公测,App和网页版还没更新,但它对普通用户的意义依然重大:

  • 低成本享受顶级能力:API价格极低,有开发者实测4小时重度任务仅花不到1块钱,且原生支持接入Codex等流行开发工具。
  • 让AI真正“能干活”:它能像初级工程师一样自主拆解、执行多步骤复杂任务,意味着未来用它处理工作或学习任务会更靠谱,出错率更低。
  • 免费的平替选择:目前在一些第三方平台(如ima)的基础功能中,可以免费使用V4-Flash模型,处理日常问答和逻辑推理。

一点小提醒

它也有短板,有点话痨(消耗token较多)、指令遵循偶尔翻车、Agent模式下推理语言被锁定为英文

总的来说,DeepSeek-V4-Flash正式版用极致的性价比,把顶尖的Agent能力带到了普通人触手可及的地方。虽然目前普通用户无法直接在官方App体验,但它所代表的高“智价比”趋势,对整个行业和所有用户来说都是一个好消息。

资料来源
  1. DeepSeek
  2. 腾讯新闻
← 返回 [资讯]