无尘阁日记

无尘阁日记

DeepSeek V4 Pro 到底强到什么程度?7月31日那次更新,把"参数神话"打穿了
2026-08-04

2026 过半了。DeepSeek V4 Pro 正式版还没影,但整个圈子已经坐不住了。

为什么?因为 7 月 31 日,DeepSeek 在 API 文档的更新日志里,低调地挂出了一个叫 V4-Flash-0731 的东西。没有发布会,没有热搜通稿。但它干了一件让所有人愣住的事——一个总参数只有 Pro 六分之一的小模型,在智能体和代码基准上,把自家的 1.6 万亿参数旗舰预览版,反超了。

我先说结论,省得你往下划:V4-Pro 现在就是开源模型的天花板,逼近闭源旗舰;但真正炸裂的,是这次 Flash 的后训练飞跃,它把”堆参数等于变强”这条行业铁律,踩了一脚刹车。

V4-Pro 本身,已经够吓人

4 月 24 日 Preview 出来时,规格就摆在那:1.6 万亿总参数,每次只激活 490 亿;统一一百万 token 上下文。关键不在大,在省。新架构(CSA+HCA 混合稀疏注意力,加上 mHC 超连接和 Muon 优化器)把一百万 token 下的单 token 算力,压到 V3.2 的三成到一成,KV Cache 降到原来的十分之一不到。以前跑不动的超长任务,现在能跑了。

能力上,SWE-bench Verified 拿到 80.6(V4-Pro-Max 版),跟 Claude Opus 4.6/4.7 一个身位;Apex Shortlist 90.2,这个分数已经压过顶级闭源;Terminal Bench 2.0 也干过了 GLM-5.1 Thinking 和 Kimi K2.6 Thinking。Artificial Analysis 给它的智能指数 52 分,比 V3.2 的 42 涨了 10 分,是仅次于 Kimi K2.6 的第二大开源推理模型。

这些数字什么意思?意思是你花闭源三十分之一的钱,能拿到接近顶级闭源的交付质量。

7 月 31 日那一下,才是重点

V4-Flash-0731,参数一点没加(还是 2840 亿总参、激活 130 亿),纯粹靠后训练重练了一遍。结果 Terminal Bench 2.1 从预览版的 61.8 直接拉到 82.7,反超了 V4-Pro 预览版的 72.1。九项智能体加代码基准,它全赢了自家的 Pro 预览版;DeepSWE 一项,分差 41.6 分;最离谱的是 ALE 基准,跟全球顶级的 Claude Opus 4.8 只差半分。

换句话说:一个小了六倍的模型,把大哥按在地上摩擦。

这事为什么重要?因为过去两年行业默认”大力出奇迹”——参数越大越聪明。阿里 Qwen 3.8-Max 堆到 2.4 万亿,Kimi K3 堆到 2.8 万亿。结果 DeepSeek 用一版纯后训练,告诉市场:推理时的后训练和工程打磨,可能比堆参数更值钱。这跟 2025 年春天那次”DeepSeek 时刻”是一个逻辑——又一次正面刚了规模法则。

成本那块更狠

V4-Flash 定价 0.14 美元/百万输入、0.28 美元/百万输出,缓存命中能到 0.0028 美元,比 Anthropic 便宜 99% 以上。一个顶级 coding 能力,价格只要人家的 0.6%。7 月 31 日这版还首次原生支持 Responses API、适配了 Codex,老的 deepseek-chat 和 deepseek-reasoner 接口要在 10 月 24 日之前迁走。

普通人能得到什么

三点。第一,顶级代码能力便宜到可以忽略成本,中小团队和个人开发者直接能用。第二,一百万 token 上下文,等于能把一整个中等代码库塞进一次对话。第三,华为昇腾、寒武纪 Day 0 适配,国产算力跑得起万亿模型,这件事本身比模型分数更有分量。

时间点记一下:V4-Pro 正式版(GA)据报 8 月 10 到 20 日来,卡在内部 Harness 编程工具的封闭测试;V4-Flash 的 MIT 开源权重也在往 HuggingFace 上放。

我说点真心话

我自己有点矛盾。一方面,开源模型逼近闭源,价格塌到这个程度,对用 AI 干活的人是天大的好事。另一方面,知识截止还停在 2025 年、暂时没有视觉能力——它强,但还不是全能。别被”强到什么程度”的标题带节奏,它强在工程和性价比,不是样样第一。

我的建议就一句:现在就去 API 里把 V4-Flash-0731 接上试试,别等 Pro 正式版。便宜、快、够用,这才是大多数人的真实需求。

我是江楠。这期就聊到这,下期我拿它真跑几个 Agent 任务给你看。