数据时效:2026-08

2026年7月31日,DeepSeek V4 Flash 正式版上线并开源。一周内登顶全球模型调用量榜首,从硅谷到北京,各家模型厂商紧急调整定价。V4 Flash 到底做了什么,把整个行业逼到了这一步?


一、只重做了后训练,发生了什么?

7月31日,DeepSeek 上线了 V4 Flash 正式版(代号 0731)。参数没变,架构没换,284B 总参、13B 激活,跟 4 月的预览版一模一样。变化全部来自后训练:RL、SFT、教师蒸馏,从头到尾重做了一遍。

效果怎么样:

基准测试V4 Flash 预览版V4 Flash 正式版V4 Pro 预览版Claude Opus 4.8
Terminal Bench 2.161.882.772.185.0
DeepSWE7.354.412.858.0
Cybergym38.776.752.783.1
Agent Last Exam15.825.216.525.7

DeepSWE 从 7.3 干到 54.4,Cybergym 从 38.7 翻到 76.7。一个预览阶段只有 V4 Pro 预览版一半水平的模型,后训练一轮之后在 Agent 能力上反超了 Pro 预览版,还在好几个基准上跟 Claude Opus 4.8 咬到了一起。Agent Last Exam 差 Opus 只有 0.5 分。

但让行业真正坐不住的,是定价。

输入 $0.14/百万 Token,输出 $0.28/百万 Token。Artificial Analysis 算过一笔账:跑一套完整基准测试,V4 Flash 平均每次任务花 3 美分。Claude Fable 5 花 $3.15。105 倍。有开发者实测,用 V4 Flash 跑了几个小时复杂任务,账单 0.31 美元。之前用 Kimi K3 做类似的事,35 美元。

海外媒体管这叫"第三次 DeepSeek 时刻"。V2 证明了开源能追闭源,V3/R1 证明了低成本能做顶尖模型。V4 Flash 的信息更直接:你性能比我强几个点,但价格是我的一百倍,开发者会怎么选?


二、硅谷的应激反应

V4 Flash 上线前一天,7 月 30 日,OpenAI 宣布 GPT-5.6 Luna 降价 80%。输入从 $1 砍到 $0.2,输出从 $6 砍到 $1.2。Terra 降了 20%。Sam Altman 的解释是"我们预期用量会很大,不需要极高毛利来覆盖训练成本"。

降完之后,Luna 输出价还是 V4 Flash 的 4.3 倍。再看能力:Artificial Analysis 智能指数,Luna 51 分,V4 Flash 50 分。差 1 分,贵 4 倍。对价格敏感的开发者来说,这个选择题根本不需要想。

Anthropic 走的是另一条路。7 月 24 日发 Claude Opus 5,定价砍到 Fable 5 的一半。策略是"同价更高配",靠性能溢价守住企业客户。但 Claude 主流版本的调用增速一直在掉。问题在于,Anthropic 的品牌溢价建立在"我最聪明"这个认知上。当市场上出现一个"足够聪明还便宜一百倍"的东西,这个溢价的底座就不那么稳了。

Google 推低价 Gemini Flash 系列,想用量换价。Gemini 3.6 Flash 跟 V4 Flash 一样 50 分,但每百万 Token 综合成本差了 19 倍:$1.16 对 $0.06。

三家处境不同,面对的是同一个事实:中端市场在消失。比 V4 Flash 强几个点、贵几十倍的模型,开发者正在批量放弃。OpenRouter 的数据很直白:V4 Flash 周调用量 7.22 万亿 Token,全球第一。前五名全是中国模型。中国大模型周调用 28.13 万亿 Token,美国 4.38 万亿,中国已经连续 14 周领先。


三、国内:鲇鱼不是鲨鱼

V4 Flash 对国内同行没有形成碾压。相反,它把整个中国模型军团的水位一起拉高了。

阿里 8 月 3 日上线 Qwen3.8-Max,2.4 万亿总参,Qwen 家族最强,权重下周开源。这个时间点,V4 Flash 上线刚三天。月之暗面 7 月 17 日发了 2.8 万亿参数的 Kimi K3,Frontend Code Arena 上赢了 Anthropic 的 Fable 5。MiniMax 8 月 3 日开源的视频模型 H3,摆明了要在多模态上走 DeepSeek 走过的路。小米的 MiMo-V2.5、腾讯的 Hy3、智谱的 GLM-5.2,全部进了 OpenRouter 调用量全球前五。

18 天内,国内几款重量级模型密集发布,多数已经或即将开源。有一个数字挺说明问题:大约 80% 的美国 AI 初创公司融资路演时用的是中国开源模型。

中国模型全球市场份额 6 月初超过美国,到 7 月 26 日大约占 63.5%。Hugging Face 统计中国开源模型下载量占全球 41%,首次反超美国。

跟硅谷不太一样的是,中国 AI 行业不是一家独大。DeepSeek 在 Agent 和性价比上开路,Kimi 在代码竞技场跟旗舰硬刚,Qwen 把开源生态铺满,MiniMax 在多模态找自己的位置。每家都在 DeepSeek 画的"斩杀线"上面找到了活法。


四、标尺变了

V4 Flash 真正改变的不是价格本身,是大家衡量模型值不值的标准。

以前比的是参数量、训练算力、Benchmark 跑分。现在比的是一块钱能换来多少有效输出。Agent 应用的爆发把这个转变放大了:Agent 任务消耗的 Token 量大概是普通代码问答的 1000 倍。单任务成本从美分级别被拉到美元级别。你在 Claude 上跑一次复杂 Agent 任务 3 美元,V4 Flash 上 3 美分。几个点的 benchmark 优势,在这个差距面前没有太大说服力。

V4 Flash 的缓存命中折扣给到 98%,行业一般 90%。OpenCode 实测缓存命中率 96%,平均每次会话 0.06 美元。这不是烧钱换市场。DeepSeek 把 V4 系列单 Token 推理浮点运算压到了前代的 27%,KV 缓存压到前代的 10%。API 业务的毛利率超过 50%。这是一场有真实工程降本支撑的降价,不是拿融资补贴定价。

还有一个更深的变化:接口已经标准化了。兼容 OpenAI 和 Anthropic 格式,切模型几乎没有摩擦成本。开发者不会忠于某个模型品牌,只会忠于当下性价比最好的那个。模型厂商进的不是一座可以筑墙的城,是一片每天都要重新抢的地。

华尔街对这件事的看法分两派。乐观的人说,价格打下来加速了 AI 落地,推理成本降到忽略不计的时候,会有更多开发者愿意试试,冒出今天想都想不到的用例。悲观的人看到的是一组数字:Amazon 2026 年资本开支约 2000 亿美元,Alphabet 1950 到 2050 亿,Meta 1300 到 1450 亿。这些投资的回报率,正在被不断拉低的 API 定价吃掉。


五、退潮的时候

很多人觉得当前这轮降价更像一次市场出清:用价格筛出真有降本能力的,淘汰靠融资撑场面的。

对开发者来说,选择多了,成本掉了,试错的门槛低到前所未有的程度。一个海外 AI 初创创始人在 X 上说,团队全线切到 DeepSeek 之后,月度推理成本降了 85%。对现金流紧张的小团队,这就是生和死的差别。

对模型厂商来说,信号很清楚:要么像 DeepSeek 那样在工程效率和定价上都做到极致,要么找到一个别人替代不了的价值。Anthropic 的安全叙事、OpenAI 的企业生态都算。中端市场那条"斩杀线"还在往上移,停在原地就会被甩出去。

V4 Flash 不是终点。DeepSeek 已经确认 V4 Pro 正式版在开发中。Flash 只靠重做后训练就把智能指数从 40 拉到 50,还反超了 Pro 预览版,那 Pro 正式版会到哪一步?硅谷每个模型团队应该都在想这个问题。


2026 年 8 月 6 日

参考来源:Artificial Analysis、OpenRouter、36氪、Pandaily、21世纪经济报道、新京报、DeepSeek API 官方文档