数据时效:2026-08 跑同一个复杂任务,DeepSeek 的 V4-Flash 收 0.03 美元,Anthropic 的 Claude Fable 5 收 3.15 美元,差一百多倍。彭博社今年 8 月 4 日把这个悬殊叫做死亡地带。它的意思是,如果你和它一样强,却卖得更贵,或者一样便宜,却更弱,那你还不如不做。这就是中国开源大模型今年夏天给全球市场标下的那条新价格线。

线上的货,是过去一个多月中国团队连续放出来的。7 月 16 日月之暗面发布 Kimi K3,2.8 万亿总参数,每次激活约 1040 亿,是当时全球最大的开源模型。7 月 31 日 DeepSeek 把 V4-Flash 正式版开源,总参只有 2840 亿、激活 13 亿,定价输入 0.14 美元、输出 0.28 美元每百万 token。8 月 3 日阿里通义千问推出 Qwen3.8-Max,2.4 万亿总参、激活 950 亿。8 月 26 日晚智谱再补一款 GLM-5.3-Flash,3200 亿总参、只激活 180 亿,放出来前它用牛来这个化名在一些平台上匿名跑了一阵,成了那几周调用量最大的模型。再往前一点,6 月智谱已经做过 GLM-5.2,字节同期放出一个视频模型 Seedance 2.5。

放到这一串发布里,最有分量的是它们的密度。一个月开出四款,各自独立,属于不同公司。科技分析师 Poe Zhao 点破了这层意思。他说中国已经有一套可复制的体系,能持续生产接近全球前沿的模型,中国进步的意义,不再建立在单一公司的突破上。单点突破,就此变成体系对抗。

顺着这个看,参数规模第一这个说法正在失灵。Kimi K3 的 2.8 万亿和 Qwen3.8-Max 的 2.4 万亿,差出一个不小的数字,可这两款模型的差距不在这里。要看的关键数字是激活参数,也就是处理一个 token 时实际被算到的那部分。这两款都只有大约 4% 的参数被用到,其余的是预备队,平时存在内存里。MoE 是混合专家的意思,把模型分成很多专家小组,每次只叫一组来干活,所以模型可以很大,活却不用全部干一遍。总参决定仓库有多大,激活参决定每次干活用多少力气。规模这个旧标尺,衡量不出谁更实用。

这也是它们和普通人手里电脑的关系。2.8 万亿的模型,就算按 4bit 量化,也就是用更省内存的方式存同一个数,把权重压到 1.4TB 上下,跑起来也要几十张高显存显卡。它只适合走 API,不适合搬回家。同一批里,阿里 8 月 14 日又开源了一个 Qwen3.8-27B,约 270 亿参数的稠密模型,不搞专家路由,4bit 后只有大约 17GB,一块 24GB 显存的家用卡就跑得动,联发科的天玑芯片当天适配。一个是把天花板往上抬,一个是把门槛往下压,两条线都在往前走。

这两条线被各自叫做大而稀疏和小而自足。大而稀疏决定最前沿卖什么价,小而自足决定普通人够不够得着,两件事出自同一套生产系统。谁代表下一代的落地方向,我的判断是两头都会落,一个落在行业的定价上,一个落在个体的选择上。

回到中心问题,Kimi K3 和 Qwen3.8-Max 走的是不是同一条技术路线。它们是同一大方向,两条岔路。都做了稀疏 MoE,都只激活约 4% 的参数,这是共同的选择。岔路在怎么把能力榨出来。Kimi K3 的力气花在架构上,自己捣鼓了一套叫 KDA 的混合线性注意力,让超长文本少花些力气也能看全,再用注意力残差把深层的信息补回来,代价是贵,输出每百万 token 15 美元。Qwen3.8-Max 走另一条,官方说架构跟前代一致,只是把后训练重做一遍就上来了。后训练是模型啃完海量文本之后的那一次打磨,用带标准答案的样本把它调得更听话,输出每百万 token 36 元人民币,便宜一截。一个赌技术尖,一个赌工程稳。

为什么中国模型能同时把能力和价格往下压。我看到三层原因,它们不互相排斥。第一层是架构,MoE 让模型很大和算得很快不再互斥,DeepSeek、智谱、月之暗面都在这上面做文章。第二层是后训练,Qwen3.8-Max 和 DeepSeek 都把力气花在这一层,V4-Flash 的 Agent 能力从预览版拿的 7.3 分涨到 54.4 分。第三层是工程与供应链,智谱的 GLM-5.3-Flash 由超过 10 万张国产芯片承载,端到端性能比初始基线提升三倍,DeepSeek 对付超长文本的办法,是把临时占用的内存砍掉九成。价格优势不是凭空降出来的,它靠这几样长期攒下来,又在同一个夏天一起兑现。

这套体系能转起来,还因为它旁边有一整圈会跟着动。一个开源模型放出来,社区立刻跟上。Qwen3.8-27B 开源三天,下载量破了 300 万次,社区给它压出五百多个量化版本,vLLM、SGLang、Ollama 这些部署框架当天就适配。模型好用,背后是一整条从训练到部署再到二次开发的链条,这条链每一环都跑得动。

这才有了彭博社画的那条线。被挤在中间的,是那批两头都够不着的模型厂商。他们没有最前沿的技术,也没有中国开源那种低价,既上不去也拼不动。

落到使用,这个变化很具体。以前你想用接近前沿的能力,得按稀缺定价付钱。现在稀缺松动了。DeepSeek 的 V4-Flash 在 OpenRouter 上一周带来 7.22 万亿 token 的调用量,排到全球第一。有报道说八成美国 AI 创业公司都在用中国的开源模型,阿里千问的累计下载量也超过了 Meta 的 Llama。对个人和小团队来说,结果是两样,要么花更少的钱拿到上一代的顶级能力,要么零成本在一台能塞进背包的机器上跑一个能写代码、会看图的模型。有开发者把 Qwen3.8-27B 叫做本地版 Opus 4.6。对在意隐私、或不想把数据传到云端的团队,这句称呼就是意义,接近前沿的能力被放到了自己机器上。

不过死亡地带这张图,来自彭博社用一个评测点画的框架,没有哪家权威机构盖章。最前端的活儿,中国模型还在追,Kimi K3 在 DeepSWE 上拿 67.5 分,低于 GPT-5.6 Sol 的 73.0 和 Claude Fable 5 的 70.0。Qwen3.8-Max 那串亮眼分数,不少是阿里自己报的,第三方还没独立验证。DeepSeek 的 V4-Flash 还有个短板,推理时语言被定成英文,系统提示词不能完全生效。斯坦福的 2026 人工智能指数把中美顶尖模型的性能差距算到大约 2.7%,缩得很小,可这个数字放在最高那几款之间,往往只是排名的先后。美国同行要在这张图里找生路,得同时接住两头,一边保住最前沿的能力,一边跟中国开源的便宜周旋定价,这两件事越到后来越难一起成立。价格和版本都变得快,智谱上线两周打半价,DeepSeek 分高峰低谷计价,阿里的权重说好下周开源,到现在还没兑现。这些短板和价格优势是同一件事的两面,不构成谁强谁弱的单边答案。

大模型竞争,更像两套生产系统在比速度,比的是能不能稳定、便宜、高频地把货出出来。这套系统厉害的地方不在每次必胜,而在它稳定。当每一两个月就有一款接近前沿、又便宜得多的模型被造出来,最前沿技术本身就会慢慢失去那种能标天价的稀缺。这才是死亡地带压掉的东西。我写这篇的时候是 2026 年 8 月,上面所有数字都按这个时点核对,到下个月它们很可能又变了。