数据时效:2026-08 8 月 20 日,一个没有名字的模型爬上 OpenRouter 榜首。免费,没有公司名,连参数规模都没标。中文开发者看它英文名 Ox 是牛,又赶上同名电影,随口喊它「牛来」。整整一周,没人知道它是谁做的。
这一周它没闲着。它终结了 DeepSeek 在 OpenCode 上连续 56 天的霸榜,连续六天调用量第一;在 OpenRouter 上,七天的调用量是第二名 DeepSeek-V4-Flash 的两倍多。按说该有人抢着认领了。可没人认。
独立研究员先动了。有人拿分词器去试,结果和 GLM 的版本逐字吻合;有人翻它返回的服务器堆栈,看到了智谱 Z.ai 的内部类路径;视频编码器的 token 消耗、emoji 风格、音频拒绝行为,都对得上。五重技术指纹,指向同一家公司。
8 月 26 日晚,北京的智谱终于承认,「牛来」是自家 GLM-5.3-Flash。320B 总参数、18B 激活,MIT 协议当天开源。同一晚,阿里通义千问也放开了 Qwen3.8-Flash-Next 的权重。两个中国大模型,撞在同一天夜里。
「开源第一」的位子,是先用真实流量占下来的。它们把 API 输入价压到了哪里。Qwen 每百万 token 收 1 元,GLM 收 0.8 元。同样叫轻量款,DeepSeek 的 V4-Flash 闲时输入 1.5 元,一进高峰涨到 3 元。而一周前的 8 月 17 日,DeepSeek 刚宣布涨价,头一次给 API 上了「峰谷定价」,高峰时段的价格是闲时的整整两倍。
一边涨价,一边降价,「比 DeepSeek 更便宜」就这么成了新赛道。我不想只把它读成一场价格战。如果只是补贴让利,谁都能喊低价,撑不过两轮。能压到这个价格,得看它靠什么。
Qwen3.8-Flash-Next 总参数约 176B,听起来是巨无霸,可每生成一个 token,只有约 6B 参数被认真算了一遍。剩下的大头里,有一张 51B 的查表。这张表约 3.2 亿行,存的是当前词和前面几个词组合起来的「含义」。每取一次结果,模型只在表里拉约 16 行。这张表不占 GPU 计算,常驻主机内存,等于用内存和硬盘当仓库,把算力省下来。
传统印象里,参数越多越贵,因为每个参数都得算一遍。现在「知识」被挪了个位置,从「必须算一遍」的激活路径,搬进「查一下就能取」的存储路径。聪明来自把东西放对地方。「规模=贵」这个等式,被这一下拆松了。
这也解释了为什么一台 24GB 显存的 4090、加 128GB 内存,就能把这样一个 176B 的模型跑起来,都不用量化。以前这是要一整个集群的事,现在一台家用机器就够。对单打独斗的人说,「拥有一台自己的模型」的下限被明显拉低了,数据可以留在自己手里,不必把每一百万 token 都交给某一家云端。
这些跑分全是厂商自己报的,没经过独立验证;Qwen 这个版本定位是 Qwen4 架构的预览,GLM 是刚转正。查表也有硬伤,它只记得最后两三个 token,长上下文改变不了它取回的内容;表做得越大,训练信号反而越弱。所以我不打算说它们已经超过谁。这份便宜能不能长期站住,取决于把成本压下来的是架构,还是补贴。
涨价方和降价方同一天出现,恰恰说明算力开始真实地进入定价。竞争标尺,正在从「谁的模型聪明」挪到「同样一块算力能交付多少」。

智谱说「牛来」上线后的全部流量,都由 10 万张国产芯片扛着,据说是华为、海光、摩尔线程这几家。国产算力头一回大规模直接服务全球真实负载。这个数字各家报道都标了「据称」。
我到现在没想透的是,这种「存储换计算」的便宜,能不能一路撑到更大的模型。查表的方向是对的,边界也清楚。一个模型想真正聪明,是不是永远逃不开要把东西算一遍,我拿不准。目前我愿意下注的是方向,不敢替这些模型背书的,是它们现在到底有多强。