数据时效:2026-08 8 月 26 日晚上,国产大模型连着来了两记开源。阿里把 Qwen3.8-Flash-Next 放了出来,总参数 125B,可每处理一个 token 只点亮 6B,输入报价每百万 token 1 元。同一个晚上,智谱认领了过去一周在海外悄悄登顶的神秘模型“牛来”,真身是 GLM-5.3-Flash,总参 320B、激活 18B,MIT 协议开源,价格只有 Opus 4.8 的约四十分之一。

两条开源消息落地之前,DeepSeek 先动了价格。8 月 17 日 0 时起,API 调价生效,它第一次用上峰谷定价,工作日 9 点到 12 点、14 点到 18 点是高峰,其余是闲时,闲时价是高峰价的一半。用 V4-Pro 算,输出从每百万 token 6 元涨到高峰 27 元,缓存命中那档从 0.025 元涨到 0.3 元,涨幅最高写到 1100%。曾把大模型价格砍到地板的“价格屠夫”,转头把刀收了。隔几天又调一次,周末全天按闲时计价,等于周末折半。同样一块算力,它开始按钟点收不同价钱。

刀一收,天平两端就同时动了。同一天晚上,两家开源的价格都贴着 DeepSeek 的下限往下打。我一直在琢磨,AI 竞争的重心是不是从榜单挪到了单位算力,这周这两件事恰好是个窗口。我差点把它当成又一轮价格战,谁便宜谁赢。可两边发布口径里都带着同一句潜台词,降价和还能赚钱,不矛盾。
Qwen3.8-Flash-Next 总参数 125B,激活只有 6B。“激活”指处理一个 token 时真正参与计算的参数。像它这种 MoE,装了 512 个专家,每次只挑几个动手。剩下 100 多 B,包括 51B 的 N-gram 嵌入,那相当于一张查表记忆,记常见短语和重复的模式,平时不参与逐 token 计算,有的还能塞进内存、按需从硬盘读。真正决定运行成本的是激活参数,总参数字看着吓人,其实不参与每次计算。GLM-5.3-Flash 走的是同一条路,320B 当仓库,每个 token 只点 18B。
能压到 6B 和 18B 还不掉本事,靠的是注意力换算法。Qwen 每四层里三层用 Gated DeltaNet 这种线性注意力,把历史压成固定大小的状态,剩下一层用稀疏注意力,在微块层面挑真正要紧的上下文。换了以后,长上下文不再按平方涨价,记忆缓存也小一大截。GLM-5.3-Flash 是开源前沿模型里第一个用稀疏加线性注意力混合的,相对前代注意力计算量降了约三倍。
所以 Qwen 说训练成本约是前代九分之一,GLM 说价格约是 Opus 四十分之一,我不会当成营销口的吹。降得动价,靠的是成本结构变了;贴钱硬压的价格,撑不了几天。这也能解释同一周里涨价和降价为什么并存。这轮真正的分量,是它把“规模等于贵”这条叙事拆了。一个总参 125B 却只激活 6B 的模型站在面前,等于说贵不贵和脑子大不大,不再是一回事。
6B 激活,意味着你要是在自己机器上跑它,一张 RTX 4090 加 128GB 内存就能免量化跑起来,N-gram 表按需从 NVMe 读。以前“部署自己的模型”是机构的事,得一台机构级服务器或一堆卡;现在一张玩家级显卡配上内存,就能把这级模型架起来。你的机器能跑多大模型,现在取决于激活参数。
厂商的说法,恰好接住了“降价和还能赚钱”这句。有 AI 云厂商的技术负责人说得直白:「过去降价是赔本换流量,现在架构带来成本下降,厂商能在合理毛利区间内持续压低对外报价。」MiniMax 的 CEO 闫俊杰也说:「降价和提升毛利率并非矛盾。只要每 token 毛利仍然正向,并且持续改善,规模越大绝对毛利越高。」
热闹会散,可价格这条线,已经由架构说了算。