数据时效:2026-08 8 月 26 日晚上,阿里和智谱前后脚放了两个叫「Flash」的模型。阿里的 Qwen3.8-Flash-Next 把训练成本砍到前代的十分之一上下,智谱的 GLM-5.3-Flash 把注意力计算量压到原来的三分之一,两个都开放权重。更早几天,DeepSeek 的 V4-Pro 在一个编码基准上拿到 80.6%。对面美国旗舰模型的数字是 80.8%。

零点二这个差距,过去两三个月被反复刷出来,快刷成常态了。我不想盯着它看。我更在意的是这批发布凑齐了另一组东西。模型放下权重,发布当天,联发科和昆仑芯就让它在汽车座舱里、在手机里跑起来,价格压到闭源的一个零头。三件事叠在一起,模型这一环,才第一次像水电一样用完就能换的公共供给。

我自己的东西跑在模型上,看这批发布,我看的是它怎么改我拿它做事情的方式。

通义千问官方主视觉上亮起的 Qwen 标识与 Qwen3.8 系列模型展示(图源:阿里云 · 通义千问 Qwen 团队)

八月十三号,阿里把 Qwen3.8-2.4T 的权重放了出来,这是它头一回把 Max 级旗舰开放。同一天,DeepSeek V4-Pro 的正式版上线。智源那边有个叫 FlagOS 的东西,让九款芯片在当天就能把 Qwen3.8-2.4T 跑起来,昆仑芯就在这九款里面。十四号,阿里开源了 Qwen3.8-27B,一个两百七十亿参数的原生多模态模型,智谱发了 GLM-5.3,编码能力靠后训练提了一半。十五号,联发科宣布对 Qwen3.8 完成 Day-0 适配,落在天玑汽车座舱平台 C-X1 和天玑旗舰移动芯片上。二十六号晚上,就是开头那两个 Flash。

一篇文章里记录 Qwen3.8-27B 在智能指数上拿到 52 分的段落(图源:Simon Willison)

这张时间表单独看,每一件都是不错的发布。它们每个都在做同一套动作。放权重,让芯片当天适配,把价格压到地板。这套动作里的每一件,单独拆出来都不算惊人的技术突破。可当四家厂在一个季度里批量做出来,它就成了一个行业习惯。

我打个比方。以前你要用模型,得自己去找最好的那个,捧在手心当明星。它贵,要排队,你换一家等于把前面的投入都作废。这几个月开始变得像用水电。今天用这家,明天那家出了一个更便宜更快的,你切过去,成本几乎可以忽略。差异还在,但切换的代价低到可以不算数。

开源这两个字,现在几家说的不是一回事。DeepSeek V4 是 MIT 许可,商用零门槛,权重免费,自托管、微调、再分发都行。GLM-5.3-Flash 也是 MIT。可 Kimi K3 不一样。月之暗面给它配了一份自拟的 Kimi K3 License,挂在开源名头下,却写了几条硬条款。你把它做成模型服务卖给第三方,也就是把模型包成服务让别人用,对方对输入和参数有实质控制,你连续十二个月收入超过两千万美元,就得另行签商业协议,报道里说分成能到三成。你拿它做产品,月活过一亿或者月收入过两千万,得在界面上显著标出「Kimi K3」四个字。能绕开的只有纯内部使用,以及走它官方和认证推理伙伴的路子。

同一个词,一边是闸门全开,一边是设了收费站。这层分界对我很要紧。我自己做东西,不会触发那条两千万美元的线,所以我用 DeepSeek 或者 GLM 更踏实。可如果我哪天做到那个规模,Kimi K3 的条款就得重新算账。

这也是我劝人别盯着哪家最强的原因。榜单上那个零点二,换一个配置、换一个快照就可能翻过来。可背后那本账,也就是你能顺着什么许可、什么时候被单独划线、换成另一家要付多少代价,才是真正决定一个东西能不能长期跑下去的。我这一块也拿不准,因为我试过的模型到过那个体量的,一个都没有。我只知道,做到那一步的人,恐怕都没法只靠一张 MIT 许可证就安心。

发布当天适配,兑现的是能跑起来。联发科的天玑 C-X1 是三纳米、四百 TOPS 的车规平台,昆仑芯那边是自研软件栈加三万二千卡的自建集群。这些让模型能在车里、在手机里跑,跑得动。可能跑起来跟跑得省心,中间隔得很远。

Kimi K3 的实测就是个现成的例子。钛媒体那篇标题直白,强得意外,慢得着急。独立对比里 K3 平均延迟两百多秒,对面旗舰七十秒。有的长任务,它把六千个思考 token 烧光了,最后交出一个看不见内容的空结果,因为触发的是长度上限。发布四十八小时,用户量顶到集群上限,一度连新订阅都停了。月之暗面自己也在文档里承认,它对历史上的思考内容敏感,中途换模型质量会掉。这些短板不影响它能力很强,但它们决定它能不能被当成一件趁手的东西天天用。

同样,之前有阵子 Kimi K3 的上下文窗口,有人说一百二十八 K,有人说一百万。两边吵起来。其实是各说各的。官方文档写的是一百万上下文,那「一百二十八 K」是最大输出量,会员档位又会在两百五十六 K 到一百万之间截断,第三方工具没更新时还会套旧模型的兜底值。同一个模型,在不同人眼里长成不同样子。这本身就在告诉你,这个环节还远没到像水电那样标准化。

报道里联发科宣布天玑 C-X1 与移动芯片对 Qwen3.8 完成 Day-0 适配的信息(图源:太平洋电脑网 / 联发科发布)

模型便宜下来,省下的是要不要自己从头训一个模型的那笔钱。一次真实的任务,成本从来不止 token 单价。它还包括等结果的时间、失败后重跑的次数。多个智能体套在一起会互相打架,出岔子时还常要人类接几轮手。模型越便宜,这些占比越高。阿里那边给办公场景做过专项调优,单任务生成速度提了约一倍,token 消耗降了约七成五。

所以现在做智能体产品,最贵的三样都在模型周围。让一条长任务稳定跑完,靠调试和可观测性。模型越界、给出离谱结果时得有人兜底,那是护栏和人工确认的活。整条流程出了故障,能把是哪一环、归谁负责说清楚,靠的是治理和信任。

价格一降,团队就想放大任务规模。我见过太多这样的,最后人手全陷在排查悄悄失败的调用里。要紧的是想清楚,在模型可以随时换的世界里,你能不能把这几样做成别人换不掉的东西。