数据时效:2026-08 同一个复杂的综合任务,第三方评测机构 Artificial Analysis 算过一笔账。DeepSeek 的 V4-Flash 单次 0.03 美元,折人民币两毛出头。OpenAI 的 GPT-5.6 Sol 是 1.86 美元。Anthropic 的 Claude Fable 5 是 3.15 美元。最贵的一次,顶最便宜的一百倍。
这三个数字本身没什么争头。争的是它们怎么来的。它们不是哪家公司一次降价降出来的。折进一个真实团队的成本,这一百倍是最直观的冲击。一个跑复杂任务的组,把底座从 Claude 换成 DeepSeek,单位成本掉两个数量级,省下来的预算能多跑几百次同样的活。落到具体负责人头上,这足以改变他敢不敢把流程里塞满 AI 调用。这才是"围剿"两个字落在地上的样子。

从六月初到八月初,八周时间,中国有五家公司前后脚出了模型。智谱的 GLM-5.2,阿里的千问 3.8-Max,月之暗面的 Kimi K3,字节的 Seedance 2.5,还有站在这波降价最前头的 DeepSeek V4-Flash。一口气连出五个,这个节奏比任何一款模型都更说明问题。彭博在报道里转述了中国科技分析师 Poe Zhao 的判断,他说自 2025 年以来最重要的变化,是中国的进步不再像单一公司的突破。最初的 DeepSeek 时刻看起来是特例,但最近的产品表明,中国已经拥有了一套可复制的体系,能够生产接近全球前沿的模型。

这套可复制的体系,才是把价格打下来的东西。一次灵光造不出一连串模型。能批量产出又快又便宜的模型,靠的是一套把公开论文、一次只调动一小部分参数的混合专家架构、自家推理优化叠在一起的流程,一条流水线。Poe Zhao 还补了一句,这套体系最大的变化,是它终于能稳定地冒尖。
性能和迭代速度也被压缩得很紧。斯坦福 2026 年 AI 指数报告里,中美顶级模型的性能差距只有 2.7%,两家轮流坐榜首,迭代间隔压到六到九个月。这个数字的潜台词是,顶尖水平正在被拉平,剩下的竞争转到成本和规模上。彭博还转述了亚洲集团合伙人 George Chen 的判断,他说很多国家都在盯着这场中美竞争,眼下不想选边站,因为竞争才刚刚开始。
美国这边的科技公司,也已经悄悄换了底座。Coinbase、DoorDash、Airbnb 用中国模型承载生产负载或跑非关键任务,初创公司 Lindy 把推理迁到 DeepSeek 之后,成本降了约九成。
可这套体系对外挂的招牌是"开源"。这几家出的全是开放权重模型,权重能下载、能本地跑、能微调。于是"开源"和"低价"被捆在一起,成了最响亮的卖点。
但开放权重和开源,是两回事。
开源有标准。2024 年 10 月,Open Source Initiative 发布的 OSAID 1.0 划了三条,模型权重,训练和推理代码,还有足以让一个熟练的人复现出大致等价系统的训练数据信息。三条都占全了才算开源。按这条线去数,几乎没有哪家前沿模型够格。
缺的恰恰是难的那两样。权重是机器算出来的结果,谁都能拷下来。训练代码只开了个边角,DeepSeek 相对大方,其余各家更抠。训练数据几乎是零,没有一家把喂模型的语料、清洗方式和采样规则公开。
我下载过这些权重,也真拿它跑过东西。它确实能用,成本也真的低。可我知道我拿到的是成品,不是图纸。我能跑,但我没法审计。我不知道它靠什么练出来,不知道它在哪些数据上犯过什么样的错。当我打算把业务和数据主权押在一家标着"开源"的模型上时,我买到的这种自由,能让我把它跑起来,却不能让我把它看透。
“能跑"这份自由也是相对的。千问 3.8-Max 的开放权重是纯文本,带一套自定义许可,产品月活过一亿或月收入过两千万美元,就得在公开场合标出模型名。它的权重文件在 BF16 精度下约 4.9TB,压到 FP8 也有 2.4TB。能把它跑起来的不是一台工作站,是一排服务器,甚至一整个机架。开源权重免费,能把它跑起来的门槛,一点不免费。

这条缝决定了两件事。第一,做采购和合规的人,没法把开放权重当开源去走流程,你只能信它公布的字面,没法核实它没说出口的部分。第二,也是更关键的,顶级能力的天花板,卡在高质量真实反馈数据能不能持续喂回来那条线上,那正是开放权重模型没公开、也最难复制的一块。
低价是不是拿质量换的,这个问题绕不开。千问 3.8-Max 在一项叫 PaperBench 的 agent 评测里拿了 93 分,超过 GPT-5.6 Sol 和 Claude Fable 5。可换到最难的编程和最难的推理上,它就露了短,SWE-bench Pro 只有 67.7,Humanity’s Last Exam 只有 43.6。DeepSeek 的 V4-Flash 也被第三方点出比较高的幻觉率。所以这些低价模型不是全能的,它们在特定任务上确实打不过闭源旗舰。
反方的证据也站得住。一份八月中旬的分析指出,按真实任务算总成本的时候,Anthropic 的模型因为 token 效率更高、返工更少,在一些任务上反而比便宜的中国模型更低。Opus 5 用中等推理强度,能对上 Kimi K3 用最高强度时的单任务成本。这句话的意思是,便宜不等于整体划算,尤其在最吃精度的尖子上。
可这个论点只保住了很窄的一截。保住的是那些非得用顶级模型不可的任务,放弃的是量大面广的普通活。而恰恰是后者撑起了大多数调用。闭源巨头手里的能力上限,并不能替普通任务的价格买单。七月,OpenAI 把最便宜最快的 Luna 砍了八成,输入从一美元降到两毛,中端的 Terra 砍了两成。Anthropic 把 Opus 5 用一半的价格推上架,还取消了 Sonnet 5 原定的涨价。如果能力上限真的能让用户心甘情愿掏三美元,它们不需要砍价。
另一个动作,是把企业从包月往按量计费上推。包月是一口价封顶,按量是把账单打开,越用越贵。这一推,等于把定价的基础从"我卖能力"换成了"你按实际用量付钱”,承认了价格要跟真实使用挂钩。据说 OpenAI 还在考虑把消费级二十美元的档位往下调。包月制是闭源最稳的现金流,正在被这一推松动。
砍价的结果也反直觉。OpenAI 把 Luna 的实际价格砍掉约九成后,用量涨了约十四倍,估算收入反而涨了三成多。价格战打到后面,利润不一定先被绞杀,用量往往会先起来。
落到中腰部企业,开放权重最实在的用处是多了个出口。便宜的模型是真的在被用,有平台统计美国企业对中国模型的 token 用量,从 2025 上半年不到百分之五,涨到 2026 年二月以后的三成以上。私有化部署让数据不出自己的内网,敏感场景和合规压力大一点的公司有了选择。欧盟 AI 法案的高风险义务今年八月落地,最高能罚到全球营业额的百分之七,加上 GDPR 和金融口的 DORA,越来越多数据不得不留在本地的边界里。七月那回 Hugging Face 的安全事件也把话挑明了,做安全取证和恶意软件分析的人,没办法用封了查询的第三方护栏,只能拉一个自托管的开放权重模型进来干活。
成本也不是白省。自托管模型想比云端 API 便宜,得让 GPU 的持续利用率快到七到八成。多数团队跑在四成到六成半的利用率上,所以更常见的做法是普通流量走公有 API,敏感流量拉回本地,溢出的再弹出去。模型是免费的,可养一套能稳定在线的推理栈,要的还是工程师和时间。
往中间走,还有第三种选项。找一家托管平台,让对方用本地或区域内的基础设施帮你跑开放权重模型,数据落点、微调自由度、价格都拿到一部分,又不用自己养一套运维。代价是基础设施这一层重新依赖供应商,能不能带走,要看退出条款写得硬不硬。
决定下一轮价格的,不会是谁跑分最高。OpenAI、Anthropic 手里握着最大的真实反馈数据池,中国这几家握着最低的推理成本,两个优势现在分在两边。
这场围剿的边界,八月初的一条新闻也露了出来。DeepSeek 宣布因算力成本和需求暴涨,要大幅上调 API 价格。百分之一的低价,是一种优势,也是一种补贴。它能把硅谷的价格拖下来,同时也在吞自己的利润。围剿打到这一步,拼的是能不能又便宜又能把真实反馈数据喂回自己的模型。谁把这两样攒到一家手里,谁就拿到下一轮的定价权。