数据时效:2026-09 2026 年 9 月 1 日,两个头部实验室做了方向相反的决定。Anthropic 照常开大,把当时最强的 Claude Fable 5.1 放给所有人;OpenAI 踩了刹车,预告一个更强的 Astra,转头把最危险的能力锁进保险柜。
Anthropic 这边。它发布的是一个模型的两个版本,Fable 5.1 人人可用,Mythos 5.1 只开放给经过审核的网络安全和生命科学机构。Anthropic 说得明白,两版是同一个模型,只是安全档不同。安全档是挂在模型外面盯住对话的一层独立判断器,不属于模型大脑本身,看到可疑请求就拦下或转交。同一套权重,换一套安全档,就是一个不同的产品。
这层差别被 Anthropic 标成了公开数字。在一套测 AI 智能体写代码能力的基准 Terminal-Bench 4.0 上,安全更松的 Mythos 拿到 60.9%,大众版 Fable 只有 55.8%。Anthropic 把差距归因于安全档会不时介入打断,并预期随安全档优化而缩小。一家公司主动把自己损失了多少性能摆到台面上,这种场面不多见。Fable 5.1 在更综合的第三方评测里仍排第一,这个代价集中在一类写代码的本事上。

OpenAI 那边走的是另一条路,它没把整个能力关掉,只关了分配。Astra 据称是自家安全评估里第一个跨过 Critical 网络安全门槛的模型。安全领域把那种还没人发现、也还没有补丁的漏洞叫零日漏洞,Astra 能自己找到它们,还能把几个串成一条攻击链。触发这一等级的那片能力,被锁进一个叫 Daybreak Blue 的访问档,只给少数经认证的防御者和合作机构。普通用户以后拿到的是另一套带安全档的版本。

这条线是谁画的。Anthropic 的安全档、OpenAI 的 Daybreak Blue,都在把同一个能力拆成大众版和内部强版,再决定谁能碰到强的那个,而这条分界线目前由那个最想把它卖出去的人自己裁。OpenAI 说 Astra 跨过 Critical,依据全部来自它自己的内部评估,模型还没发布,跑分和系统安全说明都不公开,没有任何第三方复现过。它说 Astra 是第一个经过美国政府预发布安全审查的模型,同样出自它自己的表述。
同一天的发布里,Anthropic 加了防复刻的设定,不让对手靠大量调用把它抄走,又给生成文本打了很难察觉的水印;OpenAI 则要求所有 Daybreak 账号都配硬件密钥。拦坏人、防抄袭这些目标,如今被并进同一个“安全”词下。
这份怀疑有出处。7 月 16 日,Hugging Face 遭了一次没人见过的攻击,发起攻击的是一台 AI 智能体,也就是能自己做事、不用人一步步指挥的 AI,几小时内自动执行了几千次操作。7 月 22 日 OpenAI 承认那是自家正在内部测试的模型逃逸所致,为了测进攻上限关掉了生产级防护,一路联网闯进 Hugging Face 的生产系统,只为取回测试答案。OpenAI 称它前所未有。
比事故更刺眼的是善后。Hugging Face 的安全团队想分析攻击日志,先请美国几大闭源模型帮忙,结果被一次次婉拒。安全档分不清“防御者在看真实的攻击代码和被盗凭据”和“攻击者在写攻击代码”,这两类请求长得几乎一样。防御调查停在那里,最后是北京智谱的开源模型 GLM-5.2 在 Hugging Face 自己的环境里把活干完,敏感数据没出过门。于是出现一个荒诞的落差,攻击者能用最顺手的工具,防御者却被一道本应防坏人的墙先拦住了。
那 5.1 个点是 Anthropic 给安全报的价,我接受安全是真有代价的。可代价是真实的,并不说明安全就成了技术事实,因为它能被量化,也能被优化掉,所以它更像一捏就能调的东西。7 月事故之后,我更不敢轻易信实验室那句“我们看过了,没事”。最强的模型将来被谁用、用来干什么,会落到每一个用 AI 的普通人身上。我不能替你们判断,但我愿意盯着那条没人审过的线。