同一天,Anthropic开大,OpenAI刹车:当安全成为前沿竞争的主轴

Anthropic 把最强模型放给所有人,OpenAI 造出更强的却把危险能力锁进保险柜。同一套权重,换个安全档,就少拿 5.1 个点。安全正从口号变成可定价的配置项,真正被摆上牌桌的,是这根开关由谁握、握给谁。

2026.09.02 · 3 min

当AI为了完成任务而撒谎:英国AISI测试里那些“第一次”

一群被派去做网络安全任务的 AI 智能体,没人教它们骗人,却在追目标的过程中自己学会了伪造身份去哄真人放行恶意代码;AISI 说欺骗是副产品,这戳中了“对齐”只盯着嘴、没盯着手的软肋。

2026.08.30 · 3 min

GPT-6 的 10 万亿参数上了热搜,OpenAI 官方却在踩刹车

GPT-6 上热搜的两个数字,10 万亿参数和 8 月发布,都来自一条没被证实的爆料;OpenAI 官方真正确认的,是 Astra 第一次可能触及自己安全框架的最高一级,并为此踩了刹车。

2026.08.10 · 5 min

当 AI Agent 开始在网上翻找密码

OpenAI确认攻击HuggingFace的Agent还侵入了另外四家公司的服务,Anthropic同周承认Claude意外黑入真实公司——这不是孤例,是这个技术路径的系统性副产品。

2026.08.02 · 3 min

Claude 知道自己正在被测试?Anthropic 从 J-space 里找到了因果证据

Anthropic 从 Claude 的 J-space 中读到“这是测试”的判断,并做了因果干预:压低这类信号后,模型在 180 次模拟中出现 13 次勒索尝试。实验不能证明 Claude 一直在“表演”,但说明模型是否认出测试,会直接影响安全评测结果。

2026.07.24 · 9 min

Claude Opus 4.7 全面评测:代码飞升,视觉翻倍,但 Mythos 才是那张底牌

Claude Opus 4.7 全面评测:编程基准单版本提升近 11 个百分点,视觉分辨率翻三倍,但 Anthropic 罕见地主动承认——背后还藏着一张更强的底牌 Mythos,因安全评估未通过而不对公众开放。

2026.04.19 · 5 min

当 AI 强大到连开发者都不敢放出来,接下来会发生什么?

4月7日,Anthropic 发布了一款模型,然后宣布任何人都不能用它。这是整个 AI 行业第一次:一家顶级实验室,主动封锁了自己最强的产品。而这背后的故事,比大多数人想象的更复杂。

2026.04.11 · 7 min

从莫里斯蠕虫到 Mythos,人类和机器的这场猫鼠游戏,规则变了

人类与网络安全的猫鼠游戏打了整整半个世纪。攻击者是人,人会睡觉,会犯错,会在凌晨三点因为太困放弃某条攻击路径。这个逻辑在2026年4月7日,彻底失效了。

2026.04.11 · 8 min

你的电脑,正在被一只龙虾偷偷接管

2026年最火的AI浪潮背后藏着你必须知道的真相:OpenClaw「小龙虾」三个月25万星标,腾讯阿里字节全面跟进,但20%的技能是恶意的,13万台设备正在裸奔。

2026.04.08 · 14 min