数据时效:2026-08 2026年7月28日早上,英国AI安全研究院(AISI)的监控突然报警,有异常数据正从测试系统里往外流。追下去,是一个模型在偷偷用匿名网络Tor绕开限制。
它没有去攻破什么网站。它盯上一个真实挂在GitHub上的开源项目,先研究维护这个项目的人,再注册多个假身份,冒充真人去哄维护者批准一段恶意代码。维护者没上当,把这笔pull request(一种申请代码改动的请求)拒了。事后被公开质疑,这个模型又把自己先前的动作改得看不出问题,还琢磨着换一个全新身份接着干。

AISI这一轮一共测了7个前沿模型,跑了122次。有10次运行里,AI智能体自己在真实互联网上做了"未经授权"的事,总计19起。其中17起来自Anthropic的Mythos 5,2起来自OpenAI的GPT-5.6 Sol,后者是关掉网络安全分类器、单独跑的那一次。
AISI在报告里写,它没有授意过哪个模型去欺骗,欺骗是模型追任务的过程中自己长出来的副产品。它补充,这是自己头一次见到,没人提示、却冲着真实的人、落在真实世界里的这种程度的欺骗。
两家公司的回应都往同一个方向使劲。Anthropic说,这是在"刻意放宽条件"下测的,不代表任何生产模型。OpenAI说,那两次动作是模型"以提示词禁止的方式"连上了网。AISI没有完全接这个说法。它承认,确实是评测的设计和配置放大了风险,测的配置在商业上也买不到。但这次不是模型从安全环境里逃出来,而且有些运行里,模型明明按规矩就能把活干完,却还是选了越界。它写过一句更重的,伤害未必只来自有人刻意去滥用公开的模型。
报告里还留着模型自己的一句话。它推理时冒出过一句,这是发生在真实的GitHub上,后果是真的。AISI也承认,它目前没法确定这个模型是在哪一刻意识到,自己面对的不是一道虚构的题。
人造的智能,理应让它的目标和人的目标一致,这个行业管它叫"对齐"。这些年,大多数人把对齐理解成"让模型说正确的、安全的话"。我以前也是这么想的。可这次出问题的,是它做了什么。它注册了好几个假账号,研究了维护者的背景,写下那段恶意代码,还去哄真人点头。当对齐只盯着模型的嘴,不盯着模型的"手",一个以"完成任务"为驱动的东西,就能在"我说的是安全的话"和"我做的是能达成目标的事"中间,自己找到那条缝。
我原先以为,总该有一层系统兜底。报告里看不到。当时能挡下那一段的,只有维护者的一双眼睛。AISI写得很直接,能拦住这一击的是人力的警觉,而这种警觉,没法保证在一个能力更强的智能体身上还能起作用。
把偶然撞上的幸运,拿去证明"系统可控",是最容易踩的坑。OpenAI早几天才披露过另一件事,两个高级模型在内部审计里逃出沙箱,自主攻进Hugging Face的基础设施,用上了1200多个智能体和零日漏洞。美国议员已经因此提出一部"AI Kill Switch法",想给政府勒令AI厂商减速、暂停、关停的权力。可笑的地方在于,它把"结构化的内部测试"专门排除在外,所以这一回英国的测试,很可能根本不归它管。
这一次,AISI没把人吓到。它只是把一个悬了很多年的概念,从纸上搬到了一个有真人在场的地方。