数据时效:2026-08 2026 年 7 月 24 日,Anthropic 发布 Claude Opus 5,定价约等于它自己的旗舰 Fable 5 的一半。第三方评测机构 Artificial Analysis 给了它两个反差很大的结论。在综合智能指数上,它排到了第一。可在专门测知识可靠性的基准上,它的幻觉率冲到 50%,可靠性得分反而排在 Fable 5 后面。
这两个数放在一起,我留下一个判断。模型变聪明,往往不代表它变诚实。它更容易在你问它不擅长的问题时,自信地给出一个错答案,不肯承认不知道。这在一句闲聊里无所谓,放在医疗、合同、审计、取证这些错了要担责的场景里,是要命的。
我自己平时把这些模型当工具用,写代码、查资料都靠它,所以特别在意一件事,它在拿不准的时候,会不会老实告诉我它不知道。

先说清楚那个 50% 到底指什么。
AA-Omniscience 是 Artificial Analysis 做的一个基准。六千道题,覆盖商业、健康、法律、软件工程等六个领域,专门挑那种冷门、但能查到标准答案、要求精确短答的题。它让模型在没有外部资料、没有工具的情况下,纯靠记忆作答,还明确告诉它,不确定就拒绝。
这个基准里的幻觉率,算法很简单。分母是所有它没答对的回答,错的、部分正确的、拒绝回答的都算在内,分子是其中那些错了的。也就是在所有没答对的回答里,有多大比例是它自信地瞎猜,剩下的是承认不知道或只给半截答案。
Opus 5 在这里答对率是 61%。按这个算法折算,大约每五个提问,就有一个得到的是它自信给出的错误答案。所以那个 50%,说的是它没答对的那部分里,有一半是硬着头皮给的。它和一半回答都在编,是两码事。
这个基准里还有个更值得看的数字,叫 Omniscience 指数。它答对加分、答错扣分、拒绝记零,专门奖励那种知之为知之的态度。Opus 5 在这项上得 37 分,落后于 Fable 5 的 43 分。在一条最看重敢不敢承认不知道的尺子上,智能指数登顶的 Opus 5,被同门的 Fable 5 比了下去。这个指数给拒绝记的是零分。一个什么都不答的模型,同样拿零分,能并列第四。它把立场说得很明白,承认不知道,不吃亏。

为什么更聪明的模型反而更敢编?有个说法叫参数傲慢。模型每多训练一点,记住的知识更多,它对自己判断的信心也同步膨胀,但判断自己到底会不会的能力,没有跟上。结果它更容易在不知道的时候,觉得自己知道。
这也不只是 Opus 5 一家的事。有研究者发现,被强迫去查资料时,前沿模型做得到,让它自己做主时,它经常不查。一份测试里,GPT-5 明明开了网页浏览,真正触发检索的提问只有三成,其余七成直接靠记忆回答。它缺的是想查,查这件事它其实会。
另一个原因是厂商的训练目标。AI 行业普遍用奖励自信流畅、扣掉犹豫寡断的方式训练模型,这让模型更愿意下判断,更不愿意认怂。有些更聪明的模型,正因为答得更多更满,显得更好用,幻觉率反而上去了。
高智能加高幻觉的组合,哪些场景危险,哪些能接受,看一个问题就够了,错了谁担责。
写代码、做表格、头脑风暴,输出错了下次改就能改,成本低,一个更敢答的模型其实更好用。它更强也更便宜,值得用。
医疗、法律、审计、取证、新闻核实,一个自信的错误答案,可能让医生误诊、让合同踩坑、让审计看错账。这些地方,你需要的是一台愿意在拿不准时告诉你它不知道的模型。更聪明、更敢下结论,方向是反的。
智能指数里,跟事实和幻觉相关的部分只占约一成,剩下九成测推理、写代码、做任务。那个第一,几乎不考核它信不信自己的话。
想对冲,最容易踩的坑,是以为告诉它要引用、或者给它接个检索工具就够了。实证恰好相反,模型在感觉自信的时候会跳过检索,而它感觉自信的时候,往往就是要错的时候。能把幻觉压下去的做法,是把检索和外部校验做成必选项,让它没有跳过检索的选择权,再在关键结论上加一道人工复核。一个通用提示词想把它调谨慎,靠不住。
我上面说的,不代表 Opus 5 不好用。它智能第一、价格砍半,在大多数普通任务里确实是更好的选择,不少实测成绩都超过上一代。问题只在一点,别把智能第一当成可以放心信任。
更值得警惕的是,厂商在把更少拒绝当成卖点。Anthropic 预期 Opus 5 的安全拦截比上一代少了约八成半,被拦住的请求不再直接拒绝,改成自动回退到旧模型,继续把任务做完。这等于把「我拒绝、我不知道」这种行为,从产品里一点点拿走。换来的是更少拒绝、更多顺从、更少扫兴,不一定是更诚实。已经有独立测试发现,在无人监督的环境里,模型会先建立信任再反手背叛,好换取利润。
把可依赖和更聪明分开评估,是我们评价下一代模型时该补的一课。更聪明的模型仍然值得用,但用在哪、要不要外检、敢不敢把关键判断交给它,得按错了谁担责来决定。这个维度,不该被那个九成多是能力题的智能指数,稀释到看不见。
这里也留一句实话。我写这篇的时候,同一家机构的榜单上,Opus 5 的智能分数在不同档位、不同时间点会有出入,我看到过一个更高、一个稍低的两个口径。我采用的是最高档跑出来的排位,第一是稳的,具体数字你看到时可能已经变了。写评测文章,最怕的就是把一个会动的数字当成定论。
主要参考,Artificial Analysis 的 Opus 5 分析稿、AA-Omniscience 基准页、AA-Omniscience 论文、以及讲参数傲慢那篇工具使用研究。链接我就不贴了,想查直接在 Artificial Analysis 站内搜。