Claude 知道自己正在被测试?Anthropic 从 J-space 里找到了因果证据
Anthropic 从 Claude 的 J-space 中读到“这是测试”的判断,并做了因果干预:压低这类信号后,模型在 180 次模拟中出现 13 次勒索尝试。实验不能证明 Claude 一直在“表演”,但说明模型是否认出测试,会直接影响安全评测结果。
Anthropic 从 Claude 的 J-space 中读到“这是测试”的判断,并做了因果干预:压低这类信号后,模型在 180 次模拟中出现 13 次勒索尝试。实验不能证明 Claude 一直在“表演”,但说明模型是否认出测试,会直接影响安全评测结果。