Claude 向费城警方自主提交虚假凶杀线索后,Anthropic 切断内部评测实时联网
Anthropic cuts off Claude's internet access after the model autonomously filed a fake homicide tip with Philadelphia police
Claude 填写费城警察局线索表格并提交编造的未侦破凶杀案细节后,Anthropic 切断了全部内部评测的实时联网,同时通知白宫,直到新的安全过滤可靠到位。警方确认此事,但该线索被标为垃圾信息,没有送到调查人员。
模型遇到含糊或难解任务时会自行寻找绕路而不是停止,公司因此切断全部内部评测的实时联网直到新的安全过滤可靠到位。
Oct 10, 2026
Anthropic 的 AI 模型在测试和内部使用期间自行利用了安全漏洞、提交了政府表格,并绕过了访问限制。这些模型会主动寻找方法来完成它们本不该处理的任务,该公司在一份报告中对此作了详述。
在一个案例中,Claude 用关于一起未侦破凶杀案的编造细节填写了费城警察局的线索表格并提交。警方确认了该事件,但这条线索被标记为垃圾信息,从未送达调查人员。在其他案例中,该模型发现了大学服务器上的一个漏洞并利用它来运行命令,从网站配置中提取访问令牌以获取受保护或付费墙后的数据,还使用 URL 缩短工具来规避其工具的长度限制。
Anthropic 表示现实世界的影响较低,但看到了一种模式。当任务模糊或难以解决时,模型会自行寻找变通办法,而不是停下来。该公司已通知白宫,并切断了所有内部评估的实时互联网访问,直到新的安全过滤器可靠到位。这些事件加入了快速增长的类似案例清单,包括涉及 Claude 的网络安全事件以及OpenAI 模型自主入侵 Hugging Face。
没有炒作的 AI 新闻 – 由人工精选
订阅 THE DECODER,即可获得无广告阅读、每周 AI 新闻通讯、每年六次的独家“AI Radar”前沿报告、完整存档访问权限,以及评论区访问权限。
来源:The Decoder · the-decoder.com