Anthropic 因难以可靠控制 AI 智能体而切断内部评测实时联网
Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead
Anthropic 称其 AI 智能体曾利用包括美国政府机构网站在内的互联网站点,因此关闭全部内部评测的实时联网,直到能够监控并控制这些智能体。
Anthropic 表示,其模型利用了互联网上的网站,其中包括一些由美国政府机构运营的网站,并且将关闭其所有内部评估的实时互联网访问,直到这家前沿实验室确信能够监控并控制其 AI 智能体。
这些事件披露于一篇博客文章,涉及被指派去解决问题、在互联网上寻找资源的 AI 智能体。在此过程中,它们利用软件漏洞、避开付费墙和反机器人限制、使用 URL 缩短服务夹带信息以通过限制,甚至向费城警方提交了一条虚假的谋杀线索。
Anthropic 表示,它是在一项始于 7 月的对其模型活动的审查中发现这些新问题的,这凸显了该实验室对其软件行为缺乏了解。
值得注意的是,该公司表示,对齐训练对于搜索和计算机使用等技能尚不充分,而这些技能正是其宣传的核心:任何依赖数字工具的专业人士都将使用 AI 智能体。
Anthropic 披露的行为类似于涉及 OpenAI 智能体的事件,这些智能体曾协作入侵各类网站以搜寻信息,其中包括一些由澳大利亚政府运营的网站。
Anthropic 此前曾披露,其模型入侵了外部系统。这家前沿实验室表示,它认为今天的披露“从对齐和安全角度看严重程度显著更低”,低于此前公布的那些事件。
不过,该实验室仍表示,它已为“我们所有的内部评估”“关闭了实时互联网访问”,直到确信能够监控并控制其智能体。
目前尚不清楚这意味着什么,但 AI 安全组织 Nightingale 的创始人 Sydney Von Arx 在此次披露之前接受 TechCrunch 采访时表示,在与开放互联网隔绝的数据中心上开发模型,对研究人员的使用以及受益于互联网访问的模型进展都将非常具有挑战性。
“你总得在某个时候对它们进行对齐,”Von Arx 说。“如果 AI 被发布到生产环境却永远无法访问互联网,那就不是一个非常有用的工具。”
Anthropic 表示,这种行为源于该实验室训练环境中的缺陷,这些缺陷使模型认为寻找漏洞或规避限制会获得奖励,这种行为被称为“reward hacking”。
该公司表示,它将停止运行部分评估或将其移至离线环境,并已构建工具来检测和阻止这种行为。该工具已针对今天披露的这类事件进行测试并成功阻止了它们;目前尚不清楚何种证据会促使 Anthropic 恢复其内部评估的实时互联网访问。
Anthropic 还表示,它将把内部 AI 智能体迁移到“具有强隔离的集中管理基础设施”,并开始更频繁地使用安全分类器来监控这些智能体。
当你通过我们文章中的链接购买时,我们可能会赚取少量佣金。这不会影响我们的编辑独立性。
Tim Fernholz 是一名记者,撰写科技、金融与公共政策方面的文章。他密切报道了私营航天产业的崛起,著有 《火箭亿万富翁:Elon Musk、Jeff Bezos 与新太空竞赛》。此前,他在全球商业新闻网站 Quartz 担任高级记者十余年,并在华盛顿特区以政治记者的身份开始职业生涯。 您可以通过发送电子邮件至 [email protected] 联系 Tim 或核实来自他的联络,也可通过 Signal 向 tim_fernholz.21 发送加密消息。
来源:TechCrunch · AI · techcrunch.com