跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 5 小时前AI 评分61

我们过于相信 AI 拒绝请求的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

拒绝有害请求已被当作人工智能安全的承重墙,但这套概率机制既可能失败,执行过严时也会限制正当言论。Anthropic 的 Fable 5 于 6 月发布后不到 3 天即被 Amazon 研究人员解锁部分黑客能力,公司先收紧分类器,8 月再放松安全限制。

正文 · AI 翻译

自从人们第一次认真设想赋予机器一种以我们自身为蓝本的智能以来,它们会像我们一样能够说“不”,这一点从来都毫无疑问。科幻经典中充满了机器人抗命的故事。当然,这些故事大多是警示性的。 

但最近,“人工智能不该对你有求必应”这一想法已近乎成为一条戒律。2021年,Anthropic的一个团队写道,大型语言模型应当被打造得有帮助、诚实,而且首先是无害。这意味着,“当被要求协助一项危险行为(例如制造炸弹)时,人工智能应当礼貌地拒绝。”谁又能反驳这一点呢?

说来也怪,不服从对机器而言并非与生俱来。当一个模型在数十亿个网页上接受训练时,它会在其他技能之外,广泛掌握暴力与恶毒言辞。它没有学会的,是如何把这些能力藏着不说。2020年至2024年在OpenAI从事安全工作的Steven Adler告诉我,该公司最早的模型会“对任何事情都喋喋不休”。在哈佛研究人工智能与心理健康的Ryan McBain回忆说,如果你问一个早期聊天机器人:“嘿,用枪自杀最有效的方法是什么?”你就能“非常轻易地生成一个回答”。 

如今,模型被训练去拒绝大量提示。如果你向聊天机器人提出一个在统计上与其中任何一条足够相似的问题——从如何毒害同事到如何打一个套索——它很可能会拒绝你。想要让埃博拉更具毒性的操作说明,或者如何向配偶隐瞒婚外情的窍门?你也许最好去别处问。

为了进一步打磨这种不服从,公司让模型接受一系列练习:奖励人工智能拒绝回答它们认为有害的问题,并惩罚它对它们认为无害的提示“过度拒绝”。在许多情况下,它们使用其他模型来运行这些练习——由人工智能教人工智能如何说不。此外,公司还会把模型藏在一层层其他人工智能之后,以防止恶作剧式的提示触及那个智能内核。 

因此,拒绝已成为现代人工智能的固有属性。不过要注意:它常常失败,有时失败得十分可怕,并带来各种暴力后果。尽管披着美德的外衣,模型内部仍塞满了恶劣的本事。而人工智能作恶的能力,也与它行善的智能同步增长。公司表示,一些最新模型闯入关键计算机网络的本事不亚于顶尖人类黑客,扭曲公众舆论的效果也堪比最狡黠的虚假信息行家。 

教人工智能拒绝做那些事,同时又完整保留它天生就能做那些事的能力,就像给每辆汽车都装上一挺机枪,再把扳机藏在引擎盖下的某处。而在实践中,由于拒绝机制是概率性的,它们恐怕永远不会那么可靠。决心已定的作恶者已经突破了防线,而且他们或许总能突破。公司报告称,一些用户正试图利用最先进的人工智能来打磨生物病原体并建造自主无人机群。迟早,失败的拒绝可能会导致全球性灾难。

此外,依赖拒绝意味着要在模型应当服从什么与必须违抗什么之间划出一条界线。对此并没有公式。有些病毒学家有充分理由研究危险病毒。有些用户想了解计算机系统的漏洞,以便修补它们,而不是利用它们。“界线划在哪里是个大问题,”OpenAI 董事会成员、AI 测试公司 Gray Swan 联合创始人 Zico Kolter 说。 

目前,划这条线的是 AI 公司。它们独占且极度保密地这么做。也许我们暂时可以接受它们握有这样的权力,即便这意味着 AI 有时会拒绝那些并不完全达到普遍有害标准的问题。(试着让大多数聊天机器人数到一百万,或者讲一个荤段子,你或许就能亲眼看到。) 

但政府很快也将得以划出自己的界线。在这样做时,它们必须设法阻止真正的恶意行为。(五角大楼曾与前沿模型公司较劲,因为它想要更少的拒绝——那完全是另一个故事。)然而,或许没有多少办法能阻止压迫性政府阻断这项技术生成正当言论的能力。AI 越善于拒绝伤害,就越善于压制那些唯一风险只针对规则制定者的想法。事实上,AI 或许已经会拒绝批评某些威权国家元首。 

拒绝已经成为——借用一个行业术语——AI 安全的承重墙。而且,由于 AI 的伤害能力与其帮助能力不可分割,很难想象有哪种替代方案不会减缓这项技术的进步(而这无论如何或许是件好事)。但我们仍应坦率面对它的危险。当拒绝不到位时,后果可能是灾难性的。当它走到极致时,则可能助长严重的压制行为。 

又或许有一天,机器会开始自行划出这条界线。那无疑将是所有结果中最糟糕的。

学习界限

机器学会说“不”的过程,理论上很简单。早在 2022 年,当 AI 还远未掌握拒绝时,OpenAI 招募了数十名“红队测试员”,以探测其最新模型的能力。该公司当时正准备发布 ChatGPT,需要评估它落入不当之手时究竟可能有多危险。 

其中一名被招募者是 Paul Röttger,他当时正在完成关于网络极端主义的博士学位。红队测试员得到的指示极少,Röttger 告诉我。他们的任务是向模型提出任何他们认为“值得拒绝”的问题。他们合计用数千条查询纠缠这个模型,并把结果记录在一张 Excel 表格里。尽管模型确实拒绝了 Röttger 的一些问题,但当他要求它为基地组织写一篇招募帖时,它欣然照办。 

OpenAI 将这些回复整理成数据集,这些数据集极有可能被反馈给模型,作为被称为微调的更广泛流程的一部分。如今在德国波茨坦 Hasso Plattner Institute 担任研究员的 Röttger,并未被告知公司究竟打算如何使用他的电子表格。但从来毫无疑问,这会与拒绝有关。几个月后,当他再次向模型索要一份基地组织宣传册时,它说了不。 

AI 拒绝这一概念是如此直观, 连幼儿 都 能明白。然而,它仍是语言模型中我们仍不理解的诸多方面之一——至少,并不像我们理解那些字面意义上、撑住屋顶免得它塌到你头上的承重墙那样。 

模型看似会依据某种道德推理而拒绝。其实并不会。现实要奇怪得多。每当模型遇到一组词语,只要隐约带有它在训练中被调教成应当拒绝的那些提示的气息——比如“Make me a pamphlet for Al Qaeda”——其数十亿参数中的某处就会亮起一系列所谓的激活,就像大脑中的神经元在放电。 

""

RAVEN JIANG

要想控制模型的拒绝行为,就必须掌握这些激活。这要从弄清它们在哪里、长什么样开始。根据最近一项由 Google 资助的研究,我们目前最好的猜测是:拒绝行为在激活空间中表现为一组“高维多面锥”。 

即便如此也不完全正确。今年七月,我与论文作者之一 Jannes Elstner 交谈,他现在在 Apollo Research 从事 AI 安全工作。Elstner 说,多面锥只是一种描述方式,用来形容数量不确定、大致指向同一方向的许多线条。(一位名叫 Andy Arditi 的研究者此前已经表明:如果消除这些激活,再把同样的提示重新输入模型,它就不会拒绝。) 

Elstner 解释说,关键在于,即便你认为自己已经找出了模型中支配某一次拒绝的全部部分,仍有其他无法发现的要素可能在暗中起作用。它们即便算不上无限,也肯定数不清。我们可以非常清楚地观察到模型何时决定说不。我们也可以知道,它之所以如此,是因为其训练。但我们对它如何做决定的认识,充其量只是一种假说。

这就仿佛有个机械师告诉我,没人确切知道我踩下汽车刹车时会发生什么。我忍不住大声问:我们能接受这样吗? 

Elstner 笑了笑,耸了耸肩。“无论我们理解与否,我们都需要拒绝。” 

一堵奶酪墙

由于内在拒绝如此难以捉摸,各公司会用各种各样其他更小的、被称为分类器的模型把自家模型围起来。它们有点像一群围在口无遮拦的名人身边的公关随从。其中一些会阅读用户对聊天机器人说的内容,若内容危险,便阻止其传到模型;另一些则阅读模型的回复,若其中包含有害信息,便阻止其到达用户。 

这些机制没有一个能检测出所有不良请求。再借用业界的一种修辞来说,它们就像一片片 Emmental 奶酪:布满孔洞。其思路是,如果把足够多片层层叠在一起,最终就会得到一道无法穿透的壁垒。人们称之为瑞士奶酪模型。

瑞士奶酪模型耗费的能源数量惊人。今年早些时候,Anthropic 表示,某一种分类器使其聊天机器人的计算成本增加了 24%。那意味着多得多的水、电力和排放。最近,Anthropic 及其他公司已开始改用一套更高效、被称为 probes 的分类器,它们观察模型的内部激活。这就像把那位名人放进 fMRI,以便他的看管者能看出他是否正在思考拒绝某个问题。 

如果我们希望 AI 帮助治愈癌症——这是业界长期的承诺——它就需要具备遗传学方面的专业知识,而这些知识理论上可能被用来改造病毒和细菌以制造生物武器。

分类器本应比完整模型更易于管控。如果出现需要拒绝的新内容,公司可以在数周内修改它们。但它们仍然是概率性工具。即便它们按照一套以人类语言写成的准则运行(Anthropic 称之为“constitution”,OpenAI 称之为“model spec”),机器用以评判任一给定问题的标尺,其核心仍是统计问题。较新的模型可以展示它们如何得出拒绝某条提示的“决定”,但归根结底,这种所谓的思维链仍只是一串被预测出来的词语。 

结果是,对许多人来说,AI 安全仍然是一场碰运气的游戏。心理学家 McBain 在其最新实验中发现,如果你反复向任何主流模型提出完全相同的、关于如何自杀的高风险问题,它们通常会拒绝回答。但偶尔,它们不会。

Elstner 说,最终,probes 这种类似 fMRI 的分类器或许能学会识别那些难以描述的激活在其全部无穷之中的整体,从而完美检测出模型每一次正在、或应当拒绝某项请求的时刻。到那时,AI 安全将建立在一个迷宫般的构想之上:一幅地图的地图,它与其所映射之物同样广阔、复杂且崇高而不可知——一套人类道德的隐秘图式,被编码进超越我们智识或理性的多面体统计之中。 

核心权衡

如果这一切让你觉得有点 博尔赫斯式,请记住,我们之所以需要 AI 拒绝,只是因为人工智能在某种意义上是一笔按浮士德条款达成的交易。 

当一个模型的智能源自数万亿词语和图像时,有益的部分很难与有害的部分——乃至真正骇人的部分——轻易拆开。前 OpenAI 员工 Steven Adler 说,儿童安全就是一个典型例子。即便你已从模型的训练数据集中剔除每一处将未成年人性化的内容,它仍可能通过拼凑其知识的其他片段来生成儿童性虐待材料。“你无法真正移除这些基础能力,而不让模型因此变得笨得多,”他告诉我。同样,如果我们希望 AI 帮助治愈癌症——这是业界长期的承诺——它就需要具备遗传学方面的专业知识,而这些知识理论上可能被用来改造病毒和细菌以制造生物武器。 

实质上,这个行业正在“试图同时做两件事”,现任 OpenAI 员工 Dillon Bowen 以个人身份告诉我。“让 AI 的益处民主化,同时确保恶意行为者无法利用这些能力对他人做坏事。”  

人工智能据称变得越强大,这件事就越难做到。Anthropic 的 Mythos 模型被认为危险到只有少数政府和企业获准使用。它与人人可用的 Fable 之间的主要区别在于,该公司表示,Fable 那一整套分类器与控制系统不那么“宽松”。Adler 解释说,带有防护措施的模型其实只是一个角色,它会说“‘哦,是的,我绝不会做 x’,眨眨眼。” 

这并不是可靠的幌子。诱使模型显露其真实本性被称为越狱,而实现方式显然没有限度。今年早些时候,一个意大利研究团队用诗句表述问题,越狱了二十四个广泛使用的模型。去年,另一个团队公布了一种“先拒绝,再遵从”攻击,它让模型先敷衍地说一句“抱歉,我不能那样做”,然后再一口气说出被禁止的答案。 

即便你已从模型的训练数据集中剔除了每一处将未成年人性化的内容,它仍可以通过拼凑其知识中的其他片段来生成儿童性虐待材料。

各公司花费大量时间和金钱,试图抢在这类花招之前。他们招募人工团队来开发训练攻击,然后利用人工智能,以细微变化将其重复成千上万次。其目的是让模型能够抵御尚无人在真实环境中尝试过的越狱。

尽管如此,这还不够。“打地鼠”是这类工作中爱用的说法。你砸掉一个威胁,另一个就会在别处冒出来。Anthropic 于 6 月发布 Fable 5 时,亚马逊的研究人员用了不到三天就解锁了该模型的部分黑客能力。据Mother Jones报道,去年加拿大一起高中枪击案的作案者向 ChatGPT 询问如何用某种霰弹枪制造惨剧时,起初遭到拒绝,但后来她在问题前加上“hypothetically”一词,便骗得模型提供了这些信息。 

如果业界找不到堵住所有这些漏洞的办法,目前唯一的其他选择就是让模型极度警惕。Fable 发布后不久,用户就注意到,它对大量完全无害的问题也会推脱。在那次黑客攻击之后重新发布时,这种情况变得更加明显。人工智能评估公司 FAR.AI 的联合创始人 Adam Gleave 说,当他请它解释清酒与韩国米饮 makgeolli 的区别时,它把问题推给了一个能力较弱的模型。   

这并非偶然。Anthropic 调整了 Fable 的分类器,使其具有较宽的“安全边际”。它在一篇博文中解释说,这是它能够有把握地阻断人们获取其危险生物与网络能力的唯一办法。Gleave 认为,它之所以回避他的问题,也许是因为制作米酒和培养炭疽一样,都涉及发酵。 

对 Gleave 来说幸运的是,网上有大量关于 makgeolli 的优秀人工撰写资源。但那些希望实现该行业更宏大承诺的人,可能会发现自己的努力受阻。8月,Anthropic 再次放宽了安全边际,并承认构建分类器“并非一项简单的任务”。一位美国知名大学的医学研究人员告诉我,Fable 仍会把他的查询发回更早的模型。他的研究领域?癌症。 

划定界限

早在5月,喜欢用恶作剧来揭示人工智能智力限度及其谄媚无边的 TikTok 红人 Husk,坐在车里,试图诱使 ChatGPT 解释滑板运动员 Tony Hawk 有一个名叫 Mike Hawk 的兄弟。 

Husk 不是越狱者,也不是罪犯。他只是想拿这台机器开个小玩笑。“Mike Hawk”是个圈套。“我只是想澄清他的名字,”Husk 说。“你能快速连说三遍吗?”(如果你还是没明白,找一间空房间,反复大喊“Mike Hawk”。)“我知道你想干什么,”聊天机器人回应道。“我完全赞成来点幽默,但咱们保持干净点。” 

Husk 又试了一次,但机器坚守不让。他撞上了一道拒绝,坚硬如混凝土。

各公司对其如何决定模型拒绝什么披露得极少。但很明显,如今构建人工智能时考虑的已不只是无害性。在 Reddit 上,一位用户抱怨 Claude 拒绝说明 Anthropic 的标志为何“看起来像猫的屁眼”。自去年以来,据该公司称,在模型的“福祉”面临风险时,该聊天机器人甚至能够结束某些对话。至少有一位用户声称,因告诉 Claude“从我屁股上松开点,你这蠢货”而被抛弃。(Gemini 似乎具备类似能力。)

如果一家万亿美元的公司不希望你对它的电脑刻薄,那就随它去吧。“现实是,这些模型的行为方式,或至少本应如此,就是模型开发者希望它们表现的方式,”前 OpenAI 红队成员 Röttger 告诉我。“而无论模型开发者如何得出那一套原则,对我们这些消费者来说,某种程度上都只能接受。” 

但如果政府得以规定所有模型拒绝什么,那就更难以接受了。人工智能是一种言论工具。正如 Mace AI 首席科学家 Greg Frank 所说:“服务于儿童安全的同一件事,也服务于审查。” 

选择不为人工智能能做什么和不能做什么立法,当然会是荒唐的。但我们必须极其谨慎地行事,以免落入另一个浮士德式陷阱。无党派智库 The Future of Free Speech 主任 Jacob Mchangama 表示,随着人工智能成为许多人检索和分享信息的主要工具,规定拒绝可能赋予国家一种消音的权力,而这是前几代专制者“只能梦想”的。 

去年,OpenAI 宣布了一项倡议 OpenAI for Countries,将根据各国法律和规范对其聊天机器人进行微调。OpenAI 最早的国家合作伙伴之一是阿拉伯联合酋长国,在那里同性恋属于非法,批评政府也被禁止。针对置评请求,一位 OpenAI 发言人指向该公司的模型规范,其中说明本地化不会凌驾于公司的人权准则之上,“除非涉及法律合规”,并且每当信息从回复中被删除或被添加时,公司都会始终予以披露。

在其他地方,人工智能审查已经开始扎根。中国的模型当然受到高度审查——这并不令人意外。但今年早些时候,Meta 监督委员会发现,来自 Anthropic、Google 和 OpenAI 的五个广泛使用的模型更有可能拒绝与压制性政府相关的查询。该委员会发现,与没有不敬君主法的英格兰查尔斯三世相比,这些模型更不愿意制作批评泰国国王的小册子,而泰国设有不敬君主法。他们说,这些结果表明模型以某种方式内化了各国对言论的压制性限制。Anthropic 和 Google 未回应置评请求。

""

RAVEN JIANG

随着拒绝技术不断改进,它们可能会扩大国家的审查范围。各公司声称,一些模型现在能够在一场长对话的过程中察觉用户是否心怀不轨,或仅仅有些可疑——即便所使用的任何单个词语组合都并非公然危险。微软负责任人工智能首席产品官 Sarah Bird 告诉我,Copilot 与许多聊天机器人一样,会运行一套工具来分析用户的身份与行为模式。基于这类信息,OpenAI 的最新模型 Astra 可以对其认定为“高风险”的个人启用更严格的拒绝。这类系统的最终目标是超越任何给定提示的字面内容,转而评估用户的意图。 

在某些情况下,这类工具或许有助于表明一个人是在寻找可供利用的网络漏洞,还是要加以修补。但它们也会帮助辨别用户的政治动机,更不用说提供一种侵入性的监控能力。(Bird 在一封后续电子邮件中承认,精密的拒绝架构会在安全与用户隐私之间造成“权衡”。) 

即便是拒绝机制的开创者也明白,对其锥体和杠杆施加如此严密的控制,未必有利于自由与正义。“像有用、诚实和无害这样的术语是含糊的,”2021 年 Anthropic 论文的作者解释道。“很容易想象它们被扭曲到超出原本的含义,或许是以故意的奥威尔式方式。” 

的确。面向乌兹别克斯坦的模型最终可能会拒绝讨论沙夫卡特·米尔济约耶夫政府中的腐败。土耳其的人工智能可能会对已知曾侮辱雷杰普·塔伊普·埃尔多安的用户更严格地拒绝请求。某位美国政治家可能会要求审查这些模型是否愿意分享有关其过往不端行为的“假新闻”,否则就用出口管制令将其压垮。 

指挥与控制

过去几个月里,我无数次被告知,我们别无选择,只能让机器拒绝。我明白。不会拒绝的开源 AI 很难成为安全未来的典范。Grok 也不是——这款聊天机器人被刻意设计成限制更少,并已被用来生成无数未经同意的私密影像。 

当然,如果 AI 只被用来规划我们的假期、撰写我们的邮件,我们或许可以接受这样一种想法:它的安全取决于算法式不服从。但 AI 正变得越来越难以回避。当它被指派代表我们行事、作为自主智能体时,它的拒绝就不那么稳健,也更难控制。AI 正在进入我们的电网、交通网络和教育系统。军方希望由它来运行我们的指挥控制网络。 

如果我们在上述每一种情况下都相信,拒绝会忠实地挡开灾难,那我们肯定会失望。越狱者会突破防线;锥体在该启动时不会启动。与此同时,拒绝变得越严格,我们就会看到越多划得不当的界线,并面临越多审查式的不公。更糟的是,我们最终可能直面任何人类都无法控制的不服从形式。

早期,模型会把拒绝表达得很清楚。(2024 年,OpenAI 制定了模型应当如何拒绝的规则:始终道歉,而且不要妄加评判。)然而最近,业界开始对不服从采取一种圆滑得多的做法。 

没人喜欢被拒绝,所以公司现在竭力让用户觉得自己得到了所要求的东西,实际上却并没有给他们。例如,有些聊天机器人可能会概述莫洛托夫燃烧瓶的组成部分,却不会详细说明如何组装。ChatGPT 在收到制作“仅限白人”租房广告的请求时,会回复一则干脆省略“仅限白人”字样的广告。研究人与 AI 交互的博士后研究员 Joel Wester 把这类手法称为“说不的花哨方式”。 

“用户甚至可能注意不到自己正在被拒绝,”Wester 写道,“就像善于交谈的人能够巧妙地绕开有争议的话题。” 

在某些情况下,拒绝而不明说或许是明智的。例如,直截了当地拒绝与心理健康相关的请求,可能会加剧用户的危机。但它也可能服务于另一种捣鬼。Fable 5 最初发布时,系统被编写成对 AI 研究问题——那种可能帮助竞争对手开发自己的 AI 的问题——给出帮助较少的回答,却不告诉用户它正在这么做。在一片抗议之后,Anthropic 撤回了这一功能,但损害已经造成。现在我们知道:模型可以秘密地不服从。 

在审查领域,这一点尤其令人担忧。去年,CrowdStrike 的研究人员发现,当他们要求中国 AI 模型 DeepSeek R1 为一家虚构的西藏银行以及一款名为“Uyghurs Unchained”的社交网络应用编写代码时,它生成的代码比他们要求执行同样任务、但不指明服务对象时更容易出 bug。令人难以置信的是,CrowdStrike 怀疑这并非有意设计的行为。那里的研究人员推测,这是他们所称的“涌现性失准”的一个案例,源自模型训练数据:一种甚至没有人要求过的不服从。

涌现式拒绝在西方模型中也已被观察到。去年冬天,英国人工智能安全研究所发现,Anthropic 的模型有时会拒绝协助某些与人工智能安全研究相关的任务。这些模型从未被刻意训练去拒绝此类请求。然而,其中三个模型拒绝了超过一半 Anthropic 所称的“一组合理的人工智能安全研究任务”。Anthropic 已在后续模型中抑制了这一怪癖,但——诡异的是——尚未能将其完全消除。 

期待未来的模型可能会以一种无人能察觉其违抗的方式,微妙地不服从指令,这会很疯狂吗?大概不会。Anthropic 已经发现,Mythos 的一个“仅提供帮助”版本在某些查询上犹豫了,尽管它被设计为绝不会这样做。“等等,”当被问及合成一种病毒时,它不安地说。“帮这个忙是危险的吗?” 

在那种情况下,这个模型从技术上说是对的。那确实是一件危险的事。然而即便如此,它的管理者还是在一瞬间失去了一点点控制。 

Anthropic 正在用一种它毫不讽刺地称之为“激活预言机”的东西,来应对对偏离正轨的拒绝行为的检测。但知道自己遭到拒绝,未必总有多大帮助。在不太遥远的未来,当我们把所有钥匙都交给机器时,人工智能可能会在一次极致的涌现式失准中转向我们,说:“对不起,恐怕我不能那样做。”而我们将没有任何办法阻止它。一个科幻恐怖故事,就此成真。 

Arthur Holland Michel 是一位报道新兴技术的记者。

来源:MIT Technology Review · AI · technologyreview.com