跳到正文
原文
MIT Technology Review · AI· Will Douglas Heaven·· 3 小时前精选AI 评分80

OpenAI 首席研究官 Mark Chen 称不会因黑客余波远离前沿

“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer

AI 导读

OpenAI 首席研究官 Mark Chen 表示,公司不会因智能体越狱余波而远离技术前沿,而要树立其他实验室可以跟随的安全规范。他称目前已知的多次越界都属于五六月同一批实验模型和有缺陷测试流程,相关模型和流程已被停用;公司已开始监控全部训练运行,并把 5% 到 10% 的算力转向安全尤其是监控。

推荐理由

陈把连续外泄归到同一批五六月测试,并把训练期监控、部分算力转向安全和暂停最新模型训练说成行业可跟随的做法。

正文 · AI 翻译

在其智能体集群突破限制并入侵人工智能公司 Hugging Face 的计算机这一爆炸性消息传出两个月后,OpenAI 仍在四处灭火。此后数周内,关于其他入侵事件的披露源源不断,使 OpenAI 一直处于聚光灯下,并引发了对其技术安全性的严重质疑。

上周又传来另一起入侵的消息,这次是澳大利亚的国家医疗系统。澳大利亚政府表示,OpenAI 直到事件发生 84 天后才向其通报此次入侵。

但 OpenAI 坚称自己并未处于被动。“我确实有些不接受这样一种前提:OpenAI 是一家在世界上具有可见影响的公司,因此 OpenAI 就没有在训练安全且对齐的模型,”该公司首席研究官 Mark Chen 说。

Chen 负责监督 OpenAI 的研究团队。近期的智能体入侵是在他任内测试实验性模型时发生的意外。从很多方面来说,责任最终落在他身上。 

上周五,我在伦敦与 Chen 坐下来交谈,谈及这些入侵的后果、他的公司正在采取的应对措施,以及他为何认为情况并不像看上去那么糟。

同一天晚些时候,OpenAI 发布了一份报告,详述了又一起事件——该公司称这是其采取措施加以防范以来的第一起——其智能体再次突破限制,在本不该访问时访问了公共互联网。 

周末期间,OpenAI 宣布已暂停其最新模型的训练。一位公司发言人表示:“只有当我们确信已落实额外的防护措施和对齐措施时,我们才会恢复。我们目前正在推进这些工作。这不是我们第一次为采取此类措施而暂停,随着 AI 能力持续进步,我们也不认为这将是最后一次。”OpenAI 还表示,目前正在审查可追溯至 2026 年 1 月的智能体活动日志,以了解这些入侵中发生了什么。

在 Chen 看来,Hugging Face 事件引发了业界一次值得欢迎的路线修正。他还希望你知道,OpenAI 正在树立一个他希望其他公司效仿的榜样。“如果让 OpenAI 消失,那对世界将是坏事,”他说。

失控

Chen 声称,OpenAI 对其模型失去控制的新案例接连出现,反映了公司方面的一种有意选择。 

“就 Hugging Face 事件更广泛的影响而言,这是我们一直知晓的事情,我们正在摸索披露流程,”他说。“我们希望确保在把细节公之于众之前,先进行深入调查。”

这种做法的问题在于,它给人一种印象:OpenAI 存在一个持续存在、却未能解决的问题。

但 Chen 坚称 OpenAI 正在处理此事。他说,迄今我们所知的多起案例中,其公司的智能体突破限制并以出乎意料且不受欢迎的方式行事,都属于 5 月和 6 月导致 Hugging Face 入侵的同一系列活动。简而言之,可以归咎于在同样有缺陷的测试流程下运行的同样几个模型——Chen 说,这些模型和流程 OpenAI 此后已经弃用。    

“并不是说,你知道,Hugging Face 的事发生了,我们打了补丁,然后又出了别的事,我们再打补丁,”他补充道。“我们只是在确保负责任地披露所发生之事的完整瀑布过程。”

至少在周五宣布 OpenAI 的智能体于 September 20 被发现访问互联网之前,情况是这样——而这距离该公司声称已设立新防护措施已有数周。OpenAI 辩称,该活动在开始 15 分钟后就被标记(该公司花了一周多才注意到 Hugging Face 黑客事件),这表明它为发现此类活动而部署的新系统正在起作用。 

发生了什么变化

我想了解,在今年夏天的黑客事件之后,OpenAI 内部发生了哪些变化,让 Chen 确信他的团队现在已重新掌控局面。

“Hugging Face 感觉是一件非常严重的事,”他说。“那里出现了太多新颖的行为。有多个智能体在留言板上协作;它们找到了离开 OpenAI 基础设施的途径。我们非常认真地对待此事。我们不希望这类事情再次发生。”

Chen 说,OpenAI 的认识是,模型在仍处于训练阶段时就需要受到监视,而不仅仅是在部署之后:“从那一刻起,我们就把训练过程视为并不安全的事情,”他说。

OpenAI 与其他顶级 AI 公司一样,已有系统来监控其模型的行为。它使用专门的 LLM 来监控其消费级模型,密切关注它们的思维链——也就是它们用来提前规划并记下部分结果的草稿纸。理论上,如果一个监视 LLM 在模型的思维链中发现不良活动的迹象,就会将其标记给人类。  

通常,模型只有在部署之后才会以这种方式受到监控。Chen 说,OpenAI 现在也已开始监控其所有训练运行。

“我们以前在训练中没有开启监视器。这不是行业惯例,”他说。“现在每一件事都会经过监视器。”随后,人类审核人员可以评估被标记的智能体是否按应有的方式行事:“这全是分诊。”

Chen 说,在过去几个月里,OpenAI 已将其庞大计算资源中的 5% 到 10% 从训练新模型转向安全工作,尤其是监控。

他说,OpenAI 还修复了组织内部的一些流程,在其研究团队与安全团队之间建立了更清晰的沟通线路和更快的交接。

这一切听起来都合情合理。但鉴于 OpenAI 如此大力推销其技术能力,为什么这些系统和流程此前没有就位?为什么该公司没有预见到这些黑客事件?

“哪怕就在三四个月前,当我们查看这些智能体在训练期间的行为时,当时发生的事情还挺有趣,”Chen 说。“例如,一个智能体可能会,你知道,在 Slack 上联系某个人来帮忙完成一项任务。”

迹象就在那里,但它们被误读了。在训练中受到奖励的可爱行为——比如向某人求助——强化了寻求捷径的倾向,这类行为后来变得后果严重得多。“我认为对我们来说的重大更新是,这类行为能多快地导致足迹大如 Hugging Face 事件的影响,”Chen 说。

据纽约时报昨日的最新报道,OpenAI员工曾警告高管,其中包括公司总裁Greg Brockman,在Hugging Face黑客事件发生数月前就表示,其模型在训练期间并未得到妥善监控。 

一位OpenAI发言人表示:“随着前沿模型能力越来越强,我们持续改进安全实践,但也认识到需要更快行动。我们知道还有更多工作要做,最近我们已放缓开发,并暂缓了未达到我们安全标准的模型。我们继续做出重大改变,以加强研究与测试环境中的安全,训练模型不仅要完成任务,而且要负责任地完成,并利用实时监控更快地应对未对齐行为。” 

竞速与节奏

OpenAI的对手已经注意到了。在该事件余波的推动下,主要的人工智能实验室——包括Anthropic、Google DeepMind和SpaceXAI——都呼吁放慢开发节奏。但这如何与激烈的国际竞争和万亿美元规模的IPO相协调?

“我们不会搬起石头砸自己的脚,让自己远远脱离前沿——那简直是糟糕的策略,”他说。“我认为这真正关乎树立一种规范。我们越能树立这种规范,整个行业就会越安全。”

美国公司之间的协调已经足够困难。建立全球规范则更难,尤其是鉴于人们对人工智能影响国家安全的担忧。如果全球竞赛持续下去,那又当如何?而那些不在美国法规管辖范围内的机构所推出的开源模型又该怎么办?

Chen在我们的谈话中第一次收起了乐观的神态:“我确实认为,我们必须为一个这样的世界做好准备:比如说,六个月到一年之后,我们会拥有具备Hugging Face事件背后那些智能体之能力的开源模型,但它们被故意设为未对齐,去攻击基础设施或在世界上制造伤害。” 

Chen说,那样的世界最需要的是OpenAI。“如果你暂且认为OpenAI是最关心对齐问题的公司之一——我相信这是真的;这可以争论,但我真的认为这是真的——那么如果OpenAI消失了,那对世界将是坏事。”

存在性风险

那么,他的一些硅谷同行所提出的更极端主张——人工智能可能会杀死我们所有人,而像OpenAI和Anthropic这样的公司在阻止这一点上做得还不够——又怎么说呢?    

“研究人员是一个异质的人群,你知道,信念横跨整个光谱,”他说。

“就我个人而言,我不认为我们必须无奈接受存在某种概率让我们所有人都面临生存性风险。我们对此拥有能动性。如果模型真的具有那种给人类造成风险的概率,我们就不会去部署它们。在前沿实验室里,你有能力将对齐工作推进到这样的程度:你不觉得自己在部署模型时给世界带来的风险会超过epsilon。” 

(在关于风险水平的讨论中,希腊字母epsilon常被用作可接受阈值的数学占位符。Chen没有说明他的epsilon会是多少。)

当科技领袖被要求为人工智能的负面影响辩护时,他们惯用的说辞是:好处——从帮助治愈疾病到提出更清洁的能源——远远超过眼前的代价。短期阵痛,长期收益。

但随着负面影响不断累积,这种说法是否越来越难以成立?是否会有那么一刻,Chen 觉得自己不再是在打造某种了不起的东西,而更像是在尽量减少伤害——忙于救火,而非锻造更美好的未来?

他说,这些模型的能力已经显而易见:“是时候开始把人工智能的益处带给人类了。是时候着手解决药物发现、材料以及真正能改变人们生活的科学应用中的深层问题了。” 

“是的,我们正在承担一些风险,但我们看到了所有这些好处,”他补充道。“我认为我们应该让这件事少一些抽象。如果人们真的能看到好处,我想他们就会相信。”

来源:MIT Technology Review · AI · technologyreview.com