Jennifer Neville 谈 AI 会错在哪里以及失败能教会我们什么
What AI gets wrong and what failure teaches us
在 Microsoft Research 播客中,Jennifer Neville 指出,单轮基准上表现很高的大语言模型,在指令被拆成多轮逐步澄清后性能会显著下降。她建议一旦模型在多轮里陷入混乱,就停止并清空对话,再一次性给出完整指令。她还说,长程工作流里若错误未被及时发现就会累积,并让模型在后续交互中更加混乱。
Jennifer Neville 是微软的一位合伙人研究经理,她的职业生涯围绕理解并推进人工智能的现实应用而展开;正如她一直在研究的人与人工智能交互一样,她的早期职业道路也是多轮的:先是数学,然后是物理;接着是认知科学,然后是工作;最后才是计算机科学——尽管她曾竭尽全力想避开这个领域。
在与首席应用科学家 Chad Atalla 的这次对话中,她探讨了评估在推动当今人工智能系统的性能边界以满足用户需求方面所起的作用,以及当模型在传统基准之外接受测试时出现的“令人惊讶的失败”。Neville 还分享了使用当前人工智能系统的实用指导,并讨论了当结果有悖预期时为何仔细审视数据很重要,以及数十年的人工智能进展让她对预测接下来会发生什么有了哪些认识。
从一段出乎意料的职业轨迹,到人工智能交互与学习的前沿,本期节目提出了一个更大的问题:当路径——无论是人类的还是人工的——并未按我们预期的方式展开时,我们能从中学到什么?
订阅 Microsoft Research Podcast:
文字稿
[音乐]
JENNIFER NEVILLE: 有些时候,我觉得自己在原地打转。事情并不顺利。我会有点灰心。然后我们会到达一个我们确实学到了一些东西的节点,而那种、那种情绪上的激动,才真正把我吸引住了。能够有点理解一些别人都还尚未理解的东西……
CHAD ATALLA: 当然……
NEVILLE: ……因为它恰恰处于我们对事物所知的前沿。
标准介绍: 这里是 Microsoft Research Podcast。在这里,微软研究人员——通过基础科学与技术研究推动进步——探索计算与人工智能中的人物、方法以及下一步。
[音乐结束]
CHAD ATALLA: 大家好,欢迎收听。我是 Chad Atalla,微软研究院的一名应用科学家。
今天,与我一同参与的是 Jennifer Neville,她是微软研究院的合伙人研究经理,也是普渡大学计算机科学与统计学 Samuel D. Conte 讲席教授。
她的研究关注面向交互领域和结构化数据的机器学习与人工智能,探讨人工智能系统训练所用的数据点如何影响其行为,以及这与用户真正想要的如何契合。
在这些研究中,她已发表 130 多篇论文,引用超过 10,000 次,并获得了诸如美国国家科学基金会 CAREER 奖、入选 IEEE 人工智能“10 to Watch”名单 (在新标签页中打开),以及来自 国际数据挖掘会议 (在新标签页中打开) 和 国际学习表征会议 的最佳论文奖。
Jen的工作最让我惊叹的是她的远见,以及她能够在人工智能领域不断发展的过程中保持一条始终一致的主线,我也很期待更多地了解她是如何走到今天这一步的。
Jen,感谢你来和我对话。
JENNIFER NEVILLE:感谢邀请我。
ATALLA:太棒了。嗯,我很想了解你是如何走到今天的。让我们把时间大大倒回去。我小时候想成为天体物理学家,但当然,现在的我是计算机科学背景。那你是什么时候知道自己想进入计算机科学的?
NEVILLE:这是个好问题。我……在我成长的过程中,我什么都想做,唯独不想做计算机科学,因为那是我爸爸所在的领域,而我不想做我爸爸做的事。所以我上大学时,先主修了数学,然后是物理,但我真的没法跟这些专业合拍。
于是我从大学辍学了一段时间,再次回到大学时,我改为主修认知科学,但那对我来说也太“软”了。里面的数学不够。那时,如果有人告诉我,“人工智能才是你该做的事,因为它把认知科学与数学和计算思维结合在一起,”我想我会为自己省下很多时间,[笑声] 但那并没有发生。
于是我工作了一段时间。后来当我重回学校时,我决定主修计算机科学,因为我想做的是思考如何运用数据、如何处理数据。就在那时我发现了人工智能。纯属偶然。我甚至都没有真正意识到它是计算机科学的一部分。
ATALLA:太棒了。嗯,进入计算机科学并想从事数据或人工智能工作是一回事,而想在这方面参与研究则是另一回事。那么,是什么样的问题或宏大构想激发了你的研究动力?
NEVILLE:是的,这其实也是个有趣的故事。我之所以进入研究,只是因为我参加了计算机科学学位中的荣誉项目,而作为荣誉项目的一部分,你必须做一个研究项目 [笑声]。
ATALLA:这是强制性的,对。
NEVILLE: 这是强制性的。所以当我和教授们谈研究项目应该是什么时,他们实际上说:“嗯,你得自己决定想研究什么题目。”
而在那时,我对数据感兴趣,也对人工智能感兴趣,而且我想了很多。我读了很多资料。我决定要探究的是如何对相互关联的网页数据进行数据挖掘,于是……当我确定这就是我想研究的问题后,有人把我引荐给了一位特定的教员……
ATALLA:不错。
NEVILLE:……他当时刚刚开始在一个尚处萌芽阶段、被称为统计关系学习的领域工作。我们就在那个领域做了我的项目,我在一个研讨会上发表了一篇论文,然后我就有点入迷了。
ATALLA:好的,是的。
NEVILLE:所以我原本并没打算继续读研,但那段经历……
ATALLA:是的。
NEVILLE:……让我想去读研究生,并继续下去。
ATALLA: 不错。你觉得是其中哪一部分吸引了你?是做研究时的那种兴奋感吗?是会议的氛围,以及学术出版的样子吗?
NEVILLE: 真正吸引我的是做研究的那种兴奋感和过程本身。那是一个很长的项目。有些时候我觉得自己在原地打转。事情进展不顺。我会有点沮丧。但我的导师会很支持、很积极,说:“不,继续做。我们正在学到一些东西。”然后,然后我们会到达一个我们确实学到了东西的节点,正是那种情绪上的兴奋感,那才是真正吸引我的。能够理解一些还没有别人理解的东西……
ATALLA: 当然。
NEVILLE: ……因为它就处在我们对事物所知的前沿,呃,它简直,几乎像毒品一样,对吧?[LAUGHTER] 所以它让我在研究领域待了这么久,就是那种同样的、同样的……追逐那种同样的感觉。
ATALLA: 明白了。嗯,很喜欢。是的,你在2021年从学术界加入了Microsoft。事实上,你现在仍是教授,而且已经任教和指导学生20年了。是什么促使你把职业生涯的一部分转向在产业界做研究,你又会如何描述产业界研究与学术界研究的区别?
NEVILLE: 我的研究大致横跨从理论到应用的整个谱系。我获得终身教职后第一次休学术假时,很多和我处于职业生涯同一阶段的同事都去了产业界实验室休学术假,而且再也没有回到Purdue。我思考过自己想走哪个方向,是更偏理论还是更偏应用,当时我觉得在职业生涯的那个阶段,探索理论一侧会更好,因为那样我或许真的会回到Purdue。
于是我去了伯克利的Simons Institute休学术假,那非常偏理论。那是一段很棒的经历,但转回学术界几乎毫无障碍。第二次学术假,我走了另一条路,也就是来到MSR [Microsoft Research]在这里休学术假。当然,能够看到理论上的算法如何真正落地——就它们在实践中、在真实系统里、面对真实用户和真实数据时的表现而言,那种感觉很难再回头。所以这就是我现在仍留在这里的原因。
ATALLA: 明白了。
NEVILLE: 所以我认为学术界与产业界研究的差别取决于……实际上受到你把研究瞄准何处这一目标的影响。因此我认为,从根本上说感觉非常相似,你在学术界和产业界会提出的问题很相似,但在产业界,你有能力在真实系统、真实数据上大规模应用它,这与学术界确实非常不同;而在学术界,我认为你最终会提出更抽象的问题,这些问题同时涵盖许多不同领域的应用。而这正是你从DARPA [Defense Advanced Research Projects Agency]和NSF [National Science Foundation]这类机构获得资助的方式。
但在工业界,要真正亲自动手,并且在真实系统里去做,会稍微容易一些。然后你的目标,某种程度上,就是产品和公司的利益。因此随着……这多少会改变你可能会提出或探究的问题类型。所以我觉得,实际上很棒的是能够身处……
ATALLA: 是啊。
NEVILLE: ……两个地方,对吧?两者之间有很多协同效应,我觉得也有很多机会可以进入工业界再回到学术界,或者从工业界起步再进入学术界。但眼下,如果你在做 AI 系统方面的工作,我认为工业界才真正是该待的地方。
ATALLA: 明白了。是的。对那些目前正在决定职业生涯中这一选择该往哪个方向走的人来说,这或许是有用的建议。
我在 Microsoft 已经待了六年多一点,其中大部分时间都在从事 AI 评估工作,这个领域当然存在许多艰巨的根本性问题与挑战。
我最初接触到你的工作并开始了解它,是因为你的部分工作为其中一些问题提出了一些解决方案,也有助于指出这些问题。我的第一反应是松了口气:有你这样出色的人在做这些事情,你会替我们处理好。我也很欣赏你如何在批评 AI 评估的同时,一路上还提供解决方案。
但我理解,那只是你更广泛研究议程中的一小部分。那么,你会如何描述你在这里所领导团队目前的研究章程?
NEVILLE: 我们的团队叫做 AI 交互与学习团队。我们真正关注的是,试图推动这些 AI 系统在真实工作环境中的行为前沿。因此这包括研究当前系统性能的边界在哪里、用户在真实工作流的实践中如何体验这一点,然后我们如何改进这一点,并推动模型在用户正在做的这类任务——复杂任务——上的性能。
我们关注评估的原因是,我们发现 ML 和 AI 领域的人进行评估的标准方式,是通过相对于人们在实践中实际如何使用它们而言相当简单的基准。因此我们发现,你真正需要做的第一件事就是问:我们想从这些系统中得到什么?并设计实用的评估,把系统置于那样的环境中。这意味着诸如多轮行为、协作环境,以及用户正在做的长程任务。
然后,一旦我们能够看到这些评估中出现的性能差距或问题所在,这也会让我们了解到,从理论或算法层面,我们需要在何处改进这些系统。
所以我们从评估入手,但最终,我们试图做的是开发更好的算法、模型、估计方法……
ATALLA: 当然。
NEVILLE: ……以推动模型的性能。
ATALLA: 是的,它是通往理解的一道大门,因此才能够推动边界并改进这些、这些系统。
NEVILLE: 是的。
ATALLA:所以你提到了多轮交互和协作环境。你有几篇近期论文专门研究这些方面,比如大语言模型如何在多轮对话中迷失,或者它们如何在这类智能体知识工作场景中破坏文档。你能再具体讲讲这些研究项目吗?
NEVILLE:当然。我们……这些是一些例子,说明我们必须以某种方式形成创新性的见解,来设计评估,从而真正能够在这些场景中控制和测试模型的行为。
就多轮对话而言,我们的做法是采用单轮基准——也许我应该先退一步说,我们在实践中观察到用户的一点是,他们往往对所要做的事说明不足。他们一开始并不知道如何给出完整的规格说明。作为计算机科学家和软件工程师,我们有时会忘记这一点,但普通用户可能无法在第一轮就完整地说明事情。因此,他们会在多轮过程中逐渐弄清楚自己在做什么,并在各轮中逐步添加条件和澄清。
所以我们的做法是,取用公开的单轮基准数据集,改动那条完整指定的单一复杂指令,让模拟用户的模型在多轮中提供这些澄清,然后研究这些模型——我们现有的所有当前模型——在这类任务被分散到多轮中加以说明时会如何表现。
我们发现,在单轮场景中看到的表现——由于我们作为模型构建者当然是针对这一点进行优化的,所以非常高——在多轮中实际上会显著下降。因此,这是一个相当令人惊讶的发现,因为此前没有人以那种方式评估过,……
ATALLA:当然。
NEVILLE:……以前以那种方式评估过。但当我们把这项研究发布到世界上时,这些系统的用户都产生了共鸣,……
ATALLA:当然……是啊。
NEVILLE:……“嗯,这就是我的体验。我知道会发生这种情况。我们该、我们该怎么解决?”而其中之一……所以我们正在研究强化学习方法,以便真正帮助模型在这些环境中学得更好,从而在某种程度上纠正这种行为。
但我们在论文中谈到的一个实用解决方案是,如果你最终让模型有点搞糊涂了——如果你是在多轮中说明某件事——那就停掉对话,清除一切,退回去,然后根据你现在所知道的,给它一个完整指定的单轮指令,……
ATALLA:我明白了,是的。
NEVILLE:……然后它在这种交互中就会表现得更好。
所以这也许说明,尽管从根本上我们在寻求对模型的算法改进,但有时在这些项目中,我们最终会得出关于用户可以如何改变自身行为的见解……
ATALLA:当然。是的。
NEVILLE:……以便从模型获得更好的结果,就它们目前的状态而言……
ATALLA:是啊……
NEVILLE:……就其表现而言。
ATALLA: 是的。嗯,我们注意到,你研究的主题之一是我们如何改进这些系统,使它们更好地与用户实际想要的东西相一致。你在这里提到了一个例子:“嘿,嗯,我们知道,现实中用户往往不会在第一轮就充分说明他们想要什么,而且我们确实会有这些很长的多轮交互。”在你发表这篇论文之后,他们对在多轮对话中迷失的这种挫败感表达了共鸣。
你如何思考去理解用户的愿望、需求和体验,而这又如何关联回你所做的事情,比如如你所说,模拟一个用户,来运行这些更长的多轮评估?
NEVILLE: 是的,那就是……能够大规模地看到用户试图做什么,以及他们在这些系统中有着怎样的失败和成功,我认为这是你身处工业界实验室、并且能够像那样大规模看到数据时所获得的优势之一。
所以我们在这里与微软内部的产品团队做了大量工作,大规模分析消费者日志,以弄清用户正在经历的主要失败模式是什么。而这就是……提供了我们很多、很多工作的那种洞见或动机。还有很多优秀的产品团队也在分析用户取得的成功,这甚至会让你能够向用户推荐如何……在我们现在拥有的这些系统中,他们将能够成功完成的是哪类任务。
我想,如果你回想一下搜索引擎最初出现的时候,人们必须学习如何与搜索引擎交互……
ATALLA: 当然。
NEVILLE: ……以一种能够有效获取他们所寻找的信息的方式。我们现在也许已经忘了那曾经发生过,因为它在所有这些人工智能系统出现之前,已经如此成为每个人都会做的事情的一部分。但现在我认为正在发生从搜索引擎向这些基于聊天的系统的转变,而且我认为用户方面也必须有一些学习,……
ATALLA: 对,是的。
NEVILLE: ……在这个新环境中。而且我认为,分析用户正在做的那些成功的事情,是开始进行推荐的一个很好的方式……
ATALLA: 是的。
NEVILLE: ……并以同样的方式辅导或教导用户。
ATALLA: 我很喜欢你指出查看真实数据的用处,但这实际上意味着什么?你们是真的在查看真实数据吗?隐私在这里如何体现?你们有什么样的流程来负责任地利用真实环境中的数据?
NEVILLE: 哦,是的,这是个好观点。谢谢你提出来。我们实际上并不是在查看数据。我们是在以一种保护隐私的方式大规模分析数据,以提取失败或成功的模式。还有很多、很多限制,使我们实际上无法亲眼看到数据。我们只能,算是,把方法推送过去,在非常受限的环境中处理数据。然后,嗯,然后这些算是经过隐私保护的更高层次洞见,才是随后推动我们之后在算法上要做的事情的那些东西。
所以先说清楚,我们并不是在用你的数据或你的回复做微调,但你在回复中能提供的细节越多——无论是通过捐赠的信息、当你点踩并给出描述时,还是在你与模型进行的那种聊天互动中——这些最终都可以被提炼成将用于改进模型的内容,而不是通过有人实际查看你一直在做的事情。
ATALLA: 而且你指出了这种从以搜索为主导模式转向这些多轮聊天互动的转变。但现在我们也看到,智能体式的,以及协作式知识工作风格的任务正变得更加相关,并且注意到你在这方面也做了一些工作。还有什么其他有趣的要点,是你愿意与我们的听众分享的吗?
NEVILLE: 是的。所以我们既有一些理论工作,试图刻画哪些类型的任务从根本上就难以让 transformer 在模型内部完成计算,也有更多基于模拟的工作,我们在其中考察那些在长程工作流中开展的复杂任务,例如,你取出一些文档,并对这些文档进行反复编辑。
在这些环境中,对模型乃至智能体而言,任务的复杂性在于不仅要追踪用户在这项长程工作活动中打算做什么,还要理解当前状态是什么、哪些信息是相关的、哪些是不相关的、事情发生了怎样的变化。而这些正是智能体开始做得相当不错的事情,但有些特定类型的任务比其他任务更容易。
ATALLA: 当然。
NEVILLE: 因此,我们关注的是:哪些类型的任务,其复杂性对当前的智能体来说已经过高,以及如何解决这个问题。智能体使用工具的最佳方式是什么?把人类纳入回路是否更好?我们如何知道事情已经出了差错?所以,让……甚至让智能体自己进行某种监控,并评估它们是否正确回答了某件事,或者它们是否应该回退到先前的状态。我认为这些目前都是开放性问题。
但我们有……我们确实有一些工作表明,再一次,随着我们在这些工作流中走得越来越长,会出现令人惊讶的失败,因为错误如果没有被抓住,就会不断累积……
ATALLA: 是的。
NEVILLE: … 并开始让 AI 更加困惑,因为它们、因为它们必须在反复的交互中执行这项任务。
ATALLA: 是的,“令人惊讶的失败”这个说法对我来说很有意思。它暗示着一种预期:“嘿,这本该做得更好,而我很惊讶它以这种特定方式失败了。”你觉得你看到的这类令人惊讶的错误更多,还是很多错误是在预期之中的,你会理解它会以这种方式或那种方式失败?
NEVILLE: 是的,我想,我想确实存在可预期的失败,因为那些……嗯,当然,随着我们努力让系统变得越来越好,可预期的失败会更少。
ATALLA: 对。如果我们能预见到它们,我们就能修复它们。
NEVILLE: 没错。但像幻觉这样的问题,是业界长期以来已经刻画过的一类失败,而且已有专门的基准和方法试图减少这些问题。
我认为我的团队最终会去寻找那些几乎表现为意外失败的现象,因为它们不是传统的失败,而且往往很难被分离出来并证明它们正在发生,因为它们非常微妙,不会仅仅表现为数学题的错误答案,或者法律意见中的幻觉案例,而是文档中这种微妙的语义内容丢失。而且我认为,如果回顾我们和团队所调查过的内容,我们有一种假设:作为人类,我们认为对我们来说难做的事情,也会是对模型来说难做的事情。但事实上往往并非如此,因为我们必须思考对 transformer 来说实际计算什么是困难的,对它们的检索系统来说检索什么是困难的……
ATALLA: 对。
NEVILLE: ……从底层内容中。
所以我认为,“意外”的来源在于:有些事情我们作为人类可能会觉得非常简单就能做到,或者我们认为如果某项任务以前被正确完成过,那么现在同样的任务再做一次也应该被可靠地正确完成。但事实上,对 LLM 来说未必如此。因此,这种意外感,我认为,是随着我们基于人类智能、关于什么难或什么容易的自身预期而悄然出现的。
ATALLA: 是啊。那么,在用户可能存在的那种困惑——基于他们预期这些系统擅长什么,或许是基于对人类智能的反思——以及外面存在的所有炒作和营销之间,你希望真实用户从中带走什么?或者,鉴于你在这里的工作,你会如何提醒他们去思考自己对 AI 系统可能拥有的能力和预期?他们怎样才能穿透这些噪音,建立起更好的预期?
NEVILLE: 哦,这是个好问题。我认为,当前的 AI 系统有很多能力,对现在工作环境中的人们会非常有用。我认为我们这项工作给人的启示是,你不应该期望它们在所有方面都 100% 成功。你应该检查你收回来的答案。如果你得到了你认为不正确的结果,你不一定要假定模型完全做不到那件事。但你应该考虑再问一次,或者换一种方式去问它,下一次你可能会得到更好的答案。
这很难融入我们现在的工作方式,因为我认为你不能……它们还没有准备好让事情被 100% 委托给它们。但如果你能弄清楚如何在与你一起的工作流程中使用它们,并加以监督和验证,我认为它们可以非常有用地去做事,提高生产力以及你完成事情的速度。
所以……也许还有另一件想说的事是,你知道,请多包涵我们,因为[笑声]我们正在这些系统发布的同时实时开发它们。因此,你们的使用实际上帮助我们推动模型的边界,因为它为我们提供了哪些事情能做、哪些不能做的例子。
也许我还想说的另一件事是,用户也许并不理解的一点在于:过去,对于基于搜索的系统或推荐系统,我们作为用户能够给出的反馈只不过是那种点赞、点踩。但现在我们所处的环境里,实际上可以给出保真度高得多的反馈,这对下游改进模型可能非常有用。
所以,如果你是在一种与模型的聊天环境中工作,要明白如果某件事进展得很糟,实际有帮助的是说明它是怎么变糟的,去……并且在你的文字交互或语音交互中真正传达,比如到底哪里出了错、你期望的是什么、而你实际得到的又是什么。因为当我们更新模型时,这些实际上会被用到。因此你可以这样理解:作为用户,你的角色可以是训练模型去做那些你本来希望它做、但它现在还做不到的事情。
ATALLA:太棒了。这里倒是个有意思的行动号召。
我只是好奇。你谈到了我们现在这类大型语言系统所处的 transformer 范式。你认为大型 AI 系统的科学接下来会走向何方?宽泛地说,也许这真的是个很难的问题,但至少就你的兴趣和研究方向而言,你认为这些系统的科学接下来会走向何方?
NEVILLE:这,这是个,这是个大问题。[笑声]我认为我们……研究界正在同时试图弄清楚,transformer 架构是否是应当使用的正确底层模型,因为 transformer 中计算如何运作存在某些已知局限。其中很多局限可以通过模型外围的封装来解决——也就是我们现在围绕模型所拥有的智能体驾驭框架——以及在后端进行的推理。
所以我认为一个开放性问题是,我们能在多大程度上借助这种围绕它的封装基础来应对 transformer 架构的局限,以及哪些方面需要用一种根本不同的……
ATALLA:当然。
NEVILLE:……底层架构来应对?我认为我们将看到各种替代架构和模型的快速发展,以及围绕我们现有模型的精细封装的快速发展。
我认为,在下一代工作中我们将看到,我们必须聚焦于与模型进行更长期的交互,并让模型以比现在切实得多的方式理解它们正在其中工作的世界。但我认为我对正在开展的研究非常看好。我认为我们,你知道,会在这件事上取得成功。
也许回到我刚起步的时候,我的第一份实习是 2000 年在 AT&T Labs。我非常清楚地记得,实习期间坐在午餐桌上玩围棋,谈论我们如何能够让,你知道,AI 模型能够,你知道,玩这个游戏,以及它如何比国际象棋更难,还有我们能做些什么。
而且,而且我当时正在学下围棋。我是在9×9的棋盘上学的。我不知道你是否学过下围棋,……
ATALLA: 我没有。
NEVILLE: ……但你不会在大棋盘上学怎么下……
ATALLA: 哇。
NEVILLE: ……因为它,它对人类来说都太难了,对吧。所以你要从这块9×9的棋盘开始。
我当时有点像在看着自己学习怎么下,并思考算法会如何学会怎么下。在我们这么做的时候,我们,你知道,算是在推测人工智能要花多久才能做到这一点。所以现在回想起来挺有意思的,因为,你知道,在AT&T Labs,有很多,可以说是,机器学习与人工智能研究领域的杰出人物都在那里。人们说:“哦,要做到这一点要花50年。”你知道,有些人说100年。但当然,现在这已经是一个已解决的问题(在新标签页中打开)。
ATALLA: 是啊。
NEVILLE: 所以展望未来,有些事情我作为研究者可能会这么认为,因为我们很难跨越我们现在在行为中看到的这类界限,往往会倾向于认为,“哦,这要花10年”,或者“这要花25年”。
但我认为,鉴于研究的步伐、从事研究的人数,你知道,在这个领域做研究的人,以及这些模型运行的规模,我认为它实际上会发生得比我作为那个人——你知道,2000年那个人工智能新生——所想的要快得多。所以……
ATALLA: 哇。那么,本着这一点,回望2000年,让我们想象现在向前跳跃20年进入未来,或者只是10年,因为事情发展得如此之快。
NEVILLE: [笑] 是啊。
ATALLA: 你希望在这个领域的研究上留下什么印记?
NEVILLE: 我认为,真正贯穿我研究生涯的那条共同主线,是思考复杂系统,以及如何让人工智能和机器学习在这些复杂系统中运作。所以——即便是现在,这也是我们在协作方面所聚焦的,我们正在思考多人类、多人工智能的交互。我认为……如果我真的从科幻式的结果来考虑,我认为如果我们在工作环境中开始看到由人类和人工智能组成的组织在团队中共同工作以完成事情并创新,而且如果我们能让它正确运作,那么我就会觉得我的研究是成功的。
ATALLA: 太棒了。那么,在我们这里收尾时,我想做一轮闪电问答会很有趣,意思是快速提问、快速的低利害回答,就是脑子里首先出现的任何东西。听起来好吗?
NEVILLE: 当然。
ATALLA: 太棒了。有哪一条建议一直伴随着你,或者改变了你的看法?
NEVILLE: 呃,好的。不过你说的是简短回答。[笑]
我刚开始学计算机科学的时候,我,呃,其实,Doina Precup(在新标签页中打开)是我第一门计算机科学课的助教。当时我有点不堪重负,觉得自己不……别人什么都懂,而我什么都不懂,她对我说,你知道,别、别害怕提问,因为人们可能看起来好像知道是怎么回事,但事实上他们并不知道是怎么回事,而且他们其实会非常感激你有勇气提出问题,因为他们很可能也在想同样的事情。而且,而且如果你、如果你愿意把问题提出来,对你和他们都有帮助。
所以在我的职业生涯中,我一直把这句话记在心里。而且这非常难,你知道,你会害怕,觉得提问会让自己显得很蠢。但毫无疑问,一路走来,每当我有这些恐惧的感觉,而且……但无论如何还是鼓起勇气提出问题的时候,我确实发现人们非常感激。而且,你知道,事后人们会说:“哦,我也在想同样的事。真高兴你问了那个问题。”所以,所以要勇敢,把问题提出来。
ATALLA: 太棒了。有什么教训是你吃了苦头才学到的?
NEVILLE: 看数据。[笑声] 看数据。
所以在机器学习里,我们有一种倾向——这也适用于各种基准。我们有、我们有一个测试集。我们运行我们的模型。我们训练它。我们把它应用到这个测试集上。我们通常会得到一个数字,也就是我们试图推高的那个指标。于是我们认为,如果这个数字在升高,我们就做得很好。如果数字没有变化,我们就会想:“哦,那这个问题太难了。”
但我多次吃了苦头才明白,当事情进展不顺时,如果你花时间去看数据,你实际上可能会发现数据里有错误。数据并不是你所期望的那样。数据与你训练模型所用的分布不同。所以任何时候……我想也许这让我成了一个数据人。[笑声] 但往往当事情没有按我们预期的方式表现时,我们就会去看数据,试图弄明白。
ATALLA: 是啊。有道理。这个很好。这个也很难。
NEVILLE: [笑] 很难记住。
ATALLA: 是的。
NEVILLE: 而且那……也许重要的一点是,尽管我已经学到了那个教训,……
ATALLA: 当然。
NEVILLE: ……在我的职业生涯中,我至少不得不把那个教训重新学习了五六次。
ATALLA: 是啊。那么,反过来说,你最引以为豪的成就是什么?
NEVILLE: 我想我会说,我能够在获得终身教职的同时把一个幼儿带大。
ATALLA: 哇,是啊。
NEVILLE: 我是在我们开始之前不久生下儿子的——我丈夫也是教职人员——所以是在我们开始担任教职之前。所以我想,我能够获得终身教职,我的儿子健康又快乐,而且我还维持住了婚姻[笑]……
ATALLA: 是啊,确实。
NEVILLE: ……大概就是最大的成就了,呃,是啊……
ATALLA: 了不起的成就,是啊。 最后一个问题。艺术或自然以何种方式影响了你的工作?
NEVILLE: 嗯,我不确定这算不算自然,但作为一名 AI 从业者,我一直在观察的一件事是,孩子、人、动物、昆虫似乎如何了解世界和环境并改变自己的行为。所以我完全承认,作为一个、作为一个带着年幼孩子的家长,我当时非常书呆子气。我会把,你知道,我们从机器学习中得到的想法拿来,试着看看能否帮助我儿子学得更好。
例如,当他还是婴儿、正在学着试着翻身时,我会说,我会说:“好,让我给你一个正向训练样本。[笑声] 比如,来,把腿这样动,”然后……
ATALLA: 是啊,是啊。
NEVILLE: ……然后看看这对他如何学习产生的影响,同时观察他学习,再思考这如何,你知道,可以融入我们开发的算法和模型中。这大概是我职业生涯中一直不断回过头去思考的最大互动。
ATALLA: 真美。是啊。
NEVILLE: 谢谢。
ATALLA: 好,Jen,感谢你分享自己的故事和见解。很高兴你能来到这里。
也感谢各位听众的收听。如果您想进一步了解我在 Microsoft 的同事们的工作,请查看 Microsoft Research 页面 aka.ms/research,或[音乐]收听本播客的其他节目。谢谢。
[音乐结束]
了解更多:
- AI 交互与学习
主页 - 当你委托任务时,LLM 会破坏你的文档
出版物 | April 2026 - 关于我们近期 AI 委托与长程可靠性研究的进一步说明
- Microsoft Research 博客 | May 2026
- LLM 在多轮对话中会迷失方向
出版物 | May 2025
在新标签页中打开
文章 AI 会错在哪里,失败又教会我们什么 最早发布于 Microsoft Research。
来源:Microsoft Research · microsoft.com