跳到正文
原文
Google Research·· 3 小时前精选AI 评分63

Google三个月专利起草实验显示AI提效未必培养初级律师判断力

Does better work always mean better workers?

AI 导读

Google Research对十一家知识产权律所的133名律师开展三个月现场实验,发现AI专利写作助手能提高起草分数,但撤掉工具后的审校判断提升主要出现在资深律师身上。

推荐理由

这项三个月专利起草实验把有工具时的起草表现和无工具时的审校判断分开衡量,资深律师独立能力有提升而初级律师没有。

正文 · AI 翻译

判断力是区分资深专业人士与初级同行的关键。培养判断力需要数千小时的在职学习,通常是在经验丰富的工作者指导下,通过对相对常规的工作进行枯燥但富有塑造性的投入来完成。但人工智能已经在改变在职学习的方式。一方面,放射学、商业问题解决、求职者写作和法律教育领域的实证研究表明,当人工智能工具被审慎地嵌入培训流程时,经验较少的工作者能够提升其独立工作表现。

另一方面,近期针对软件工程师、管理顾问、高中生和临床医生的实验表明,虽然人工智能如同临时外骨骼,能够提升即时产出,但一旦撤除该工具,这些收益往往无法持续。要理解人工智能如何削弱或增强专业能力,需要三个很少同时具备的要素:(1)将人工智能的持续使用嵌入日常专业工作,时间跨度为数月而非数小时;(2)在无法使用人工智能时,对无辅助判断力进行可信评估;(3)由领域专家进行盲评。

在由美国国家经济研究局发表的《人工智能辅助是增强还是削弱专业能力?来自一项为期三个月的专利撰写实地实验的证据》中,我们描述了一项实地实验,用以捕捉在高度依赖专业知识的知识产权法律职业中,因使用人工智能而产生的短期生产力与长期技能培养两方面的变化。在实验中,我们在11家与 Google 保持常规、非独家业务往来的知识产权律师事务所的133名律师中,随机分配了当时尚未发布的 Google Labs 人工智能专利撰写助手工具(现为 Gemini Notebook 的一部分)的使用权限。每家事务所三分之二的律师(“处理”组)获得了该工具的提前使用权,其余律师(“对照”组)则接受了一些如何使用人工智能的培训,但在为期三个月的研究期结束之前不得使用该工具。

借助人工智能,工作更出色

经过10天的AI辅助后,我们向所有参与的律师发送了一套针对一项假想发明的发明人材料,并要求他们起草一份专利。90天后,我们用另一套模拟的发明人材料再次这样做。在两个时间段,我们都看到了预期中的AI对起草任务表现的提升。在第10天,获得AI工具使起草分数(由独立法律专家依据包含李克特量表的评分标准,对质量的五个不同方面进行评分)提高了0.34个标准差,相当于在对照组分数的百分位排名中上升10个点;到第90天,这一提升增加到0.38个标准差,意味着上升11个百分位点。这些提升在所有质量维度上都表现出高度的一致性。值得注意的是,更好的表现来自较差分数频率的降低和良好分数频率的提高,而优秀分数的频率没有变化。具体而言,被分配获得AI使用权限的律师,其分数从最低五分位移动到了中低五分位和中间五分位,但杰出分数的数量没有明显变化。这一模式在初级律师中尤为明显,他们在质量上的提升还伴随着显著的时间节省(例如,在第10天的任务上比对照组平均124分钟的速度快18分钟)。

但专利律师并不只是起草专利;他们还会审阅彼此的工作,查找可能使专利在法庭上无法执行的关键错误(有时被称为“专利忌语”)——例如,过度主张一项发明的新颖性或范围。因此,我们在第90天增加了另一项任务,要求受试者对一份包含许多错误(既有实质性的,也有风格性的)的现有假想专利进行红线标注(即手动标记并修正)。这项测试任务反映了较资深律师日常运用的那种专业判断,而在这类判断上,他们往往没有依赖AI的余裕。关键的是,虽然实验组律师被鼓励在起草任务中使用这款未发布的AI工具或任何其他AI工具,但没有人被允许在红线标注任务中使用AI,这使得他们在这项任务上的分数成为其技能发展程度的衡量标准。对于所有任务,包括起草和红线标注,我们与第三方专利专业人士合作,从五个质量维度对提交内容评分:(1)可执行性,(2)准确性,(3)策略性模糊(对权利要求的策略性范围界定),(4)完整性,以及(5)清晰度。

当AI被移除时

当AI助手在第90天的红线标注任务中被移除后,拉平效应消失了。获得AI工具使用权限的律师在这项无辅助任务上比对照组高出0.32个标准差(相当于百分位排名上升9个点),但这一效应完全由资深律师驱动,他们比对照组受试者高出0.45个标准差(上升13个点),而初级律师没有明显改善。相反,初级律师的分数出现分化:极低分更多,平庸分更少,良好分更多,优秀分则没有增多。

这些结果对学习意味着什么?获得 AI 工具使用权的资深人员,在过去三个月使用该工具的过程中,显然在专业判断力方面收获了显著价值。但初级层面的情况则更为微妙。部分分数有所提高,暗示 AI 具备跨越式学习的能力。另一些分数则落到了分布的较低层级,表明在某些情形下,AI 可以帮助初级人员交付合格的工作,但他们在机器辅助下更高的表现,并不会转化为更快地获得那种使资深专业人士具有独特价值的专业能力。

审视定性编辑模式,有助于了解不同经验水平的专业人士如何使用生成式 AI 工具。在处理组与对照组中,初级人员提交的内容都遵循僵化的形式主义:初级人员按从上到下的顺序工作,常常在触及主要专利权利要求之前,就把时间耗尽在对低风险引言部分的文字校对上。初级人员还侧重于表层的同义词替换,而非商业范围的改进。即使初级人员发现了严重缺陷,他们也常常留下描述性评论来诊断问题,而不是执行修订来加以修正。由于这种“只诊断、不执行”的姿态在未获辅助的对照初级人员中同样普遍,它代表了一种初级人员的基线短板,而三个月依赖 AI 来执行改写并未弥补这一短板。

相比之下,资深律师持续从接触 AI 中受益。处理组的资深人员在修订上花费的时间比初级人员更长,他们绕过低风险的文字,从头重建权利要求,剔除可能无意中缩小法律权利或限制保护范围的措辞,并将许多编辑与明确的法律原则相配合。在后续访谈中,资深人员表示,他们并不把 AI 的输出当作成品,而是当作“逻辑审计员”。这削弱了他们对现有文字的执着,迫使他们阐明结构性编辑的原因与方法,从而激活并磨砺其基础专业能力。

进一步的方向

提升表现与培养持久的专业判断力是不同的目标。对初级专业人士而言,二者尤其可能彼此掣肘。基础专业能力或许是缺失的一环,它能让 AI 辅助下的反复练习在职业生涯中转化为成熟的专业判断力。即便模型能力不断进步,这种判断力很可能仍将继续重要:律师在与法官、客户和同事的互动中仍会运用自己的判断。他们无法在所有场合都依赖 AI 工具来协助自己。当下这个 AI 时刻的一项关键挑战是,确保那些旨在让今天的工作做得更好的工具,不会妨碍初级专业人士成长为我们明天所需要的专家。

在专业人士的工作环境中开展研究,对研究人员而言是一项挑战。我们的实验仅纳入了有限的专利律师样本,这反映了该领域顶尖专业人士按小时计费的高费率。我们只在三个月内对他们进行观察,与他们培养持久专业能力所需的数年相比,这只是一个很小的时间窗口。此外,过去一年里,模型能力与基线 AI 熟悉度(以及 AI 赋能产品在法律领域的渗透)都在快速提升,如果我们现在重新开展试验,这些变化可能会影响我们的结果。这些局限性为进一步研究带来了机会,其中一些我们希望在未来几个月推进。尽管如此,我们这项工作的一个明确结论是:要理解 AI 辅助对专业技能的影响,需要通过测试把使用工具的效果与用户在无辅助情况下的表现效果区分开来。

致谢

衷心感谢共同作者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;以及 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 的指导与支持;感谢 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 与我们合作开展这项实验;感谢 Kiera Russell 提供产品访问权限和可信测试者支持;感谢 Steve Gong 和 Taylor Montgomery 提供法律指导与招募支持;并感谢我们的传播、营销及研究博客合作伙伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo,推动了此次发布。

来源:Google Research · research.google