Google Research 两项研究评估 AI 改进英国乳腺癌筛查流程
Improving breast cancer screening workflows with machine learning
Google Research 与多家 NHS 机构合作开展 AIMS 研究,并在 Nature Cancer 发表两项配套论文,评估 AI 乳腺癌检测系统的独立性能及其作为第二阅片人的流程效果。
用同一随访窗口比较AI独立检测和作为第二阅片人的流程,可以看到检出与人工阅片负担的变化,以及仲裁推翻正确召回的风险。
乳腺癌是英国35–64岁女性的首位死因,但研究已确凿表明,通过乳腺X线摄影进行早期筛查能够挽救生命。英国国家医疗服务体系(NHS)乳腺筛查计划目前依赖双人阅片流程——两名人工乳腺X线摄影阅片员分别评估每例病例,仲裁小组则根据当地规程及两次初步阅片结果,在需要时对病例进行复核。尽管这一严格流程非常有效,但临床放射科医师短缺30%——预计到2028年将达到40%——威胁着该计划的长期可持续性。
人们对探索人工智能助力乳腺癌筛查流程潜力的研究工作兴趣日益浓厚。在我们此前在该领域的工作基础上,我们与多家NHS机构合作,作为乳腺X线摄影筛查中的人工智能(AIMS)研究的一部分,进一步探究人工智能在该领域的潜力。正如本月早些时候所分享的,我们在Nature Cancer上发表了两项配套研究,评估了基于人工智能的乳腺癌检测系统的不同方面。在第一项研究中,我们评估了独立人工智能系统的性能以及前瞻性整合的可行性。在第二项中,我们开展了一项端到端阅片员研究,将原有的双人阅片与仲裁流程,与将人工智能系统用作第二阅片员的流程进行比较。尽管仍需更多工作来证明该系统在前瞻性临床实践中的有效性,这些研究强化了使用人工智能支持乳腺癌筛查的潜在益处的证据。
研究1:独立性能与整合可行性
第一项研究分为两个阶段。在第一阶段,我们对人工智能系统的独立性能进行了大规模多中心回顾性评估。在第二阶段,我们开展了一项前瞻性、非干预性部署研究,以评估将实时系统整合到真实临床工作流程中的可行性及相关挑战。
阶段1:多中心独立性能评估
第一个回顾性阶段纳入了在英国五家NHS筛查服务机构接受筛查的125,000名女性的乳腺X线照片(应用纳入/排除标准后为115,973名)。这些服务涵盖三种不同的临床工作流程,差异在于第二阅片员是否对第一阅片员设盲,以及病例如何被选入仲裁(见下图)。人工智能工作点(决定人工智能标记病例时保守程度的阈值)在各筛查服务机构分别确定,以针对筛查人群和工作流程的地方差异进行调整。
该研究的主要终点评估了AI系统检出癌症的敏感性和特异性,并与该病例的历史(原始)第一阅片者进行比较。研究采用了严格的金标准,利用39个月的随访窗口,使我们能够研究AI系统在间隔期癌和下一轮筛查癌于出现临床症状之前很久即被检出方面的增量获益。除主要终点外,研究还评估了AI系统相对于第二阅片者和共识阅片者的表现,以及病灶级定位(是否识别出乳腺中正确的异常)和公平性分析。通过纳入严格的病灶级分析,我们的研究探讨了AI系统是否成功定位了精确的感兴趣区域,而非依赖于可能虚假的相关性。该研究阶段为回顾性设计,以便在大规模上验证AI性能,且不涉及收集人类阅片者的任何额外判读,也不涉及前瞻性部署。
第2阶段:前瞻性技术可行性
在第二阶段,为了解将AI纳入不同诊所真实筛查工作流程时的实际考量,我们在伦敦2家主要筛查服务机构下属的12个筛查点开展了前瞻性非干预部署。该阶段重点在于证明技术整合成功、评估自动化资格核查,以及监测分布偏移。
在各站点,我们先对筛查乳腺X线照片进行假名化,再将其传递给基于安全Google Cloud的AI系统进行处理。本研究还评估了一种迭代式操作点校准流程:研究人员在研究期间监测召回率并调整操作点,以便更好地将系统校准至当地环境并确保运行安全。
主要结果
在独立性能评估中,AI系统在不降低特异性的前提下,取得了显著高于原始第一人类阅片者的敏感性。总体癌症检出率从每1,000名女性7.54例上升至9.33例;至关重要的是,AI系统能够检出原始双阅片流程中被漏诊的25%间隔期癌。
该AI尤其擅长检出浸润性癌,对这些较高风险癌症类型的敏感性优于原始人类阅片者。对于首次参加筛查的女性,其表现也格外出色:在提高检出敏感性的同时大幅减少了假阳性。一项探索性分析观察到,在年龄、族裔、乳腺密度或社会经济地位方面,并未出现明显的系统性人口学差异。
在前瞻性部署阶段,AI系统以非干预方式成功部署于12个正在运行的NHS筛查站点,在两家服务机构、每家约两个月的时间内处理了9,266例。从完成筛查到完成AI阅片的时间很短,中位时间为17.7分钟,而第一人类阅片则超过2天。至关重要的是,实际部署成功识别出历史训练数据与现代临床数据之间的“分布偏移”。通过揭示这种漂移,该研究表明,若辅以严格、分阶段的方法,将操作点校准到当地工作流程与要求,安全的AI部署可能会更为有效。
研究 2:评估融入双阅片工作流程
虽然第一项研究对独立性能进行了定量评估,但并未探讨人类阅片者在仲裁过程中实际与 AI 输出交互时会有怎样的表现。尽管以往的回顾性研究模拟了仲裁,但我们的第二项研究是一项大规模阅片者研究,22 名人类阅片者依据真实的当地筛查服务规则对数千例病例进行仲裁,从而深入了解真实世界中的人与 AI 交互。我们比较了两种工作流程:
- 标准诊疗组:涉及第一位和第二位人类阅片者的历史决策
- AI 辅助组:将第一位人类阅片者的历史决策与我们的 AI 阅片者配对
本研究纳入了来自 50,000 名女性的病例(应用纳入/排除标准后为 45,602 例)。22 名经认证的乳腺 X 线摄影阅片者审阅了依据当地筛查服务规则需要仲裁的 8,732 例病例——其中一项服务规定,当两位原始阅片者对召回建议不一致时进行仲裁;另一项服务则规定,当任一原始阅片者建议召回时进行仲裁。仲裁者以两人一组的方式阅片,以模拟临床共识小组。在标准诊疗组中,仲裁者审阅两位人类阅片者的意见;在 AI 辅助组中,向仲裁者展示第一位人类阅片者的意见以及 AI 的输出及其高亮的感兴趣区域。随后,仲裁者做出是否召回该女性的最终决定。与我们第一篇论文中的方法类似,本研究具有可靠的真实标准,包括 39 个月的随访,使研究人员能够追踪 AI 辅助工作流程是否能比标准诊疗更早发现间期癌和下一轮筛查癌。该研究的主要终点是,AI 辅助诊疗组相对于标准诊疗组在病例层面癌症检出灵敏度和特异度上的非劣效性。
主要结果
在分析全部病例(包括经仲裁与未经仲裁的病例)之后,我们发现,仲裁后 AI 辅助工作流程在总体灵敏度和特异度方面在统计学上非劣于传统的双人工作流程。除了取得与传统工作流程相似的结果之外,我们估计 AI 辅助工作流程将使所需人类阅片总数减少约 46%。这一比例略低于 50%,因为约 8.7% 的复杂病例(例如涉及乳房植入物的病例)仍需要两名人类阅片者。在考虑到仲裁阅片比第一或第二阅片者的阅片更耗时之后,这相当于阅片者总体耗时减少 36–44%。在结局没有相应妥协的情况下为阅片者节省的这些时间,有望帮助应对英国病例负担不断加重的危机。
虽然仲裁成功过滤掉了人类阅片者和人工智能系统产生的许多假阳性,但研究揭示了一个相关的负面影响:人类仲裁小组错误地推翻了人工智能对93例阳性癌症病例作出的正确召回决定,其中大多数是难以发现的间期癌和下一轮筛查癌症。这一结果凸显了持续研究的必要性,即人类阅片者如何解读并处理可能与自身判断不一致的人工智能预测,重点既在于在专家中建立信任,也在于提高人工智能结果的可解释性。
结论
综合来看,这些研究表明,基于人工智能的筛查系统在单次阅片中能够提供更优的癌症检测性能,并在英国所采用的完整双阅片工作流程中达到非劣效表现。人工智能辅助筛查有望显著降低总体人工阅片工作量和阅片时间,同时提高癌症检出率,尤其是浸润性癌症和首次筛查。然而,要充分发挥人工智能的潜力,需要克服运营方面的问题,例如应对增加的仲裁量、提高模型可解释性,以及通过持续的性能监测和本地阈值校准来主动管理数据漂移。
最终,这项工作支持这样一种观点:人工智能辅助筛查或可实现可持续的医疗体系,让技术与人类专业知识协同运作,从而更早发现癌症,最重要的是挽救更多生命。
致谢
我们谨感谢Google Research、National Health Service以及我们的学术合作伙伴中的众多贡献者,是他们使这项工作成为可能。我们也感谢Imperial College London、Royal Surrey NHS Foundation Trust、St George’s University Hospitals、Cancer Research UK和Cancer Research Horizons的工作人员,他们整理并协助获取了本研究所用的OPTIMAM数据。我们特别感谢患者与公众参与小组提供的宝贵建议和意见。AIMS研究由卫生与社会保健大臣授予的National Institute for Health and Care Research (NIHR)奖项资助。图片由发表在Nature Cancer上的图片修改而来,依据Creative Commons Attribution 4.0 International License。要查看该许可协议的副本,请访问 http://creativecommons.org/licenses/by/4.0/.
来源:Google Research · research.google