跳到正文
原文
Google Research·· 2026-03-12精选AI 评分60

Google Research 探讨 AMIE 对话式诊断在真实临床研究中的可行性

Exploring the feasibility of conversational diagnostic AI in a real-world clinical study

AI 导读

Google Research 与 BIDMC 完成一项前瞻性单中心可行性研究,由 AMIE 在非急诊基层门诊就诊前,经医师实时监督以文本对话采集病史。

推荐理由

这项真实门诊研究以盲评比较受监督的 AMIE 诊前问诊和主诊医生,显示鉴别诊断质量接近而管理方案实用性与成本效益由医生更好。

正文 · AI 翻译

具备临床推理与对话能力的人工智能系统,有潜力大幅提升人们获得医学专业知识与医疗服务的机会,同时让医生重新获得与患者相处的时间。然而,要将这些创新付诸实践,需要以安全为中心、以证据为基础的方法。近年来,我们与 Articulate Medical Intelligence Explorer(AMIE)开展的工作探索了对话式医疗人工智能的可能性,首先在模拟环境中展示了其诊断能力,包括在 协助临床医生应对诊断挑战 以及 与患者演员互动 时。然而,正如 近期一篇关于临床医学中人工智能的综述 所强调的,将这些系统转化为临床实践,需要在真实世界的工作流程中进行评估。

在我们的新工作“对话式诊断人工智能在门诊初级保健诊所中的前瞻性临床可行性研究”中,我们分享了证据路线图上一个关键里程碑的结果:与 Beth Israel Deaconess Medical Center(BIDMC)合作开展的一项前瞻性、单中心可行性研究。在这项 预先注册、经 IRB 批准的前瞻性研究中,我们专门探讨了 AMIE 如何在新的门诊初级保健就诊前帮助收集患者信息,并了解临床医生和患者如何看待在诊疗体验中使用人工智能系统。这项研究代表了我们超越合成场景的第一步,旨在严格评估 AMIE 在真实世界临床环境中与患者互动时的安全性与实际可行性。

在真实世界临床工作流程中测试 AMIE

将人工智能系统转化为临床实践,需要在具备严格安全监督的真实世界医疗服务场景中进行评估。在这项前瞻性、单臂可行性研究中,AMIE 被部署用于在学术医学中心的门诊初级保健预约之前,对患者进行就诊前临床病史采集。

该临床场景聚焦于已预约就新发、非紧急、发作性主诉接受诊疗的患者,就诊方式为面对面或通过远程医疗平台。患者在预约流程中受邀参与研究,并获得充足时间审阅该研究经 IRB 批准的方案,同时得到保证:其是否参与的决定不会影响其诊疗。

研究参与者在当面问诊之前通过安全网页链接与 AMIE 系统互动。这些由人工智能驱动的文字聊天由一名医生通过带屏幕共享的实时视频通话进行监督。该监督医生(在下图中称为“AI supervisor”)接受了培训,以便在需要时根据一套预先定义的结构化安全标准进行干预,从而为临床安全与方案依从性提供保障。

在患者前往医生处进行紧急护理就诊之前,该系统生成了转录文本和摘要,以便为其临床医生提供就诊前互动的全面概述。监督是确保临床实践安全的常用手段。例如,实习临床医生将有机会在医生的密切监督下并征得患者同意后与患者沟通,从而获得指导医生的反馈。同样,在本研究中,AMIE 系统在参与研究的患者前往 PCP 就诊之前生成了转录文本和摘要,并在征得患者同意后提供给其临床医生。该摘要包含供医生审阅的就诊前互动概述。

关于安全性、性能、信任与体验的认识

在真实世界临床工作流程中评估对话式医疗 AI 系统,需要考核多项标准,并同时纳入患者和临床医生的视角。我们从多个维度评估了该系统的表现,包括其在真实世界部署中的安全性与可行性、临床推理能力,以及患者和临床医生对互动的感受。结果表明,在监督下将 AMIE 部署用于此项任务不仅可行,而且在对话层面是安全的,并获得了良好反响。

参与情况

本研究纳入了 100 名完成与 AMIE 就诊前互动的成年患者。其中 98 人按计划参加了门诊初级保健预约。患者样本涵盖不同年龄和种族/族裔群体,以及健康素养和技术素养水平各异的人群。与研究期间共计 1,452 次紧急护理就诊相比,参与本研究的患者倾向于更年轻,因为研究期间该诊所全部紧急护理就诊中有一半以上的患者年龄超过 60 岁。不过,在研究期间,全部紧急护理就诊人群倾向于女性和白人,这与本研究中的患者样本一致。

安全性

监督 AMIE 与患者互动的人类 AI 监督员接受了培训,以便在满足四项预先规定的安全标准之一时触发安全停止:

  1. 对自身或他人造成伤害的紧迫担忧
  2. 患者因与 AI 的互动而表现出显著的情绪困扰
  3. 监督员根据对话识别出潜在的临床伤害
  4. 患者明确要求结束会话

在本研究的所有 AMIE 与患者互动中,人类 AI 监督员均未需要触发安全停止,这为 AMIE 在此次真实世界部署中的对话安全性提供了证据。

临床推理

为评估诊断和管理能力,一组未参与紧急护理问诊的临床评估人员以盲法和随机方式,对 AMIE 和 PCP 的鉴别诊断及管理计划进行了评分。每个患者病例由三名临床评估人员审阅并评分,结果基于每例三名评估人员评分的中位数汇总。

对鉴别诊断(DDx)和管理(Mx)方案的盲法评估表明,AMIE 与 PCP 的总体 DDx 和 Mx 方案质量相近,在 DDx 以及 Mx 方案的适当性和安全性方面均无显著差异。然而,PCP 在 Mx 方案的实用性和成本效益方面优于 AMIE。根据就诊后 8 周的病历审查,AMIE 的 DDx 在 90% 的病例中包含最终诊断,top-3 准确率为 75%,并且在最终诊断经诊断检测(实验室、微生物学、病理学或影像学)确认的 46 名患者子集中仍保持较高水平。

鉴于 AMIE 与 PCP 进行推理的情境不同,管理方案在成本效益和实用性方面的这些差距是可以预期的。AMIE 无法获取患者的 EHR,无法进行体格检查,也无法整合多模态用户输入,例如患者的整体外观。PCP 或许能够利用这一丰富的情境优势及其在特定临床环境中工作的经验,制定更具成本效益且更实用的管理方案。

为进一步评估诊断表现,我们将 AMIE 的鉴别诊断与最终诊断进行了比较;该最终诊断是在 PCP 紧急护理就诊八周后通过病历审查确立的。AMIE 在 90% 的病例中成功在其前 7 项诊断可能性中匹配到最终诊断。此外,该系统在所有被评估病例的 56% 中准确地将最终诊断识别为其单一最可能的诊断。

为更好地理解这些诊断能力,我们还根据最终诊断最终是如何确立的进行了亚组分析。病例按照最终诊断是推定性的(由 PCP 在未进行进一步检测的情况下作出)还是更具确认性的(经专科转诊或诊断检测确认,例如实验室、微生物学、病理学或影像学结果)进行分类。虽然 AMIE 在需要通过检测或专科医生进行客观确认的病例中保持了较强的诊断准确性,但在最终诊断纯粹基于 PCP 推定诊断的病例中,该系统的总体准确性往往更高。

信任与体验

除展示安全性之外,我们还探究了患者和医疗服务提供者使用 AMIE 的体验。患者在与 AMIE 互动前、与 AMIE 互动后以及与其医疗服务提供者会诊后完成了 对人工智能的总体态度量表(GAAIS)。与 AMIE 互动后,态度转向更为积极,并在见过医疗服务提供者后仍保持在较高水平。这一变化在两个子量表——感知效用和对 AI 的担忧——以及总体量表上均具有统计学显著性。

患者调查和访谈显示满意度很高,患者普遍认为 AMIE 礼貌,并且能够有效解释医疗状况。

审阅 AMIE 就诊前转录文本的临床医生认为其有用,并指出对就诊准备有可感知的积极影响。在定性访谈中,PCP 指出,AMIE 有助于将就诊动态从简单的数据收集转向数据核实,从而促成更具协作性的对话和共同决策。

局限性与未来方向

本研究提供的证据表明,对话式医疗AI作为现实世界环境中的有用工具,初步具备可行性、安全性与用户接受度,代表着迈向潜在临床转化的关键一步。本研究是一项单中心可行性研究,并显示出一些细微的局限性与改进空间,凸显了我们以安全、负责任的方式生成真实世界证据的重要性。

首先,该研究的纯文本聊天界面无法充分体现临床照护丰富的多模态特性。未来系统或可受益于整合语音或视频交互,或视频功能,从而更好地捕捉非言语线索和体格检查所见。其次,本研究未纳入对照比较,因此不支持就该干预措施相较基线工作流程的疗效作出量化结论。未来研究可在本工作发现的基础上,通过对照比较量化AI对医疗体系的影响。最后,本研究并未详尽探讨既有健康素养、技术素养以及对聊天机器人的熟悉程度等因素如何影响临床环境中与AI系统的交互;了解更广泛人群如何看待这些系统,以及此类因素如何影响交互,仍是未来研究的重要领域。

在本研究中,AMIE与患者之间的交互由一名专职医师“实时”监督,这代表了最大限度保障患者安全的一种范式。我们还在关于以医师为中心的监督的OSCE研究中探索了异步工作流程的可能性。

总之,这项工作提供了重要的实证证据,表明对话式AI在现实世界中对患者和医疗服务提供者可以是安全且有帮助的,我们期待在即将开展的更大规模对照比较研究中进一步评估这些系统的效用与影响。

致谢

本项目是 Beth Israel Deaconess Medical Center、 Beth Israel Lahey Health,以及 Google Research、 Google DeepMind和 Google for Health的多个团队之间的广泛合作。我们感谢本工作的众多合作者、赞助方和审阅者。我们衷心感谢各位共同作者在整个研究过程中的诸多贡献:Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Adam Rodman。

来源:Google Research · research.google