跳到正文
原文
Google Research·· 2026-08-12精选AI 评分67

Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

Advancing AMIE towards expert-level audio-visual clinical consultations

AI 导读

Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

推荐理由

随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

正文 · AI 翻译

当医生接诊患者时,问诊远不止于双方交换的言语。医生会观察患者的步态,留意可见的不适体征,注意其呼吸,并引导患者完成体格检查动作。这一持续的视觉与听觉信息流会与口述的临床病史无缝整合。这些非言语的视觉与听觉线索对于有效诊断、患者信任和临床沟通至关重要。

具备临床推理与对话能力的人工智能系统有望大幅提高医学专业知识与医疗服务的可及性,从而促成这样一种未来:医生可以将时间集中在医患互动中最有意义的方面。在早期工作中,Articulate Medical Intelligence Explorer(AMIE)——我们用于临床推理与对话的研究型人工智能系统——在基于文本的诊断对话中展现出专家级表现,并被证明可有效作为临床医生的鉴别诊断辅助工具。最近,我们将 AMIE 的能力推进到诊断之外,转向随时间推移治疗和管理疾病。

我们还将 AMIE 的能力扩展到专科级评估,涵盖肿瘤学、心脏病学和眼科学,以及多模态诊断推理(对象为图像和临床文档),这些均在有患者演员参与的模拟环境中进行。与此同时,我们已开始将这些研究进展转化为临床实践,途径包括一套以医生为中心的监督框架,以及我们首批真实世界临床研究,其中包括一项临床可行性研究(合作方为Beth Israel Deaconess Medical Center),以及一项正在进行的全国性随机研究(合作伙伴为Included Health)。

尽管取得了这些进展,我们的研究仍存在一项根本性制约:基于文本的界面舍弃了临床实践的视觉与听觉维度。患者必须将复杂的身体症状转化为书面描述,这一过程会丢弃诊断信息,并可能对数字素养或健康素养有限的患者产生负面影响。纯文本系统既无法独立观察那些为临床推理提供依据的视觉与听觉线索,也无法引导患者完成塑造鉴别诊断的体格检查动作。

今天,在“迈向用于实时视频问诊的专家级医疗人工智能”中,我们展示了实时视频配置的 AMIE,即 AMIE (Video),用以应对这些限制。AMIE (Video) 构建于Gemini和Project Astra之上,可进行同步临床视频问诊,感知非言语临床线索,引导患者演员完成虚拟体格检查,并开展诊断推理,且全部实时进行。在一项包含 100 个场景、300 次实时问诊以及一组 30 名经委员会认证的初级保健医生(PCP)的多臂随机研究中,我们首次展示了一个在实时临床视频问诊中展现专家级表现的人工智能系统。

AMIE (Video):一种异步多智能体架构

要通过视频开展有效的临床对话,必须在相互竞争的需求之间取得平衡:系统既要以自然的对话速度回应患者,又要同时进行审慎的临床推理,并持续处理视觉与听觉信息流。目前,单一智能体无法满足所有这些要求。深度推理需要时间,但对话中的停顿会削弱患者的信任与融洽关系。

为应对这一挑战,AMIE (Video) 采用异步多智能体架构,将工作分配给三个持续并行运行的专用智能体:

  • Talker 智能体:面向患者的智能体负责驱动响应迅速、低延迟的语音交互。它在纳入其他智能体指导的同时,维持自然的对话流畅度。
  • Planner 智能体:该智能体在后台运行,持续优化系统的临床推理,更新鉴别诊断与管理计划,同时识别信息缺口,并重新排定各项临床目标的优先级。
  • Perception 智能体:该智能体持续审阅音频与视频流,识别具有临床意义的非语言线索(例如可见的痛苦迹象、体格发现或听觉信号),并将这些观察置于正在进行的对话情境中加以理解。

这种解耦设计使 AMIE (Video) 能够在保持自然对话延迟的同时,完成否则会带来不可接受延迟的诊断推理与视听感知。自动化评估证实,这一三智能体架构中的每个智能体,都对临床指标的提升作出了重要贡献,例如病史采集能力、临床推理与治疗建议,以及对与对话质量相关的指标,包括以患者为中心的沟通技能和响应延迟。

以自动化评估引导开发

构建视听医学 AI 的一项关键挑战,是大规模刻画系统的感知与推理能力。为引导开发,我们依据医学文献归纳出一套与远程医疗相关的临床视听能力分类体系,涵盖非语言视觉线索、听觉信号和体格检查操作。随后,我们围绕该分类体系构建了一套自动化评估工具。

该评估框架将有针对性的单轮视听评估与多轮模拟音频问诊相结合。单轮视听评估检验临床感知与推理的具体实例(例如,正确识别解剖左右侧,或识别呼吸窘迫的迹象)。多轮模拟音频问诊则评估端到端的对话表现,同时将视觉线索以文本描述的形式注入模拟中(例如,在帕金森病场景中,被提示展示笔迹的 AI 患者模拟器可能会注入这样的口头描述:“[holding up paper to camera showing cramped, tiny script]”)。这些互补的评估共同实现了系统设计的快速迭代,并在人工评估之前充分刻画了 AMIE (Video) 的能力与失效模式。

通过随机视频研究进行评估

为了在更具挑战性且更贴近现实的端到端视听临床问诊场景中评估临床能力,我们开展了一项大规模随机客观结构化临床考试(OSCE)研究,并采用同步视频问诊界面。

为了在评估中覆盖广泛的疾病情况,该研究涵盖100个临床情景,涉及五个身体系统,包括心肺、腹部、头/眼/耳/鼻/喉(HEENT)、神经/精神以及肌肉骨骼疾病。15名经过培训的患者演员在三个研究组中完成了300次标准化问诊:

  • AMIE (Video):采用视频配置的AMIE进行实时视频问诊。
  • AMIE (Text):仅文本版本,作为基线,用以分离视听能力的贡献。
  • PCP (Video):10名经委员会认证的PCP通过同一视频界面进行问诊。

一个由20名经验丰富的初级保健医生组成的独立小组,使用既定的临床评分标准对所有问诊进行了评估,既包括通用临床能力量表,也包括针对每个情景量身定制的详细病例特异性评分标准。

主要结果

专家级临床表现:在核心临床能力、病史采集的全面性、诊断准确性、处置适当性以及沟通质量方面,临床评估者对AMIE (Video)的评分与PCP相当。在这些维度上,AMIE (Video)也达到或超过了AMIE (Text)。

体格观察与检查方面的优势:在引出体征并主动引导患者演员完成虚拟检查操作方面,AMIE (Video)的平均评分显著高于PCP和AMIE (Text)。这一优势也体现在病例特异性的感知与检查评分标准得分中。

患者演员更偏好视频体验:与基于文本的聊天相比,患者演员强烈偏好同步视频界面,认为其使用起来显著更容易,并且在沟通健康问题方面更有效。与PCP和AMIE (Text)相比,他们还在共情、融洽关系以及对诊疗的信心方面对AMIE (Video)给予了更积极的评价。

局限性与负责任的开发

这项研究存在重要局限性,必须在这些局限性的背景下解读这些结果。本研究完全由专业患者演员在模拟临床环境中完成,而非由真实患者就其自身健康状况就诊。无论患者演员多么熟练,都无法完全复现真实临床问诊的复杂性与不可预测性,且情景仅限于能够通过表演真实呈现的病症,遗漏了那些视听感知具有诊断意义的重要临床表现。在本研究范围之外,有针对性的自动化评估发现,尽管整体对话质量与诊断准确性较高,仍偶发感知与推理错误,且系统仍存在可能破坏对话自然度的间歇性技术问题。鉴于 Project Astra 的原型性质,这包括未来开发可能在系统层面解决、并超出本工作所探索的特定医疗应用的技术考量。在能够就真实世界效用得出任何结论之前,必须在真实患者与真实临床状况的研究中评估这些发现,这是必不可少的下一步。

展望未来

这项工作表明,从基于文本的临床 AI 向视听临床 AI 的转变能够以专家级质量实现。AMIE (Video) 能够应对临床实践中丰富的感知信息,观察非语言线索、指导体格检查,并通过口语对话自然交流——这些能力更接近远程医疗视频问诊的体验。

在通往负责任的真实世界证据的道路上,仍有重要问题有待解答。我们的发现需要在真实患者中得到验证,扩展到无法通过表演呈现的临床表现,并由稳健的安全框架加以支持。我们已在这一方向迈出初步步伐:与 Beth Israel Deaconess Medical Center 合作的一项真实世界可行性研究为基于文本的 AMIE 在临床实践中的安全性与实用性提供了初步证据,而我们与 Included Health 合作的正在进行的全国性随机研究正在进一步评估 AI 在真实世界虚拟医疗中的表现。这些研究经验将共同为如何负责任地将视听能力整合到临床实践中提供参考。尽管仍有许多工作要做,这些结果标志着迈向有朝一日能够通过应对临床实践的感官复杂性来增强医疗服务的 AI 系统的重要里程碑。

致谢

此处所述研究是 Google Research 与 Google Deepmind 多个团队的共同工作。我们感谢所有共同作者——Mahvish Nagda、Jihyeon Lee、Matthew Thompson、CJ Park、Tim Strother、Valentin Liévin、Roma Ruparel、Akshay Goel、Teya Bergamaschi、Suhana Bedi、Meet Shah、Pavel Dubov、Liviu Panait、Toshiyuki Fukuzawa、Sam Schmidgall、Craig Schiff、Joseph Xu、Aliya Rysbek、Yana Lunts、Jan Freyberg、Rebecca Hemenway、Sunny Virmani、David Racz、Carey Radebaugh、Joëlle Barral、Kavi Goel、Dale R. Webster、Katherine Chou、Avinatan Hassidim、Yossi Matias、James Manyika、Gregory Wayne、Tao Tu、Yun Liu、Ethan Goh、Christina Chen、Ryutaro Tanno 和 Cameron Chen。

来源:Google Research · research.google