Google Research分享SymptomAI日常症状评估对话研究结果
SymptomAI: Towards a conversational AI agent for everyday symptom assessment
Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。
13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。
很大一部分临床诊断仅凭基于语言的问诊即可得出。这些诊断性问诊通常由临床医生在面对面或远程就诊期间通过医患互动进行。尽管这些互动是症状评估的金标准,但它们往往受到经济,地理,和系统性障碍的限制,从而影响其可及性。当前的语言模型(LMs)在经整理的医学病例研究中接受评估时,已展现出强大的鉴别诊断评估能力,凸显了其支持诊断流程的潜力。然而,现有评估在很大程度上依赖于经整理的、高度详细且有时为合成的患者病例情景,这可能无法反映真实世界的经历和临床表现的变异性。这些评估并未捕捉日常患者如何报告其健康症状,例如医学素养水平不一、信息不完整,以及自然对话中出现的其他复杂性。这构成一个关键缺口,导致人们对语言模型在真实世界情境中的表现仍不确定。
为弥补这一缺口,我们对一组实验性对话原型 AI 智能体开展了一项原位比较研究,这些智能体旨在探索对话式 AI 如何进行端到端症状问诊和鉴别诊断评估,以用于研究基准测试。在我们最近的研究论文“SymptomAI:迈向用于日常症状评估的对话式 AI 智能体”中,我们分享了一项随机全国规模研究(n=13,917)的结果;在该研究中,已同意参与的研究参与者与五种可能的 Gemini Flash 2.0 SymptomAI 智能体之一进行互动。研究期间生成的所有诊断、标签和疾病关联仅用于研究分析,并不构成已确认的临床诊断或官方医学评估。在与 AI 智能体互动两周后,我们请研究参与者报告其在就诊医疗服务提供者时获得的任何诊断。利用这些数据,我们开展了一项临床专家标注研究,将 SymptomAI 的诊断表现与真实临床医生的医学评估进行比较。
在评估 SymptomAI 鉴别诊断(DDx)的准确性之后,我们进一步将 SymptomAI 的诊断与参与者在同 SymptomAI 对话之前一段时间内其 Fitbit 可穿戴设备的生物信号进行比较。我们表明,那些得出传染病病因诊断的 SymptomAI 对话,与可能提示免疫反应的生理趋势相吻合,从而为 SymptomAI 的表现提供了进一步的证据。
工作原理
我们招募了 13,917 名同意参与研究的受试者,每人向五个随机分配的 SymptomAI 智能体之一描述自己的症状,这些智能体在进行症状问诊时的灵活程度各不相同。在这些对话中,参与者描述自己的症状,SymptomAI 提出后续问题,对话最终形成一份 鉴别诊断(DDx,即一份合理诊断列表)以及后续步骤建议。参与者随后可以去看医疗服务提供者,并被要求在两周后通过问卷调查分享该次就诊的结果。为评估 SymptomAI 的评估并建立基线,我们开展了一项临床专家标注研究:由三名经委员会认证的临床医生组成的小组审阅对话记录,并提供他们自己的评估(即鉴别诊断)。然后,每位临床医生以 盲法方式 对 SymptomAI 提供的 DDx 以及其余临床医生提供的 DDx 进行排序。
主要结果
临床专家对 SymptomAI DDx 的偏好
我们发现,在超过 50% 的病例中,临床医生更偏好 SymptomAI 生成的 DDx,而非其他临床医生提供的 DDx。这表明,SymptomAI 的 DDx 与我们临床医生的医学评估相一致的频率,不低于甚至高于其他临床医生的 DDx。
临床专家发现 SymptomAI 的 DDx 更为准确
同样,我们通过 top-5 Accuracy(即参与者的个人医疗服务提供者所提供的真实诊断是否作为五个可能诊断之一出现在 DDx 中)来比较 SymptomAI 生成的 DDx 与真实临床医生提供的 DDx 的准确性。我们让每位临床医生分别判断所提供的诊断是否包含在每一份 DDx 中,包括 SymptomAI 生成的 DDx 以及临床医生提供的 DDx。我们发现,临床医生将 SymptomAI 生成的 DDx 评为准确的频率高于其他临床医生提供的 DDx。
引出更多信息可提升表现
作为这项研究的一部分,我们评估了开展病史采集访谈的不同方法。参与者被随机分配到五个研究臂,每个研究臂采用不同的提示策略。其中两个(Dynamic Live 和 Dynamic Final)被赋予完全自主权,可以提出不受限制的后续问题;另外两个(Fixed Canonical 和 Flexible Canonical)则各自从医学院所教授的一套标准病史采集问题中提问;最后是一个未经提示的 Base LM,代表当前查询 LM 聊天机器人时完全由用户驱动的现状体验。我们发现,所有由智能体驱动的提示策略(即 SymptomAI 主动提出后续问题)均显著优于 Base 条件,表明从参与者处引出信息对于提高鉴别诊断准确性具有价值。
SymptomAI 在低置信度案例上的表现
我们发现,在临床医生对自己的 DDx 最缺乏信心的病例中,SymptomAI 高于临床基线的表现优势最大。
来自 SymptomAI 的诊断与生物信号相关
鉴于 SymptomAI 相对于临床基线的准确性,我们还可以探索其大规模应用的潜力。目前,临床标签的成本阻碍了对人群规模数据集的真实世界分析。像 SymptomAI 这样准确的症状检查系统有潜力实现临床质量诊断的自动化参考标注,从而开启对生理数据的大规模分析——这是目前无法大规模完成的任务。
此类例子之一是将可穿戴生物信号与不同疾病类别相关联。可穿戴生物信号最显著的变化见于急性呼吸道感染。为了在人群规模上研究这一点,我们从同意参与的受试者处收集了其与 SymptomAI 交互之前最多 30 天的每日生物特征数据。我们发现,在临近用户报告症状的数天里,生物信号出现明显变化,表明症状开始出现。重要的是,队列之间的区分是通过对 SymptomAI 的 top-1 候选诊断进行分类,并将被归类为呼吸道感染的诊断分组而得出的。该队列排除了非感染性呼吸道疾病,如 过敏性鼻炎 或 慢性阻塞性肺疾病。这些参与者的可穿戴生物信号变化峰值与症状报告日期相一致,这种相关性可作为与其所报告症状相符的观察性生理证据。
与生物信号相结合的效用
基于 AI 的症状表现评估为新研究打开了大门。通过使用 SymptomAI 分析大量症状报告,并将其与实时 Fitbit 数据配对,我们可以探索广泛疾病范围内的数字生物信号表型。我们的分析显示,在用户进行 SymptomAI 对话之前的数天里,生理指标出现了明显变化——包括心血管功能、呼吸、皮肤温度和睡眠质量。这些客观变化与症状对话的时间高度吻合,为验证患者报告的症状提供了一种潜在方式,或提供被动数据,以帮助结合其症状对话为鉴别诊断提供依据。此外,这种实时可及性凸显了 AI 症状检查工具的一项核心优势。与可能受预约延误影响的传统临床就诊不同,参与者可以在症状仍较新鲜时同步参加 SymptomAI 研究。这有可能提高患者所报告发病时间线的准确性——这是人群规模健康分析的一个关键细节。
局限性
SymptomAI 是一项探索性研究工作,可能代表基于 AI 的症状评估领域的一项重大研究进展,并展示了它为寻求了解自身症状的公众所能提供的潜力。虽然人群部署评估揭示了通过远程患者访谈进行症状评估的准确性,但在与临床医生的评估进行比较时,仍存在微妙的局限性。
首先,鉴别诊断本身就是一项模糊的任务,即便已报告的诊断也可能随时间纵向变化和发展。症状评估是某一时刻的快照,捕捉的是当时所呈现的症状。由于我们部署的规模,我们无法控制症状报告的频率与时机。因此,一些参与者可能在更具代表性的指标出现之前很早就报告了症状,而另一些人则可能在多年慢性病经验之后,基于知情背景报告了明显的指标。未来的工作可以聚焦于症状发展过程中特定时间点的特定疾病,例如早发性代谢综合征,或呼吸道感染开始时讨论的症状。研究期间生成的所有诊断、标签和疾病关联均由人工智能得出,仅用于研究分析,并不构成已确认的临床诊断或官方医学评估。
其次,在我们的评估中,临床医生审阅的是静态聊天记录,并未被赋予自行提出后续问题的自主权。如果由他们主导症状访谈,临床医生可能会凭直觉获取不同的信息。此外,尽管近期研究表明,对话式人工智能系统能够以临床医生级别的细节和准确性采集临床数据,但此类系统可能会遗漏其他信号,例如肢体语言、视觉评估、病历,或在初级保健情境中与患者既有的融洽关系。
总之,我们介绍 SymptomAI,一种用于开展真实世界患者访谈和症状评估的研究性对话式人工智能代理。我们通过人群样本上的 DDx 准确率展示了 SymptomAI 的端到端真实世界表现,并说明 SymptomAI 的诊断如何能够支持对可穿戴生物信号等人群规模信号的分析,以识别生理信号与所报告疾病之间的关联。
致谢
这项工作是 Joe Breda、Jake Sunshine 和 Daniel McDuff 同等贡献的成果。我们感谢来自 Google Research 和 Google DeepMind 的共同作者与合作者对本工作的贡献。
来源:Google Research · research.google