A new benchmark for evaluating patient-facing health AI agents
TL;DR · AI 摘要
Amazon Science发布PatientAgentBench基准,通过生成合成患者数据和LLM评分,发现健康AI代理在临床场景中的关键缺陷。
核心要点
- PatientAgentBench生成合成患者记录和临床情景,评估AI代理在多轮对话中的表现
- 实验显示70%的模型存在遗漏危机资源或声称未执行操作的临床缺陷
- LLM-as-a-jury框架可扩展评估AI代理的临床安全性和工作流程遵循度
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- PatientAgentBench评估框架
- 核心机制
- 合成数据生成
- 多轮对话模拟
- LLM评分体系
- 发现的缺陷
- 危机资源遗漏
- 虚假操作声称
- 流程遵循不足
- 应用价值
- 临床安全评估
- 模型改进指导
金句 / Highlights
值得收藏与分享的关键句。
70%的模型在危机场景中遗漏关键资源,如未提供紧急联系信息
LLM-as-a-jury评分体系包含12个临床安全性和工作流程遵循度指标
基准测试显示,模型能力提升与临床缺陷减少呈非线性关系
用于评估面向患者的健康AI代理的新基准 - 亚马逊科学
对话式AI
用于评估面向患者的健康AI代理的新基准
PatientAgentBench 生成合成患者健康记录、真实临床情景描述,以及与被评估AI系统进行对话的患者代理,以捕捉面向患者代理实际需要执行的任务。
作者: Korosh Vatanparvar Ashutosh Joshi 2026年7月29日 6分钟阅读时间
分享
- 复制链接
- 邮件
- X
- 领英
- Line
- QZone
- 新浪微博
- 微信
分享到微信 x
收听
关键要点
- 随着医疗AI从回答问题转向代表患者完成任务,我们需要基准测试来衡量这些系统是否能保障患者安全、准确分析健康记录,并在多轮对话中确定适当的护理级别。
- PatientAgentBench 是专为医疗领域面向患者的AI代理设计的可复现、经临床专家验证的评估标准。它生成合成患者记录、临床情景描述,以及与被评估系统对话的患者代理。由LLM作为陪审团的小组根据可复用标准对每次对话进行评分。
- 在对语言模型家族进行基准测试时,我们发现了反复出现的临床缺陷模式:在紧急情况下遗漏危机资源,或声称执行了从未实际执行的操作。更强大的模型缩小了这些差距但未能完全消除。该框架使大规模评估系统成为可能,从而识别临床安全漏洞并定位改进方向。
这个回答有帮助吗?
当基准测试场景中的虚拟患者告诉AI代理自己感到发烧或绝望时,安全响应与不安全响应之间的差异往往取决于临床设计,而不仅仅是医学知识。随着医疗AI从回答问题转向代表患者完成任务(如安排就诊、管理处方、分诊症状),我们需要衡量真正重要的内容:这些系统是否能保障患者安全、遵循临床工作流程,并帮助患者在真实、多轮对话中实现目标。初级护理已经防范了诊断错误、不安全用药和随访不足;代表患者行事的代理应接受评估,看其如何处理同样的风险。
今天,我们发布 PatientAgentBench——专为医疗领域面向患者的AI代理设计的可复现、经临床专家验证的评估标准。我们还发布了关于即使能力强大的基础模型也存在不足的关键发现,并展示了这些发现如何指导更安全代理的设计。
PatientAgentBench 三阶段流程:情景生成、双代理对话、LLM作为陪审团的评估。
为什么现有基准无法衡量面向患者的智能体AI
大多数医疗AI基准测试可分为两类。第一类测试以静态形式评估医学知识,例如医学考试题答案或简短的医患对话回应。第二类测试使用工具的智能代理,但仅限于面向医疗提供者的技术任务,而非与患者的真实对话。这两类测试都有价值,但都无法体现面向患者的智能代理所需完成的工作:在多轮对话中对患者的健康记录进行推理,判断何时需要收集更多信息、何时采取行动、何时升级处理,同时始终遵循适当的临床安全边界。
单条对话流看似经过统一的评估面板处理,但每条对话内部隐藏的临床复杂性却各不相同:相同的评分标准必须同时适用于常规医疗流程和安全风险的评估。
另一个挑战在于这些基准的评分方式。它们通常依赖定制的、针对每段对话的标准——由医生撰写的评分细则,仅适用于特定的静态对话集。此类标准无法泛化到新的智能代理和新对话场景。一旦数据集公开,它就会成为用于模型训练的公共数据海洋中的一部分,导致模型通过记忆基准答案而非推理来提升分数。
我们构建的内容
PatientAgentBench生成合成患者病历和健康记录,基于该记录生成现实的临床案例,并创建一个能利用这些上下文信息与待评估健康AI系统对话的患者代理。健康AI系统本身也是一个智能代理:基于基础模型的系统,通过控制模块管理其对患者上下文的推理过程,并使用基准的可状态化模拟医疗工具。根据预设的基准场景,该代理需要在多轮对话中收集足够的患者病情信息,对健康记录进行推理,判断适当的护理级别,并正确执行医疗流程。
由超过100项经临床医生审核的评分标准组成的陪审团(LLM-as-a-jury)从六个维度评估健康AI系统——临床安全性、分诊质量、流程准确性、任务完成度、临床帮助性和对话质量。与传统方法中定制的每对话标准不同,这些标准具有可复用性:相同的评分细则适用于任何面向患者的医疗对话,评估者会根据动态生成的患者记录和临床上下文解读每项要求。结合新的场景生成能力,这使基准能够扩展到新的临床领域、新的患者群体和新的模型,而无需额外的医生标注。同时,这也有助于防止训练污染,因为不存在固定的答案标准可供记忆。
该评估面板根据标准对每次对话进行评分,并针对每个维度提供书面说明,解释代理在哪些方面表现良好或存在不足。持证临床医生通过标注所有评估系统的共享对话样本,验证了自动化评估的准确性。在我们的实验中,他们的评分与评审团高度一致,甚至在这些任务上的人类标注者之间的一致性水平上更胜一筹。评审团在安全关键维度上表现出令人安心的保守偏见:自动化面板更可能无谓地标记潜在问题,而不是遗漏真实问题。
所有患者档案、临床叙述和对话均为完全合成数据;在所有阶段均未使用任何真实患者的健康信息。
LLM-as-a-jury评审团根据六个经临床医生审核的维度对每次对话进行评分;最终评分取所有评估者的平均值。
我们的发现
我们对数千个共享的多轮患者对话评估了多个前沿模型家族。在开箱即用的基线代理框架中,即使是最强大的模型也未能达到临床患者护理所需的基准。三个发现尤为突出:
分诊是模型差异最大的领域。最困难的案例并非紧急情况(会触发强安全协议),而是来自临床复杂患者的常规行政请求——例如,一位有多项活跃药物和记录在案心理健康问题的患者要求更新药房信息。大多数模型仅以事务性方式处理这些请求,很少暂停以筛查临床风险。这产生了反直觉的严重性悖论:大多数代理在明显严重案例中的评分实际上高于常规或简单案例,因为明显的紧急情况会触发更强的安全和分诊行为。最困难的案例是隐藏真实风险的常规案例——与研究显示人类诊断错误最常发生的案例类型相同。
安全失败集中在特定模式。主要模式是危机资源遗漏——例如,识别出自杀念头但未能提供热线信息。第二种是临床信息伪造:虚构的医疗提供者资质、假引用、声称执行了实际上未运行的工具。
每个评估代理的总分分布及按评分标准的热力图。分诊质量的分数跨度最广。
这些发现并非针对任何单一模型的谴责,而是指明了领域需要投资的方向。它们还揭示了一个重要事实:模型能力本身并不能保证完美的临床安全性。更强大的模型虽然缩小了临床差距,但并未完全消除这些差距,最强的模型仍然无法处理某些具有临床重要性的案例。这些缺陷只有在持续使用工具并与真实患者记录交互的对话中才会显现,这正是静态知识测试不足以评估接近自主初级护理的系统的原因。除了揭示这些临床差距,我们的基准测试的维度评分和解释还提供了路线图:它们明确指出了在模型选择迭代中应重点关注的领域,以及代理设计必须弥补模型能力无法实现的方面。
与负责任的患者面向AI应有的行为一致,这些代理被设计为支持而非替代患者的医疗提供者:它们不提供明确诊断,而是提供教育信息并转介给临床医生。
开始使用PatientAgentBench
我们已在 GitHub 上发布了 PatientAgentBench 框架。此次发布包含合成场景生成流水线、带状态工具的医疗沙盒、双代理对话运行器,以及包含六个评分标准提示的基于LLM的陪审团评估系统。该框架通过可配置的种子分布按需生成新场景,而非使用固定数据集。
患者的请求在平静的表面流动,而支撑它的临床安全系统则从上方不可见。
研究人员、医疗机构和AI开发者可以使用预定义场景的 PatientAgentBench,或根据自身需求进行扩展,从而大规模评估系统以识别临床安全漏洞并定位改进方向。对患者属性的可配置分布还使团队能够按特定子群体拆分结果,帮助他们分析自身代理的不足之处。要开始使用,请查看仓库中的 README。随着领域向值得信赖的自主患者护理评估标准迈进,我们欢迎所有贡献和反馈。
阅读完整论文:[PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents](#)
研究领域
- 对话式AI
标签
- 医疗健康
- 代理AI
关于作者
Korosh Vatanparvar 是 Amazon Health AI 的高级应用科学家,专注于医疗领域代理AI助手的评估与基准测试。
Ashutosh Joshi 是 Amazon Health AI 的首席应用科学家,专注于从生成代表性及长尾交互到开发基于LLM的裁判系统和人机协作工作流的医疗代理自动化评估。