A new benchmark for evaluating patient-facing health AI agents
Amazon Science1627 字 (约 7 分钟)
85
Amazon Science发布PatientAgentBench基准,通过生成合成患者数据和LLM评分,发现健康AI代理在临床场景中的关键缺陷。
入选理由:PatientAgentBench生成合成患者记录和临床情景,评估AI代理在多轮对话中的表现
精选文章#Health AI#Benchmarking#Amazon Science#Clinical AI英文