谷歌研究院宣布,其实验性医疗人工智能系统 AMIE 在实时临床视频咨询中展现了专家级的性能,这标志着人工智能系统首次在同步视听医疗中与经过委员会认证的医生进行匹配。该研究结果于 2026 年 8 月 11 日发布,是人工智能辅助医疗保健发展的一个重要里程碑。
在一项涉及 100 个临床场景、300 次现场咨询以及由 30 名经过委员会认证的初级保健医生组成的小组的多组随机研究中,AMIE 的视频配置在核心临床能力方面的评级与人类医生相当。谷歌研究院官方博客上的一篇文章详细介绍了这项研究,评估了诊断准确性、病史采集彻底性、管理适当性和沟通质量。对于关注人工智能研究和医疗保健进展的读者,AI Buzz Wire 的最新人工智能发展 提供持续报道。
AMIE 视频的工作原理
AMIE(视频)基于 Google Gemini 模型和 Project Astra 构建,通过视频界面进行同步临床咨询。该系统可以感知非语言临床线索,指导患者进行虚拟体检,并实时进行诊断推理。
为了实现这一目标,Google 设计了具有异步多代理架构的 AMIE,该架构将工作分配给三个连续并行工作的专门代理。 Talker 代理处理面向患者的语音交互,保持自然的对话流程,同时结合其他组件的指导。 Planner 代理在后台运行,不断完善临床推理、更新鉴别诊断并识别信息差距。感知代理不断审查音频和视频流,识别临床相关的非语言线索,例如明显的痛苦迹象、身体发现或听觉信号。
这种解耦设计解决了对话式医疗人工智能的基本挑战。深入的临床推理需要时间,但对话的停顿会侵蚀患者的信任和融洽关系。通过分离代理,AMIE 可以保持自然的会话延迟,同时执行复杂的诊断推理和视听感知。
研究设计和主要结果
该研究采用客观结构化临床考试格式,这是评估医学教育临床能力的黄金标准。 15 名经过培训的患者参与者在三个研究组中进行了 300 次标准化咨询:视频模式下的 AMIE、作为基线的纯文本模式下的 AMIE,以及 10 名经过委员会认证的初级保健医生通过同一视频界面进行咨询。
由 20 名经验丰富的初级保健医生组成的独立小组使用既定的临床评分标准对所有咨询进行了评估,包括一般能力量表和针对每种情况量身定制的具体病例评分标准。
结果是惊人的。在核心临床能力方面,临床评估人员对 AMIE(视频)的评价与初级保健医生相当。 AMIE 在引出身体体征和通过虚拟检查操作主动指导患者方面的评分也显着高于医生和纯文本基线。
与基于文本的聊天相比,患者参与者强烈喜欢视频体验,认为它更容易使用,并且对于传达健康问题更有效。与人类医生和纯文本版本相比,他们还对 AMIE(视频)在同理心、融洽关系和护理信心方面给予了好评。
限制和负责任的开发
谷歌强调,这项研究有重要的局限性。该研究完全是由专业患者演员在模拟临床环境中进行的,而不是由真实的患者展示自己的健康状况。患者演员无论多么熟练,都无法完全复制真实临床遭遇的复杂性和不可预测性。
这些场景也仅限于可以通过表演真实描绘的条件,省略了视听感知对诊断具有重要意义的重要临床表现。尽管总体对话质量和诊断准确性很高,但有针对性的自动评估偶尔会出现感知和推理错误。
谷歌指出,在得出有关现实世界效用的任何结论之前,下一步至关重要的是对真实患者和真实临床条件的研究结果进行评估。该公司已经朝这个方向采取了早期措施,包括与贝斯以色列女执事医疗中心进行的现实世界可行性研究以及与 Included Health 正在进行的全国随机研究。
医疗人工智能的前进之路
AMIE 结果发布之际,人们对人工智能辅助医疗保健的兴趣日益浓厚。 2026年6月,《自然》杂志发表的一项研究发现,人工智能医疗工具在诊断和治疗决策方面可以与医生媲美甚至超越医生。谷歌的 AMIE 研究将这项工作扩展到视听领域,证明人工智能可以与临床实践的丰富感知相结合。
谷歌的研究人员警告说,虽然从基于文本的人工智能到视听临床人工智能的转变可以在模拟环境中以专家级的质量实现,但在负责任的现实世界部署的道路上仍然存在重要问题。研究结果需要通过真实患者进行验证,扩展到涵盖无法通过模拟实施的临床表现,并得到强大的安全框架的支持。
保持人工智能领先地位
对人工智能和医学交叉领域的最新突破感兴趣吗? 阅读更多人工智能新闻 在 AI Buzz Wire 上深入报道人工智能研究、医疗保健创新和改变患者护理的技术。
