共计 1077 个字符,预计需要花费 3 分钟才能阅读完成。
AI 医疗正在进入更难的考场。 一项发表于《科学》的新研究显示 ,OpenAI 的一款推理模型在真实临床病例测试中, 已能在诊断和治疗方案制定上达到人类医生水平, 并在部分场景中展现出更好的表现。
📌 研究不只考“标准答案”, 而是模拟真实急诊
这项研究由哈佛医学院与贝斯以色列女执事医疗中心的研究人员完成。 与常见的受控医学问答测试不同 , 研究重点放在真实临床环境: 病历信息可能不完整、记录格式不统一, 患者状态也会持续变化。
研究团队让模型在多个诊疗节点作出判断, 覆盖从急诊分诊到住院治疗等环节 。关键限制是: 模型每一步只能使用当时医生已经掌握的信息, 不能提前看到后续检查结果。
🔍 一个典型病例:AI 提示被忽视的狼疮线索
研究中提到, 一名患者因肺栓塞进入急诊 , 治疗后一度好转, 但随后病情再次恶化。医生最初怀疑药物未能发挥效果, 而 AI 模型基于当时可用的电子健康记录, 提示患者可能存在狼疮病史。
狼疮是一类自身免疫性疾病, 可能引发心脏炎症 。后续结果显示, 模型指出的方向是正确的。这个案例也说明,AI 在面对复杂病情变化时, 可能帮助医生从大量文本病历中捕捉到容易被忽略的关联。
💡 几个重点: 模型强在哪里
- 能处理混乱文本: 模型主要依赖电子健康记录等文本信息, 在不规整数据中寻找线索。
- 适应动态场景: 测试覆盖患者病情变化过程, 而非一次性给出完整病例。
- 鉴别诊断表现突出: 在同时考虑多种疾病可能、逐步排除的任务中, 模型表现优于早期系统。
- 对照结果较强: 研究显示, 在相同信息限制下, 模型表现超过两名经验丰富医生; 在其他标准化诊断挑战中, 也超过了一组医生基准。
📊 重点阅读: 它还不能替代医生
研究人员也强调, 这项结果并不意味着 AI 应该取代医生 。当前模型完全依赖文本病历, 尚未处理医学影像、声音、体征表现和非语言线索, 而这些都是真实诊疗中非常关键的信息。
此外, 临床系统能否真正落地, 不能只看诊断准确率 。更重要的问题包括: 它是否能改善患者结局、是否会带来新的误判风险、医生如何理解和采纳其建议, 以及医疗责任如何划分。
因此, 更稳妥的定位是:AI 有机会成为临床决策支持工具, 尤其适合急诊科这类节奏快、时间紧、信息不完整的环境 , 用来辅助医生整理线索、提出可能方向和补充鉴别诊断。
🚀 行业观察:AI 医疗进入“真实世界验证”阶段
围绕“哈佛新研究:AI 模型“急诊科”场景诊断能力有望超越人类”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。