哈佛研究显示:OpenAI o1 在急诊分诊诊断中表现优于两名医生基线

77次阅读
没有评论

共计 1153 个字符,预计需要花费 3 分钟才能阅读完成。

观察视角
围绕事件本身、节奏变化与潜在影响展开。

AI 医疗再次迎来一个值得关注的样本。 一项由哈佛医学院与贝斯以色列女执事医疗中心团队参与的研究显示 , 在真实急诊病例的文本信息评估中,OpenAI 的 o1 模型在部分诊断环节表现出高于医生基线的准确性, 尤其是在信息最少、决策压力最大的急诊分诊阶段。

📌 研究背景: 用真实急诊病例测试大模型

这项研究发表于《Science》, 研究团队由医生和计算机科学家共同组成 , 目标是观察大型语言模型在不同医疗场景中的表现。与许多模拟测试不同, 其中一个实验直接选取了贝斯以色列急诊室的 76 名患者案例。

研究者将两名内科主治医生给出的诊断, 与 OpenAI o1 和 4o 模型生成的诊断进行对比。随后, 另外两名主治医生在不知道诊断来源的情况下进行评估, 以减少主观偏差。

🔍 核心结果:o1 在分诊环节优势更明显

在初始分诊病例中,o1 给出“准确或非常接近”的诊断比例为 67%。作为对照, 两名内科主治医生的相应比例分别为 55% 和 50%。研究主要作者之一、哈佛医学院 AI 实验室负责人 Arjun Manrai 表示, 该模型在多个基准测试中超过了此前模型和医生基线。

💡 不能简单理解为“AI 超过急诊医生”

需要强调的是, 这项研究并未声称 AI 已经可以在急诊室独立做出生死攸关的判断。研究者的表述更谨慎: 这些结果显示, 有必要在真实患者护理场景中开展前瞻性试验。

同时, 外界对结果的解读也存在争议。 急诊医生 Kristen Panthagani 提醒称, 一些标题可能过度放大了研究结论, 因为实验中用于对比的是内科主治医生, 而不是实际长期从事急诊工作的急诊医生。

  • 样本规模有限: 实验涉及 76 名急诊患者, 仍需更大规模验证。
  • 输入形式受限: 研究主要考察文本病历信息, 未充分覆盖影像、体征等非文本数据。
  • 医生类型差异: 对比对象并非专门的急诊科医生, 这会影响结果解读。
  • 责任框架缺失:AI 诊断若进入临床, 仍需要明确问责机制。

📊 行业观察:AI 更像“第二诊断意见”

从这项研究看, 大模型在早期诊断中的价值正在变得具体: 它可以在信息不完整时快速提出候选判断 , 帮助医生扩大思路, 降低漏诊风险。尤其在急诊分诊这类高压场景中,AI 如果能稳定提供可靠提示, 可能成为医生的辅助工具。

但医疗决策并不只是“猜中疾病名称”。 患者沟通、风险取舍、治疗路径选择以及责任承担 , 仍高度依赖临床医生。贝斯以色列医生 Adam Rodman 也提醒, 目前围绕 AI 诊断还没有正式的责任框架, 患者在关键治疗决策中依然需要人类医生引导。

🚀 总结: 亮眼结果之后, 关键是临床验证

围绕“In Harvard study, AI offered”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0