共计 1169 个字符,预计需要花费 3 分钟才能阅读完成。
AI 看病成为医患新包袱? 补上「多轮追问」, 通用 AI 才迈得过医疗关
“上午看了 30 个号,25 个病人是带着 AI 结论来的 。”这句来自三甲医生的无奈吐槽, 折射出当下医疗场景的新痛点: 患者习惯把症状、化验单丢给通用大模型, 再拿着 AI 的“诊断”去求证医生, 结果不仅没提高效率, 反而加重了医患沟通负担。
📌 从单轮问答到多轮追问
- 重点: M4 是大脑, 百小医是身体
- 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
- 重点: 后续仍需关注官方更新、落地范围以及实际反馈。
M4 最核心的变化, 是让模型学会“提问”。基于 SCAN-bench 2.0 体系, 训练场景从单次标准化问诊扩展为多轮访视与复杂患者画像。在动态问诊评测中,M4 初诊得分 79.0、复诊 74.7, 均领先其他顶尖模型。以百川 C 端产品“百小医”为例, 一位用户半夜突发急性脚痛, 百小医连续追问了 10 轮, 从饮食结构到发作频率, 逐步锁定痛风风险。这种“连续追问 10 轮”不是闲聊, 而是通过信息补全逼近真实门诊流程。
🔍 循证引用: 每一句结论都有据可查
医疗 AI 最怕“一本正经胡说八道”。M4 构建了原子化临床路径体系 , 将复杂指南拆解为 1000 余个可复用决策单元, 覆盖 200 余种常见疾病。更重要的是, 它引入了更严格的证据锚定机制——每一句结论都能精确落到原文的具体段落, 而非像通用模型那样甩一串“对不上号”的文献。在 Baichuan-EBM 评测中,M4 的循证引用精度达到 90.0, 远高于 GPT-5.5 的 54.7。
💡 全病程记忆: 记住一个人, 才能看好病
真实的诊疗很少在一次问诊结束。M4 推出“全病程记忆”, 打通历史病历、多轮问诊、化验趋势与用药反馈, 让模型在多次对话中始终掌握患者是谁、既往病史如何。在长上下文临床记忆评测中,M4 取得 86.9 分, 较上一代提升 21.1 分。一个典型场景是: 子女在家庭群聊中随口提到“最近走一圈就喘”, 百小医结合长期健康记录与既往病史, 主动提醒可能存在早期心功能不全风险, 最终促成就医。这种细碎线索, 通用大模型几乎无法捕捉。
📊 Harness 调度: 让 AI 自主决策诊疗路径
围绕“AI 看病成为医患新包袱? 补上「多轮追问」, 通用 AI 才迈得”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。
🚀 双医模式:AI 做诊室外的“健康管家”
百川的最终目标是形成“双医模式”: 医生负责诊断与治疗决策,AI 负责诊室外的长期陪伴、信息整理和风险提醒 。M4 是大脑, 百小医是身体, 两者结合将专业级医疗能力送入家庭场景。在中国医学科学院肿瘤医院的 75 个患者群测试中, 百小医安全性达 99.6%, 深度互动率 60%-73%。这一模式有望填补诊室外 95% 的时间空白, 让健康管理真正连续起来。