AI考上东大京大却栽在世界史论述题:理科高分背后的能力边界

71次阅读
没有评论

共计 1122 个字符,预计需要花费 3 分钟才能阅读完成。

看点

准大学生“反击指南”。

重点阅读

AI 理科碾压人类状元, 却被这道“文科题”戳中了死穴 …

AI 已经能在顶尖大学入学考试中拿到惊人成绩,但它并非没有短板 近期一场围绕东京大学、京都大学入学试题的闭卷盲测显示,ChatGPT 5.2 Thinking 在部分理科考试中超过人类高分考生; 不过, 在需要长线组织和历史叙事的世界史论述题上, 它的表现明显失速。

📌 闭卷盲测:AI 在东大、京大理科考试中高分通过

这次测试由 LifePrompt 与日本补习机构河合塾合作进行,特点是“闭卷”和“物理断网”: 模型不能联网检索, 只能依靠既有训练能力完成试题。

在东京大学理科三类相关考试中,材料显示满分 550 分,ChatGPT 5.2 Thinking 取得 503 分; 作为参照, 当年录取考生中的最高分为 453 分。京都大学医学部考试中,AI 也取得 1176 分, 高于人类最高分 1098 分。

值得注意的是, 这类结果更适合被视为一次特定条件下的能力观察, 而不是对所有考试场景、所有模型表现的普遍结论。

🔍 数学满分之外, 世界史论述题只拿 25%

问题并不只是“知识点记不住”。世界史论述通常要求考生把多个时代、地区、制度和经济因素串联起来 , 说明因果关系, 并在有限篇幅内形成清晰论证。换句话说, 它考查的是 结构化表达、主题控制和宏观叙事能力

💡 短板指向: 大模型仍难稳定驾驭长逻辑

这类现象在长文本生成中并不罕见: 句子层面看似流畅,段落之间也能衔接, 但整体目标、论证路线和结论呼应未必稳定。对于历史论述、政策分析、复杂项目方案等任务来说, 真正困难的部分往往不是“写出内容”, 而是持续维持一条清晰主线。

📊 重点阅读: 对学生和职场人的三个启发

  • 机械刷题价值下降:在规则清晰、答案可验证的任务中,AI 的性价比和速度会持续提高。
  • 结构化能力更重要:提出问题、拆解任务、设计框架、整合输出, 将成为人类使用 AI 时的关键能力。
  • 复杂现实仍需人来判断:谈判、组织协作、利益协调、责任承担等场景, 涉及信任、情绪和价值判断, 不能简单交给模型完成。

🚀 行业观察: 会用 AI 的人, 可能比会做题的人更有优势

这场考试并不意味着 AI 已经全面替代高水平学生,也不意味着文科天然安全。更准确的说法是:AI 正在快速吞掉大量标准化、可拆分、可评分的任务, 而人类需要向更高层的组织、判断和决策环节移动。

未来更有价值的能力,可能不是单纯比 AI 算得快、背得多, 而是能够把一个模糊问题转化成可执行路径, 再利用 AI 完成检索、推演、草拟和校对, 最后由人完成取舍与定稿。

因此, 这次“理科高分、论述低分”的对比,真正值得关注的不是 AI 又考了多少分, 而是它把能力分界线画得更清楚了: 标准化知识正在被压缩, 统领复杂问题的能力正在变得更稀缺。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0