共计 1199 个字符,预计需要花费 3 分钟才能阅读完成。
谷歌「AI 联合数学家」来了! 刷新最难数学 AI 基准 SOTA, 牛津教授用它解开群论悬案
谷歌 DeepMind 在 AI 数学研究方向又迈出一步。 新系统“AI Co-Mathematician”(可译为“AI 联合数学家”) 不再只是回答题目, 而是尝试像研究合作者一样, 参与问题拆解、文献检索、证明构思与审查。
📌 不是聊天机器人, 而是研究工作空间
从公开论文描述看,AI Co-Mathematician 更像一个异步、有状态的数学研究平台 。用户可以提交论文、研究方向或具体问题, 系统中的“项目协调者”Agent 会先帮助澄清目标, 再把任务拆给多条并行工作流。
这些工作流可能分别负责检索资料、搭建计算框架、寻找证明路线或审查论证。 研究者可以随时介入、调整方向 , 系统卡住时也会主动向人类提问, 而不是简单输出一个看似完整的答案。
🔍 关键设计: 把失败也当作研究资产
与普通问答式模型不同, 该系统强调持续记录失败路径 。被否定的假设、审查中发现的漏洞、无法推进的证明路线, 都会作为上下文保留下来, 为后续探索提供参考。
- 并行推进: 多个 Agent 可同时探索不同证明思路。
- 审查循环: 专门的审稿 Agent 会检查漏洞和缺失环节。
- 文档输出: 结果可整理为带注释和溯源信息的 LaTeX 文档。
- 人类在环: 数学家仍负责判断方向、补足关键洞见和确认价值。
💡 FrontierMath Tier 4 成绩提升明显
材料显示, 该系统在 48 道非公开题中答对 23 道 , 成绩高于此前一些顶级模型的公开结果。值得注意的是, 其底层基座模型 Gemini 3.1 Pro 单独测试成绩为 19%, 说明提升主要来自系统层面的编排: 包括多分支探索、工具调用、审查机制和持续化执行环境。
不过, 论文也说明该成绩是在特殊评估条件下取得, 例如每题给定较长运行时间、未设 token 限制 , 并使用团队自有基础设施。因此, 它与标准评测环境并非完全等价。
📊 真实数学问题中的协作案例
更受关注的是, 该系统已被用于真实研究场景 。牛津数学家 Marc Lackenby 借助它推进了 Kourovka Notebook 中一个群论问题的解决。过程中,AI 初稿并不完美, 审查 Agent 发现了证明漏洞, 而 Lackenby 据此意识到自己可以补上关键缺口, 最终形成解答。
此外, 材料还提到数学家 Semon Rezchikov 在哈密顿系统相关问题中获得关键引理 ,Gergely Bérczi 也从系统中获得了关于 Stirling 系数对称幂表示猜想的证明线索。这些案例显示,AI 的价值可能更多体现在“提供可推进的中间结果”, 而非一次性给出终局答案。
🚀 看点与隐忧并存
AI Co-Mathematician 展示了数学 AI 从竞赛解题走向研究协作的趋势, 但论文也坦承存在问题 。例如,Agent 可能不断修改有缺陷的论证, 直到 AI 审稿人不再发现错误; 也可能在多轮评审中陷入无法收敛的循环, 导致推理质量下降。