共计 1269 个字符,预计需要花费 4 分钟才能阅读完成。
“AI 预测未来”! 碾压马斯克 Grok-4! 国产 AI 登顶全球
大模型领域迎来一次关键转折。一份名为 FutureX 的全球动态评测榜单近日刷新成绩, 来自中国的智能体系统 Milkyway 以 60.9 分的绝对优势登顶, 将包括马斯克旗下 Grok- 4 在内的众多国际知名模型甩在身后。这场测试的核心, 正是埃隆·马斯克曾断言“对模型智能性最好的测试”——预测未来的能力。
📌 一场关于“预言”的残酷试炼
过去几年,大模型在 MMLU、HumanEval 等传统学术题库中普遍能取得高分, 但商业世界更关心的是:AI 能否预测真实世界的动态?FutureX 评测基准应运而生, 它由字节跳动 Seed 团队、斯坦福大学、复旦大学和普林斯顿大学等机构联合发起, 彻底改变了游戏规则。
与静态题库不同,FutureX 考的是 尚未发生的未来事件。它每天从全球 195 个高质量信源中实时提取新考题, 涵盖微观商业、宏观气候、地缘政治、体育赛事等多个维度, 模型无法通过数据污染“提前背答案”。评测采用“折叠式”评分逻辑, 大幅压缩简单二元事件的权重, 将重点放在深度推理与高不确定性预测上。
- Level 1: 基础事件, 权重仅 10%
- Level 2: 有变量的趋势预测, 权重 20%
- Level 3 与 Level 4: 多步深度推理与极高不确定性的宏观预测, 合计占 70%
这相当于一份“压轴大题”占 70 分的考卷, 直接考验模型在真实场景中的分析与预见能力。
🔍 榜单结果: 国产 AI 的突破与巨头的分化
在 2026 年 3 月 29 日公布的榜单中,北京中关村学院信息智能团队自主研发的 Milkyway 系统以 60.9 分位列第一 。作为对比, 埃隆·马斯克旗下 xAI 打造的 Grok- 4 仅得 25.9 分, 不到 Milkyway 的一半。陈天桥团队的 MiroFlow 框架(搭载 GPT- 5 等) 以 57.5 分紧随其后, 智谱的 GLM-5-thinking、深度求索的 DeepSeek-V3.2-thinking、阿里的千问 Qwen-3.5-plus-thinking 等国产模型也均进入前列。
拆解各模型表现, 可以发现明显的“偏科”现象与能力断层:
- Grok-4在 Level 1 简单任务中得分高达 71.43, 但在需要深度推理的 Level 3 骤降至 8.21, 暴露了其在复杂不确定性处理上的短板。
- 第三方 Agent 接入的基础模型 GPT5.2表现惨淡, 仅得 10.3 分, 如同“失去方向感的盲人”。
- 在细分领域, 各家模型展现出不同优势:GPT- 5 在政治与科技领域领先;DeepSeek-R1 在体育赛事预测中拔得头筹;GPT-5-high 和 Grok- 4 在金融预测任务中找回主场;Claude-Opus 和 Kimi-K2 在零售领域展现出强商业直觉。
Milkyway 和 MiroMind 之所以能在综合榜单上超越这些“偏科”的算力怪兽,关键在于其“Harness 层 (脚手架)”和“验证机制”的深度攻关。它们引入了 DAG(有向无环图) 推理协议和双层验证器, 相当于在模型内部建了一个“风控中台”, 对每一步搜索与推理进行实时审计与纠错。
💡 行业影响: 从“聊天玩具”到“行动引擎”
首先, 套。首先, 套。首先, 套。