国产AI登顶全球预测榜单,Milkyway以绝对优势超越Grok-4

129次阅读
没有评论

共计 1269 个字符,预计需要花费 4 分钟才能阅读完成。

Analysis

“AI 预测未来”! 碾压马斯克 Grok-4! 国产 AI 登顶全球

大模型领域迎来一次关键转折。一份名为 FutureX 的全球动态评测榜单近日刷新成绩, 来自中国的智能体系统 Milkyway 以 60.9 分的绝对优势登顶, 将包括马斯克旗下 Grok- 4 在内的众多国际知名模型甩在身后。这场测试的核心, 正是埃隆·马斯克曾断言“对模型智能性最好的测试”——预测未来的能力。

📌 一场关于“预言”的残酷试炼

过去几年,大模型在 MMLU、HumanEval 等传统学术题库中普遍能取得高分, 但商业世界更关心的是:AI 能否预测真实世界的动态?FutureX 评测基准应运而生, 它由字节跳动 Seed 团队、斯坦福大学、复旦大学和普林斯顿大学等机构联合发起, 彻底改变了游戏规则。

与静态题库不同,FutureX 考的是 尚未发生的未来事件。它每天从全球 195 个高质量信源中实时提取新考题, 涵盖微观商业、宏观气候、地缘政治、体育赛事等多个维度, 模型无法通过数据污染“提前背答案”。评测采用“折叠式”评分逻辑, 大幅压缩简单二元事件的权重, 将重点放在深度推理与高不确定性预测上。

  • Level 1: 基础事件, 权重仅 10%
  • Level 2: 有变量的趋势预测, 权重 20%
  • Level 3 与 Level 4: 多步深度推理与极高不确定性的宏观预测, 合计占 70%

这相当于一份“压轴大题”占 70 分的考卷, 直接考验模型在真实场景中的分析与预见能力。

🔍 榜单结果: 国产 AI 的突破与巨头的分化

在 2026 年 3 月 29 日公布的榜单中,北京中关村学院信息智能团队自主研发的 Milkyway 系统以 60.9 分位列第一 。作为对比, 埃隆·马斯克旗下 xAI 打造的 Grok- 4 仅得 25.9 分, 不到 Milkyway 的一半。陈天桥团队的 MiroFlow 框架(搭载 GPT- 5 等) 以 57.5 分紧随其后, 智谱的 GLM-5-thinking、深度求索的 DeepSeek-V3.2-thinking、阿里的千问 Qwen-3.5-plus-thinking 等国产模型也均进入前列。

拆解各模型表现, 可以发现明显的“偏科”现象与能力断层:

  • Grok-4在 Level 1 简单任务中得分高达 71.43, 但在需要深度推理的 Level 3 骤降至 8.21, 暴露了其在复杂不确定性处理上的短板。
  • 第三方 Agent 接入的基础模型 GPT5.2表现惨淡, 仅得 10.3 分, 如同“失去方向感的盲人”。
  • 在细分领域, 各家模型展现出不同优势:GPT- 5 在政治与科技领域领先;DeepSeek-R1 在体育赛事预测中拔得头筹;GPT-5-high 和 Grok- 4 在金融预测任务中找回主场;Claude-Opus 和 Kimi-K2 在零售领域展现出强商业直觉。

Milkyway 和 MiroMind 之所以能在综合榜单上超越这些“偏科”的算力怪兽,关键在于其“Harness 层 (脚手架)”和“验证机制”的深度攻关。它们引入了 DAG(有向无环图) 推理协议和双层验证器, 相当于在模型内部建了一个“风控中台”, 对每一步搜索与推理进行实时审计与纠错。

💡 行业影响: 从“聊天玩具”到“行动引擎”

首先, 套。首先, 套。首先, 套。

正文完
 0