AI评测背后的华人“出题人”:陈文虎与MMLU-Pro、MMMU的故事

135次阅读
没有评论

共计 1364 个字符,预计需要花费 4 分钟才能阅读完成。

信息整理

AI 成绩单背后, 藏着一位华人“出题人”

在 AI 领域, 每一次前沿模型发布 , 总伴随着几份熟悉的成绩单:MMLU-Pro、MMMU、MMMU-Pro…… 这些名字对普通用户或许陌生, 但对模型公司和研究者而言, 它们已是衡量模型能力的“标准科目”。GPT、Claude、Gemini、Llama、Qwen、DeepSeek 等纷纷在这些基准上交卷。然而, 当所有人盯着分数时, 很少有人知道出题人是谁。这些评测背后, 都指向同一个名字——陈文虎。

📌 旧考卷失灵, 新基准应运而生

  • 重点: AI, 你需要向虎证明自己很聪明。
  • 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
  • 重点: 后续仍需关注官方更新、落地范围以及实际反馈。

MMLU 曾是大语言模型最常用的评测之一, 覆盖多个学科 , 用于衡量模型的知识理解和推理能力。但随着模型能力飙升, 前沿模型在 MMLU 上得分接近 100%, 彼此差距微乎其微。一张大家都考满分的试卷, 已无法区分谁更强、强在哪里。行业亟需一张更难、更不易被“糊弄”的考卷。

2024 年, 陈文虎团队推出 MMLU-Pro。它并非简单扩充题库, 而是彻底改造: 包含 12032 道题, 覆盖 14 个领域, 选项从 4 个扩展到 10 个, 降低蒙对概率; 同时清理简单、歧义题目, 增加推理题。结果显示, 模型在 MMLU-Pro 上准确率比原版下降 16% 到 33%, 且成绩波动更小。这张新卷子不仅更难, 也更稳定, 让优秀模型的真实差距重新显现。

🔍 从语言到多模态:MMMU 与 MMMU-Pro

MMMU 包含 1.15 万道多模态题, 源自大学考试和教材 , 覆盖六大领域、30 个学科。测试中, 当时最强的闭源模型 GPT-4V 和 Gemini Ultra 仅达 56% 和 59% 准确率, 表明多模态模型仍有巨大提升空间。随后, 陈文虎团队推出 MMMU-Pro, 进一步过滤掉仅靠文本就能回答的题目, 并引入 vision-only 设置, 将问题嵌入图像, 迫使模型必须同时理解视觉与文本信息, 杜绝“只看文字猜答案”。

💡“出题人”的背景与理念

陈文虎是加拿大滑铁卢大学助理教授, 谷歌学术引用超 3 万次 。他本科毕业于华中科技大学, 后在德国亚琛工业大学获硕士, 博士毕业于加州大学圣巴巴拉分校。博士期间, 他专注于复杂问答、表格推理等方向, 参与过 HybridQA、TabFact 等项目, 深知模型容易在哪些地方“蒙对”。

博士毕业后, 他进入谷歌研究院 , 后参与 Gemini 多模态模型评估工作。这段经历让他更清楚模型能力的边界, 也更容易发现评测中的漏洞。2022 年他加入滑铁卢大学, 创办“老虎实验室”(TIGERLab), 继续深耕基础模型与评测。实验室不仅做评测, 也研究视频理解、生成模型等, 这种“既出题也做题”的模式, 让评测更贴近真实能力。

📊 行业影响与观察

MMLU-Pro 已被 NeurIPS 2024 收录 , 并集成到 EleutherAI 的评测框架中, 成为开源社区常用工具。许多模型发布时开始报告 MMLU-Pro 分数,Hugging Face 排行榜也将其纳入。这些基准重新定义了模型能力的衡量标准, 让行业拥有更可靠的语言。

🚀 总结

围绕“AI 成绩单背后, 藏着一位华人“出题人””,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0