共计 1102 个字符,预计需要花费 3 分钟才能阅读完成。
谁在给大模型出题、卖题、判卷? 聊聊 AI 数据行业的野蛮生长
📌 钱先到了: 估值在一年内连跳几级
为模型公司提供训练数据的新公司,正在快速长大。AfterQuery 今年 4 月宣布 A 轮融资时估值 3 亿美元, 到 9 月, 据媒体报道新一轮融资已将其估值推至 32 亿美元。另一家提供训练数据与智能体环境的公司 Bespoke Labs, 也在 7 月宣布种子轮与 A 轮合计融资 4000 万美元。
🔍 需求转向: 从“打标签”到“搭环境”
过去提到数据标注,人们想到的多是给图片打标签、给模型回答打分, 核心任务是为预训练准备海量语料。变化出现在推理模型跑通强化学习之后: 训练需要可验证的信号, 代码和数学天然容易验证, 而医疗、金融、基础指令遵循等任务并没有结构化的标准答案。
于是评分细则 (rubric) 成为过渡期的关键方案——由领域专家写下打分规则,再让较弱的模型照着规则判卷, 也就是业内常说的“弱模型监督强模型”。而当模型开始真正执行任务, 交付物又进一步变成包含任务定义、工具、沙盒和验证机制的强化学习环境。验证方式也分化出程序化检查、rubric、人类偏好等不同流派, 业界尚未形成统一共识。
💡 谁在做这门生意: 玩家基因差别很大
- 招聘系:Mercor、Handshake 等从招聘起家, 靠自动 AI 面试在较短时间内搭建专家网络;
- 传统数商:Scale AI 从众包网络出发, 优势在于数据与人员质检上积累的经验;
- 研究工程系:BigCode、Snorkel AI 等偏代码、工具调用类的环境生产;
- 垂直与经纪: 小团队深耕单一领域, 甚至出现手握版权数据、负责撮合买卖的数据经纪商。
此外, 一些具身智能公司因大量投入数据建设,也顺势做起了数据生意。何允中认为, 行业的饼还在变大: 大数商有资源优势, 小团队在垂直领域同样有机会。
📊 卖数据与做评测, 并不是一回事
榜单分数上涨,未必等于真实用户体验改善。由加州大学伯克利分校 RDI 与 300 多位行业专家共同构建的 Agents’Last Exam, 思路是让专家提交自己做过的项目, 并为任务配备执行环境与验证机制, 检验智能体能否完成耗时较长、具有经济价值的工作。其初衷是: 如果模型刷的是有意义的题, 提升就能落到日常工作里。
🚀 总结: 门槛正在从“人多”转向“懂行”
AI 数据行业的竞争,已经从“谁的人多”转向“谁更懂某个领域的真实工作流”。对模型公司而言, 买到的不再只是标注量, 而是一套可验证的任务与机制; 对数据公司而言, 真正的壁垒在于能否找到懂行的人, 并把专业知识与工作经验转化为模型可以学习的信号。这条链条的透明度依然有限, 却在相当程度上决定了大模型下一阶段的进步速度。