共计 1227 个字符,预计需要花费 4 分钟才能阅读完成。
Agent 需要“油表”和“刹车”: 一篇论文, 扒光了 Agent 的“糊涂账”
AI Agent 正在从“能不能干活”进入“干一次要花多少钱”的阶段 。 近期一篇由多所高校研究者发布的预印本论文, 将代码 Agent 的 Token 消耗摊开分析, 指出其成本波动、重复操作和预算不可控, 可能成为企业落地中的关键障碍。
📌 变化: 代码 Agent 的成本不再像普通对话那样可预期
在传统聊天或代码问答场景中,用户通常能大致感知一次交互的长度。但 Agentic 编码任务不同: 它需要读取项目文件、理解上下文、调用工具、运行测试, 并在失败后继续尝试。研究称, 这类任务的 Token 消耗可达到普通代码问答或推理任务的约千倍量级。
更重要的是,花费并不主要发生在“生成代码”上, 而是发生在持续输入上下文上。每多一轮尝试, 模型都可能重新接收文件内容、报错信息和历史操作记录, 输入 Token 因此快速累积。
🔍 原因: 反复探索让 Token 成本失控
论文基于 SWE-bench Verified 等代码任务进行测试, 发现同一任务在不同模型、不同运行之间的成本差异明显。即便是同一模型处理同一问题, 多次运行的 Token 消耗也可能出现较大波动; 跨模型比较时, 最高与最低消耗差距更为显著。
研究者还观察到,高成本运行并不必然带来更好结果。部分高消耗任务中,Agent 会反复查看相同文件、修改相近位置, 形成“绕圈式”探索。论文提到, 在一些高成本运行里, 文件查看和修改中有相当比例属于重复操作。
- 输入膨胀:上下文越堆越长, 计费随之增加。
- 路径不稳定:同一问题可能走出完全不同的调试路线。
- 缺少止损:面对难题时,Agent 往往继续尝试, 而不是及时放弃。
- 模型差异:不同模型的 Token 使用习惯存在明显差别。
💡 核心信息: 模型自己也很难提前估价
一个值得注意的结论是,人类对任务难度的判断, 与 Agent 实际消耗之间相关性有限。开发者认为“改一行就好”的问题,Agent 可能需要先扫描大量文件才能定位; 而看似复杂的算法问题, 模型若已有清晰模式, 反而可能较快完成。
研究还让模型在执行前先检查代码库并预测自身 Token 用量, 但结果并不理想。论文称, 前沿模型普遍存在低估自身消耗的情况, 预测相关性也有限。更尴尬的是, 某些模型进行“估价”本身也会消耗不低成本。
📊 影响: 企业选型需要加入“Token 效率”
这项研究给企业使用 AI Agent 提了一个现实问题: 只比较模型能力和响应速度已经不够。若在规模化代码修复、自动测试、仓库维护等场景中部署 Agent,Token 效率会直接影响预算。
- 任务成功率: 是否真的能解决问题;
- 执行速度: 完成一次任务需要多久;
- Token 效率: 解决同类任务要消耗多少资源。
🚀 总结:Agent 落地要先把账算清
围绕“Agent 需要“油表”和“刹车”: 一篇论文, 扒光了 A”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。