Opus 5.5 干一半就停?Anthropic 官方指南揭示 Agent 提前收工的真相

4次阅读
没有评论

共计 1247 个字符,预计需要花费 4 分钟才能阅读完成。

编辑导读

Opus 5.5 干一半就开溜?Anthropic 揭秘: 你的程序替它打了下班卡

让 AI Agent 连夜迁移代码库 , 第二天打开终端却只看到一句「接下来我将处理剩余端点」, 然后就没了下文。这种场景在 Opus 5.5 发布后并不罕见: 模型能力更强了, 但干着干着就停下来, 不催不动。

📌 现象: 能力变强, 却更容易半路收工

Anthropic 在配套提示词指南中直接点名了这类问题: 无人值守的 Agent 汇报完进度后, 停在半路不再继续。原因并不复杂——Opus 5.5 在长任务中会主动同步进度, 而部分沿用旧逻辑的 Agent 程序只认一条规则: 模型不再调用工具, 就视为任务完成。

🔍 四种「优等生习惯」成了停工诱因

  • 纸上谈兵 : 写了一大段总结, 宣布下一步要做什么, 却没调用任何工具。
  • 过分礼貌 : 停下来问「如果您不介意, 我继续处理某某」, 然后原地等待。
  • 假装请示 : 列出需要拍板的决策项, 但这些决策其实不影响它继续干活。
  • 汇报强迫症 : 觉得字数够了或刚做完一个小阶段, 就停下来做总结。

💡 官方三招: 把验收权拿回来

  • 任务清单 : 把大任务拆成细项, 由待办工具维护。回合结束时若清单仍有未完成项且模型未说明卡点, 应用自动发消息让它继续。
  • 铁面验收员 : 事先定好完成标准, 每次回合结束交给更小的模型对照检查, 未达标则把原因塞回去让它返工。
  • 硬刹车 : 同一任务自动续跑两三次仍卡住, 必须强制停下来交给人复查, 避免 API 额度空转。

📊 迁移陷阱: 旧代码为何突然报 400

  • thinking 参数不能再关闭, 也不能手工指定 budget_tokens, 要么不传, 要么设为 adaptive。
  • tool_choice 不能再强制调用工具, 官方建议用 auto 配合严格工具调用。
  • thinking 块绑定了模型和上下文,2026 年 8 月 31 日后创建的账户中途改写历史消息再回放旧块会报错。
  • 旧版电脑操作工具下线,Claude API 和 Google Cloud 上需换成 computer_toolset_20260801。

还有不报错的暗坑: 进度文字被挪进默认不显示的思考块, 界面看起来像卡死 ;max_tokens 覆盖思考加正文总量, 旧上限可能不够用; 思考内容不返回也照样按输出 token 计费。

🚀 成本与设计:medium 已不是当年的味道

既然思考关不掉,effort 就成了调控成本的唯一旋钮。Opus 5.5 支持 low 到 max 五档。官方称 medium 档已能追平甚至超越 Opus 5 的 high 档, 但同时提醒: 同一档位下 Opus 5.5 每回合思考量更大, 旧项目直接搬 high 档会导致 token 数飙升。建议从 medium 起步, 用真实数据测试后再往上调。

🧭 总结: 模型跑得快, 脚手架得跟上

过去怕模型不动脑, 逼它把推理写出来 ; 现在反倒要劝它少想点。过去费尽心思让它按时汇报, 现在它汇报太勤快, 活却停在半路。一个 Agent 能否把活干完, 模型能力只占一半, 另一半取决于你如何定义「完成」、如何保存上下文、如何分配推理预算。下次 Agent 再干到一半就溜, 先别急着骂它偷懒, 回头翻翻自己写的那段循环。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码