共计 1659 个字符,预计需要花费 5 分钟才能阅读完成。
Harness 火热, 是因为 AI 终于能管 AI 了。
当 AI 开始管理 AI,开发效率会发生怎样的质变? 近期, 一个名为“Harness”的架构概念在 AI 圈迅速走红, 从 Anthropic、OpenAI 的技术博客到社交媒体讨论, 处处可见其身影。这并非偶然, 而是 AI 智能体开发进入新阶段的标志。
📌 Harness 是什么? 从实际案例看本质
要理解 Harness,不妨从 Anthropic 工程师鲍里斯·切尔尼的实践说起。在开发 Claude Code 过程中, 他创造性地采用“用 AI 管 AI 写 AI 代码”的模式:
- 开启多个 Claude Code 副本, 分别承担编码、评审、审核等任务
- 通过总管的“计划模式”协调工作流程
- 将常见错误、代码风格等指导信息写入 Markdown 文件, 供 AI 自动参考
这种模式下,切尔尼个人每天能发出 10-30 个代码合并请求, 数月无需手动编码。Anthropic 得以实现几乎隔日一次的重大更新频率,Harness 功不可没。
🔍 架构解析: 三层智能体协同工作
Harness 本质上是一个 多智能体协同工作的整体流程。借用电气工程中的“线束”概念, 它统筹的是子智能体与模块的动作功能。具体架构通常包含三层:
- 规划者(Planner): 制定工作流程和任务分配
- 生成器(Generator): 执行具体的代码生成或任务处理
- 评估器(Evaluator): 检查工作质量, 提供反馈
这种架构在 Anthropic 内部评测中表现惊人: 以 Claude Opus 4 为上层智能体、Sonnet 4 为子智能体的多智能体架构, 性能比单一 Opus 4 模型强出 90.2%。
💡 效率与成本: 高性能背后的权衡
高效率往往伴随着高成本。Anthropic 在 3 月的示例中对比了单一模型与 Harness 架构:
编写一个 2D 复古小游戏, 单一模型运行 20 分钟、成本 9 美元, 成品不可用; 全套 Harness 运行 6 小时、成本 200 美元, 成品可用。
数据显示,多智能体架构耗费 token 的速度是普通聊天机器人的 15 倍以上, 但完成复杂任务的效率也同比提升。这促使模型厂商不断升级底层能力——正如 Opus 4.6 所强调的: 更强的模型才能驱动更高效的 Harness。
📊 技术精髓: 传统工程原则的 AI 化实现
有趣的是,Harness 的热潮被一些从业者认为“很不 AI 风”。开源项目从业者赵晨阳指出,Harness 的关键点其实是 用 AI 重新实现传统软件工程原则:
- 文档即代码: 将工作准则保存在智能体的 Markdown 文件, 而非每次对话重复提示
- 关注点分离与单一职责: 将任务拆分为专门版块, 每个子智能体只处理单一事务
- 左移约束: 结构化定义智能体权责, 避免上层智能体自行猜测
Anthropic 研究员尼古拉斯·卡利尼的实验印证了这一点。他花费约 2 万美元 API 额度、并行 16 个子智能体、用时两周生成 10 万行 Rust 代码 , 最终构建出可运行的 C 编译器。他的精力重点不在写提示词, 而在 设计子智能体架构的基础环境——测试、运行、反馈等机制, 让多智能体能够无人工干预自行运转。
🚀 行业观察:AI 开发的三阶段演进
回顾 ChatGPT 问世后的三年,AI 开发范式经历了清晰演进:
- 第一年: 聚焦如何写出更好的提示词, 在聊天窗口调用大模型性能
- 第二年: 让 AI 自动调用不同大模型和 API,Manus 和 AI 智能体概念兴起
- 第三年:AI 学会自动调用本地文件和云端智能体,OpenClaw 和 Harness 架构成为热点
趋势很明显:AI 的调用层级越来越高,任务越来越复杂。Harness 的出现标志着 AI 开发从“单兵作战”转向“团队协作”, 从依赖人工提示转向系统化流程管理。
🧭 总结与展望
Harness 的火热并非概念炒作,而是 AI 开发进入深水区的必然产物。它解决了单一模型在处理复杂、长期任务时的局限性, 通过多智能体协同实现了质效提升。尽管成本较高, 但对于追求极致效率的团队而言, 这种投入正在变得值得。
未来, 随着底层模型能力的持续增强和架构设计的不断优化,Harness 有望从高端应用走向更广泛的开发场景。AI 管 AI, 或许将成为下一代软件开发的标准配置。