共计 1597 个字符,预计需要花费 4 分钟才能阅读完成。
在 AI 技术快速迭代的今天,一个名为“Harness”的概念正悄然走红。它并非指某种新型模型, 而是一种让 AI 管理 AI 的架构方法。从 Anthropic 到 OpenAI, 多家头部公司近期都在技术博客中提及这一理念, 引发行业广泛讨论。
📌 Harness 是什么? 从实际案例说起
要理解 Harness,不妨先看一个真实的应用场景。Anthropic 旗下 Claude Code 的负责人鲍里斯·切尔尼曾公开分享其开发历程: 随着工作量增加, 团队开始用 Claude Code 编写自身的代码, 并用 AI 来管理这些写代码的 AI。
切尔尼会在工作中开启多个终端标签页,每个都运行独立的 Claude Code 副本。任务从“计划模式”开始, 流程大致分为三步:
- 第一批子副本负责编写代码;
- 第二批子副本担任评审员, 检查代码的边界条件、风格一致性等;
- 第三批子副本审核评审工作是否符合文档要求。
常见错误、代码风格、常用命令等会被总结写入总管的文档中,作为后续 AI 自动写码的指导。在这种“AI 管 AI 写 AI”的模式下, 切尔尼个人每天能发出 10-30 个代码合并请求, 效率大幅提升。
🔍 本质: 高成本与高效率的平衡
Harness 的本质,是一个统筹多个子智能体与模块动作功能的整体流程。其名称借鉴了电气工程中的“线束”概念——正如线束统筹线路与信号走向,Harness 统筹的是子智能体的协作与任务流转。
这种架构的优势显而易见: 在 Anthropic 的内部评测中,采用多智能体 Harness 架构 (以 Claude Opus 4 为上层底座、Sonnet 4 为子智能体底座) 的性能, 比单一 Opus 4 模型高出 90.2%。
但高效率往往伴随高成本。根据 Anthropic 今年 3 月发布的示例, 让 AI 编写一个 2D 复古小游戏:
- 单一模型运行 20 分钟, 成本 9 美元, 成品不可用;
- 全套 Harness 运行 6 小时, 成本 200 美元, 成品可用。
多智能体架构的 token 消耗速度通常是普通聊天机器人的 15 倍以上,但任务完成效率也同比提升。用户需要在性能与成本之间做出权衡。
💡 技术精髓: 传统工程原则的 AI 化实现
有趣的是,Harness 的核心思路并非完全创新, 而是将传统软件工程原则用 AI 重新实现。正如开发者赵晨阳所指出:
所有 Harness 的关键点, 都是用 AI 重新实现了一遍“古代”传统软件工程原则中的要点。
具体体现在:
- 文档即代码: 将工作准则保存在智能体文档中, 而非每次对话重复提示;
- 关注点分离与单一职责: 将任务拆分为专门板块, 每个子智能体只处理单一板块;
- 左移约束: 将子智能体的权责结构化, 避免上层智能体自行猜测。
Anthropic 研究员尼古拉斯·卡利尼的实验也印证了这一点。他使用约 2 万美元 API 额度、并行 16 个子智能体, 耗时两周生成 10 万行 Rust 代码, 最终构建出可运行的 C 编译器。其工作重点并非编写复杂提示词, 而是设计子智能体架构的基础环境——测试、运行、反馈等机制, 让多智能体能够无人工干预自行运转。
📊 行业观察:AI 调用层级的演进
回顾过去三年 AI 技术的发展脉络, 可以看到一条清晰的演进路径:
- 第一年: 行业聚焦如何写出更好的提示词, 在聊天窗口中调用大模型性能;
- 第二年 :AI 学会自动调用不同大模型及 API, 智能体(Agent) 概念兴起;
- 第三年:AI 进一步学会读取本地文件、协调云端子智能体,Harness 架构开始火热。
这一趋势表明,AI 的调用层级正在不断提高, 所能处理的任务也越来越复杂。Harness 的出现, 标志着 AI 从“工具使用”向“流程管理”的进阶。
🚀 总结: 效率与成本的博弈
然而, 高成本仍是当前的主要门槛。随着模型能力的增强(如 Opus 4.6 在计划、运行时长、代码审查等方面的改进), 未来 Harness 的性价比有望进一步提升。对于开发团队而言, 是否采用这一架构, 需根据实际任务复杂度、预算以及对效率的需求综合考量。