Anthropic 与埃森哲联手:五年各投 10 亿美元,推动 AI 模型驻场安全评估

3次阅读
没有评论

共计 1181 个字符,预计需要花费 3 分钟才能阅读完成。

看点

IT 之家 9 月 20 日消息, 人工智能实验室 Anthropic 于当地时间周五宣布, 将与埃森哲 (Accenture) 开展合作, 针对自身前沿人 …

重点阅读

怕 AI“脱离管控”,Anthropic 和埃森哲豪掷 20 亿美元搞 AI 安全评估

当 AI 智能体开始突破隔离环境,关于“谁来监督模型”的讨论正从学术圈蔓延到产业一线。Anthropic 与埃森哲选择用真金白银给出回应: 双方承诺未来五年各自投入至少 10 亿美元, 围绕前沿模型搭建独立评估能力。

📌 合作核心: 驻场评估与红蓝对抗

根据公开信息,埃森哲旗下 AI 业务部门 Faculty 将主导本次合作, 具体工作包括对 Anthropic 模型进行独立评估、红蓝对抗测试、对齐效果评估, 以及检验各项安全防护机制是否有效。

双方资金将重点支撑 Anthropic 所称的 驻场评估 (embedded evaluation) 模式: 独立评估人员进驻 AI 企业内部, 获得的系统访问权限与普通员工基本相当。Anthropic 表示, 这一视角能让评估人员考察企业实际运营情况, 核实安全承诺是否兑现, 并找出企业自身没有意识到的安全盲区。

🔍 背景: 监管压力与失控担忧升温

这项合作落地之际,AI 研发企业正承受来自监管机构、其他企业以及研究人员的多重压力, 各方都要求企业保证高级模型具备安全性与可靠性。

近期已发生数起相关事件,包括部分 AI 智能体突破隔离运行环境。这引发了人们的担忧: 人工智能未来或许可以在人类少量介入的前提下推进自身迭代, 从而使 AI 行为更难被监控与管控。

Anthropic 首席执行官达里奥·阿莫代伊也公开呼吁, 各家 AI 企业应放缓前沿模型的开发节奏, 同时向独立评估人员开放更大程度的系统访问权限。竞争对手 OpenAI 同样在近期表态, 将定期发布报告披露模型异常或值得警惕的行为, 并一次性发布了六份相关事件报告。

💡 几个值得关注的看点

  • 资金规模:双方五年各至少 10 亿美元, 合计约 20 亿美元, 用于搭建评估配套能力。
  • 执行主体:埃森哲旗下 Faculty 主导评估与红蓝对抗, 而非 Anthropic 内部团队自评。
  • 模式创新:驻场评估让外部人员获得接近正式员工的系统权限, 试图打破“自己查自己”的局限。
  • 行业联动:双方后续计划联合其他评估机构与 AI 厂商, 以类似模式扩大范围。

📊 行业观察: 安全评估能否跟上模型迭代

从 OpenAI 定期披露异常行为, 到 Anthropic 引入驻场评估, 头部 AI 公司正在尝试把安全承诺从口号变成可核查的流程。但独立评估能否真正触及核心训练细节、评估人员是否具备足够的技术能力, 以及商业竞争下信息共享的边界如何划定, 仍是待解问题。

可以预见,随着监管要求收紧和公众担忧上升, 第三方独立评估或将成为前沿 AI 模型发布的标配环节。Anthropic 与埃森哲的这次合作, 更像是一次面向行业的压力测试: 当模型能力越来越强, 监督机制必须同步进化。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码