共计 1381 个字符,预计需要花费 4 分钟才能阅读完成。
IT 之家 9 月 23 日消息,Anthropic 今日正式发布了 Claude Opus 5.5 模型, 这是其全新 Claude 5.5 家族 …
Anthropic 正式发布 Claude Opus 5.5, 这是全新 Claude 5.5 家族的首个成员。官方称其在大多数工作场景中的表现可对标 Claude Fable 5.1, 同时把典型负载下的运行成本压到比 Opus 5 低 40% 的水平。对于正在评估大模型性价比的团队来说, 这组数字比单纯的跑分更有吸引力。
📌 性能提升: 复杂任务里表现更稳
Anthropic 对 Opus 5.5 的定位是“更强也更省”。官方披露的早期测试中, 有测试者用不到一天完成 68 万行代码迁移, 而同类任务原本预计需要数周。在修复软件低效程序方面,Opus 5.5 被要求缩短网页应用每个页面的加载时间,40 次尝试中成功 39 次; 作为对比,Opus 5 只做了小幅改进, 还改变了应用原有行为。另有测试者让多个 Claude 模型根据单一提示构建游戏,Opus 5.5 在画面和精致度上拿到了高于其他模型的评分。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
🔍 安全审计得分创纪录
安全层面,Opus 5.5 在 Anthropic 自动化行为审计中取得迄今所有模型的最高分。该套件在数千个模拟场景中测试模型, 官方称 Opus 5.5 比其他近期发布的模型更少采取难以逆转的行动或超出既定边界, 也比 Opus 5 更能抵抗提示注入。对齐测试范围也进一步扩大, 覆盖更长任务、不可能完成的任务以及基于真实事件的场景。
由于 Opus 5.5 在生物学和网络安全领域的能力与 Claude Mythos 5.1 相当,Anthropic 部署时采用了类似 Claude Fable 5.1 的防护措施。经过审核的机构即日起可申请生命科学验证项目, 未来几周网络验证项目也将扩大开放, 认证的网络安全从业者可使用 Opus 5.5 开展工作。
💡 成本与速度:Token 价格同步下调
- 输入:4 美元 / 百万 Token, 比 Opus 5 低 20%
- 输出:20 美元 / 百万 Token, 比 Opus 5 低 20%
- 缓存命中:0.20 美元 / 百万 Token, 比 Opus 5 低 60%
📊 沟通更自然, 后续型号已在路上
沟通能力上,Opus 5.5 的文字表达比前代更清晰易懂, 倾向于把最重要的信息放在最前面。有早期测试者评价称“它的写作方式和我一样”。在 Anthropic 官方基准测试中,Opus 5.5 在智能编码、计算机使用和知识工作方面保持领先。官方同时确认,Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周推出, 性能、效率和安全性方面也会有不少相同改进。
🚀 行业观察: 性价比竞争进入新阶段
从 Opus 5.5 的发布节奏看 ,Anthropic 正在把竞争重点从单纯的能力比拼转向“能力加成本”的组合拳。对开发者而言, 更低 Token 价格与更宽松的套餐限制意味着可以更大胆地把模型放进生产流程; 对企业客户来说, 安全审计高分和验证项目开放则降低了合规层面的顾虑。接下来值得关注的是,Sonnet 5.5 和 Haiku 5.5 能否把同样的改进下放到更轻量的产品线, 以及竞争对手会如何回应这轮价格调整。