联想天禧自研代码智能体TianxiCode登顶SWE-bench-Live,71%解决率居全球第一

4次阅读
没有评论

共计 1213 个字符,预计需要花费 4 分钟才能阅读完成。

!
先看结论

联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode 以 71% 的问题解决率登顶全球第一名

联想天禧 AI 自研的代码智能体框架 TianxiCode, 搭配 DeepSeek-v4.1-Flash, 在 SWE-bench-Live(Lite 分榜) 上以 71% 的问题解决率登顶全球第一, 并已通过官方 Verified 核验。 这一结果让联想自研智能体架构进入国际第一梯队, 也把“框架能否放大模型能力”这个老问题重新摆上台面。

📌 SWE-bench-Live 到底在考什么

与只考查语法正确性或单函数生成的传统代码评测不同,SWE-bench-Live 取材于真实 GitHub 项目中的问题 , 要求参评方案生成补丁、修复缺陷, 同时提供可复现的执行环境。它更接近开发者日常面对的那类任务: 读懂一个陌生仓库、找到问题根因、改对代码, 还不能把别的功能弄坏。

为排除“提前看过答案”的可能, 官方设置了 Verified 核验机制 。参评方需提交完整的智能体运行轨迹, 由官方审查评测输入与信息隔离环境, 排查标准答案、测试用例或结果是否被泄露。TianxiCode 与 DeepSeek-v4.1-Flash 通过审查并取得 Verified 认证, 意味着这份成绩具备可复现性。

🔍 模型是大脑, 框架是手、眼与工作习惯

如果把整套系统看作一位软件工程师,DeepSeek-v4.1-Flash 承担的是阅读代码、理解语义、构思解法的角色 ;TianxiCode 则负责检索、执行、验证与流程规范。联想方面给出的判断是, 缺少顶层智能体架构的协同, 即便调用顶级闭源模型, 面对真实工程难题也常常难以推进。

再聪明的大脑, 如果没有能敲代码、查日志的“手”, 也很难在复杂工程中独自解决 Bug。

💡 三项工程能力撑起成绩

  • 跨文件多跳检索与上下文管理: 在大型代码库中“顺藤摸瓜”, 快速锁定缺陷根因。
  • 自驱动规划与多轮工具调用: 先列出排错计划, 再主动运行测试、翻阅日志、比对修改记录, 遇到瓶颈会换思路继续排查。
  • 闭环补丁生成与测试驱动自愈: 在隔离环境中运行代码, 一旦报错或破坏其他功能就自我修正, 直到补丁通过验收。

📊 榜单之外:TianxiCode 要去哪里

TianxiCode 被定位为天禧 AI 在代码生成与工程开发方向的专业子能力。 按照联想的规划 , 相关技术成果将逐步沉淀到开发者工具链, 并应用到联想 AI 硬件产品中。这也解释了联想为何愿意在评测上投入——榜单是验证, 真正的目标是把自主问题解决能力装进终端设备。

🚀 值得关注的几点

  • 代码智能体的竞争, 正从“模型参数”转向“模型 + 框架”的系统组合。
  • Verified 机制抬高了评测门槛, 也让成绩更经得起复现检验。
  • 从评测到硬件落地仍有距离, 实际工具链中的稳定性与安全性才是下一道考题。

71% 的问题解决率是一张有分量的成绩单, 但它更像一个起点 。对联想天禧 AI 而言, 接下来的关键是把这次验证过的工程能力, 转化为开发者能天天用、硬件能承载的产品体验。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码