近日,在国际公认难度最高、最贴近真实开发环境的软件工程评测SWE-bench-Live(Lite分榜)中,由联想天禧AI自主研发的专业代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash取得突破性成绩:以71%的问题解决率登顶全球第一名,并正式通过官方审核。
这一成绩不仅标志着联想自研代码智能体框架迈入国际第一梯队,更展现出天禧AI生态以自研工程架构驱动模型潜能、在复杂软件工程竞技场抗衡全球顶尖方案的硬核实力。Tianxi Code 是联想天禧AI聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想 AI 硬件产品中。
不同于考查简单语法或单函数生成的传统代码测试,SWE-bench-Live是当前全球软件工程领域的权威性动态评测基准。
SWE-bench-Live以真实GitHub项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。相较于单纯考查代码片段生成,这类评测更贴近真实开发中的问题处理过程,对系统理解代码、定位问题和完成修复提出了综合要求。
为了确保评测的绝对公正,SWE-bench-Live官方设立了“Verified”核验机制。参评方案必须提交全链路的智能体运行轨迹(Trajectories),由官方团队严格审查评测输入、信息隔离环境,并彻底排查是否存在向智能体泄露标准答案、测试用例或结果的可能。TianxiCode与DeepSeek-v4.1-Flash成功通过审查并斩获“Verified”认证,充分证明了其代码修复成绩的可复现性与高含金量。
如果把“TianxiCode配合DeepSeek-v4.1-Flash”整个系统比作一个软件工程师。那么DeepSeek-v4.1-Flash是工程师的大脑,负责阅读代码、理解语义、构思解法;而TianxiCode则是工程师的眼、手、工具箱以及工作流规范。再聪明的大脑,离开了一双能敲代码、查日志的“手”和的严谨工作习惯,也无法在复杂的现实工程中独自解决 Bug。
多项榜单对比数据印证了这一点:若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策。而这些足以见证TianxiCode的技术含金量。
在实际软件工程场景下,TianxiCode展现出跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大系统工程能力。
跨文件多跳检索(Multi-Hop Retrieval)与精准上下文管理(Context Pruning & Slicing)让TianxiCode能够像资深工程师一样“顺藤摸瓜”寻找问题,在大型代码库中快速定位缺陷根因。
自驱动规划(Autonomous Planning)与多轮工具调用(Multi-turn Tool Calling)赋予TianxiCode像真人程序员一样“边看边敲”:遇到Bug会先列出排错计划,主动打开终端命令行去运行测试、翻阅日志、比对修改记录。遇到解决不了的问题,它还会灵活换个思路继续排查,实现自主推进。
闭环补丁生成(Closed-Loop Patching)与测试驱动自愈(Test-Driven Self-Correction)可以让TianxiCode能够自测自纠。TianxiCode会自动在隔离环境中运行代码,一旦发现新代码报错或破坏了其他功能,就立刻进行自我反思与修改,直至补丁通过项目验收。
可以说,TianxiCode扎实的自研工程底座展示了复杂的现实软件研发场景下,强大的智能体框架带来的决定性力量。
作为天禧AI生态在专业技术领域的关键研发布局,TianxiCode此次在国际顶级评测中跻身第一梯队,不仅是一次技术实力的集中验证,更为智能体在真实研发场景的落地铺平了道路。
代码智能体的最终价值,不在于单一榜单的排名,而在于为一线开发者分担繁重的排错与工程协同成本。未来,联想天禧AI将持续推动TianxiCode的技术成果向开发者实际工具链沉淀,依托成熟的自主智能体架构,让安全、高效、真正具备自主问题解决能力的专业代码工具,深度赋能到联想的硬件设备中。