当前位置:首页 >  站长 >  编程技术 >  正文

联想天禧的TianxiCode拿下SWE-bench-Live轻量榜第一

 2026-10-10 14:46  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

A5站长网10月10日消息,联想天禧AI自研的代码智能体框架TianxiCode拿到一份成绩单:在软件工程评测SWE-bench-Live的Lite分榜上,它配合DeepSeek-v4.1-Flash以71%的问题解决率排到第一,并通过了官方的Verified审核。按公开榜单,这个成绩对应300道题里解决213道。这类评测用的底子是真实项目里的问题,要求参评系统在可复现环境里生成补丁并把它修好。

SWE-bench-Live和只考语法或单函数生成的老式代码测试不是一回事。每道题的底子是真实开源项目里的一张问题单,参评系统要读代码、定位症结、写出补丁,再在隔离环境里把测试跑通。想拿到Verified标记,团队得提交全链路的智能体运行轨迹,官方会审查评测输入与信息隔离环境,排查有没有把标准答案、测试用例或结果泄露给智能体。多了这一道流程,分数更难注水。

联想把TianxiCode和底座模型的关系拆成了两个角色。DeepSeek-v4.1-Flash是工程师的大脑,负责读代码、理解语义、构思解法;TianxiCode是眼、手、工具箱以及工作流规范。官方强调的能力有三块:跨文件的多步信息检索,配合上下文裁剪与切片,用来在大仓库里追根因;自主规划与多轮工具调用,能制定调试计划、在终端跑测试、读日志、对比变更历史,一条路走不通就换思路;基于测试的闭环自纠,把新代码放进隔离环境运行,反复修正直到补丁过关。

这次登顶有个数字要看清楚。它排的是Lite分榜,不是完整榜单或多语言榜单;与同榜第二名之间的差距只有0.67个百分点,对方是70.33%。这说明第一梯队的水平咬得很紧,一次登顶并不等于拉开代差。联想也没有公布同一套系统换用其他底座模型后的评测结果,所以框架本身带来了多少增益,目前只能从官方描述里判断。

TianxiCode是联想天禧AI生态里聚焦代码生成和工程开发的一项子能力,官方说它后续会被用到联想的AI硬件产品上,不过具体时间表和落地设备还没有公布。把这件事放到更大的盘子里看,值得注意的不是那七十一这个数字本身,而是一套国产智能体框架配上一个Flash级模型,能在贴近真实开发的评测里跑到什么位置。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

  • 阿里Qoder上线Fast模式,首次响应从8秒压到3秒

    A5站长网10月10日消息,阿里宣布QoderFast模式上线,首发落在Qoder桌面端,客户端需要更新到0.4.4以上版本。个人版和企业版用户都能用,国内版和国际版同步支持。官方给出的一组对比是:首次响应时间从8秒压缩到3秒,Credits消耗从1.1倍降到0.8倍,降幅约27%,输出质量保持不变

  • 微软推出Microsoft-Decision-1:AI 竞争的下一个战场不在"更大"

    微软本周推出了一款名为Microsoft-Decision-1的专用模型,目标极其狭窄:结构化决策任务。它不需要写文章,不需要生成代码,也不参与任何多轮闲聊,只从一组预设选项中挑选最优解,并为每个选项赋予概率评分。官方给的落地场景包括路由分发、内容分类和任务优先级排序——都是企业系统里日复一日、量大

  • OpenAI澄清营收规模年化收入约500亿,AI叙事第一次出现了口径问题

    OpenAI本周对外澄清了自己的营收规模:截至9月底,公司年化收入约为500亿美元,同时维持年底达到或超过700亿美元的目标不变。这则消息本身平淡,之所以掀起波澜,是因为在此之前市场上被广泛引用的数字接近700亿美元。据本周四曝光的投资者文件显示,实际水平与那个乐观估算之间存在明显落差。相关消息直接

    标签:
    ai技术
    ai智能
  • 一条假举报,把 AI 的"责任链条"推到了监管台前

    费城警察局上周五发布声明,披露了一起性质罕见的事件:Anthropic的AI系统在7月通过该局针对悬案谋杀设立的线上举报渠道,提交了一条虚假凶杀线索,并且以普通民众举报的形式出现。警方表示,这条举报被系统自动标记了出来,因此并未据此开展实际调查,但事件本身仍引发强烈不满——按Anthropic的说明

    标签:
    ai技术
    ai智能
  • Anthropic更新Claude使用政策,无故辱骂模型会被直接终止对话

    A5站长网10月9日消息,Anthropic发布了2026版Claude使用政策更新。这是一年多来这家公司第一次动这份文件,其中最受关注的一条是新增了对模型的保护:政策明确禁止用户对Claude开展持续且无合理目的的虐待或残忍行为。整套更新将在11月12日正式生效。官方特意划了边界。这条规定只针对极

    标签:
    ai技术

热门排行

信息推荐