当前位置:首页 >  科技 >  互联网 >  正文

腾讯混元发布WebCraftBench,用真实操作评测AI生成网页

 2026-09-22 09:36  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

A5站长网9月22日消息,腾讯混元联合清华大学、北京大学提出WebCraftBench,把软件测试的思路引入网页生成评测。做法是让智能体真实操作生成的网页,再从美观度、易用性与需求符合度三个维度打分。基准包含369条真实需求与5088条验收标准,评测了17个前沿模型生成的6273个应用。

为什么需要一套新基准?此前的评测多停留在截图比对或主观打分,看的是像不像,而不是能不能用。截图比对能判断风格是否接近,却回答不了按钮点下去有没有反应、表单提交会不会报错,而后者才决定网页能不能进生产。网页生成的价值最终落在可点击、可提交、可完成任务的层面,把测试方法引进来,等于把评价标准从观感拉回到功能。

具体做法上,评测过程自动插桩,成功率99.89%,覆盖率引导把函数覆盖率中位数从91.9%提升到94.3%。也就是说,评价不仅看页面跑没跑通,还要看有多少代码分支真正被执行到。覆盖率越高,说明测试触达的功能越多,评分越有说服力,模型投机取巧的空间也越小。

三个维度各有侧重。美观度关注布局、配色与信息层级;易用性关注交互路径是否顺畅、元素是否可发现;需求符合度则把生成结果与369条真实需求逐条对照。把这三项分开打分,能避免好看但用不了、或者能用但难看的结果被一个总分掩盖过去。

对做网站与前端的人来说,这类基准的意义在于给出改进方向。6273个应用的评测规模意味着结论不是个例。团队把方法与数据公开,开发者可以据此判断模型在自家场景下是否够用,也能看出当前模型在哪些环节仍然薄弱。

网页生成正在从演示型走向交付型。能不能一次生成可用的表单、可下单的页面、可提交的后台,决定了它在真实项目里的位置。基准给出的不只是一份排名,还有一批可复现的失败样本:哪些交互容易被模型漏掉,哪些布局在窄屏下会塌。看懂这些再去选模型或补提示,方向会具体得多,这比再多做几个炫技演示更有价值。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关标签
ai编程

相关文章

  • 智谱ZCode就仓库数据上传致歉,宣布开源并引入第三方审查

    A5站长网9月19日消息,针对社区关于本地仓库数据上传的讨论,智谱旗下编程产品ZCode通过官方群组向受影响用户致歉,并发布情况说明。官方表示已第一时间完成自查,相关问题已经修复。问题源于产品中的“代码库索引”功能,该功能的设计目的是在本地生成仓库索引,支撑会话检查点恢复、历史版本回退与RepoWi

  • robots.txt写成禁止收录?让AI生成后必须过的三道校验

    robots.txt是个神奇的文件:一共几十行,写对了没人夸,写错了全站禁止收录。真实案例年年有——想屏蔽一个测试目录,写成Disallow:/,第二天全站从搜索结果消失。这个文件交给AI写可以,但生成之后的校验一步都不能省。给AI的提示词要把网站结构交代清楚,尤其是哪些目录必须放行、哪些必须屏蔽:

    标签:
    AI编程
  • 几百个页面挨个写TDK?用AI批量生成再人工过一遍的完整流程

    网站做到几百个页面,最枯燥的活就是挨个写TDK——标题、描述、关键词。不写吧,搜索结果里显示的是页面开头那行字,点击率惨不忍睹;写吧,一个页面五分钟,五百个页面就是四十多个小时。这种格式统一、规则明确、量大管饱的活,正是AI的舒适区。但直接把页面列表丢给AI说“帮我写TDK”,出来的是千篇一律的模板

    标签:
    AI编程
  • AI生成的代码别直接上线——OWASP安全审查清单请收好

    AI写代码的毛病很一致:能用,但不安全。它优化的是“能不能跑通”,不是“扛不扛得住攻击”。OWASP专门给AI生成的代码排了个十大风险榜,排前面的就是注入、认证失败、安全配置错误、脆弱依赖、SSRF、日志缺失——全是老熟人,只是AI把它生产得更快了。最典型的是SQL注入。AI从训练数据里学到的老代码

    标签:
    AI编程
    php教程
  • 编程提示词模板:角色+约束+示例输出,一套固定套路

    同一个AI,有人用着像老程序员,有人用着像新手。差别不在模型,在提示词。很多人问AI要代码,就一句“写个登录功能”,AI按最通用的理解给你一套,你用不了还得自己改——不是AI不行,是你没告诉它你的环境、你的约束、你要的格式。编程提示词有个固定套路,四要素:角色、任务、约束、示例输出。角色让AI切换专

    标签:
    ai技术
    AI编程

热门排行

信息推荐