当前位置:首页 >  科技 >  IT业界 >  正文

星动纪元的VPP2拿下RoboDojo第一,没加一点额外数据

 2026-10-11 16:09  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

10月10日,具身智能企业星动纪元宣布,其自研的世界动作模型VPP2在具身智能评测基准RoboDojo上位列榜首,综合平均成功率32.26%、综合平均得分39.26分,泛化能力、精细操作和记忆能力三项评测也都排在第一。同场竞技的对手里包括GPT-6的Astra、Physical Intelligence的π0.5,以及英伟达的GR00T-N1.7,VPP2同步开源。

RoboDojo是什么,决定了这个第一的含金量。它由香港大学MMLab牵头,联合近20所学术机构共建,包含42项双臂操作任务,覆盖泛化、精细操作、长程任务、记忆和开放词汇指令理解五个维度。和传统数据集不同,它更像换题考试,会挪动物体位置、改变环境布局、换一种说法下指令,专门测模型走出训练舒适区之后还灵不灵。

VPP2属于世界动作模型这一类。这条路线今年的分歧点在训练方式:一种是把视频预测和动作生成放进同一套参数里端到端一起训,另一种拆开分阶段来。VPP2选的是后者,先让模型学会预测任务过程会发生什么,再提速并引入动作模块,用两段式把世界的演化规律和机器人的动作策略分开处理,避免预测误差直接灌进动作里。

数据侧也做了减歧义的处理。团队筛掉信息量不足的视频,把任务描述写细,统一动作坐标的表示,让同一段素材在不同场景下指向一致;复杂任务则交给视觉语言模型拆成子任务,再逐条交给动作模块执行。这套做法不带额外数据,也不上机器人自我进化之类的增强手段,训练只用了标准数据集。

和对手的差距可以量化。VPP2领先GPT-6的Astra约9.78个百分点,得分高出10.29分。但把绝对值摆出来看,32.26%的成功率谈不上机器人已经能干活,绝大多数任务它仍然做不下来。这个榜单的价值在相对位置,不在绝对水平——它说明仅靠标准数据、不堆料,也能在泛化能力上拉开身位。

另一条线索是榜单本身的更替频率。RoboDojo的榜首在六周内换过三次,接棒的几乎都是中国团队,VPP2之前登顶的LiberAI也来自国内。星动纪元的路径是把仿真里的能力往真机迁移,在ALOHA机械臂平台上的实测里,10类操作任务的平均成功率达到58.5%。仿真榜单考的是上限,真机能不能稳住,才是具身智能商业化真正的分水岭。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

  • 微软在Windows里加了一层智能体沙箱

    A5站长网10月11日消息,微软在旧金山办了一场围绕Windows和Surface的发布会,Windows与设备部门执行副总裁帕万·达武鲁里和英伟达首席执行官黄仁勋同台。整场发布的主线有两条:一是把Windows改造成同时调用本地模型与云端模型的平台,微软管这叫混合智能;二是给智能体加一层叫MXC的

  • Jev母公司完成8.7亿美元融资,a16z领投、估值75亿美元

    A5站长网10月10日消息,开发决策模型Jev的TypeSafeAI宣布完成8.7亿美元融资,估值75亿美元。这一轮由a16z领投,红杉资本和老股东DCVC参与。距离Jev在9月15日发布还不到一个月。公司称,约三分之一的财富500强企业已经在使用这款模型,但没有透露具体客户名称。Jev的运行方式和

    标签:
    ai技术
    ai智能
  • 联想天禧的TianxiCode拿下SWE-bench-Live轻量榜第一

    A5站长网10月10日消息,联想天禧AI自研的代码智能体框架TianxiCode拿到一份成绩单:在软件工程评测SWE-bench-Live的Lite分榜上,它配合DeepSeek-v4.1-Flash以71%的问题解决率排到第一,并通过了官方的Verified审核。按公开榜单,这个成绩对应300道题

  • 阿里Qoder上线Fast模式,首次响应从8秒压到3秒

    A5站长网10月10日消息,阿里宣布QoderFast模式上线,首发落在Qoder桌面端,客户端需要更新到0.4.4以上版本。个人版和企业版用户都能用,国内版和国际版同步支持。官方给出的一组对比是:首次响应时间从8秒压缩到3秒,Credits消耗从1.1倍降到0.8倍,降幅约27%,输出质量保持不变

  • OpenAI澄清营收规模年化收入约500亿,AI叙事第一次出现了口径问题

    OpenAI本周对外澄清了自己的营收规模:截至9月底,公司年化收入约为500亿美元,同时维持年底达到或超过700亿美元的目标不变。这则消息本身平淡,之所以掀起波澜,是因为在此之前市场上被广泛引用的数字接近700亿美元。据本周四曝光的投资者文件显示,实际水平与那个乐观估算之间存在明显落差。相关消息直接

    标签:
    ai技术
    ai智能

热门排行

信息推荐