具身大模型榜单林立,“世界第一”含金量待考
来源:互联网8月18日,具身大模型赛道正陷入一场密集的“榜单竞赛”。据公开调研信息,当前该领域资本热度持续走高,各类“世界第一”与“登顶”消息频繁出现。近期,越疆科技宣布其空弈DobotWAM具身大模型在UNOBench Challenge公开排行榜两大赛道同时登顶;智元机器人也宣布其自研的WITA-Omni Preview模型在DailyOmni榜单超越众多对手位列榜首。拉长周期来看,极佳视界、中科第五纪、千寻智能等企业也均在WorldArena、RoboArena等榜单中拿下过“全球第一”。在密集的登顶叙事背后,行业对评测标准真实性的讨论正在升温。
头部企业密集宣布登顶
近期具身大模型领域的“登顶”声明呈现出集中释放的态势。越疆科技的空弈DobotWAM具身大模型在UNOBench Challenge公开排行榜的两大赛道同时取得榜首位置。智元机器人自研的WITA-Omni Preview模型则在DailyOmni榜单中位列第一。更早之前,极佳视界、中科第五纪、千寻智能等企业也分别在WorldArena、RoboArena等不同评测体系中获得过“全球第一”的表述。这些成绩的发布节奏密集,且均冠以“世界第一”或“登顶”的标签,使得具身大模型赛道在短时间内形成了高度集中的声量。
榜单数量快速膨胀
与密集的登顶声明相对应的是评测榜单数量的快速扩张。据调研统计,目前具身大模型相关的榜单数量已超过20个。这些榜单在评测维度、任务设置、数据规模和评分规则上差异明显,部分榜单侧重于仿真环境中的任务完成度,部分则尝试引入真机测试环节。由于榜单数量众多且各自独立运行,同一模型在不同榜单中的排名可能出现显著差异,这也为“世界第一”的表述提供了较大的空间。榜单的快速膨胀使得横向比较的难度进一步加大。

仿真刷分与真机测试的成本落差
业内对榜单含金量的质疑主要集中在评测方式上。仿真榜单的测试环境相对可控,模型可以通过针对性优化在特定任务上取得高分,刷分难度较低。相比之下,真机测试需要真实的机器人硬件、物理环境和人工干预,成本高昂,难以大规模、高频次开展。这种成本落差导致大量“登顶”成绩集中在仿真榜单上,而真机环境下的表现验证相对滞后。仿真成绩能否迁移到真实物理世界,成为衡量具身大模型实际能力的关键变量。
权威标准尚未形成
尽管榜单数量已超过20个,但业内公认的权威评测标准尚未形成。不同榜单之间的评测口径、数据集和评分方法缺乏统一规范,导致“世界第一”的含金量难以直接比较。对于下游应用方和投资机构而言,缺乏权威标准意味着难以有效甄别模型的实际能力边界。当前行业面临的核心问题并非缺少榜单,而是缺少一个能够真实反映模型在物理世界中表现的评价体系。
真实物理世界检验成行业核心议题
在“榜单狂欢”背后,如何让具身大模型的能力经得起真实物理世界的检验,正在成为行业亟待解决的核心问题。真机测试的高成本与仿真评测的易刷分之间的矛盾,使得单纯依赖榜单排名难以全面评估模型能力。业内开始关注评测体系中真机测试的权重、任务设置的现实贴近度以及评测过程的透明度。随着具身大模型从实验室走向实际应用场景,评测标准的可信度将直接影响技术落地的节奏与资本配置的效率。