揭秘具身智能的榜单生意链:刷榜狂欢背后的繁荣与泡沫
来源:36kr 10 小时前

2026年上半年,具身智能赛道超935亿元融资,322起融资事件将行业推上风口。

和融资热潮一起到来的,是另一个同样高频出现的词汇——“全球第一”。据不完全统计,目前活跃于行业的各类榜单已超过20个,几乎每周都有新的“第一”诞生。

星动纪元、智元、跨维、千寻智能、极佳视界、鹿明……各家企业的战报里,动辄便是登顶某国际榜单的捷报。RoboChallenge Table30的榜首半年内换了四次,World Arena在同一时期冒出了两个“第一”。

更耐人寻味的是,“第一” 的生产速度甚至跑赢了机器人技术的迭代速度。一款模型从发布到登顶榜单,往往只需要一周;榜单更新的频率,甚至比企业产品迭代周期还快。

当“第一”的数量越来越多时,行业正在经历一场关于排名通胀的集体困惑。

这种现象并不令人意外。资本在追逐标的,标的在争夺注意力,而注意力需要一个简单粗暴的锚点,“第一名”恰好满足了这种需求。

但问题是,当前具身智能行业尚缺乏一套公认的技术评价体系,具身智能又是个技术路线分散的赛道,一个好的具身智能究竟是什么样的,行业还在探索中。

在一片混沌中,大量评测榜单粉墨登场。公众和资本不禁要问,这些第一究竟有多少含金量?又是谁在批量制造这些第一?当榜单狂欢盖过技术本身,具身智能这条被寄予厚望的前沿赛道,正在经历一场从泡沫到务实的成人礼。

具身智能刷榜利益链:谁需要第一,谁帮忙制造第一?

时间倒回一个月前。

6月3日,具身智能企业千寻智能的一篇推文将行业的榜单乱象推到了台前。

文章中,千寻智能自研的具身基座模型Spirit v1.6在RoboArena榜单上综合得分全球第一,力压英伟达Cosmos3和Physical Intelligence的Pi0.5,“打破硅谷霸榜魔咒”,而RoboArena更是千寻智能口中“具身智能奥林匹克”“世界级权威主榜单”。

图源千寻智能微信公众号

同日,千寻宣布完成15亿元A+轮融资,三个月累计融资总额接近50亿元。

技术登顶与融资落地的时间点重合,一切看起来都是具身智能赛道的标准叙事,一家创业公司凭借技术突破获得资本认可。

殊不知,仅仅几天后,这场“胜利”被戳破。有业内人士梳理RoboArena公开的310条评测记录后发现,其中72%的分数仅来自两个注册账号,ECUST Robot Lab与Robotics Lab,前者对Spirit v1.6评测了179次,给出的胜率高达 97%;后者评测45次,胜率86.7%。

形成鲜明对比的是,英伟达官方用同款模型测试21次,胜率为0%。更蹊跷的是,这两个高频评测账号均在5月底集中注册,此后Spirit v1.6的评测记录便爆发式增长,其中ECUST Robot Lab累计276次评测里,超过六成的评测对象都是千寻智能的模型。

事件最终以RoboArena官方回溯调查、移除可疑数据、Spirit v1.6从主榜消失收场。但这起事件更像一扇窗口,照出了具身智能榜单的水分。

过去半年,具身智能模型评测堪称“铁打的榜单,流水的第一”,几乎每隔几天就有一家企业宣布“登顶全球榜首”“力压国际巨头”“斩获赛道第一”。

今年2月,原力灵机DM0宣称在RoboChallenge真机评测中获得单任务与多任务双项第一;

3月,极佳视界GigaWorld-1在WorldArena Track1阶段性评测中位列第一;

5月,星动纪元Era0拿下RoboChallenge Table30综合排名第一;

同月,智元GE-Sim 2.0登顶World Arena Track1;

6月,跨维智能DSCFuncWorld登顶World Arena Track2。

这期间,World Arena榜单上还出现了星动纪元Ctrl-World拿“具身任务能力全球第一”、北京人形Pelican-Unify成双冠王的局面。

每个“第一”都有榜单背书,每个榜单都有自己的赛道划分。当“第一”成为流水线上的标准件,我们需要追问的是:谁在拼命要这个第一,又是谁在帮他们制造?

要理解这场榜单狂欢,得先看清一条完整的利益链。

对创业公司而言,榜单第一从来不是荣誉勋章,而是商业工具。本质上,具身智能仍是典型的故事驱动型赛道,技术路线未定型、商业化未跑通,投资人判断企业价值缺乏硬指标,榜单排名便成了最直观的估值锚点。

一个“第一”的头衔,往往能直接拉动估值上浮数亿元,更是下一轮融资的敲门砖。

千寻智能和星动纪元都是在登顶榜单后,同步宣布的融资消息。榜单发布与融资官宣的高度同步,早已是行业公开的操作惯例,先拿榜单造势,再用热度抬估值,最后完成融资交割,榜单甚至成为资本叙事里的标准配置。

除了融资,榜单也是企业市场宣传的核心卖点。面向政府、产业客户与公众,“全球第一”是成本最低、穿透力最强的营销话术。

当行业里每家公司都在讲模型能力、讲泛化能力,但又缺乏一把公认的尺子时,榜单第一就成了最容易被外界理解、最方便传播的信号。

需求旺盛的地方,自然会催生供给。如今的具身智能赛道,榜单早已不是第三方中立评测,而是一门成熟的生意。

目前市面上的具身智能榜单大致可分为三类,考察机器人真干活的能力的VLA操作综合榜、考察对物理世界的推演能力的世界模型榜、考察极端场景下的单点能力的专项基准榜。

问题在于,部分榜单本身就是商业产品。标准不透明、规则可干预,与商务合作深度绑定。在6月举办的智源大会上,智源研究院院长王仲远直言,现阶段“榜单并不完全可信,各种各样的榜单令人眼花缭乱。”

即便是看似中立的技术评测榜单,也存在大量可操作空间。RoboArena事件暴露的就是分布式评测机制的漏洞。根据官网介绍,RoboArena是一个分布式评测框架,发起者来自加州大学伯克利分校、斯坦福大学、华盛顿大学、英伟达等高校和科技巨头,兼具顶尖学术机构、头部科技公司背书。

在RoboArena上,任何机构都可以成为评测者,相当于考生自己可以注册账号当考官给自己打分。

而更多封闭式评测榜单,则存在“针对榜单专项优化”的情况。2026年自变量算法举办的具身智能黑客松赛事,南京邮电大学的参赛队伍在公开A榜的 “按指令分类水果”任务中,针对固定的水果品类、标准摆放位置反复微调模型,将单任务成功率拉至赛事上游。但在进入完全未知的盲测B榜后,赛事方新增了未训练过的水果种类、加入干扰物体并调整了桌面布局,这套专为A榜打磨的模型效果大不如前。

这显然是一场具身智能赛道的“应试教育”。把固定考题练到娴熟,自然能交出亮眼答卷,可一旦脱离预设环境,性能便会立刻现形,而这种定向优化换来的高分,与具身智能追求的、适配真实复杂物理世界的泛化能力,完全背道而驰。

当需求与供给就位,刷榜就成了一场心照不宣的集体狂欢。企业需要第一来融资,资本需要第一来讲故事,唯一被忽略的,是具身智能本该扎根的技术与真实场景。

具身智能狂奔,行业需要一把价值标尺

如果说刷榜乱象是表象,那其根源则在于一个更深层次的困境,整个具身智能行业,正处于一场没有统一参照系的蒙眼狂奔之中。

拆解完整条利益链条就会发现,无论是企业的榜单执念,还是主办方的商业操作,能够成立的核心前提,都是行业没有一套公认的价值标尺。

实际上,这种无标尺的竞争并非具身智能行业独有。回望科技产业史,几乎每一个新兴赛道在概念爆发期,都经历过类似的野蛮生长阶段。

汽车行业有百公里加速、续航里程、自动驾驶分级,这些指标统一、可量化、可复现,企业很难在核心参数上长期造假,消费者与投资人也能清晰判断产品优劣。

手机行业有芯片制程、跑分、影像评测,即便早期也曾出现过跑分作弊、针对评测软件定向优化的乱象,但最终行业形成了相对统一的评价坐标系,毕竟企业的真实实力很难靠榜单永久掩盖。

即便是同样新的大模型赛道,也形成了MMLU、GSM8K、HumanEval等公认的基准测试集,覆盖知识推理、数学计算、代码生成等多个维度,测试方法公开透明,结果可复现。

但具身智能至今没有这样一把公认的尺子。或者说,具身智能尚未建立起这样的产业共识。

需要明确的是,具身智能是一个横跨感知、决策、运动控制、人机交互等多个领域的交叉赛道,技术路线高度分散,不同企业的技术路径天差地别。

举例来说,宇树科技深耕四足与人形机器人的底层步态算法,主打硬件与运动控制;千寻智能、星动纪元主打VLA具身大模型与世界模型,强调语义理解与任务规划能力;擎朗智能专注商用服务机器人,优势在于场景适配与商业化闭环;还有智元创新这类全栈自研企业,从硬件本体到算法模型再到场景应用全覆盖。

原则上,不同路线的企业,很难放在同一张榜单上比较。运动控制强的企业,模型能力可能一般;模型跑分高的企业,真机落地可能还没开始;场景落地深的企业,通用能力未必突出。

技术路线分散之外,具身智能赛道迭代速度堪称你追我赶。这两年,无论是WAIC等展会的比拼,还是玩家们产品的路线,都发生了变化。

2024年行业比拼机器人自由度、静态行走稳定性;2025年竞争焦点转向VLA视觉语言动作模型的基础操作成功率;迈入2026年,赛道重心转移至世界模型预测能力、无遥操连续作业、异常场景自主恢复等指标。

宇树科技一年之内接连迭代G1人形机器人硬件版本,先后开源UnifoLM-WMA-0、UnifoLM-VLA-0两代UnifoLM系列具身模型;云深处科技机器人产品线迭代节奏迅速,人形产品从DR01原型机升级至面向工业场景的DR02全天候人形机器人,同时持续更新绝影系列四足机器人;智元机器人持续更新AGIBOT人形本体与GE-Sim仿真世界模型,迭代仿真数据集与真机作业策略;星动纪元在不到一年时间内连续迭代多代具身智能算法,持续演进ERA系列VLA基础模型,并推出Ctrl-World可控生成式世界模型,搭建策略模型与世界模型协同训练体系。

图源宇树科技官方微博

更深层的矛盾在于,具身智能的终极考场是真实物理世界,而物理世界的复杂性,从根本上就难以被完全标准化。实验室里固定光照、固定物体、固定位置的测试环境,到了真实的工厂、家庭、商超场景里,变量会指数级增加。

仿真环境里成功率100%的模型,放到真机上可能连杯子都抓不稳;固定场景里表现完美的机器人,遇到物体偏移、光线变化、突发障碍物就可能直接宕机。这种从实验室到物理世界的天然落差,让标准化评测的参考价值大打折扣,也进一步加剧了行业评价体系的混乱。

本质上,刷榜乱象是行业从泡沫走向成熟的必然产物。当一个赛道处于概念爆发期,资本大量涌入,技术尚未定型,商业化还没跑通,市场迫切需要一套简单的符号来区分好坏、判断价值。

但各行各业也反复证明,当行业进入深水区,泡沫会逐渐退去,真实的价值标尺会最终建立。这个转折点,往往发生在资本从听故事转向要业绩、行业从拼概念转向拼落地的时刻。

参数和融资盛宴背后,具身智能也将进入去泡沫期

回望2026年上半年的具身智能赛道,依然是资本的盛宴。

IT桔子数据显示,上半年国内具身智能赛道融资总金额达935亿元,较 2025 年同期提升5倍;融资事件322笔,同比增长137%。此外,百亿估值独角兽企业至少已有22家,而2025年时仅有3家。

参数路线分化态势愈发明显。智元GE 2.0用20亿参数登顶World Arena;银河通用发布通用小脑模型AstraBrain-WBC 0.5,参数规模达8040万;原力灵机发布DM0.5,参数量4B,训练数据达15万小时……

纸面参数越来越亮眼,榜单排名越来越高,但一个尖锐的问题始终悬在行业头顶。这些能力,有多少能落到真实场景里?

一些变化正在悄然发生。

WAIC 2026无疑是个可参考的风向标。相比于过去展会比拼“谁会倒水”“谁的手指更灵活”,今年的具身智能展区,展台变成了微型工位。一些玩家把酒店洗衣房、咖啡馆、便利店完整搬进展馆,人形机器人全场零遥操、纯自主运行,完成洗衣、叠衣、制作咖啡、商品拣选等全流程作业,所有场景均来自真实合作品牌的运营需求。

“零遥操、纯自主”,成了本届WAIC上具身智能展示的隐形标准。企业不再靠人工后台遥控完成表演式演示,而是要求机器人自主应对环境变化、处理异常情况。评价维度也从单动作成功率,转向连续作业时长、异常恢复率、场景适配成本等更贴近物理世界的指标。

图源WAIC微信公众号

标准体系的建设也在同步推进。WAIC2026期间,《全球工业具身智能导则》编制正式启动,聚焦工业场景下的环境感知、自主决策、多机协同、功能安全等核心维度,试图为工业具身智能建立统一的技术与评价标准中国标准化。

尽管统一的行业标准尚未完全建立,但共识逐渐清晰——具身智能的能力,不能靠榜单定义,而要在真实场景里验证。

随着宇树科技冲刺A股、智元创新启动赴港上市,具身智能赛道的头部企业开始进入资本化兑现期。IPO的硬要求,正在倒逼行业褪去泡沫。

资本市场要的不是全球第一的头衔,而是真实的出货量、营收、利润与可持续的商业模式。参考宇树、云深处等冲击资本市场的玩家,靠的不是榜单排名,也不是模型故事,而是具身智能机器人打下的商业化基本盘。

当头部企业带着真实业绩走向二级市场,整个赛道的估值体系都会随之重构。过去靠一个榜单就能抬升估值的时代正在过去,未来的资本会更挑剔。

细数科技产业的发展规律,每一条前沿赛道都会经历概念炒作、泡沫膨胀、榜单泛滥的阶段,这是技术从实验室走向产业化的必经之路。具身智能作为大模型与机器人的交叉赛道,承载着下一代通用智能的想象,出现阶段性的概念泡沫与榜单乱象,并不意外。

所有的泡沫终会退去,所有的虚名终会落地,具身智能的终极考场,永远是真实的物理世界。机器人会不会走路、模型跑分高不高,最终都要回答一个问题,它能不能在工厂里替代人工、能不能在家庭里提供服务、能不能在真实场景里创造价值。

眼下,具身智能正从概念走向产业的成人礼。未来能留在牌桌上的企业,从来不是榜单上短暂的第一名,而是能在真实场景里站稳脚跟、为客户创造真实价值的那一个。

当刷榜的喧嚣散去,真正的技术长跑,才刚刚开始。

简体中文 English