

如何看待人形机器人在运动会中超越人类极限?这背后是硬件的胜利还是算法的降维打击?
——9.32秒、2.88米之后
8月22日至26日,第二届世界人形机器人运动会在北京国家速滑馆"冰丝带"举行,16个国家的666支队伍、2056台机器人在51个赛项中同场竞技。
开幕首晚,百米纪录便被刷至9.32秒(人形机器人首次在正式比赛中超越博尔特9.58秒的人类世界纪录),而一年前首届的最好成绩还是21.50秒;
原地跳高(2.8843米)和400米(38.15秒)的人类纪录也相继告破。
这一跨越的背后是三项先后走向成熟的技术:
“
从"稳定地走路"都曾是学界难题,到今天在正式赛场跑进10秒大关,中间是一条跨越二十余年的技术演进之路。
本文沿这条技术脉络,复盘人形机器人的运动能力如何一步步走到超越人类的今天。

起点:机器人连走路都不会的年代
今天看到机器人飞奔跳跃的画面,很容易忘记一个事实:让一台双足机器人稳定地走路,曾经是整个机器人学界最难的问题之一。
人类走路看起来毫不费力,但从力学角度看,双足行走其实是一个极其复杂的动态过程。每走一步,身体的重心都会短暂地离开支撑面,然后通过迈出下一步重新找到平衡。
本质上,走路就是一个"持续失去平衡、又持续恢复平衡"的循环。人类婴儿学会走路大约需要一年时间,而机器人学界为了这个问题,花了几十年。

▲图 | 本田ASIMO机器人行走画面,弯膝、小步幅的"静态稳定"步态是那个时代的典型特征 ©【深蓝具身智能】编译
早期的解决方案是"静态稳定"。确保机器人的重心投影始终落在脚掌支撑范围之内。
-
本田在2000年推出的ASIMO是这个时代最具代表性的产物。
它能走路、能上楼梯,甚至能跑步,但动作明显僵硬,膝盖始终弯曲,步速也很慢。
这不是设计上的疏忽,而是"静态稳定"策略的必然结果:为了保证重心不越界,机器人必须压低身体、缩小步幅、放慢速度。
-
与此同时,波士顿动力走了另一条路。
从BigDog四足机器人到Atlas人形机器人,波士顿动力选择了液压驱动方案。液压系统的优势在于功率密度高,能够在短时间内输出巨大的力量,因此Atlas可以完成跑步、跳跃甚至后空翻等高度动态的动作。
但液压系统也有明显的缺点:机械结构复杂、维护成本高、噪声大,而且存在漏油等实际工程问题。

▲图 | 波士顿动力Atlas机器人展示跑酷动作,在障碍物间跳跃翻转 ©【深蓝具身智能】编译
这两条路线代表了早期人形机器人运动控制的两个极端:
ASIMO式的保守但可控,Atlas式的激进但昂贵。
真正的突破,需要找到一条兼顾性能和成本的中间路线。

硬件转折:让关节"活"起来
人形机器人运动能力的第一次质变,发生在硬件层面。
传统工业机器人使用的电机,设计目标是高精度定位,通常配合高减速比齿轮箱工作。
高减速比意味着电机转很多圈,输出轴才转一圈,好处是输出力矩大、定位精确;但代价是关节变得"僵硬"——外力很难反向推动关节,关节也无法快速响应突然的冲击。
对于需要与地面频繁碰撞的行走和跑步来说,这种"僵硬"的关节是致命的。
-
转折点出现在MIT的腿部实验室。
研究者们提出了一种新的电机设计思路:使用大气隙半径、短轴向长度的电机拓扑结构,配合低减速比传动。
这种设计让电机本身就能输出较大的力矩,不再需要高减速比齿轮箱的放大。由此带来的关键特性是"可反驱性"——外力可以轻松地反向推动关节,关节能够柔顺地吸收冲击。

▲图 | MIT Cheetah机器人的"本体感知执行器"设计对比:传统高减速比方案(左上)vs 串联弹性执行器(右上)vs 低减速比高力矩方案(下),后者成为当前主流 ©【深蓝具身智能】编译
这让关节从"刚性定位工具"变成了"柔顺的力交互接口"。
机器人的腿不再是僵硬的支架,而是可以感知地面、适应冲击、灵活响应的运动器官。更重要的是,由于传动系统高度"透明",关节输出的力矩可以直接通过电机电流来估算,不需要额外的力传感器就能实现精确的力矩控制。
宇树科技也是这一技术路线的代表之一。
从四足机器人Go1、B2到人形机器人H1、G1,宇树的产品线一直采用低减速比电驱方案。
截至2026年8月,宇树的人形机器人累计生产下线约18000台——这个数字本身就说明,电驱方案在成本和可制造性上的优势,是液压方案无法比拟的。

控制革命:从"写公式"到"让机器人自己摔"
硬件的进步解决了"关节能不能动"的问题,但"怎么协调几十个关节一起动"就是运动控制的问题了。
-
传统的运动控制方法依赖数学模型。
工程师需要建立机器人的动力学方程,然后基于简化模型(如线性倒立摆模型)来规划步态。
这种方法的核心思想是:先用数学推导出机器人应该怎么走,再让机器人照着执行。它在平坦地面上效果不错,但一旦遇到复杂地形、外部干扰或者需要高速运动的场景,手工设计的步态就很难适应。
每换一种地形、每调整一个参数,工程师都需要重新调试,工作量巨大。
-
真正改变游戏规则的是强化学习(Reinforcement Learning, RL)的引入。
强化学习的核心思路很直接:不再告诉机器人"应该怎么走",而是给它一个目标(比如"向前走"),让它在虚拟环境中自己尝试。走得好就给奖励,摔倒了就给惩罚,经过数百万次甚至数十亿次的尝试,机器人自己"学"出一套最优的行走策略。
这个方法之所以可行,得益于GPU并行计算能力的飞速发展。以NVIDIA的Isaac Gym为代表的大规模并行仿真平台,可以同时运行数千个机器人实例,让训练过程从"一台机器人摔几万次"变成"几千台机器人同时摔几万次"。
原本需要数周的训练时间被压缩到几个小时甚至几分钟。

▲图 | NVIDIA Isaac仿真平台中数千台机器人同时进行并行训练的画面 ©【深蓝具身智能】编译
但仿真环境毕竟不是真实世界。仿真中的地面摩擦力、机器人的质量分布、电机的响应延迟,都和现实存在差异。如果直接把仿真中训练好的策略搬到真实机器人上,往往会因为这些差异而失效。这就是所谓的"Sim-to-Real Gap"(仿真-现实鸿沟)。
-
解决这个问题的关键技术叫做"域随机化"(Domain Randomization)。
原理并不复杂:在仿真训练过程中,故意随机改变各种物理参数——地面摩擦系数、机器人各部件的质量、电机的响应延迟、传感器的噪声等等。这样训练出来的策略,因为已经"见过"了各种各样的物理条件,对真实世界中的不确定性天然具有鲁棒性。

▲图 | Sim-to-Real迁移的核心方法对比:系统辨识(左上)、域适应(左下)和域随机化(右),域随机化通过在仿真中引入大量随机变化来覆盖真实世界的不确定性 ©【深蓝具身智能】编译
宇树"超人"机器人仅用3个多月就完成了从研发到发布,背后正是这套成熟的"仿真训练+域随机化+真机部署"流水线在发挥作用。

▲图 | "超人"机器人原地跳高2米,旁边标尺清晰可见跳跃高度 ©【深蓝具身智能】编译

速度进化:从学会走路到跑赢博尔特
有了柔顺的硬件和高效的训练方法,人形机器人的运动能力开始快速攀升。宇树H1机器人的速度进化史,是这个过程最直观的缩影。

▲图 | 宇树H1机器人在跑道上进行百米冲刺测试,速度达到10m/s ©【深蓝具身智能】编译
-
2024年3月,宇树H1以3.3米/秒的速度创下人形机器人速度世界纪录。这个速度大约相当于普通人慢跑的配速,在当时已经是一个里程碑。
-
2026年4月,同样是H1平台,速度提升到了10米/秒——接近博尔特百米冲刺的平均速度。
-
仅仅4个月后,"超人"将这个数字推到了12.66米/秒,正式超越了人类的速度极限。
从3.3到12.66,两年多时间速度提升了近4倍。值得注意的是,这种提升并不仅仅来自硬件的升级。
强化学习训练出的跑步策略,往往和人类的跑步姿态有明显差异。这是因为机器人的身体结构:关节的自由度、质量分布、力矩输出特性,和人类完全不同,最优的运动策略自然也不同。
RL算法不受人类运动经验的约束,它会在物理规律允许的范围内,找到最适合机器人身体的运动方式。
这也引出了一个有趣的问题:机器人为什么能超越人类?
人类的运动能力受到生物学的硬性约束:肌肉存在力-速度关系的限制(力量大时速度慢,速度快时力量小);高强度运动会产生乳酸堆积导致疲劳;肌腱和韧带有承受极限,超过就会受伤。
而电机没有这些限制,它可以在高转速下持续输出大力矩,不会疲劳,也不会受伤。再加上机器人的身体结构可以针对特定运动任务进行优化(比如"超人"的0.85米腿长就是专门为高速奔跑和跳跃设计的),超越人类的运动极限在技术上是完全可以实现的。

全身协调:不只是腿的事
跑步和跳跃主要考验的是下肢能力,但真正实用的人形机器人更需要的是全身协调,走路的同时搬东西、弯腰的同时保持平衡、手脚并用完成复杂任务。
这就是"全身控制"(Whole-Body Control)要解决的问题。
近两个月,全身控制领域出现了几项值得关注的进展。
-
波士顿动力发布的ZEST
ZEST的核心能力是:从动作捕捉数据、普通视频甚至非物理约束的动画中学习运动技能,然后零样本(不需要额外调试)直接部署到真实机器人上。在演示中,Atlas机器人学会了匍匐前进和霹雳舞等高度动态的全身动作,而且同一套框架还能迁移到宇树G1和Spot四足机器人上。
-
Google DeepMind 发布的 Gemini Robotics 2
首次实现了从脚到指尖的AI全身控制。搭载该系统的Apptronik Apollo 2人形机器人可以根据语言指令行走、拿取物品、弯腰放置——整个过程中行走、弯腰、抓取等动作由同一个AI模型统一协调,和以前"走路归走路、抓东西归抓东西"的分离式控制有本质区别。

▲图 | Google DeepMind Gemini Robotics 2实现人形机器人"从脚到指尖"的全身智能控制,机器人可以边走边完成物品整理任务 ©【深蓝具身智能】编译
从这些进展中可以看到一个清晰的趋势:人形机器人要同时具备行走、奔跑、弯腰、抓取、搬运等多种能力,并且这些能力之间可以无缝切换和协调。

机器人运动会:从实验室到赛场
回看本届的世界人形机器人运动会。已经不仅仅在于"机器人也能比赛了"这个新鲜感了,而是它正在推动人形机器人技术从"实验室演示"走向"标准化评测"。
本届运动会的51个项目分为两大类:30个竞技类项目和21个场景类项目。
-
竞技类项目(足球、网球、田径等)检验的是机器人的运动极限:跑得多快、跳得多高、协调性有多好;
-
场景类项目(工业装配、家庭服务、危化巡检等)检验的是机器人的实用能力:能不能在真实工作场景中完成有价值的任务。
这种"竞技+场景"的双轨设计,反映了人形机器人技术发展的现实状态:运动能力已经取得了突破性进展,但要真正走进工厂和家庭,还需要在操作精度、环境适应性、任务理解等方面继续提升。
从首届到第二届,参赛队伍从280支增长到666支,增幅138%。
这个增长速度本身就是产业热度的一个指标,更值得注意的是参赛国家和地区的多样性:16个国家和地区的队伍同场竞技,说明人形机器人已经不再是少数几个国家的专属赛道,而是一个全球性的技术竞争领域。

9.32秒、2.88米后,下一步是什么?
先泼一盆冷水:9.32秒和2.8843米证明的是技术栈的成熟,不是产品的成熟。
单项极限之所以能被快速刷新,恰恰是因为目标单一、工程可以极端化;

▲图 | 抱着“必死”的决心冲线
而产业需要的是全能选手。判断下一步的方向,与其盯着纪录数字,不如看三个正在发生的转向。
-
第一,竞争的坐标轴正在从"极限指标"转向"泛化能力"。
2026年更值得注意的信号不是某项纪录本身,而是"统一":
ZEST让同一套框架零样本迁移到Atlas、宇树G1和Spot身上;Gemini Robotics 2用同一个模型协调从脚到指尖的全部动作。
当行走与操作被纳入同一个策略,"会跑"和"会用"就不再是两台机器人、两套系统。下一个里程碑不是更快的百米,而是一个策略既能冲刺也能叠衣服。
-
第二,瓶颈已经从硬件转向数据。
运动能力之所以能在二十年内追平并超越人类,一个常被忽略的前提是:它几乎可以完全在仿真中习得——
足底与地面的接触、关节的动力学,都足够容易被物理引擎刻画,域随机化再补上剩余的误差。
操作则不同:可变形的物体、千变万化的抓取姿态、指尖牛顿级的力反馈,仿真-现实鸿沟至今没有通用的弥合方案。
于是产业转向真实数据:场景赛、遥操作采集、真机演练,本质上都是在补这块短板。
从这个角度看,本届运动会的21项场景赛与其说是比赛,不如说是一次大规模的真机验收与数据积累;组委会所言的"以赛定标、以标促产",走的正是当年ImageNet之于计算机视觉的路线——
标准化基准先行,产业能力随后跟进。
-
第三,商业化的门槛是可靠性与成本,而非性能。
峰值性能容易,持续作业难:12.66米/秒只能维持几十米,而一块电池能支撑的连续工作时长、整机成本、故障率,才决定机器人能不能进入工单和排班系统。
本届赛事的两个细节说明重心已经转移——完赛时限大幅收紧,比拼的不再是"能不能完赛"而是稳定性;领跑奖牌榜的智元,派出的全部是量产机型。
从ASIMO弯着膝盖小心翼翼地走路,到天工以38.15秒跑完400米,人形机器人的运动能力用二十年完成了从"勉强能走"到"超越人类"的跨越。
而在这个夏天,宇树发布"超人"、波士顿动力发表ZEST、Google DeepMind推出全身控制、2056台机器人在北京同场竞技……正是人形机器人从"实验室明星"走向"日常工具"的一个重要转折点。
而这个转折之后的方向其实已经清晰:机器人已经证明了自己“能到达”,接下来要证明的是“能完成”。
运动能力是基础设施,操作能力是上层应用,两者的结合才是"通用具身智能"的完整图景。
编辑|阿豹
审编|具身君
扫码添加阿蓝,选择想要加入的交流群即可
(按照提交顺序邀请,请尽早选择)
👇
