具身机器人控制三层架构:VLM规划、MPC/WBC运动……

11.gif

640.gif

‘大脑’决定去哪,‘小脑’决定怎么走,‘脊髓’决定别摔、别撞、别烧。

——做什么、怎么做

在一般的工作讨论中,具身机器人的控制机制经常按照动物的神经组织方式分层。

  • 上层称为大脑层,处理环境理解与任务规划;

  • 中间是小脑层,负责运动协调与轨迹生成;

  • 处在下方的是脊髓反射层主管不经过大小脑的快速保护动作。

如果按工程栈展开,大致就是:VLM 层 → 技能策略层 → WBC/MPC 层 → 反射与安全层。

这种分法源于生物学,工程上把它当作设计框架。

需要说明,实际系统的边界没有分得这么清楚,层与层之间经常有重叠,划分多半出于工程习惯,只是借用生物概念。早期机器人常用单一控制器,任务简单时够用,任务复杂以后,失败率明显上升。

这种分层的动机来自延迟与算力的矛盾:

决策需要大量计算,快速反应却等不起计算完成;只靠大脑层集中计算,算力和时延都吃不消。

于是,任务按层次拆开,算力也按层次分配。

对时延敏感的动作在本层闭环,不必上报,响应链路大幅缩短。分层还有一个好处:便于测试与安全认证,每一层的故障范围可以独立界定。

本文将沿着 “做什么 → 怎么做 → 保命” 这条主线,把大脑层、小脑层、脊髓反射层逐层拆开:

每一层的职责边界、技术选型、算力与硬件平台,以及它们之间的数据流与故障降级机制。

用一套清晰的时间尺度,串联起这条看似复杂的控制链路。

09.webp

大脑层

它到底管什么

按一般划分标准,大脑层回答 "做什么"

它接收相机,激光雷达,麦克风传来的信号,建立对环境的理解,把任务分解成有序步骤。

以“把水杯放到桌上”为例:

系统先识别水杯位置判断桌面高度,规划行走路线,然后决定伸手时机。这些决定以秒级到分钟级的频率更新,输出是高层指令,没有直接接触电机。

任务急的时候,这层会跳过部分规划,直接走预设流程,把时间省下来。

这层是作为总指挥具体执行交给下层。

导航与建图SLAM通常归入这一层,机器人先回答“我在哪,周围有什么,然后处理“接下来做什么”

边界很清楚:大脑层出错时,后续各层会跟着出错,因此这一层的正确性关系到全局,不能指望小脑层和反射层来纠偏

常用模型:LLM、VLM、VLA

大脑层常用的模型可以排成一条演进链:

  • LLM(大语言模型):把自然语言指令解析成结构化任务;
  • VLM(视觉语言模型):做模态对齐,让图像与文字对应起来;
  • VLA(视觉语言动作模型):输出直接落在动作上,把感知结果变成动作分布。

任务与运动规划(TAMP)方法把高层描述分解为可执行的动作序列,常见实现是行为树与有限状态机。遇到开放场景,蒙特卡洛树搜索在多种候选动作之间做选择,世界模型预测环境下一时刻的变化,为规划提供输入。

强化学习在这一层的主要角色在训练阶段,训练完成的策略网络在推理时给出决策。

工程难点:不是模型能跑就行

大脑层的难点,主要不在“能不能推理”,而在工程化:

  • 推理慢

这类模型参数量大,一次推理需要几百毫秒乃至数秒,天然无法进入快速反馈回路。

  • 数据贵

VLA 需要海量具身数据,采集成本高、公开数据集少,训练出来的模型泛化表现不稳。

  • 工程细节决定体验

模型输出结果要缓存和复用——相似场景下的规划结果可以省去重复推理,这类工程细节直接决定实际响应速度。多模态输入的对齐、长指令的上下文管理、输出动作的合理性约束,同样要靠工程处理兜底。

比如NeuroVLA系统在这一层用Qwen-VL 做视觉语言骨干,Q-Former提取任务相关意图,模拟皮质脊髓束的语义筛选,输出高层运动目标,跑在 CUDA 计算层上。

640.webp

图 | NeuroVLA©【深蓝具身智能】编译

  • 大脑层的处理器要求

大模型推理依赖GPU 或专用 AI 芯片SoC,显存容量与带宽直接决定推理速度。算力需求通常以数百至数千 TOPS 计量,功耗从几十瓦到几百瓦。

在部署路线上有一个关键取舍:云端 or 机载?

云端方案把推理放到数据中心,通过无线链路把结果传回机器人,无线回传引入额外时延,在信号差的厂房里可能达到秒级。因此多数产品选择机载部署,同时用量化,剪枝与模型蒸馏压缩模型体积。

功耗与散热限制迫使设计者在机载算力和云端算力之间权衡,这部分成本构成整机成本的主要部分。

640 (1).webp
10.webp

小脑层

它到底管什么

小脑层则是主要负责“怎么做”它把大脑层的意图翻译成关节空间的运动指令,主要围绕一件事情——让动作真正“协调”:

  • 逆运动学求解、动力学补偿;
  • 平衡维持、步态生成与全身协调;
  • 输出各关节的位置、速度和力矩指令,更新频率在 100 Hz ~ 1 kHz 量级。

走路时重心放哪只脚,抬腿多高,这些判断由这一层作出;维持平衡所需的手臂摆动,同样落在这一层;

步态生成常用倒立摆模型近似,加上零力矩点约束保证落脚稳定,髋关节高度控制处理起伏地形;

还有关节处的阻抗调节在这里完成,遇到外力时关节表现得柔软,避免硬碰硬。

它的两个接口也很清晰:

  • 向上:接收大脑层的抽象任务描述;
  • 向下:向反射层传递具体的力矩边界。

经典方法:MPC + WBC

小脑层的经典做法是模型预测控制MPC与全身控制WBC

  • 模型预测控制(MPC)在每个控制周期内解一个优化问题:

其中  是状态, 是控制输入, 与  是权重矩阵,约束包含关节限位与地面接触条件;

预测时域的长度决定计算量与前瞻范围。控制时域决定更新频率;

非线性动力学先线性化,在每步重新计算,形成线性时变模型预测控制;

权重矩阵  和  的取值靠经验调, 给大时,跟踪紧一些, 给大,动作自由一些,两者之间的平衡决定走路姿态;

模型预测控制的鲁棒性来自每步重新求解,模型误差在每一步被修正,没有积累的机会。

  • 全身控制(WBC)则把机器人动力学写成等式约束

在满足受力条件的前提下分配各关节力矩,重心,躯干姿态,脚部位置这些任务按重要性排队。

状态估计常用扩展卡尔曼滤波,把惯导,关节编码器与视觉数据融合起来。

学习方法:RL 的"下沉"

近些年深度强化学习训练的策略网络下沉进这一层:策略在仿真环境里训练,用域随机化减少迁移损失,随后部署到实物。

基于学习的步态策略在四足机器人上效果尤其突出,地形适应性好——传统方法难以复制这种表现。

实时性:这一层的生命线

小脑层对实时性要求严格,指令必须在一个控制周期内算完,时延抖动要低。处理器快慢是次要问题,时延抖动直接决定控制质量:

  • 主处理器用 CPU 加实时操作系统,优化问题的求解可用 FPGA 加速;

  • 这一层常见的芯片有工业级实时 CPUFPGADSPTI C2000 一类),MCUSTM32,瑞萨 RH850 一类),Jetson 主控,以及专用的运动控制板卡;

  • 算力需求低于大脑层,通常从几十 GFLOPS 到几个 TOPS;

  • 常见硬件组合是 Jetson 一类的主控负责上层计算,MCU 负责执行控制回路,部分方案使用专门的运动控制板卡。

640 (2).webp
11.webp

脊髓反射层

它到底管什么

脊髓反射层处理“紧急制动安全”的问题,类似于生物的下意识反应(不经过大小脑),对机器人也是一样的

碰撞发生、关节力矩超出限制、足底突然失去支撑……这些情形留给反应的时间短,来不及等上层计算结果。

640 (3).webp

图 | 四足机器人腿部的reflex反射路径,在腿部就闭环了,不上报大小脑©【深蓝具身智能】编译

反射动作由传感器信号直接触发,所经回路短,可以就在执行器里面闭环、不上报 时延在微秒到毫秒量级,比上层快几个数量级。

典型的反射机制

足底落地瞬间有冲击 → 反射层调节关节刚度把它吸收掉;

手臂撞上障碍物时 → 机械臂马上切换进柔软模式避免伤人;

电机电流异常增大 → 系统按碰撞处理;

足底压力一旦低于阈值 → 抬腿反应被触发。

支撑这些反应的模型基本是固定逻辑,没有学习成分。

  • 力矩是否超限,靠阈值比较器判断;

  • 触觉传感器一旦触发,直接生成摆动动作;

  • 阻抗控制设有安全钳位,输出力矩被限制在允许范围,写公式就是一条饱和函数:

  • 急停逻辑的优先级高于其他一切指令;

  • 多个冗余传感器的信号互相表决,单个器件误报不会引发动作。

为什么不用学习模型?

这一层没有采用学习模型,因为它必须在任何输入下保持确定行为——可预测性排在第一位。

有些设计干脆把反射逻辑做成硬件电路,程序无需运行,故障模式容易分析。学习策略的输出在到达电机之前,先过这一层过滤,越界部分被截断。

阈值从哪里来?

通常靠仿真标定和实物试验,留出安全裕量。阈值定得过紧,正常动作被误伤;定得过松,保护起不到作用。

NeuroVLA的Spiking Spinal模块是个特例,相当于把大模型也下沉进了反射层。

LIF 脉冲神经网络做执行接口:膜电位带状态,能保留短时记忆,网络结构带残差连接,输出端用连续积分解码,把脉冲转成平滑的关节指令;

事件驱动稀疏:让神经元在动作变化时发放,静止姿态下接近静默,功耗跟着降下来;

整个系统端到端训练,脉冲部分用代理梯度解决不可导问题。

生物体的膝跳反射不需要大脑参与,机器人里面把这套逻辑搬了过来,实现改成了电路和阈值。

论文把整体策略写成三层映射的复合,形式是

其中 是当前视觉观测, 是语言指令,是本体感觉历史压缩出的动态上下文。脊髓模块的 神经元动力学写成

是膜电位衰减因子,是突触权重,是输入脉冲序列,是发放阈值。

据研究报告,检测到碰撞力以后触发撤退反射,时间小于 20 毫秒,皮层回路要 200 毫秒以上,本地感觉运动回路快了 10 倍。

研究还观察到两种自发出现的稀疏形式:静态时神经元回到静默,控制信号按身体部位分离成不同的发放模式——均无额外监督。

640 (4).webp

图 | 基于FPGA平台的神经形态处理器©【深蓝具身智能】编译

  • 可靠性要求,三层中最高的

典型配置:一颗几百兆赫兹的单核 MCU 足够,复杂一点的用 CPLD 或 FPGA,特殊场合用模拟电路;
神经形态方向:Intel Loihi、IBM TrueNorth、清华天机 Tianjic、SynSense Speck 这类事件驱动芯片;
运行环境:无操作系统或简单实时内核。

Spiking Spinal模块部署在自研的 FPGA 神经形态处理器上,用 LIF 脉动阵列加尖峰稀疏感知,抑制不活跃的事件,省掉无效的神经元更新。

在该研究中,也拿其和 TrueNorthLoihi 这类顺序更新的处理器做比较,认为脉动阵列的并行更新快于顺序更新。

640 (5).webp
12.webp

层间衔接与数据流

数据流:向上压缩,向下翻译

各层之间靠明确接口衔接,数据流有两个方向,传感器信息分级传递,数据频率从上到下层层升高,抽象程度层层降低,信息量反而增加:

向上:关节编码器与触觉信号直接进入反射层,同时把处理过的摘要送给上层。反射层向上传的数据经过压缩,保留峰值和方向这类摘要——上层不需要处理原始触觉流。

向下:上层指令向下逐级翻译——大脑层的任务描述变成小脑层的轨迹,随后变成反射层能监视的力矩范围。

接口定义要稳定,改一层不至于牵连另一层——这是分层结构的主要收益。

时延预算:分层的底层逻辑

时间尺度上的分工,直接决定了算力预算的分配方式:

  • 大脑层慢,延迟要求松,大量算力花在模型推理上,决策允许百毫秒量级;
  • 小脑层控制周期固定,计算必须按时完成,算力留给确定性的优化求解,时延要求毫秒到十毫秒;
  • 反射层消耗的算力近乎为零,换来的要求是硬件级可靠性,时间预算落在亚毫秒。

设计上要求各层能独立运行:

  • 大脑层死机时小脑层维持站立与简单行走,反射层始终保护执行器与结构;

  • 小脑层出问题时,大脑层应当停止下发新任务,把系统转入安全模式。

各层之间用看门狗互相监视,异常时逐级降级。

这种机制比单层系统好验证,因为每一层的故障范围可以限定。

当然,代价也明码标价。每层算力按峰值需求配置,空闲时段多,整机算力利用率不高。

13.webp

分层,不仅是自然规律

这种分层是一种工程妥协,同自然规律或许真的关系不大。

如果将来单个芯片足够强大,且机身总线传导速度和带宽都足够,完全可以不分层。行业也确实在往这个方向走——“大小脑一体化 SoC”和“视触同源”已经出现在新一代具身智能芯片的技术路线里。

640 (6).webp

图 | 大小脑融合,来自《具身智能芯片技术路线新动向:“大小脑一体化SoC”和“视触同源”》一文©【深蓝具身智能】编译

实际产品里边界并不那么固定:不同公司的系统,有的把部分规划下沉到小脑层,有的把学习控制器放在中间层。

NeuroVLA 把神经形态芯片放进反射层,是分层思路的一种具体化——它在能效和反射速度上的表现值得关注,但训练和部署的完整流程尚未定型。

划分本身的价值在于给出时延预算与算力预算的组织方式。

对多数轮式机器人,双足机器人和四足机器人来说,这种理解已经够用。形态超出常规的机器人(例如软体机器人),需要重新考虑分层方式。(这里描述的框架当参照用,具体取舍要看任务与成本。)

说到底,大脑定方向,小脑管动作,脊髓守底线,三者并非替代关系。

今天的分层逻辑,恰恰是理解这场融合的起点。因为只有看清每一层在管什么,才知道哪些边界正在消失,哪些底线必须保留。

编辑|咖啡鱼

审编|具身君

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png