

‘大脑’决定去哪,‘小脑’决定怎么走,‘脊髓’决定别摔、别撞、别烧。
——做什么、怎么做
在一般的工作讨论中,具身机器人的控制机制经常按照动物的神经组织方式来分层。
-
上层称为大脑层,处理环境理解与任务规划;
-
中间是小脑层,负责运动协调与轨迹生成;
-
处在下方的是脊髓反射层,主管不经过大小脑的快速保护动作。
如果按工程栈展开,大致就是:VLM 层 → 技能策略层 → WBC/MPC 层 → 反射与安全层。
这种分法源于生物学,工程上把它当作设计框架。
需要说明,实际系统的边界没有分得这么清楚,层与层之间经常有重叠,划分多半出于工程习惯,只是借用生物概念。早期机器人常用单一控制器,任务简单时足够用,任务复杂以后,失败率明显上升。
这种分层的动机来自延迟与算力的矛盾:
决策需要大量计算,快速反应却等不起计算完成;只靠大脑层集中计算,算力和时延都吃不消。
于是,任务按层次拆开,算力也按层次分配。
对时延敏感的动作在本层闭环,不必上报,响应链路大幅缩短。分层还有一个好处:便于测试与安全认证,每一层的故障范围可以独立界定。
本文将沿着 “做什么 → 怎么做 → 保命” 这条主线,把大脑层、小脑层、脊髓反射层逐层拆开:
每一层的职责边界、技术选型、算力与硬件平台,以及它们之间的数据流与故障降级机制。
用一套清晰的时间尺度,串联起这条看似复杂的控制链路。

大脑层
它到底管什么
按一般划分标准,大脑层回答 "做什么"。
它接收相机,激光雷达,麦克风传来的信号,建立对环境的理解,把任务分解成有序步骤。
以“把水杯放到桌上”为例:
系统先识别水杯的位置和判断桌面高度,规划行走路线,然后决定伸手时机。这些决定以秒级到分钟级的频率更新,输出是高层指令,没有直接接触电机。
任务急的时候,这层会跳过部分规划,直接走预设流程,把时间省下来。
这层是作为总指挥,具体执行交给下层。
导航与建图SLAM通常归入这一层,机器人先回答“我在哪,周围有什么“,然后处理“接下来做什么”。
边界很清楚:大脑层出错时,后续各层会跟着出错,因此这一层的正确性关系到全局,不能指望小脑层和反射层来纠偏。
常用模型:LLM、VLM、VLA
大脑层常用的模型可以排成一条演进链:
-
LLM(大语言模型):把自然语言指令解析成结构化任务; -
VLM(视觉语言模型):做模态对齐,让图像与文字对应起来; -
VLA(视觉语言动作模型):输出直接落在动作上,把感知结果变成动作分布。
任务与运动规划(TAMP)方法把高层描述分解为可执行的动作序列,常见实现是行为树与有限状态机。遇到开放场景,蒙特卡洛树搜索在多种候选动作之间做选择,世界模型预测环境下一时刻的变化,为规划提供输入。
强化学习在这一层的主要角色在训练阶段,训练完成的策略网络在推理时给出决策。
工程难点:不是模型能跑就行
大脑层的难点,主要不在“能不能推理”,而在工程化:
-
推理慢
这类模型参数量大,一次推理需要几百毫秒乃至数秒,天然无法进入快速反馈回路。
-
数据贵
VLA 需要海量具身数据,采集成本高、公开数据集少,训练出来的模型泛化表现不稳。
-
工程细节决定体验
模型输出结果要缓存和复用——相似场景下的规划结果可以省去重复推理,这类工程细节直接决定实际响应速度。多模态输入的对齐、长指令的上下文管理、输出动作的合理性约束,同样要靠工程处理兜底。
比如NeuroVLA系统在这一层用Qwen-VL 做视觉语言骨干,Q-Former提取任务相关意图,模拟皮质脊髓束的语义筛选,输出高层运动目标,跑在 CUDA 计算层上。

▲图 | NeuroVLA©【深蓝具身智能】编译
-
大脑层的处理器要求很高
大模型推理依赖GPU 或专用 AI 芯片SoC,显存容量与带宽直接决定推理速度。算力需求通常以数百至数千 TOPS 计量,功耗从几十瓦到几百瓦。
在部署路线上有一个关键取舍:云端 or 机载?
云端方案把推理放到数据中心,通过无线链路把结果传回机器人,无线回传引入额外时延,在信号差的厂房里可能达到秒级。因此多数产品选择机载部署,同时用量化,剪枝与模型蒸馏压缩模型体积。
功耗与散热限制迫使设计者在机载算力和云端算力之间权衡,这部分成本构成整机成本的主要部分。


小脑层
它到底管什么
小脑层则是主要负责“怎么做”。它把大脑层的意图翻译成关节空间的运动指令,主要围绕一件事情——让动作真正“协调”:
-
逆运动学求解、动力学补偿; -
平衡维持、步态生成与全身协调; -
输出各关节的位置、速度和力矩指令,更新频率在 100 Hz ~ 1 kHz 量级。
走路时重心放哪只脚,抬腿多高,这些判断由这一层作出;维持平衡所需的手臂摆动,同样落在这一层;
步态生成常用倒立摆模型近似,加上零力矩点约束保证落脚的稳定,髋关节高度控制处理起伏地形;
还有关节处的阻抗调节在这里完成,遇到外力时关节表现得柔软,避免硬碰硬。
它的两个接口也很清晰:
-
向上:接收大脑层的抽象任务描述; -
向下:向反射层传递具体的力矩边界。
经典方法:MPC + WBC
小脑层的经典做法是模型预测控制MPC与全身控制WBC。
-
模型预测控制(MPC)在每个控制周期内解一个优化问题:
其中 是状态, 是控制输入, 与 是权重矩阵,约束包含关节限位与地面接触条件;
预测时域的长度决定计算量与前瞻范围。控制时域决定更新频率;
非线性动力学先线性化,在每步重新计算,形成线性时变模型预测控制;
权重矩阵 和 的取值靠经验调, 给大时,跟踪紧一些, 给大,动作自由一些,两者之间的平衡决定走路姿态;
模型预测控制的鲁棒性来自每步重新求解,模型误差在每一步被修正,没有积累的机会。
-
全身控制(WBC)则把机器人动力学写成等式约束
在满足受力条件的前提下分配各关节力矩,重心,躯干姿态,脚部位置这些任务按重要性排队。
状态估计常用扩展卡尔曼滤波,把惯导,关节编码器与视觉数据融合起来。
学习方法:RL 的"下沉"
近些年深度强化学习训练的策略网络下沉进这一层:策略在仿真环境里训练,用域随机化减少迁移损失,随后部署到实物。
基于学习的步态策略在四足机器人上效果尤其突出,地形适应性好——传统方法难以复制这种表现。
实时性:这一层的生命线
小脑层对实时性要求严格,指令必须在一个控制周期内算完,时延抖动要低。处理器快慢是次要问题,时延抖动直接决定控制质量:
-
主处理器用 CPU 加实时操作系统,优化问题的求解可用 FPGA 加速;
-
这一层常见的芯片有工业级实时 CPU,FPGA,DSP(TI C2000 一类),MCU(STM32,瑞萨 RH850 一类),Jetson 主控,以及专用的运动控制板卡;
-
算力需求低于大脑层,通常从几十 GFLOPS 到几个 TOPS;
-
常见硬件组合是 Jetson 一类的主控负责上层计算,MCU 负责执行控制回路,部分方案使用专门的运动控制板卡。


脊髓反射层
它到底管什么
脊髓反射层处理“紧急制动安全”的问题,类似于生物的下意识反应(不经过大小脑),对机器人也是一样的。
碰撞发生、关节力矩超出限制、足底突然失去支撑……这些情形留给反应的时间短,来不及等上层计算结果。

▲图 | 四足机器人腿部的reflex反射路径,在腿部就闭环了,不上报大小脑©【深蓝具身智能】编译
反射动作由传感器信号直接触发,所经回路短,可以就在执行器里面闭环、不上报。 时延在微秒到毫秒量级,比上层快几个数量级。
典型的反射机制
足底落地瞬间有冲击 → 反射层调节关节刚度把它吸收掉;
手臂撞上障碍物时 → 机械臂马上切换进柔软模式避免伤人;
电机电流异常增大 → 系统按碰撞处理;
足底压力一旦低于阈值 → 抬腿反应被触发。
支撑这些反应的模型基本是固定逻辑,没有学习成分。
-
力矩是否超限,靠阈值比较器判断;
-
触觉传感器一旦触发,直接生成摆动动作;
-
阻抗控制设有安全钳位,输出力矩被限制在允许范围,写公式就是一条饱和函数:
-
急停逻辑的优先级高于其他一切指令;
-
多个冗余传感器的信号互相表决,单个器件误报不会引发动作。
为什么不用学习模型?
这一层没有采用学习模型,因为它必须在任何输入下保持确定行为——可预测性排在第一位。
有些设计干脆把反射逻辑做成硬件电路,程序无需运行,故障模式容易分析。学习策略的输出在到达电机之前,先过这一层过滤,越界部分被截断。
阈值从哪里来?
通常靠仿真标定和实物试验,留出安全裕量。阈值定得过紧,正常动作被误伤;定得过松,保护起不到作用。
NeuroVLA的Spiking Spinal模块是个特例,相当于把大模型也下沉进了反射层。
用LIF 脉冲神经网络做执行接口:膜电位带状态,能保留短时记忆,网络结构带残差连接,输出端用连续积分解码,把脉冲转成平滑的关节指令;
事件驱动稀疏:让神经元在动作变化时发放,静止姿态下接近静默,功耗也跟着降下来;
整个系统端到端训练,脉冲部分用代理梯度解决不可导问题。
生物体的膝跳反射不需要大脑参与,在机器人里面把这套逻辑搬了过来,实现改成了电路和阈值。
论文把整体策略写成三层映射的复合,形式是
其中 是当前视觉观测, 是语言指令,是本体感觉历史压缩出的动态上下文。脊髓模块的 神经元动力学写成
是膜电位衰减因子,是突触权重,是输入脉冲序列,是发放阈值。
据研究报告,检测到碰撞力以后触发撤退反射,时间小于 20 毫秒,皮层回路要 200 毫秒以上,本地感觉运动回路快了 10 倍。
研究还观察到两种自发出现的稀疏形式:静态时神经元回到静默,控制信号按身体部位分离成不同的发放模式——均无额外监督。

▲图 | 基于FPGA平台的神经形态处理器©【深蓝具身智能】编译
-
可靠性要求,三层中最高的
Spiking Spinal模块部署在自研的 FPGA 神经形态处理器上,用 LIF 脉动阵列加尖峰稀疏感知,抑制不活跃的事件,省掉无效的神经元更新。
在该研究中,也拿其和 TrueNorth,Loihi 这类顺序更新的处理器做比较,认为脉动阵列的并行更新快于顺序更新。


层间衔接与数据流
数据流:向上压缩,向下翻译
各层之间靠明确接口衔接,数据流有两个方向,传感器信息分级传递,数据频率从上到下层层升高,抽象程度层层降低,信息量反而增加:
向上:关节编码器与触觉信号直接进入反射层,同时把处理过的摘要送给上层。反射层向上传的数据经过压缩,保留峰值和方向这类摘要——上层不需要处理原始触觉流。
向下:上层指令向下逐级翻译——大脑层的任务描述变成小脑层的轨迹,随后变成反射层能监视的力矩范围。
接口定义要稳定,改一层不至于牵连另一层——这是分层结构的主要收益。
时延预算:分层的底层逻辑
时间尺度上的分工,直接决定了算力预算的分配方式:
-
大脑层慢,延迟要求松,大量算力花在模型推理上,决策允许百毫秒量级; -
小脑层控制周期固定,计算必须按时完成,算力留给确定性的优化求解,时延要求毫秒到十毫秒; -
反射层消耗的算力近乎为零,换来的要求是硬件级可靠性,时间预算落在亚毫秒。
设计上要求各层能独立运行:
-
大脑层死机时小脑层维持站立与简单行走,反射层始终保护执行器与结构;
-
小脑层出问题时,大脑层应当停止下发新任务,把系统转入安全模式。
各层之间用看门狗互相监视,异常时逐级降级。
这种机制比单层系统好验证,因为每一层的故障范围可以限定。
当然,代价也明码标价。每层算力按峰值需求配置,空闲时段多,整机算力利用率不高。

分层,不仅是自然规律
这种分层是一种工程妥协,同自然规律或许真的关系不大。
如果将来单个芯片足够强大,且机身总线传导速度和带宽都足够,完全可以不分层。行业也确实在往这个方向走——“大小脑一体化 SoC”和“视触同源”已经出现在新一代具身智能芯片的技术路线里。

▲图 | 大小脑融合,来自《具身智能芯片技术路线新动向:“大小脑一体化SoC”和“视触同源”》一文©【深蓝具身智能】编译
实际产品里边界并不那么固定:不同公司的系统,有的把部分规划下沉到小脑层,有的把学习控制器放在中间层。
NeuroVLA 把神经形态芯片放进反射层,是分层思路的一种具体化——它在能效和反射速度上的表现值得关注,但训练和部署的完整流程尚未定型。
划分本身的价值在于给出时延预算与算力预算的组织方式。
对多数轮式机器人,双足机器人和四足机器人来说,这种理解已经够用了。形态超出常规的机器人(例如软体机器人),需要重新考虑分层方式。(这里描述的框架当参照用,具体取舍要看任务与成本。)
说到底,大脑定方向,小脑管动作,脊髓守底线,三者并非替代关系。
今天的分层逻辑,恰恰是理解这场融合的起点。因为只有看清每一层在管什么,才知道哪些边界正在消失,哪些底线必须保留。
编辑|咖啡鱼
审编|具身君
扫码添加阿蓝,选择想要加入的交流群即可
(按照提交顺序邀请,请尽早选择)
👇
