

解决:算法越来越“胖”,但机器人能携带的算力芯片却依然“瘦弱”。
——MoE,从小显存跑大模型说起
当你把一个大模型塞进人形机器人的脑袋里,往往会发现它还没开始工作,显存就已经溢出了。
这就是“显存墙”:模型参数、KV缓存、中间激活值三重叠加,消费级显卡和机器人端侧芯片根本扛不住。
于是,混合专家架构(MoE, Mixture of Experts)出现了。

▲图| LingBot-Video,一个具身专属的MoE,来自网络©【深蓝具身智能】编译
用一句话,我们先简单介绍MoE。
混合专家,直白说就是把一整个大神经网络拆成一堆分工明确的小型子网络,也就是“专家”,再配一个负责分配任务的门控调度层。
核心逻辑是不用每次推理都调动全部网络,只挑匹配当前输入的一小部分专家参与计算。
依靠稀疏激活特性,实现“总参数量能堆到超大、单次推理只激活少量参数”,打破显存与算力双重约束,是现在小显存设备跑超大基础模型最核心的技术路线。
“

小显存承载大模型的底层矛盾
先区分稠密模型、MoE稀疏模型的本质区别。
稠密模型
传统稠密Transformer属于全激活网络,模型里每一组参数、每一层网络单元,不管输入是什么内容,前向推理时全部都要参与运算,没有任何闲置模块;
显存占用由模型权重、KV缓存、中间激活值三部分叠加固定死,一点都省不下来,形成很难跨过去的硬件门槛。
7B稠密模型FP16精度就要14GB左右显存,34B模型直接突破60GB,机器人机载SoC普遍只有8–16GB显存,完全无法加载中大型稠密模型。
具身智能需要长时序上下文,KV缓存占用随上下文长度二次增长,128K上下文稠密模型缓存可达数十GB,机器人运行频繁出现OOM显存溢出,前向传播特征图、训练梯度张量还会进一步拉高显存开销。
由于成本原因,工业机械臂、人形机器人机载芯片显存普遍8–16GB,自动驾驶域控制器多为16–32GB,稠密VLA视觉-语言-动作模型、通用世界模型无法本地部署,只能依赖云端推理,百毫秒级通信延迟无法满足机器人10–50ms实时控制要求。
-
缺点
行业早期优化方案各有短板,量化、剪枝、蒸馏会削弱多模态与物理推理能力,硬盘分片交换带来秒级推理延迟,升级HBM显存硬件成本过高,不适合规模化量产。
MoE
MoE是Transformer架构改良变体,核心改造集中在前馈网络FFN层,抛弃单一全量网络设计,整套架构包含大量独立专家子网络、全局共享基础网络、门控路由调度器。
-
专家是独立小型FFN网络,各司其职完成细分任务;
-
稀疏激活是MoE核心,推理时门控仅筛选Top-K匹配专家运算,其余专家休眠;
-
整套模型由分工各异的专家混合调度推理,因此命名混合专家。

▲图| MoE概念©【深蓝具身智能】编译
完整运行流程为门控对多模态输入打分筛选专家,总参数量可拓展至万亿级别,但单次仅激活5%–10%参数,推理无需全部专家常驻显存,搭配动态缓存实现小显存承载超大模型。
Mixtral-8×7B总参47B,单次激活仅14B,同等规模稠密模型需要90GB以上显存;
DeepSeek-R1 671B模型推理激活370B参数,16GB显存设备借助分页(370B还有分成多页)调度即可本地运行,EdgeMoE、FloE等边缘框架叠加量化、预取技术,显存占用显著降低。

MoE核心原理以及为什么它适配低显存具身端侧
标准MoE Transformer由共享专家、路由专家、门控路由三部分构成,适用于图像、点云、语言、关节信号等等多模态输入。
-
共享专家是一直激活的,编码通用物理常识与基础视觉特征,保障基础感知稳定;
-
路由专家为大量独立FFN子网络,分别负责视觉分割、动力学计算、语言推理、导航规划等细分任务;
-
门控路由是轻量化线性网络,输出各专家匹配权重筛选Top-K参与计算,训练加入负载均衡损失,避免专家冷热不均。
更具体一点的话,混合专家模型(MoE)的核心可以通俗理解为靠大参数量堆知识储备,用低激活量控推理成本,在效果和效率之间找到平衡点。
以DeepSeek V3为例,它的总参数量达到671B,具备千亿级大模型的知识广度,但每个token推理过程中仅激活37B参数,只占总参数的约1/18,最终实现了拥有671B级别的知识储备,却只需要37B级别的推理成本的效果。
这和你考语文时不想数学,考数学时不想语文是一样的。
这是传统密集型(Dense)模型无法同时做到的优势,密集模型如果要提升知识量就必须增大整体参数量,推理成本会同步线性上升。
MoE架构靠三个核心组件的协同设计:
-
多专家模块(Experts):
Transformer结构中每层的前馈网络(FFN)会被独立复制N份(行业常见配置为8、64或256份),每一份就相当于一个独立的「专家」。
在模型训练过程中,不同专家会自动学习到不同的能力偏向,比如有的专家擅长自然语言理解、有的擅长代码生成、有的擅长数学推理、有的负责存储通用知识,形成分工明确的能力矩阵。
-
路由分配器(Router):
每个输入token进入MoE层时,路由分配器会先计算该token与各个专家的匹配度得分,根据得分选择最合适的专家处理这个token。
最主流的分配策略是Top-K路由(通常选择1个或2个匹配度最高的专家),而DeepSeek V3采用的是更灵活的「Top-8动态路由+1个全局共享专家」的方案,兼顾了分配精度和通用能力覆盖。
-
负载均衡机制:
训练过程中会额外加入辅助损失函数,避免出现「专家偏科」问题:
防止路由分配器总是优先选择少数几个专家,导致其他专家得不到足够的训练数据、能力无法充分发挥,最终保证所有专家都能得到充分训练,实现能力的均衡发展。
两个原因,一个是FFN结构简单好处理,二是FFN参数多体积大值得拆。
标准 Transformer 单层中,FFN 参数量占比约 70%~80%,多头注意力仅占 20% 以内。

▲图| Switch Transformers论文的 MoE layer图示,来自原始论文©【深蓝具身智能】编译
MoE针对小显存设备存在三个核心优势
-
第一是激活显存大幅压缩
稠密模型激活张量与总参数量正相关,MoE仅运算少量专家,激活显存下降一个数量级,16GB机载GPU可稳定运行8K上下文MoE-VLA,同等能力稠密模型需要64GB显存。
-
第二,专家动态分页调度机制
FloE、ReMoE将高频专家存入显存,冷门专家存放内存闪存,路由提前预取所需专家掩盖IO阻塞,ReMoE优化后专家复用率提升26%,显存交换开销降低30%,适配机器人低带宽内存架构。
-
第三,多任务显存冗余消解
还有多任务解耦减少显存冗余,稠密多任务模型所有参数常驻显存且任务特征相互干扰,MoE不同任务分配独立专家,闲置专家可卸载释放显存,多任务并行显存占用降低明显。
适配端侧落地的显存优化工程技术包含四类:
专家粒度量化,视觉、动作敏感专家保留FP16,共享专家使用INT4/INT8量化,显存减半且精度损失低于阈值;
基于任务贡献度剪枝冗余专家,总参数量缩减70%不影响稀疏推理效率;
流水线预取并行执行路由预测、专家加载、模型推理,将机器人控制延迟稳定控制在50ms以内;
混合专家并行,单卡分片缓存专家、多卡并行推理,低成本拓展模型整体容量。

MoE在具身智能体系中的地位
完整具身智能链路一般覆盖多模态感知、高层语义决策、低阶运动控制、环境世界模型四层。

▲图| 自变量机器人开源WALL-OSS是MoE加上CoT双引擎驱动的具身智能统一架构©【深蓝具身智能】编译
MoE是贯穿全链路的底层架构范式,同步解决大容量、低显存、低延迟、多任务泛化多个痛点,分为三层核心定位。
-
底层硬件适配层面
在具身智能与端侧部署场景中,人形机器人、移动设备及车载域控的显存容量普遍受限(8–32GB),稠密架构的千亿多模态模型在成本与延迟上难以满足量产标准。
相比之下,MoE稀疏架构凭借其动态激活机制,可大幅降低单次推理的算力与带宽需求,目前被业界视为端侧部署千亿级模型最可行的工程路径之一。
结合模型量化与专家裁剪技术,MoE有望解决端侧缺乏高性能通用模型的痛点,为具身智能从云端远程控制向本地实时自主运行过渡提供关键的基础设施底座。
-
中层算法能力层面
稠密网络普遍存在任务负迁移问题,同步学习抓取、行走、对话时任务特征互相干扰,陌生场景成功率大幅下滑。
MoE依靠专家分工天然解耦任务,视觉、语言、动力学、导航对应独立专家,训练仅更新对应模块权重,无跨任务干扰,小样本新任务仅微调专属专家,泛化能力提升明显,MoE-ACT、DeMUSE等机器人模型均完成实验验证。
-
上层通用智能层面
通用具身智能依赖大规模世界模型预测环境动态、预演交互行为,稠密世界模型扩容参数量会直接触发显存爆炸。
MoE可无限扩容专家集群,拆分刚体、流体、人机交互、多物体碰撞专属仿真专家,在有限显存硬件搭建高精度长时序环境预测模型,支撑机器人自主规划与无实体试错学习。

MoE在具身智能几个核心场景落地应用
如前面我们提到的,在面临“千亿级模型的知识广度”与“端侧16-32GB显存/毫秒级实时响应”之间的刚性冲突,MoE 架构凭借稀疏激活与动态路由机制,成为当前缓解这一矛盾的关键工程底座。
-
感知-决策-执行一体化(工业操作场景)
多模态感知场景依托稀疏MoE-VLM/VLA模型,传统稠密RT-2、OpenVLA受显存限制只能轻量化部署,细粒度识别、复杂指令理解能力不足。
MoE架构拆分图像、语言、动作三类专家,分别完成视觉检测、指令拆解、像素到关节坐标映射。
以UR5e机械臂搭载16GB机载GPU为例
MoE-ACT模型部署于UR5e机械臂16GB机载GPU,一套模型完成装配、分拣、人机协作,任务切换无显存溢出;工业巡检机器人搭载该架构无需云端,本地故障识别推理延迟极低。
单套模型即可覆盖装配、分拣、人机协作等多元工况,任务切换时仅需更换激活专家,无需加载全套权重,显存无溢出风险,且本地推理延迟满足产线节拍要求(工业巡检场景故障识别无需上云)。
-
底层实时运动控制(高动态场景)
低阶运动控制场景对延迟要求严格,控制周期必须低于20ms,单一稠密网络无法适配平地、楼梯、重载、柔性物体等多元工况。
MoE按照运动模态划分步态、负载、柔性操控专家,传感器实时采集环境数据后门控快速切换对应动力学模块,无需全局重训。
相比稠密控制网络,显存占用降低约一半,陌生地形步态稳定性也有提升,广泛应用于人形、四足机器人实时运动控制。

-
高层规划与工业级确定性(智能决策场景)
通用大模型的回答具有“概率性”,而工业现场(如装配、焊接)只接受“确定性”输出;且家庭服务机器人需处理多步骤长时序任务,上下文记忆极耗显存。
工业端
MoE架构将大模型的泛化能力约束在工业置信区间之内。
通过融合VLA技术与专家路由,在保证车间环境理解力的同时,强制输出符合物理约束(如关节限位、避障)的自适应轨迹,实现零/少样本任务规划。
服务端
通用常识存放于共享专家,清洁、烹饪、对话等高频动作分属专属专家。长序列任务中,路由仅激活当前步骤相关专家,大幅缩减KV缓存的显存占用,使得端侧芯片有能力承载分钟级的历史交互记忆。
-
环境世界模型与前瞻预测(减少物理试错)
机器人在真实环境中移动、抓取时,对刚体碰撞、流体溅射、柔性形变的预测极度消耗算力,且无法泛化至新场景。
以LingBot-Video为例
将刚体、流体、柔性形变、人机交互预测拆分为独立专家,推理仅激活当前场景匹配模块,大幅削减显存压力。全新环境仅新增少量专家,无需全模型重训,小样本自适应能力提升38.6%,低显存硬件可预测未来10–20帧环境画面,机器人提前规避碰撞,大幅降低实体硬件试错损耗。

MoE落地具身智能现存瓶颈与前沿优化方案
凡事没有绝对完美,当前工程落地存在几类核心痛点:
-
第一,门控路由带来额外计算开销,大规模专家场景新增5–15ms延迟,破坏机器人实时控制约束;
-
第二,专家负载分配不均,高频任务专家长期占用显存,冷门专家频繁交换读写,IO延迟剧烈波动;
-
第三,多模态特征分布差异过大,视觉、语言、运动输入干扰门控打分,专家激活失衡;
-
第四,预训练阶段(不是推理阶段)所有专家权重必须常驻显存,超大MoE训练依赖多卡集群,小型实验室硬件条件难以支撑。
对应端侧优化方案大致分为五类:
(1)时序感知路由ReMoE利用机器人连续时序图像优化门控逻辑,提升帧间专家复用率,减少显存交换;
(2)模态分离门控为视觉、语言、运动搭建独立路由分支,隔离多模态特征干扰,负载均衡损失降低;
(3)硬件感知专家裁剪读取设备显存容量,自动剔除低贡献冗余专家,实现模型规模自适应硬件;
(4)训练推理分离架构,预训练开启负载均衡损失优化权重分配,推理阶段直接关闭该计算,削减门控额外开销;
(5)混合精度协同压缩融合剪枝、量化、分页加载技术,万亿级MoE模型可部署至16GB边缘硬件。

未来演进:MoE驱动通用具身智能的技术路线
随着端侧优化技术持续迭代,MoE将推动具身智能完成从“云端辅助”到“本地通用自主智能”的跨越,未来将呈现四大发展趋势:架构轻量化、全栈一体化、智能可生长、软硬件协同。
显存墙是制约具身智能商业化落地的核心硬件枷锁,传统稠密模型的全激活架构存在原生缺陷,量化、剪枝、硬件升级等优化均是治标不治本。
而MoE混合专家架构,通过稀疏激活、按需调度的核心范式,从根源上平衡了模型能力、推理成本、端侧显存开销三者矛盾。
如今的MoE,早已不止是一项显存优化技术,更是通用具身智能的底层核心架构。它既解决了端侧设备算力、显存不足的工程难题,又通过专家专业化分工破解了稠密模型多任务泛化弱、负迁移的算法短板,是未来人形机器人、端侧通用智能规模化落地的核心基石。
编辑|咖啡鱼
审编|具身君
扫码添加阿蓝,选择想要加入的交流群即可
(按照提交顺序邀请,请尽早选择)
👇
