具身智能面经(一):π论文篇,从π0到π-FAST的24个高频问题

提到具身智能论文,π 系列几乎是一条绕不开的主线。具身领域的论文太多了,很难都读一遍;但如果能把 π 系列的核心论文和演进逻辑吃透,基本就能搭起自己的知识框架,面试时也足够说服面试官。


下面这些问题,是我在面试中被反复问到的,并且这些问题问得都比较细了。把它们真正吃透后,面对大多数围绕 π 系列的面试追问,基本都能从容应对。

 

SHEN LAN

01  π0:架构与动作建模

 

  1. π 系列在 VLM 主体、视觉编码器以及图像与语言 token 融合方面有哪些特殊设计?注意力如何交互?

  2. VLM 的输出如何注入 Flow Matching 动作模块?

  3. π0 中的 action chunk 具体表示哪些时间范围与控制量?模型如何生成并在执行时滚动使用这一段动作?

  4. 若既要利用预训练 VLM,又要对齐连续动作,除了梯度隔断外还有哪些可行的设计?

 

SHEN LAN

 

SHEN LAN

02  π0.5:架构、训练与泛化

 

  1. π0.5 的网络架构、输入与输出、训练损失和关键设计分别是什么?

  2. π0 与 π0.5 在核心目标、数据与动作表示、训练方式和泛化能力上有哪些区别?

  3. π0 与 π0.5 如何处理 VLA 中的机器人本体状态?这种设计差异会带来哪些影响?

  4. π0.5 的 Action Expert 梯度会回传至 VLA 吗?为什么?

  5. π0.5 的开放世界泛化由哪些数据、训练目标和架构设计共同支撑?这些因素分别如何起作用?

  6. π0.5 中用于高层子任务或机器人规划的模块负责预测什么信息?它如何为低层连续动作生成提供条件?

 

SHEN LAN

 

SHEN LAN

03   π*0.6 / π0.7 / RLT:后训练与组合泛化

 

  1. π*0.6 要解决什么问题?为什么大规模 VLA 不易直接采用 PPO?后训练如何转化为近似监督学习?

  2. 在 π0.5、π*0.6 与 RLT 等方法中,replay buffer 在数据闭环和策略更新中承担什么作用?

  3. π*0.6 的 reward model 如何获得奖励信号?奖励设计如何支持后训练?

  4. π0.7 如何提升组合泛化?(额外上下文、原子指令、目标图像与 world model )

  5. RLT 的训练与测试流程是什么?

  6. 请完整说明 ReCAP 的流程,包括人工介入、训练和测试环节。

  7. ReCAP 与 SFT + GRPO 有什么区别?(数据使用、value/reward 建模和策略更新)

  8. 与 PPO 相比,RLT 对 value 的监督有什么不同?

 

SHEN LAN

 

SHEN LAN

04  πFAST与动作表示

 

  1. π-FAST 的离散自回归动作生成,与 π0/π0.5 的连续 Flow Matching Action Expert 相比,各有什么训练和推理取舍?在闭环重规划时,两者又分别有什么限制?

  2. FAST 如何将连续动作序列转换为离散动作 token?与逐维分桶等朴素离散化相比,DCT 与 BPE 分别带来什么变化?

  3. 频域压缩会牺牲哪些动作细节?在什么控制频率、任务精度或闭环要求下,FAST 更适合或不适合?

 

SHEN LAN

 

SHEN LAN

05   π 系列的整体演进

 

  1. π 系列论文的演进脉络是什么?各版本试图解决的核心问题分别是什么?

  2. 如果 π 系列继续推出下一篇工作,你认为最可能的发力方向是什么?

  3. 从动作表示、解码方式和预训练迁移角度比较,π 系列与 RT 系列、OpenVLA 的技术路线有哪些关键差异?

 

SHEN LAN

 

SHEN LAN

06   写在最后

 

在 π 系列论文的面试中,面试官喜欢问的,不仅仅是某个模块“是什么”,更是不同版本之间“为什么要这样改”:它的动机是什么?又解决了前一版本的哪些问题?

因此,读论文时不应只记住“做了什么”,还要理解“为什么这样做”——从问题、动机到设计取舍,从作者的角度出发,建立完整的迭代思路。

 

文章来源:@bo233 知乎作者授权分享:https://zhuanlan.zhihu.com/p/2081126347766875774