超级独角兽Skild发布S1,成功将上下文学习搬进机械臂!仅用一段视频,搞定十分钟陌生任务

11.gif

640.gif

迄今为止,机器人技术一直停留在BERT时代。

——任务由视频演示指定,而非语言

大语言模型最关键的一步跃迁,不是参数变大,而是从BERT时代的"每个任务都要微调"走到GPT的"给个提示就能干"——也就是上下文学习。

机器人领域至今还卡在BERT阶段:想让机械臂学一个新任务,先花几小时遥操作采集数据,再跑一轮任务专属微调,验证完才能上线。换一个任务,整套流程重来一遍。

Skild AI发布的旗舰机器人基础模型S1,把上下文学习正式搬进了机械臂操作。

640 (1).gif

任务演示进入上下文窗口,策略将其翻译为自身形态与当前场景下的动作©【深蓝具身智能】编译

给它看一段人类演示视频,不管任务训练时见没见过、时长5秒还是10分钟,它直接在真机上执行,不微调、不后训练,同一套权重跑全部任务

盆栽换盆、摊煎饼、手冲咖啡、套件组装这四个训练集里完全没有的长时序任务,单段视频演示即可驱动,从录演示到机器人自主跑起来最短11分钟。

01.webp

为什么机器人需要上下文学习,而不是语言提示

现在主流VLA(视觉语言动作)模型用语言指令指定任务,“把杯子拿起来"这种原子动作确实够用。但任务一旦变复杂、变长时序,语言就不够用了。

没人能用一句话讲清楚怎么套床单、怎么把蛋白打到硬性发泡、怎么系一个特定的结。

人在这种时候会停止描述,开始"做给你看”。

640 (1).webp

图 | 传统机器人学习流水线:每遇到一个新任务,都要从头采集数据、微调专用策略©【深蓝具身智能】编译

S1的核心判断就是:机器人的任务指定方式应该从语言转向视频演示

预训练阶段,每个任务只用一段上下文演示来指定,演示可能来自不同场景、不同视角、甚至不同本体,策略被迫去理解演示者的意图、功能对应关系和任务进度,而不是死记硬背某条轨迹。

用元学习的话说,预训练是"外环",教会策略怎么从上下文里学;推理时演示驱动"内环",权重一个都不动。

这就引出评估上下文学习能力的两条轴:

  • 任务是否在预训练分布内(已见 vs 完全未见);

  • 任务是短时序原子动作,还是长时序需要组合新技能

目前同期的机器人上下文学习工作,基本都集中在短时序、已见任务上。

S1是第一个在长达10分钟、训练完全没见过的任务上展示上下文学习的机器人基础模型。

02.webp

数据引擎:没有单一数据源能同时赢三个维度

高质量数据是基础模型的核心,但机器人数据的麻烦在于,没有任何一个来源能同时占住三个关键维度:

640 (2).webp

图 | 各类机器人数据源在硬件接近度、多样性、可扩展性三维度上的权衡:遥操作最贴近硬件但最难扩展,第一视角视频正好相反©【深蓝具身智能】编译

  • 硬件接近度:数据和部署硬件有多像;

  • 多样性:覆盖多少任务、场景、行为;

  • 可扩展性:多采一份数据的成本有多高。

遥操作最贴近机器人本体,但采集最慢、最贵;第一视角视频(egocentric video)规模最大、场景最丰富,但和机器人本体之间域差距最大;UMI(单手遥操作采集)居中;仿真可扩展性强但多样性和真实感有限。

Skild的做法是四条线同时在内部扩,并且数据质量控制投入是采集投入的三倍

——每花1美元采数据,花3美元做质量筛查,低质量噪声数据盲目放大反而有害。

03.webp

S1实际能做什么,以及指标背后的真实含义

已见任务:宽基础操作能力

预训练池覆盖大量操作原子技能,S1可以在分布内执行各类抓取、放置、整理任务。

这部分不是重点,因为已见任务上传统VLA本来就不差。

640 (2).gif

未见长时序任务:真正的差异化

四个训练集完全没有的任务:盆栽换盆、摊煎饼、手冲咖啡、套件组装。

每个任务最长10分钟,包含几十步操作,全部由单段视觉演示驱动。S1不仅组合了已知技能,还出现了训练时没有的全新行为——比如挖土给植物腾位置、把咖啡滤纸压进漏斗、翻煎饼。

盆栽任务的时间线很能说明问题:晚上8:54材料送到办公室,大部分时间花在搬家具摆场景,9:22录完一段第一视角人类演示,9:27机器人开始自主执行。

从演示到真机跑起来11分钟

传统流程下,这个任务先要几小时遥操作采集,再微调,再验证,至少是天级周期。

640 (3).webp

ICL缩放定律:未见任务上7倍差距

这是全文最硬核的量化部分。在1k到100k小时数据上,分别训练ICL策略和语言prompt策略,数据、架构、算力完全一致,只改prompt嵌入方式。

640 (4).webp

图 | 成功率随预训练规模变化,对比上下文演示与语言提示:左为已见任务,右为未见任务©【深蓝具身智能】编译

  • 已见任务

小数据(1k小时)时语言prompt反而领先(53% vs 43%),因为语言把任务压缩成token,ICL在小数据上容易过拟合高维条件信息。

但随着数据放大,ICL反超——语言指令允许多种合理执行方式,而演示直接指定了一种模式,歧义更少。

  • 未见任务

100k小时数据下,语言prompt成功率只有9%,ICL达到66%,7倍差距。原因有二:

一是新技能(比如翻煎饼)语言根本没有动作根基,ICL靠广泛视觉对应关系迁移更好;

二是长时序组合任务,语言太粗,没法精确描述一个从未要求过的技能链,演示直接把组合写清楚了。

不过这里的成功率是"每步平均成功率",评测时用人工介入从失败中恢复以确保所有步骤都被评分。66%不是端到端一次跑通的概率,而是平均每一步的成功比例。

另外评测集是内部基准,不是公开第三方榜单,数字的绝对值需要谨慎看待,趋势(ICL在未见任务上显著优于语言prompt)才是核心信息。

一次演示≈380次后训练样本

把差距换算成更直观的概念:

对一个新任务,语言prompt策略需要做多少次后训练遥操作,才能追上ICL策略看一次演示的效果?

640 (6).webp

图 | 匹配一次上下文演示所需的后训练样本数量:一次视频演示约等于380次后训练样本©【深蓝具身智能】编译

答案是约380次

ICL策略从不后训练,看一次演示就到66%;语言prompt策略后训练到2000次样本才到86%。

当然,后训练最终能超过ICL,但Skild预期随着ICL预训练继续放大,这个差距会缩小。

04.webp

涌现出来的特性,以及横向行业定位

抗扰动、错误恢复、常识推理、甚至修正演示

S1表现出几个不是专门训练但自然涌现的行为:

  • 抗扰动:执行中把物体滑走、换掉物体、改变光照,这些演示里没出现过,S1照样完成任务;

  • 错误恢复:失败了会重试,而不是闷头继续——哪怕是滑板轮组装这种未见任务也能恢复;

  • 常识推理:演示里用浇水壶浇花,但现场只有一杯水,S1直接用杯子代替;演示里往杯子倒果汁,但杯子已经快满了,S1只补到满;

  • 修正演示:演示者自己有时会犯错(比如打鸡蛋太早弄洒),S1执行时用更稳的动作完成同一步——它把演示当成目标规格,而不是要复刻的轨迹。

分布偏移鲁棒性:五级扰动测试

选一个已知任务,从L1到L5逐级加大部署场景和训练条件的偏移:

L1同物体同位置,L2物体随机偏移15cm/30°,L3偏移30cm/45°,L4换成功能相似但不同的物体,L5迫使一半动作换到另一只手臂执行。

640 (7).webp

图 | 部署场景偏离训练条件时的成功率:L5强扰动下语言prompt策略退化幅度是ICL的三倍©【深蓝具身智能】编译

L5强扰动下,语言prompt策略退化幅度是ICL的约三倍。

VLA对物体姿态小变化还行,但一旦需要新动作(新物体或新位置迫使新执行计划)就崩;ICL可以直接用一个适配部署条件的演示来提示,灵活度高得多。

640 (8).webp

图 | 部署场景偏离上下文演示时的成功率:ICL对物体位置偏移甚至物体替换都鲁棒,只有执行计划被迫大变时才明显下降©【深蓝具身智能】编译

05.webp

写在最后

机器人可以像大语言模型一样,通过预训练获得"从一段演示里立刻学会新任务"的能力,而不是每个任务都从零采集微调

一次演示约等于380次后训练样本,从录演示到真机执行11分钟——这两个数字如果能在更多场景、更多硬件上复现,机器人部署的经济模型会被根本改变。

过去机器人落地慢,不是算法不够好,而是每个新场景、新任务都要重复一遍数据采集-微调-验证的闭环,成本和周期压得商业化走不动。上下文学习如果真的成立,机器人就能像人一样,看一遍就上手,不行再看一遍。

当然,现在还早。

内部基准、桌面场景、每步成功率而非端到端成功率,这些都是需要继续夯实的地方。

编辑|小小怪博士

审编|具身君

Ref:

Introducing S1: In-Context Learning for Robotics

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png