"没有触觉就没有具身智能":一个正在被神化的技术神话

640.gif

具身智能的新信仰:触觉为王。。。

——智能一定要有感觉吗?

2026年5月,某灵巧手公司被爆正考虑在香港IPO,下一轮融资目标估值60亿美元

而与此同时,这家公司刚刚向某材料上游企业签下了10万套触觉传感器的采购订单,双方围绕“集成触觉传感的机器人灵巧手技术平台开发”展开深度合作

做手的人,正在疯狂采购触觉皮肤。

另外几家被资本密集下注的公司,核心技术标签也都与「触觉传感」相关。

2026年,"触觉为王" 成了具身智能某细分领域的「新信仰」。

但一个更根本的问题悬而未决:具身智能,真的需要触觉吗?

《银翼杀手》里Roy Batty在雨中死去,他说“我曾见过你们人类无法置信的事物”——却从来没感受过那些雨滴的温度。《星球大战》的C-3PO被拆成零件又重装回来,全程安安静静。《机械姬》里的Ava,永远不会知道被人触碰是什么感觉。

四十年科幻,系统性地做了一件事:让机器人拥有智能,甚至自主觉醒了意识,却从未让它们拥有「触觉」。

现实中,绝大多数自动化设备也没有触觉,在工厂里照样干得很好。为什么到了人形机器人这里,触觉突然成了“不可或缺”?

触觉赛道是虚火还是真金?

三年前,触觉还是具身智能领域可有可无的 "锦上添花"。所有人都在拼视觉大模型和运动控制,没人把触觉当回事。

转折点在 2024 年。当所有人形机器人公司都在为抓取成功率焦头烂额时,大家发现:仅靠视觉,可能做不出能在真实世界工作的灵巧手

所有机器人抓取演示,都必须在实验室的理想条件下进行。稍微有点遮挡或光线变化,成功率就会断崖式下跌。

于是,「触觉传感器」崛起,成了行业的某一根救命稻草。

640 (1).gif

图 | Sharpa North进行GPU插装演示

站在2026年看,触觉赛道三重机遇正在叠加:

灵巧手放量(年销量从1.92万到7.02万,据各官网公司消息不完全统计)渗透率提升(触觉装配从少数到主流),覆盖范围扩张(从指尖到全手到全身)。三条增长曲线叠在一起,触觉传感器的需求正在陡峭攀升。

「灵巧手」只是其中一个支点,也是当下最紧迫的需求点。

但是,抛却「商业噱头和行业炒作」,技术落地才是科技领域永恒的命题。

所以,下面我们结合多篇代表性工作,以灵巧手领域为核心脉络,具体的来聊聊近 3 年「触觉」在技术层面的真正进展。

01.webp

灵巧操作,为什么需要触觉?

当前,灵巧操作的本质困境,不在算力,不在自由度,而在于感官的割裂

视觉天生有死角,触觉始终难融合。

当一台灵巧手伸入狭窄空间、手指弯曲包覆物体的瞬间,外部视觉被完全遮挡,触觉传感器又只有接触发生之后才能反馈信息。

因此,单纯迭代机械结构、升级控制算法,始终无法突破灵巧操作的物理上限。

近三年触觉行业真正的突破性进展,集中围绕感知补全、硬件升级、模态融合、几何认知四大核心维度

感知补全:遮挡下盲区怎么解决?
触觉硬件跃升:触觉能否达到视觉级分辨率?
感知融合:视-触信号如何统一表征?
几何理解:触觉信息如何被策略真正“理解”?

640.png

图源网络

02.webp

为什么灵巧操作这么难?

——感知的"死角"

人类在抓取一个小物件时,视觉、触觉和本体感觉几乎是同步工作的:

眼睛提供目标的位置和形状,手指在接近时感知空气阻力和温度变化,接触瞬间皮肤的触觉感受器会迅速反馈压力分布和纹理信息,整个过程流畅而自然。

机器人则不然,它的"感官"往往是割裂的,而且在物理结构上存在天然的局限。

这种割裂来自两个断层。

  • 第一,视觉遮挡。 

固定相机被臂体遮挡,腕部相机被手指自遮挡:越是接近成功抓取的“最后一厘米”,视觉信号越接近失明。

  • 第二,触觉延迟。 

触觉传感器只有接触发生后才能提供信息,在“接近-触碰”的过渡期完全真空。

两个断层叠加,造成的一个不可避免的后果是:

当外部视觉被遮挡、触觉尚未激活时,机器人的感知世界几乎坍缩为一个点

系统只知道“有根手指在运动”,却对它与物体的空间关系一无所知,只能靠预设轨迹“蒙着干”。

这也是为什么一台能精确组装齿轮的灵巧手,可能捡不起一把掉落的螺丝刀。

640.webp

03.webp

把感官直接带到第一接触现场

既然外部视角不可靠,那就创造一套完全围绕接触点展开的视觉系统。

代表工作:FingerViP

发文团队:香港中文大学(CUHK)、香港理工大学

于是,FingerViP 提出了一种将微型相机直接嵌入灵巧手每一个指尖的感知方案,并在此基础上构建了一套完整的学习系统。

硬件设计:指尖模块的工程挑战

FingerViP 的硬件核心是一个"视觉增强指尖模块"(Vision-Enhanced Fingertip Module)。

团队选用了一款 12MP 的 SONY IMX258 USB 摄像头模组,其传感器尺寸仅为 8.5 × 8.5 × 4.95 mm,通过柔性排线(FPC)连接到控制板。为了在不显著增加手指体积的前提下完成集成,摄像头被以约 30° 的角度嵌入指尖内部,使其视野能够覆盖手指前方和掌侧区域。

640 (1).webp

图 | FingerViP 视觉增强指尖模块的 CAD 渲染图与爆炸视图。(a)搭载了五个指尖模块的机器人灵巧手整体结构;(b)指尖模块内部结构,包括摄像头控制板、IMX258 传感器、FPC 排线和传感器插座;(c)实物制造完成的指尖模块。©【深蓝具身智能】编译

  • 相比于腕部相机,指尖相机的位置更靠近操作区域,能够在接触发生前就提供清晰的近距离视图;

  • 相比于外置触觉传感器,它不需要实际接触就能获取信息。

五个指尖相机同时工作,形成了一个以手为中心(Hand-centric)的多视角感知网络,能够从不同角度观察物体和操作环境,大幅降低了遮挡的影响。

当然,这种设计也带来了工程上的挑战:

如何在极其有限的空间内走线、散热,如何保证排线在手指反复弯曲时不断裂,都是需要精心设计的细节。

策略学习:如何处理动态变化的多视角输入

FingerViP 采用了基于扩散模型的全身视觉运动策略(Whole-body Visuomotor Policy)。

该策略的输入来自三个层面:

第三人称相机提供全局场景上下文;

五个指尖相机提供局部的手-物交互细节;

两类辅助信号:指尖相机位姿编码和单指关节电流编码。

99.png

图2 | FingerViP 的全身策略架构。(a)系统输入:五路指尖 RGB 图像(灰色)、一路第三视角图像(粉色)、20 个手部关节电流值以及 26 个臂-手关节角度;(b)指尖关节电流和相机位姿通过手部运动学模型编码为几何和接触相关特征;(c)基于 Transformer 的扩散模型将所有多模态 token 作为条件,预测未来 26 自由度的关节指令序列。©【深蓝具身智能】编译

在真实世界的实验中,FingerViP 在四类任务上进行了测试:在密闭盒子内按按钮、从不稳定支架上取下木棍、在遮挡窗帘后取物,以及开柜门并取出物品的长视野任务,整体成功率达到 80.8%。

04.webp

让触觉长得越来越像视觉:硬件的代际跃升

既然外部相机看不清,那就让触觉本身变得像视觉一样丰富。

如果说 FingerViP 所代表的路线是"用视觉替代触觉",那么另一条并行的技术路线则是让触觉传感器本身变得更强、更小、更全面。

这条路线的代表是以 GelSight 为起点、以 DIGIT 360 为阶段性终点的光学触觉传感器演进。

GelSight:光学触觉的奠基工作

发文团队:MIT

GelSight 的核心原理是利用弹性硅胶表面的形变来"记录"接触信息。

传感器表面覆盖了一层涂有反光涂层的软性弹性体,内部通过多色 LED 光源和摄像头组合,对弹性体背面进行成像。

当物体压入弹性体时,表面发生形变,摄像头捕捉到的图像随之变化,通过光度立体法(Photometric Stereo)可以高精度地重建出接触面的 3D 几何形状。

640 (2).webp

图 | GelSight 传感器的基本结构示意。从左至右依次为:摄像头、骨架支撑结构、反光镜、LED 光源和硅胶弹性体。©【深蓝具身智能】编译

GelSight 将触觉感知的分辨率提升到了新高度,能够感知物体表面细微的纹理差异,并精确估算法向力和切向力。

然而,早期 GelSight 传感器的体积限制了它在多指灵巧手上的应用,因此它更多地被用于平行夹爪的指尖,而非需要高度集成化的多指手。

DIGIT 360:全方位数字触觉

发文机构:Meta AI、GelSight 

与早期的平面触觉传感器不同,DIGIT 360 采用了仿人类指尖的曲面设计,能够感知来自各个方向的接触信息,将光学触觉传感器的设计推向了一个新的维度。

640 (3).webp

图4 | 安装在机器人手指上的 DIGIT 360 触觉传感器。©【深蓝具身智能】编译

DIGIT 360 最显著的特点是采用了超广角鱼眼镜头,使得单个传感器能够覆盖整个指尖曲面的触觉信息,实现了真正意义上的"360度触摸感知"。

640 (4).webp

图5 | DIGIT 360 传感器的内部结构爆炸图。从上到下依次包括:硅胶指尖、静/动态压力传感单元、超广角鱼眼镜头、图像采集系统、片上 AI 处理单元以及气体传感和 USB-C 接口。传感器集成了超过 18 种独立的感知特征,涵盖了触觉、温度、声音等多个物理维度。©【深蓝具身智能】编译

从技术参数来看,DIGIT 360 拥有超过 830 万个感知像素(taxels),能够分辨细至 7 微米的空间细节,检测小至 1 毫牛顿的力,其信号处理速度比人类皮肤感受器的响应速度快 30 倍

05.webp

算法层面的融合

有了更强的硬件之后,视觉信号与触觉信号本质不同,怎么把它们放进同一个坐标系里?

两个代表性工作从不同角度给出了答案。

NeuralFeels:触觉补盲,神经场在线重建

发文机构:卡内基梅隆大学、Meta AI 等

NeuralFeels 针对的是手内操作(In-hand Manipulation)中一个经典难题:

当机器人用多根手指握住一个物体进行旋转或重新抓取时,物体几乎完全被手遮挡,外部相机无法看到物体的当前姿态,导致操作策略失去了关键的感知反馈。

NeuralFeels 的解决思路是将视觉和触觉信号融合到一个统一的神经场(Neural Field)表示中,在操作过程中在线地估计物体的姿态和形状。

640 (5).webp

图 | NeuralFeels 的系统流程。左侧为多指手上的视觉(RGB-D 相机)和触觉(DIGIT 传感器)输入;中间为在线构建的神经隐式场(Neural SDF),用于编码物体的 3D 几何形状;右侧为基于位姿图优化的联合跟踪结果,实现了物体姿态的实时估计。©【深蓝具身智能】编译

  • 该系统的前端包含两个模块:

一个基于运动学感知分割的视觉深度预测模块,以及一个专门训练的触觉 Transformer,用于从 DIGIT 传感器的图像中预测接触深度。

  • 后端将视觉和触觉的深度流融合到一个 instant-NGP 神经场中,并通过非线性最小二乘优化同步更新物体姿态。

实验结果表明,在严重的视觉遮挡条件下,视触觉融合相比纯视觉方法将跟踪性能提升了高达 94%。证明其不仅能"细化"视觉估计,在极端遮挡情况下甚至能"消除"视觉的歧义。

3D-ViTac:低成本触觉 + 3D 统一表示

发文机构:哥伦比亚大学等

众所周知,在很多操作任务中,我们需要的不是极高精度的单点触觉信息,而是广泛覆盖的接触分布信息。

因此与 NeuralFeels 使用专用的高精度触觉传感器不同,3D-ViTac 聚焦于双臂精细操作场景,选择了低成本、灵活的触觉传感器方案:

每个传感单元面积仅 3 mm²,可以大面积铺设在手指表面,提供密集的接触覆盖。

640 (1).png

图 | 3D-ViTac 的系统架构。©【深蓝具身智能】编译

3D-ViTac 的核心创新在于统一的 3D 表示空间。

它将视觉点云和触觉信号都映射到同一个 3D 坐标系中,形成"视觉点"和"触觉点"两种类型的点云,从而保留了两种模态之间的空间关系。

这种表示随后被输入扩散策略进行模仿学习。

实验结果显示,在处理易碎物品(如薄纸张)和执行涉及手内调整的长视野任务时,融合触觉信息的策略显著优于纯视觉基线 。

这两项工作从不同角度证明了一个共同的结论:

在精细操作中,视觉和触觉作为互补关系,一个负责"宏观定位"(视觉),另一个负责"微观校正"(触觉),两者的有效融合是提升操作鲁棒性的关键。

深蓝具身智能

前面几项工作的共同主题,是让机器人"感知得更清楚":通过更高分辨率的触觉、更近距离的视觉、更统一的多模态表示:

640 (6).webp

但即使硬件和融合框架都齐备了,仍有一个更深的 gap:

触觉信号被策略网络接收之后,它真的被"理解"了吗?

06.webp

触觉丰富之后,如何被策略真正理解并用于操作?

简单来说,传统算法只能“看见”接触,却无法“理解”接触发生的位置、姿态与几何关系,这也是高精度灵巧操作屡屡失败的核心症结。

SaTA:空间锚定触觉

发文机构:Sharpa、清华大学、武汉大学

这一研究直接指向了这一问题的核心:触觉信号缺乏空间语义。

现有的端到端学习方法在处理触觉信号时,往往把触觉图像当作一张普通的图片输入网络,而不知道这张图片对应的是哪根手指、处于什么位置、朝向哪个方向。

同样的一个接触图案,出现在拇指上和出现在小指上,对应的应该是完全不同的动作调整。

但如果策略不知道这个触觉信号的空间来源,它就无法做出正确的判断

——这就是 SaTA 所定义的"空间语义缺失"问题。

于是,SaTA 将触觉特征锚定到手部运动学坐标系,让机器人从“看见触觉”升级为“理解触觉”。

具体通过多尺度空间编码与特征融合,为每一组触觉数据赋予精准的空间语义:

  • 对于每一个指尖触觉传感器,系统通过正向运动学(Forward Kinematics)实时计算其在手部坐标系中的 6D 位姿;

  • 再用多尺度傅里叶编码(Fourier Encoding)对这一位姿进行空间编码;

  • 最后通过 FiLM(Feature-wise Linear Modulation)机制将空间信息注入触觉特征。

这样一来,每一个触觉 token 都携带明确的"我在哪里、朝向哪里"的几何语义。

640 (7).webp

图 | SaTA 框架总览。多模态输入(头部/腕部 RGB 图像、各指尖触觉图像、关节状态)经过各自的编码器处理,核心创新在于黄色的空间锚定触觉编码器(Spatial Anchored Tactile Encoder):通过正向运动学计算每个触觉传感器的 6D 位姿,用傅里叶编码捕捉多尺度空间变化,再通过 FiLM 将空间语义融入触觉特征,最终由 ACT 风格的 Transformer 生成动作序列。©【深蓝具身智能】编译

这一设计的意义在于,策略不再需要从数据中隐式地"猜测"触觉信号的空间来源,而是直接获得了带有几何坐标的触觉表示。

也正因如此,机器人能够在视觉完全遮挡的情况下,仅凭触觉完成亚毫米级的精度操作。

640 (8).webp

图 | SaTA 验证的三大极限任务。上排:双臂 USB-C 自由空间插接(要求亚毫米对准精度);中排:扑克牌分张(要求精细力调制和角度控制);下排:灯泡安装(要求螺纹精确啮合与顺从插入)。每行从左至右依次为初始状态、接近阶段、关键接触时刻(红框标注视觉严重退化区域)和成功完成。©【深蓝具身智能】编译

实验证明:

  • 在 USB-C 插接任务上,SaTA 将成功率从行业基线的接近 0% 提升至 35%;

640 (2).gif

  • 扑克牌分张从 65% 提升至 95%;

640 (3).gif
  • 灯泡安装从 70% 提升至 100%。

640 (4).gif

整体来看,SaTA 相比强视触觉基线方法将成功率提升了最高 30 个百分点,同时将任务完成时间缩短了 27%。

值得一提的是,所有实验均基于 Sharpa 自研的 SharpaWave 灵巧手平台开展。该灵巧手每根指尖均集成视觉触觉传感器,可实时采集接触面边缘轮廓、压力分布、表面纹理及接触形态等多维信息。

640 (5).gif

采集到的原始触觉图像,经由 SaTA 算法完成坐标系转换,从单纯的传感器图像坐标,精准锚定到手部 URDF 运动学坐标系,赋予触觉数据完备的手部空间语义。

正是这套硬件传感采集 + 算法空间化表征的完整闭环,让 USB-C 插接、灯泡安装这类视觉遮挡严重、接触交互密集、精度要求达亚毫米级的复杂任务。

由此,SaTA 补齐了触觉感知链路中一个极易被忽视却至关重要的环节:

当海量触觉原始数据输入智能策略后,如何让机器人真正读懂触觉背后的空间逻辑与操作意图。

640 (9).webp

触觉在具身智能中到底是什么位置?

综合来看,视觉触觉融合领域在近两年从硬件端的微型化和全方位化,到算法端的统一表示和神经场融合,整体技术路线取得了实质性进展。

但在这些进展之外,仍有几个问题值得冷静审视,例如硬件耐用性、计算开销与实时性之间的矛盾、泛化能力的边界仍不清晰等。

那么,触觉在具身智能中到底是什么位置?

答案可能比想象中要复杂:它既不是“必须有”,也不是“不需要”,而是取决于我们如何定义“具身智能”这件事本身。

我们需要抛弃非黑即白的极端思维。既不能认为触觉一无是处,也不能认为没有触觉就没有具身智能。

触觉是非常重要的能力,但不是具身智能的必要条件

正确的态度是:场景决定需求

真正需要触觉的时刻,或许不是“做得好”的时刻,而是“出意外”的时刻。

灵巧手是风口。

但让这只手可以不闯祸,才是信仰。(路线只是路线,不是最终目的)

在工程上,“够用”往往比“完美”更值钱。

四十年前,科幻电影选择让机器人“无感”,因为那是一个安全的选择——无感就不会有痛苦,无感就不会有反抗,无感就不会有人类面对另一个意识时的恐惧。

四十年后,产业界正在做出完全相反的选择么?

编辑|阿豹

审编|具身君

Ref

[1] FingerViP: Learning Real-World Dexterous Manipulation with Fingertip Visual Perception

[2] GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force

[3] Digitizing Touch with an Artificial Multimodal Fingertip. arXiv preprint

[4] NeuralFeels with neural fields: Visuo-tactile perception for in-hand manipulation

[5] 3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing

[6] Tactile robotics: Past and future

[7] Spatially-anchored Tactile Awareness for Robust Dexterous Manipulation

【深蓝学院】技术交流群

 

💪致力于帮助各位朋友「打破隐形的墙」,共建一个更自由、更有深度、更有价值的交流生态社区!在各大企业工作的,可以相互内推,互通有无;在学校读研读博的,可以交流想法,携手合作。

扫码添加阿蓝,选择想要加入的交流群即可

(按照提交顺序邀请,请尽早选择)

👇

image.png