多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

机器人加了个触觉传感器,成功率从 17% 掉到 6%:具身智能最贵的一个教训

机器人加了个触觉传感器,成功率从 17% 掉到 6%:具身智能最贵的一个教训 目录 开场一个反常识的实验结果️ 触觉到底在感知什么先拆开这个模糊的概念 五条技术路线没有一条通吃 视触觉的四个难点精度最高也最难落地️ 数据采集的死结要采触觉先得屏蔽触觉 仿真补位以及它补不上的一段⚡ 回到开头为什么加了触觉反而更差 量产卡在一致性最不性感也最要命 行业判断爆发前夜还是为时过早️ 这件事对做数据平台的人意味着什么 落地清单 写在最后 开场一个反常识的实验结果2026 年 6 月一篇论文在具身智能圈投下了一颗炸弹。论文名字叫T-Rex: Tactile-Reactive Dexterous Manipulation。作者阵容极其豪华李飞飞、Jim Fan、Pieter Abbeel、Jitendra Malik、Ken Goldberg、Trevor Darrell加上一批来自伯克利、英伟达、斯坦福、MIT 的研究者。他们做的事情很朴素拿当前机器人领域最主流的视觉-语言-动作模型π0.5在输入里多加一路触觉信号。按常理多一个感知维度模型应该更强对吧结果是任务成功率从 17% 跌到 6%。一个降幅 65% 的相对损失。触觉不但没帮忙还成了猪队友。论文标题里的 “T-Rex”霸王龙是个双关梗——霸王龙的前肢短小。而这项研究要解决的正是灵巧手如何真正感知世界这个难题。这组数字出自对论文实验表格的完整梳理T-Rex 65%、EgoScale 35%、π0.5 17%、Tactile-VLA 15%、Reactive Diffusion Policy 6%、π0.5tactile 6%、ViTacFormer 3%。同一条赛道上最强基线是 35%T-Rex 是 65%绝对差 30 个百分点。而朴素加触觉这个看起来最合理的方案是 6%——比最强基线低了 29 个百分点。这篇论文出自李飞飞团队不是无名小作坊。那么问题来了为什么触觉这个被寄予厚望的模态会在真实机器人上水土不服今天我们不猜直接把数据和工程逻辑摆出来。️ 触觉到底在感知什么先拆开这个模糊的概念在讨论怎么用触觉之前得先说清楚触觉是什么。《硅谷101》这期机器人触觉专题请到了一目科技创始人兼 CEO 李智强Eric、联合创始人陈天一以及亚德诺半导体美国人工智能总监于弢。三人带着摄制组进了实验室和试产车间。节目里把触觉拆成了两个正交的维度这个拆法比触觉 压力传感器要准确得多维度具体内容机器人为什么要它力感知 · 静态力抓握时手指持续施加的压力判断捏得够不够紧、物体有多硬力感知 · 动态力物体滑动时产生的高频信号判断是不是要掉了、摩擦力够不够形态学感知材质、表面粗糙度、纹理分辨苹果和橘子、光滑还是粗糙为什么这个区分重要因为静态力和动态力的物理机制完全不同对传感器的要求也完全相反。后面讲五条技术路线时会看到有些方案天生只能测其中一类。节目里还有个硬证据有实验把正常人的手部触觉神经短暂麻醉被试的拧、抓、系扣子立刻失灵。这说明视觉在精细操作上无法替代触觉——不是不够好是原理上做不到。但这里有个容易被误读的地方。受访者说了一句很关键的话一些没有触觉的机器人任务成功率看起来很高但这并不等于可用性强。原因是只靠视觉的做法可以「动得非常非常慢每次微调一毫米不断去试」最终总能成功。如果你只看成功率这个指标本身就是个伪命题。拧螺丝是典型场景——等你用视觉发现螺丝已经拧花才判断出力过大太晚了。 五条技术路线没有一条通吃目前市面上的触觉传感器主要有五条路线。它们的差异不在精度高低而在测量哲学的根本分歧。路线原理优势局限压阻式材料受力形变→电阻变化→反推压力最成熟、便宜、门槛低只测垂直方向的力温度湿度下漂移压电式石英/PZT 受力→电荷偏移→电压对振动、冲击等高频信号敏感只对变化的力敏感静态力会衰减到零电容式平行板电容器形变改变间距/面积→电容变化灵敏度高、响应快、成本较低动态范围有限易受电磁干扰光学式视触觉柔性材料形变内嵌摄像头拍摄后反算精度最高能同时解算形貌与力分布成本高、结构复杂、做小很难磁感应弹性体加磁性颗粒底部磁传感器测磁场同样能推算三维力易受电磁干扰分辨率有限前两条路线直接把力转成电信号后三条先让材料形变、再测形变程度。后三者的关键优势是突破了垂直方向的限制能感知三维力。压电式的失效机制值得单独说它只在按下的那一瞬间产生电压信号一直按着不动信号会慢慢衰减到零。所以它天生测不了我需要持续握紧多久这类问题。工程上的结论是没有哪条路线通吃多传感器结合更可能是最终方案。逻辑很直白——人的每一寸皮肤都有感知机器人要达到同等水平全身铺最贵的方案成本扛不住而且不同部位的精度要求本来就不一样。指尖需要光学式的高分辨率手掌和手臂用压阻式或电容式覆盖更大面积更划算。节目在 WAIC 展会看到的情况印证了这个逻辑采用电容式的方案已批量用于工厂分拣与检测采购价只有光学式的四分之一到二分之一。 视触觉的四个难点精度最高也最难落地一目科技选的是光学式。节目组进了他们的材料实验室和试产车间看到的是这条路线全部的真实代价。材料软、薄、耐磨的不可能三角要求业内术语为什么必须要软杨氏模量低才能通过细致形变精确反映物体硬度和力度耐磨—否则长期执行任务会性能漂移或破损薄—才能缩小传感器尺寸、扩大应用场景三点天然对立只能找平衡。节目里展示了他们正在研发的「可恢复性材料」——类似皮肤自愈机理是特定官能团的分子键断裂后能恢复。结构视距是物理硬约束视触觉本质上是微距摄影。镜头和感光芯片之间必须留出对焦距离这是它做不大的底层原因。他们的解法是自研超表面与芯片技术压缩视距把厚度做到和 SIM 卡差不多、不到 16 毫米下一代目标是 3 毫米。照明层更难手指表面不是平面两侧有弧度灯珠排布要做大量光路仿真他们叫光追踪才能做到 270 度覆盖且不串扰。还有个细节挺能说明这行的真实门槛测量材料光学特性的 BSDF 设备专业款要百万元级他们的博士是自己搭了一台。算法三条路各有取舍方法做法优点缺点标记点法皮肤上印微小标记点跟踪位移算形变算法简单、制造容易精度上限低——标记点数就是分辨率上限纹理分析法随机喷涂颗粒或材料自带纹理追踪光影流动硬件简单无需做标记点算法复杂、算力大、延迟高光度立体法RGB 三色光不同方向打光按像素 RGB 值反算形变精度与制造复杂度折中算力居中需多色照明制造稍复杂这里有个容易忽略的知识点前两种方法只看亮度和对比度单色照明就够了光度立体法必须用多色光。纹理分析法原理上相当于光学鼠标的三维版——鼠标检测二维平面变化触觉传感器要检测三维。成本单指千元级这是光学式最硬的一道坎。单价在单指千元级比压阻、电容贵一个档次。降本路径是随量下降受访者认为未来有可能降到小几百元。但也要算清另一笔账——不光是制造后续的算法和算力要求也更高因为视触觉要复用视觉模型而视觉模型通常都不小。高成本对应的是高上限。实验室里的对比很直观没有触觉的灵巧手夹薯片很容易夹飞带视触觉的夹爪能轻轻夹起你从它手里抽走薯片时它会感知到轻微晃动与摩擦慢慢卸力夹树叶时能感知树叶的微小形变和弹性反力️ 数据采集的死结要采触觉先得屏蔽触觉机器人训练最缺的是数据。在触觉领域业内的原话是更极端的可用的数据基本为零。原因在于高保真触觉传感器此前一直缺失用传统方法采来的数据跟人的差距很大。而普通视频、文字这类互联网数据根本无法反映力的大小和方向。所以这个领域尤其强调真机数据。但真机采集撞上了一个悖论要采集人的触觉就得在人手和物体之间加一层传感器而这层传感器会屏蔽掉人自己的触觉。操作者的手变笨了示范质量下降训出来的机器人自然没有人的灵巧。节目组做了个实验戴上厚手套拿豆腐要么滑落要么按碎——判断摩擦力够不够、形变到什么程度全靠触觉。除了这个悖论还有两个硬伤一是数采设备本身笨重尺寸大、穿戴麻烦会影响操作员的动作本身。下一代方案是超薄传感器只在关键位置贴触觉点而不是戴复杂手套。二是数据密度根本不够。最好的织物触觉手套一只手也只有约500 个感知点。抓一颗 M2 螺钉在手套上就是一个点——连方向都测不出来。于弢团队与 MIT 合作的项目发现用这类手套采的数据大部分有效场景是「整个手掌抓一个较大的东西」一旦涉及精细操作数据直接失效。节目组把这种状态描述成一个恶性循环第三条路也没走通触觉字段的采集格式各家不统一——两指设备只适合工业夹爪不适合灵巧手触觉、视觉、本体信息之间的时间轴对齐能力也做得不够好。没有统一格式就形不成大规模训练集。 仿真补位以及它补不上的一段既然真机采集这么难行业把希望放到了仿真上。英伟达是这条路线最重要的押注者用的是 Isaac Lab 框架。做法分两层给不同物体赋予刚重、软硬、表面粗糙度等物理属性同时输入触觉传感器自身的特征弹性体物理特性、手指内的光源分布。然后推算接触时的形变与光路变化最后用真机数据标定修正。障碍是算力。用有限元方法精细计算弹性体形变可能一帧要算一个小时实时训练完全用不了。所以学术界提出各种简化。最有代表性的是英伟达的TacSL论文——用「软接触模型」代替有限元把物体和皮肤都当刚体处理但允许它们按接触力大小互相穿透。形变不是最精确但能大致模拟速度快得多。⚠️这里要纠正节目的一处口误。TacSL 论文发表于IEEE Transactions on RoboticsarXiv 版本是2024 年不是节目说的2025 年。它的加速幅度是实测数据在 512 个并行环境下生成速度达 1631 FPS相比 Taxim 的 7.28 FPS 提速超过 200 倍力场生成在 32,768 并行环境下达到 1,541,043 FPS相比 CPU 基线加速 428 倍。节目提到的82.7% 成功率核实后是Peg Insertion插销插入任务在 81 次 policy-trial 试验中取得的零样本迁移结果对应的是 ColorAug 配置。对照组数据能看出这个数字有多脆Peg Insertion 配置真机零样本成功率Vanilla27.2%ConcatColorAug77.9%ColorAug82.7%也就是说82.7% 不是仿真就能白拿的结果而是精心调过数据增强和域随机化之后才拿到的。换句话说仿真本身不解决问题仿真 随机化 增强这套组合才解决问题。至于仿真与真机的差距一目科技 Eric 给出的数字是仿真准确率 90% 以上剩下那 10% 主要差在柔性物体的模拟上。而他对数据配比的判断是真机和仿真至少 1:1甚至仿真会占多数。这跟仿真替代真机的叙事相反但工程上更诚实。触觉的数据量视觉的十分之一这里有个反直觉但合乎逻辑的判断。Physical Intelligence 的研究员 Kay 给视觉模型的答案是100 万小时约等于一个人一生的物理经验。而触觉只需要十分之一10 万小时左右就开始显现泛化能力。原因不难理解机器人的行为数据里塞满了「转身、伸手、移动」这类过程信息而这些对训练真正有效的往往只是「拿起」「放下」等关键接触动作。而触觉在没有操作时输入基本为零——那 10 万小时里已经天然减掉了大量无效部分。⚡ 回到开头为什么加了触觉反而更差现在可以正面回答那个问题了。节目把触觉应用的三道坎列得很清楚障碍具体表现为什么难触觉没法用规则定义拿起纸杯力气小点行稍微夹紧有形变也可接受鸡蛋绝不能让蛋壳变形软硬、脆弹、破坏阈值无法写成单一数值规则触觉信号维度太多纵向压力、横向剪切力、摩擦力、温度、振动、音频不加处理直接输入模型无法分解信号退化为噪声频率不匹配触觉天然高频视觉语言模型跑在低频计算资源浪费、反应慢、触觉噪声干扰高层规划第三条是主因。前两条还有工程解法第三条是结构性矛盾。有第三方技术解读把频率错配讲得更直白视觉是慢感知摄像头以大约每秒 5 帧的频率扫描世界触觉是快感知接触瞬间的压力、滑动、形变以毫秒计变化天然需要每秒 20 次以上频率才能发挥作用。打个比方让一个长跑运动员和一个短跑运动员在同一条跑道上用同样速度跑——长跑觉得节奏太快跟不上短跑觉得节奏太慢憋得慌。强行塞进同一个低频 Transformer结果不是 112而是 111。T-Rex 的解法三个专家两种频率T-Rex 给出的不是修修补补而是架构层面的重做。核心叫MoTMixture-of-Transformer-Experts借鉴 MoE 思路由三个专家分工专家职责运行频率Latent Expert潜在专家处理视觉语言观察预测未来视觉表征提供慢速上下文理解低频Action Expert动作专家根据上下文生成动作序列输出粗略动作约 5 HzTactile Expert触觉专家像反射系统一样在执行中用触觉反馈快速修正力度、角度、接触状态约 20 Hz关键的创新不在多设一个专家而在异步执行推理时动作专家生成动作规划同时触觉专家以更高频率独立运行复用已算好的上下文缓存只做快速触觉推理。这个设计的直觉等价于基础模型的双系统结构——System 2 负责慢思考和长程规划System 1 负责快反应和本能动作。消融实验证明这个设计不是花架子去掉异步精修平均成功率从 65% 掉到 60%掉 5 个百分点。而在六任务消融里去掉触觉输入会掉到 42%掉 23 个百分点。还有个数字更狠去掉 22,889 小时的第一视角人类视频预训练平均成功率从 65% 崩到 18%。这说明触觉不是万能药视觉预训练依然是地基。业界分歧单练还是合练观点提出者理由单独训练触觉模态李智强Eric触觉自身语义理解先闭环再与其他模态融合每个模块可独立训练测试像插件一样即插即用必须与视觉同时训练于弢亚德诺视觉是全局的、触觉是极度局部的手形变化时力在空间上的分布也变只有结合才能让模型理解我拿了什么才会有这样的感知于弢还提了一个迁移层面的问题视觉-触觉融合后的 latent space 表征在一个 embodiment 上做同一件事可以但迁移到另一个载体上非常难。哥大李昀烛团队的做法是把触觉的力分布结合到三维点云上——这时力不再是一个标量而是空间中的一个分布。两条路线目前没有绝对优劣。T-Rex 走的是执行过程中的高频修正Tabero论文主打前置的语义力控。顺带说个时间线节目里提到今年五月有一篇名为 Tabero 的论文。核对下来TacSL 发表于 2024 年IEEE TROT-Rex 发表于 2026 年 6 月arXiv:2606.17055。 量产卡在一致性最不性感也最要命最后一环是量产。节目组在 ICRA 2026维也纳上手测了多家触觉传感公司的产品——大多数做不到一致性。原因是触觉传感器太精密了弹性体厚度相差太大、弹性系数不一致、传感器间距不同都会让参数出现偏差算法就算不出正确数值。而手指的调整动作本身非常微小做精密操作时输出力稍微偏差就可能导致任务失败。这种传感器比任务要求还精密的错配是量产阶段最尴尬的问题。试产车间的流程能看出这个行业的真实成熟度环节工艺要求现状凝胶固化超净工作台局部 100 级洁净不能有灰尘和气泡依赖超净环境成本高视觉筛选拍摄剔除带气泡与杂质的样品上位机再筛一次已自动化粘接/预总装壳体、灯带、相机、芯片精密组装大量步骤仍依赖手工总装前成像检测力学反馈画面 内置 AI 算法检验已自动化批次试产样品自动化测试验证工艺参数稳定性已自动化受访者承认现阶段很多步骤仍依赖手工因为触觉传感器是新品类上下游的标准化和自动化设备尚未统一——数采设备、灵巧手各有不同的协议、接口和手型适配要求。他们的做法是双线并行自动化量产线稳定交付标准品试产线承接定制化需求和新工艺验证。两条线协同运转被视为这个行业走向成熟的标志。 行业判断爆发前夜还是为时过早节目结尾给出三条行业信号2026 年触觉传感器需求出现明显上涨行业逐渐意识到触觉数据对训出更好的物理 AI 模型很关键灵巧手、上下游和具身整机都在拼命出货反过来带动触觉传感成熟WAIC 上已有汽车电池装配工厂把触觉传感器装上机械臂——不同电池包形态变化频繁传统纯编程自动化无法适应产线的频繁调度第三条我个人认为最有说服力因为它跳出了机器人必须像人才有意义的叙事。触觉的第一个规模化落地场景可能不是人形机器人而是需要应对来料变形的柔性产线。汽车电池装配就是典型——电池包的形变、来料差异是刚性的视觉再准也读不出这个边角有没有翘起来。市场规模上节目引用了美国银行BofA Global Research的预测指标数值来源2026 年人形机器人年出货量9 万台BofA Global Research2030 年人形机器人年出货量120 万台BofA Global ResearchExhibit 22025→2035 年复合增长率86%BofA Global Research2030 年中国人形机器人物料成本降至 1.7 万美元以下BofA Global Research节目里说假设都装配了触觉传感器、每个机器人 10 根手指触觉的市场需求将提升到千万级别——这个换算是对的120 万台 × 10 指 1200 万个触觉传感器。但要注意这是2030 年的年出货口径不是存量更不是市场规模。用单指千元级成本算仅中国以外的全球市场年出货对应的传感器产值就在百亿元人民币量级。至于时间点受访者按量产周期倒推认为下一个里程碑在 2026 年底或 2027 年初。这个判断和美银的出货曲线节奏吻合——2027 年 29 万台、2028 年 50 万台量的爬坡确实在这两年。李智强在节目里的说法被节目组放在了最后作为收束“触觉是让机器人类人甚至超越人的最后一块拼图因为它不仅是多了一个维度的数据更是让机器人掌握到了’人类的第一语言’。”这个说法有个旁证。GelSight 的灵感来源是 MIT 视觉科学教授 Edward Adelson 观察自己孩子时发现的——婴儿伸手去摸一切触摸对他们的吸引力远超视觉。Adelson 是视觉专家他想做人工触觉思路是把机械的触觉信号转换成视觉信号——因为如果是图像我就知道该怎么处理。️ 这件事对做数据平台的人意味着什么聊到这儿可能有点远了但既然要说就说透一点。机器人行业现在遇到的数据采集悖论在企业数据治理里有一个几乎同构的版本。同构点在于采集本身就是一种干预。触觉采集要在人与物体之间插入一层介质企业的数据采集要在业务与系统之间插入一层流程。插入的瞬间被观测的行为已经不是自然行为了。差别在于介质能不能做到足够薄。一目科技的答案是把传感器从 16 毫米压到 3 毫米——介质越薄对主体行为的干扰越小。这是一个纯工程解但它给了数据平台一个直接启示机器人触觉的约束数据平台的对应工程取舍传感器要薄3mm才不干扰操作数据采集链路要薄才不改变业务行为埋点/CDC 越轻量越好重量级 Agent 越少越好各家格式不统一模态间时间轴对不齐各业务系统口径不统一跨域关联对不上先统一元数据与主键再谈数据融合仿真与真机要 1:1 搭配业务真实数据与模拟/推演数据要搭配纯仿真失真纯真样本量不够量产要一致性不能每批都漂数据质量要可度量、可追溯一致性靠自动化校验不靠人工抽检这里要克制地说一句SPARK 融合平台做的事是把数据从哪来、怎么对齐、谁能看到这几件事变成可执行、可追溯的流程——iPaaS 负责接数据治理中心把质量校验和口径统一前置到入库之前全域守卫划权限边界。但这些只解决数据可不可信、能不能被用起来的问题不解决判断标准本身对不对。触觉领域那个真正的死结——“哪些接触算成功”——最终得由做机器人的人来定。平台能保证这个标准被一致地执行但定标准仍然是人的工作。 落地清单如果你正在评估要不要上触觉方案这几条是从上面的核实里抽出来的可操作判断先明确目标场景属于哪一类。接触丰富的精细操作拧螺丝、插销、剥鸡蛋触觉收益最大粗放的分拣搬运光学式性价比不划算WAIC 上电容式四分之一到二分之一的价格就是答案。别信加个传感器试试式的方案。T-Rex 的 17%→6% 是个明确的反例。如果你的模型架构是低频单流先改架构异步双频再上传感器否则数据采回来也是浪费。数据采集方案要先算介质成本。评估的不只是传感器单价还有对操作者行为的干扰程度——织物手套只有 500 个感知点这个数字说明薄和大比精更重要。仿真要跟域随机化一起上。TacSL 的 82.7% 是在 ColorAug 配置下拿到的Vanilla 只有 27.2%。只搭仿真环境不做随机化和图像增强会得到一个看起来很美的假数字。量产一致性要写进验收标准。ICRA 2026 上多家公司产品的一致性都做不到。这一项如果不提前写进去量产阶段一定会回来返工。 写在最后这篇论文最有价值的地方不是那个 30 个百分点的领先而是它证明了一件事多一个模态不等于模型更强。过去两年具身智能的默认假设是把所有感知转成 token 塞进同一个大模型数据多了智能自然涌现。T-Rex 用一组消融实验把这个假设否掉了一半。而它给出的解法——慢思考负责规划、快反应负责修正、两者异步运行共享状态——并不是什么新鲜架构。人类神经系统就是这么工作的机器人直到 2026 年才刚开始照抄。倒是那个数据采集悖论值得反复咀嚼要采触觉先得屏蔽触觉。这句话听起来像个段子但它精确描述了每一个想要客观记录真实世界的系统都会撞上的墙。你一测量就改变了你测量的对象。那些被迫在记录的准确性和被记录者的自然性之间做取舍的从传感器到日志系统其实是同一道题。参考资料T-Rex: Tactile-Reactive Dexterous ManipulationarXiv:2606.170552026-06TacSL: A Library for Visuotactile Sensor Simulation and LearningIEEE Transactions on RoboticsarXiv 2024Bank of America InstitutePhysical AI, part 2: Humanoid robots《硅谷 101》机器人触觉的爆发前夜五大技术路线、数据困局与模型之争2026-09-04 上线片长 42 分 45 秒本文数据来源标注论文实验数据引自原论文及公开实验表格梳理出货量预测引自 BofA Global Research受访者观点为节目口述未经独立验证
返回列表