英伟达 × 伯克利联合开源了一套名叫 T-Rex 的方法论,核心就一句话——让机器人学会"感觉"。Jim Fan 的开场比喻特别抓人:
一句话:像素够便宜、到处都是,但在接触的那一刻就失效了。真正决定成败的,是摸上去那一下的感觉。
① 触觉 = 模型的一等公民
用混合 Transformer 跑双时钟异步:慢的视觉-运动专家负责规划动作;快的触觉专家以每 4 次触觉 tick 对 1 次视觉 tick的高频实时修正动作。力的变化比帧来得快,所以架构也得跟上。
② 开源迄今最大触觉数据集
约 50 小时(5500 段)高质量、严格同步的机器人操作语料,在 22 自由度的 SOTA 触觉机械手上采集,今天就能在 HuggingFace 上下载。
③ 训练配方
T-Rex 扩展了英伟达之前的 EgoScale 方法:人类第一视角视频做预训练,再来一波多样化的触觉机器人操作做中段训练。实验证明这套配方能很好地跨越"无接触预训练 → 接触密集操作"之间的鸿沟。
开源核心信号:T-Rex 是英伟达与伯克利(Berkeley)的合作,方法论 + 数据集全部开源放 HuggingFace。对做机器人/具身智能的团队,等于拿到一套"触觉优先"的现成配方和迄今最大的触觉数据。
这是今天三条里最"前瞻 + 可落地"的一条。它把一个长期被忽视的环节(触觉)提到了一等公民位置,而且给了可以立刻动手的三样东西:方法论、数据集、开源代码。
最值得记住的判断:"触觉将扛起最后一公里。下一段缩放曲线会以触觉小时数来衡量。"——如果像素在接触瞬间失效,那谁先掌握"摸",谁就掌握机器人操作的决胜点。
看点:开源的 5500 段触觉数据集,足以让很多实验室/开发者不用自建昂贵触觉机械手,直接在这套数据上调模型——这是门槛骤降的信号。