T-Rex:融合触觉感知,突破纯视觉局限的机器人灵巧操作新框架
当前机器人学习领域的主流突破,大多依托视觉感知技术落地。但在需要物理接触、精细交互的实操场景中,例如插卡、拧钥匙、操控柔性形变物体等任务,纯视觉方案的缺陷被充分暴露。现阶段主流的视觉-语言-动作(VLA)模型,仅能依托画面完成浅层环境观测,无法精准推理物体接触瞬间的物理状态变化,难以适配精细化交互作业需求。
人类在实操过程中,可依靠手部触觉反馈实时微调抓握力度、接触角度与操作姿态,灵活适配物体形变、位置偏移等动态变化。但长期以视觉为核心感知方式的机器人,缺失关键的触觉感知闭环,无法完成动态自适应调整,这也成为制约机器人灵巧交互能力升级的核心痛点。
T-Rex框架:多模态融合的触觉响应式操作方案
针对纯视觉机器人操作的固有短板,加州大学伯克利分校、英伟达、斯坦福大学联合团队创新性研发出T-Rex触觉响应式灵巧操作框架。该框架打破单一视觉感知的局限,将视觉观测、语言指令、触觉传感三大模态信息深度融合,构建一体化机器人学习体系。

区别于传统纯视觉训练模式,T-Rex采用“大规模人类预训练+触觉驱动中期专项训练”的双层训练机制,让机器人摆脱对视觉画面的单一依赖,能够精准感知物理接触状态、捕捉交互动态变化,实现主动触觉响应式操作。
研究团队在12项高难度物理接触交互任务中完成全面测试,结果显示,T-Rex框架的综合平均成功率位居所有对比算法首位,相较于最优基线模型,整体作业性能提升超30%,大幅刷新了灵巧交互机器人的实操性能纪录。
三、高质量多模态数据集:T-Rex性能的核心支撑
高精度、高适配的训练数据集是机器人灵巧学习的核心基础。为适配高接触交互任务的训练需求,研究团队搭建了100小时时长、触觉信号全程同步的大规模遥操作数据集,成为T-Rex框架高效学习的关键底气。
该数据集覆盖200余种日常实操物体、22类基础运动单元,可全面适配12项真实场景机器人操作任务的训练与评测需求。为保障数据集的完整性与精准度,团队搭建了一套全流程同步采集遥操作平台,可在单次示教过程中,同步收录手部运动轨迹、触觉传感数据、机器人控制参数、高清视觉画面等多维度信息,实现多模态数据的精准匹配。

整套采集硬件系统由双臂Dexmate Vega-1机器人、Sharpa Wave灵巧机械手、多视角RGB摄像头及高精度指尖触觉传感器组成。同时,操作人员佩戴MANUS数据手套采集指尖高精度运动数据,搭配VIVE追踪器实时捕捉手腕姿态,完成人体双手动作的全方位采集。
系统将采集到的人体运动数据精准重映射至机器人端,还原自然、贴合人类习惯的双手操控逻辑;同时将视觉图像、触觉反馈、机器人运行状态、执行动作、自然语言指令深度整合,构建出高精度、多维度、强关联的机器人训练数据集,为模型学习精细触觉交互逻辑提供核心数据支撑。
在整套数据采集流程中,MANUS数据手套实现了手指级精细化运动捕捉,精准复刻人类实操动作逻辑,为机器人学习真实、自然的物体交互方式,提供了高质量的示教样本。
四、技术价值:推动多模态机器人学习全新升级
T-Rex框架的核心创新,是验证了“人类大规模预训练+触觉专项迭代训练”组合模式的有效性。该训练机制不仅大幅提升了多模态数据的利用效率,更显著增强了机器人模型在复杂实操场景中的泛化能力。依托精准匹配的人体运动、触觉交互、机器人执行动作关联数据,模型能够深度学习物理交互规律,突破纯视觉感知的认知局限。
该研究充分证明,通用基础大模型可通过融入触觉感知维度,补齐物理交互认知短板,构建“视觉+语言+触觉”三位一体的智能操作体系。在整套科研体系中,MANUS数据手套凭借高精度运动捕捉能力,完善了遥操作示教流程,为触觉响应式灵巧操作技术的落地迭代提供了关键硬件支撑,助力高精度、高适应性的智能机器人交互技术实现突破升级。