机器人如何拥有“触觉想象力”?UniTac让VLA从视觉走向深度物理交互
在具身智能的演进历程中,我们往往容易陷入一种“视觉至上”的迷思。当机器人能够精准识别物体类别、规划轨迹路径时,人们便默认其已具备完成任务的能力。然而,真实世界的物理交互远比视觉表征复杂。面对一颗葡萄的轻捏、一只纸杯的平稳抓取,或者是柔软毛巾的折叠,仅靠视觉输入往往导致灾难性的后果——捏碎、变形或滑落。这种现象揭示了当前基于视觉的机器人智能体系中存在的一个关键缺失:缺乏对接触过程的深层理解与预判能力。UniTac的出现,正是为了填补这一空白,它通过引入“触觉想象力”,让机器人在指尖触碰物体之前,便能预判其物理属性,从而从根本上提升操作的安全性与时序控制精度。
从“被动反馈”到“主动预判”的认知跃迁
传统的机器人操作策略通常遵循“感知-规划-执行-反馈”的闭环逻辑。在这种范式下,触觉或力觉信息仅在接触发生后才被激活,用于修正偏差。这种滞后性在处理刚性、规则物体时或许尚可接受,但在面对柔性、易损或非结构化物体时,其弊端暴露无遗。一旦视觉系统因光照遮挡、材质反光或物体形变而无法提供精确状态时,依靠事后修正的策略往往为时已晚,物理损坏已不可逆。
UniTac提出的核心创新,在于将触觉感知的时间维度前移。通过构建统一的触觉理解与生成架构,该模型能够根据视觉输入和本体感觉,预测潜在的触觉状态。这意味着机器人不再仅仅是一个执行指令的机械臂,而是一个具备“未触先感”能力的智能体。例如,在面对一个软杯时,UniTac会先在内部模拟不同接触力度下的形变反馈,从而计算出最佳的接触点和施力大小。这种从“碰后知痛”到“碰前预感”的转变,标志着具身智能从单纯的语义锚定走向了更深层次的物理世界锚定(Grounding)。这一突破性成果已被计算机视觉顶级会议ECCV 2026接收,引发了学术界与工业界对触觉模态重要性的重新审视。
破解传感器异构难题:统一触觉表征的架构设计
要让机器人拥有通用的触觉能力,首要障碍并非算法模型,而是数据的碎片化与异构性。当前的触觉传感器种类繁多,包括GelSight、DIGIT、Duragel等基于视觉的触觉传感器,以及力触觉阵列等。尽管它们输出形式可能看似相似,但其数据生成机制存在本质差异。以视觉式触觉传感器为例,其捕捉到的图像实际上是凝胶受压后的形变,其中混合了物体本身的物理属性(如硬度、粗糙度、纹理)和传感器的固有特征(如光照条件、凝胶老化程度、Marker布局等)。
这种混合信息导致了一个严峻的挑战:同一个物体在不同传感器下可能呈现出截然不同的视觉特征。如果模型无法有效解耦这些变量,就无法实现跨设备的泛化能力。UniTac的创新之处在于,它没有简单地将触觉图像视为普通的RGB图像进行处理,而是提出了一种双重视角的解耦架构。
在理解端,模型被设计为同时学习“物体物理属性”和“传感器配置特征”。通过引入传感器识别任务,迫使神经网络去区分哪些变化源于物体本身的接触形变,哪些源于传感器本身的噪声或差异。这种设计使得UniTac能够提取出超越特定硬件限制的、具有物理意义的一致表征。在生成端,UniTac摒弃了传统生成模型中常见的无条件分支,因为触觉本质上不存在“无来源”的状态。相反,模型采用条件生成策略,先给定目标传感器在零接触状态下的基线特征,再叠加由物体属性引起的变化。这种细致入微的建模方式,确保了生成的触觉信号不仅符合视觉语义,更贴合特定传感器的物理响应规律。
性能验证:从理论架构到真实场景的跨越
UniTac的有效性在多项基准测试中得到了充分验证。在触觉理解任务中,基于UniTac构建的UniTac-7B模型在PHYSICLEAR-Test数据集上取得了66.51分的优异成绩,显著优于Octopi等专用触觉理解模型及BLIP3o等通用多模态模型。特别是在属性-物体匹配任务中,其得分达到64.61分,证明模型不仅学会了识别软硬、粗糙度等表面属性,更建立了触觉信号与物体语义之间的深层关联。
在更具挑战性的触觉生成任务中,UniTac面对Digit、GelSight、GelSight Mini和Duragel四种截然不同的传感器,依然保持了卓越的稳定性。其平均结构相似性(SSIM)达到0.836,峰值信噪比(PSNR)达到19.93,均创下当前最佳记录。这一性能表明,UniTac成功打通了不同传感器之间的数据壁垒,实现了真正的跨模态迁移能力。更重要的是,当这一触觉先验知识被接入视觉-语言-动作(VLA)模型后,机器人的操作成功率在涉及柔性物体(如橙色毛巾、易碎纸杯)的任务中实现了质的飞跃。实验对比显示,未接入UniTac的VLA模型往往因无法预判形变而捏扁纸杯或抓歪毛巾,而接入UniTac后,机器人能够提前调整抓取姿态和力度,展现出近乎人类般的细腻操作技巧。
产业展望:触觉作为具身智能的“第二双眼”
UniTac背后的研发团队——优理奇机器人(UniX AI),由耶鲁大学博士杨丰瑜领衔,联合浙江大学、麻省理工学院、牛津大学及耶鲁大学等多所高校的研究力量共同完成。这一跨机构合作模式体现了当前具身智能研究的复杂性与系统性。从早期的Touch and Go数据采集,到UniTouch的多传感器表征统一,再到TaRF的三维空间对齐,优理奇始终沿着“让机器人理解如何接触”这一主线深耕。UniTac的发布,并非孤立的技术突破,而是这一技术路线的自然延伸与升华。
从产业应用的角度来看,触觉感知能力的补齐,将极大地拓展机器人技术的服务边界。在家庭护理场景中,机器人需要与人体进行柔软、安全的物理接触,任何过大的力度都可能导致伤害;在精密装配领域,微小零件的插入与固定需要毫米级的力控反馈;在康养陪护中,机器人辅助老人起身或行走时,必须实时感知受力状态以调整支撑策略。在这些场景中,视觉往往受限,而触觉则是不可或缺的安全阀。UniTac所实现的“触觉想象力”,实际上是为机器人装备了“第二双眼”,使其能够在看不见的接触界面中洞察物理世界的本质。
随着VLA模型与世界模型的进一步融合,触觉不再是一个独立的模块,而是深度融入机器人的认知-行动闭环中。UniTac通过统一理解与生成框架,证明了触觉数据不仅可以被“看”见,更可以被“算”出来。这种从数据驱动向物理规律驱动的转变,为构建真正通用、鲁棒的具身智能体奠定了基础。未来,当机器人能够像人类一样,在触摸之前便感知到物体的质感、温度与弹性,人机协作的物理边界将被彻底打破,一个更加安全、高效且充满温情的智能机器人时代终将到来。