世界模型有了触觉?50万小时视频驯出首个隐式触觉动作模型

5 阅读

具身智能的感官进化:从“看见”到“感知”

在具身智能(Embodied AI)的发展脉络中,视觉始终占据着主导地位。过去几年,我们见证了基于视频预训练的大型模型如何让机器人学会抓取、移动甚至烹饪。然而,视觉存在天然的局限性:它只能捕捉物体表面的光影变化,却无法直接感知物体内部的应力、摩擦力或是接触瞬间的微小形变。这就好比一位钢琴家仅凭观看视频学习弹奏,即便记住了指法,也难以在黑白键上奏出细腻的强弱变化。

触觉,作为人类操作世界中不可或缺的第二大感官,长期以来却是具身模型中的“短板”。大多数现有的世界模型虽然能预测物体移动轨迹,却难以准确判断接触是否发生、接触点在哪里,更无法量化接触时的受力情况。这种感官缺失,使得机器人在处理需要精细力控的任务时显得笨拙且缺乏鲁棒性。

BeingBeyond智在无界近期发布的Being-H0.8,正是在这一痛点上取得了突破性进展。作为首个基于人类视频数据的隐式触觉世界动作模型,Being-H0.8并没有简单地叠加传感器数据,而是从底层架构上重新定义了世界模型的交互逻辑。它不再仅仅依赖视觉预测未来,而是将触觉信号深度嵌入到“预测-执行-反馈”的完整闭环中,让机器人具备了“未触先知”和“触后微调”的能力。

核心架构:隐式空间中的触觉预演

Being-H0.8的创新之处首先体现在其模型架构的设计上。与试图在像素层面重建未来画面的传统视频生成模型不同,Being-H0.8采用的是隐式世界模型(Latent World Model)思路。这意味着,模型关注的不是画面中每个像素的颜色变化,而是那些对任务执行真正关键的潜在状态变化,例如接触是否发生、物体形态如何改变、力流如何传递。

该模型由四个核心模块协同工作:

首先是Mixture of Transformers (MoT) 模块,负责预测交互后果。在预训练阶段,模型学习根据当前画面和指令,预判接下来可能发生的接触状态。这种预判并非凭空想象,而是基于海量数据中总结出的物理规律。

其次是慢-快动作专家系统。这一设计巧妙地平衡了计算效率与实时响应能力。“慢速流”负责处理视觉、语言和整体任务上下文,维持长期的动作计划;“快速流”则在动作执行过程中,实时读取最新的触觉反馈和机器人状态,仅重新生成下一小段动作。这种分层机制使得机器人不必在每次检测到微小接触变化时都重新计算全盘计划,从而实现了毫秒级的动作纠偏。

通用触觉编码器(Universal Tactile Encoder)则解决了异构触觉数据融合的难题。无论输入来自指尖传感器、压力手套还是虚拟重建的触觉信号,都会被统一转换为固定格式的触觉Token。最后,TopoHand模块负责对齐不同本体(人手、灵巧手、平行夹爪)的动作空间,确保语义一致的动作在不同设备上能被正确解析。

数据底座:50万小时视频的深层挖掘

如果说模型架构是Being-H0.8的大脑,那么数据则是它的记忆库。BeingBeyond拥有国内规模最大的人类操作视频数据池,累计超过50万小时的第一人称视角视频。然而,原始视频并不等于高质量训练数据。这些视频中混杂了大量无效片段,如镜头抖动、手部出画、动作冗余等。

团队为此构建了一套极其复杂的数据处理流水线。首先通过过滤、去重和切分,提取出有效的交互片段。接着,利用MANO手部模型和HMR(Hand Motion Refinement)技术,从裸手视频中恢复出精细的手部运动轨迹和相机参数。对于机器人数据,则重新整理URDF格式,统一关节约定和坐标系,确保数据的一致性。

经过清洗和标准化,这些数据形成了UniHand-3.0数据集。但这只是第一步,因为原始视频仍然缺乏触觉信号。如何让机器人在没有触觉记录的视频中“学会”触觉,成为了更大的挑战。

从视觉推断触觉:TactoHand的革命性突破

Being-H0.8最引人注目的技术亮点之一,是TactoHand模块的引入。该模块的核心思想是:即使没有直接的触觉传感器数据,也可以通过三维几何关系和时序信息,推断出接触的发生。

TactoHand利用已经配准的手部和物体网格,计算顶点间的距离和表面法向量,从而判断接触是否发生。它在MANO手部表面的778个顶点上预测两类信息:一是接触标注,确定接触点;二是邻近度标注,描述手指从接近到接触的连续过程。这一模型在3010万帧数据上训练,并引入时序信息以避免视角重叠导致的误判。

此外,团队还引入了约55小时的真实压力手套数据,包含540万同步帧。这些真实数据与TactoHand推断的伪触觉数据形成互补:前者提供准确的物理压力、摩擦和材质信息,后者提供大规模的场景覆盖和动作多样性。这种混合数据策略,极大地丰富了模型的触觉表征能力。

统一表征与动作对齐:打破本体壁垒

在获取了丰富的触觉数据后,如何将其统一表示并应用于不同控制的机器人,是另一个关键技术难题。不同传感器输出的数据格式各异,有的只标记接触,有的提供逐顶点压力,有的甚至缺失某些通道。

通用触觉编码器通过构建一个由粗到细的触觉金字塔,将不同来源的数据映射到统一的MANO拓扑上。每个触觉Token不仅包含压力或接触信息,还携带三维位置、拓扑位置、左右手标记及有效性标识。这种设计使得模型能够区分“无传感器”与“零压力”,提高了鲁棒性。

进一步地,TopoHand模块解决了人手与机器人本体之间的动作鸿沟。它不试图将所有手改造成同一种结构,而是将手腕位姿、形态编码、关节角等要素拆分为规范化的槽位。这使得语义相近的动作(如“捏住”、“抓取”)在不同本体上能进入相同的表示空间,实现了跨本体的知识迁移。

实战验证:高难度精细操作的突破

基于这套架构,Being-H0.8在真实双臂机器人实验中展现了令人惊叹的能力。在包中取物任务中,机器人不仅能视觉定位物体,还能通过触觉反馈判断抓取力度,避免滑脱。在毛笔写字任务中,模型能根据笔尖与纸面的接触压力,实时调整运笔的轻重缓急,写出具有书法韵味笔画。

此外,挤牙膏、夹薯片等需要精确力控和柔性操作的任务,机器人也能轻松完成。这些任务对纯视觉模型而言极具挑战性,因为它们的成败往往取决于接触瞬间的微小力变化。Being-H0.8通过隐式触觉预测,提前预判接触后果,并在执行中根据实时反馈调整动作,实现了类似人类专家的“手感”。

技术路线的演进与未来展望

回顾Being-H系列的发展,可以看出智在无界在具身智能数据路线上的清晰战略。从验证人类视频预训练的可行性(Being-H0至H0.5),到解决大规模数据的规模化利用(H0.5至H0.7),再到当前的高质量数据提取与多模态融合(H0.8),每一步都直击行业痛点。

Being-H0.8的发布,标志着具身智能从“视觉主导”向“多模态深度融合”的转变。它证明了仅凭人类视频,也能挖掘出丰富的物理交互知识,无需依赖昂贵且稀缺的真实触觉标注数据。这不仅降低了具身模型的训练成本,也为大规模通用机器人的普及铺平了道路。

当然,挑战依然存在。触觉数据的长尾分布、极端接触场景的泛化能力、以及多模态同步的延迟优化,仍是需要持续攻克的难题。但Being-H0.8提供的架构范式和数据挖掘方法,为后续研究提供了宝贵的参考。

随着世界模型逐渐拥有“触觉”,机器人将不再只是冷冰冰的执行机器,而是能够感知物理世界细微变化的智能体。从实验室走向家庭、工厂和医院,具身智能的下一个里程碑,或许就在指尖的每一次轻柔触碰中。

结语:重构物理交互的认知边界

Being-H0.8不仅仅是一个新模型的发布,更是一种认知范式的更新。它告诉我们,智能不仅仅源于对视觉信息的处理,更源于对物理世界交互的深度理解。触觉的引入,让机器人在“做”的过程中拥有了“感”的能力,从而在复杂动态环境中展现出更高的适应性和智能水平。

对于整个AI行业而言,这一突破意味着具身智能的训练数据维度得到了极大拓展。通过从海量非结构化视频中提取隐含的物理规律,我们有望以更低的成本、更快的速度培养出具备通用操作能力的机器人。未来,随着数据规模的进一步扩大和模型架构的不断优化,像Being-H0.8这样的模型将成为机器人日常工作的标准配置。

在这个充满不确定性的物理世界中,触觉赋予了机器人一种确定的“手感”,让它能够像人类一样,在细微之处见真章。这不仅是技术的进步,更是人类与机器协作方式的一次深刻变革。随着这项技术的成熟,我们有望看到一个更加灵巧、感知更加敏锐的机器人时代到来。