WAIC 2026具身智能观察:从人形崇拜到世界模型的数据战争

0 阅读

具身智能的下半场:形态解构与认知重构

2026年的世界人工智能大会(WAIC)呈现出一幅截然不同的图景。如果说去年的具身智能展区是“人形机器人的阅兵式”,那么今年则是“场景驱动的功能性实验场”。随着具身智能首次独立成馆,与智算并列为核心赛道,行业信号清晰可见:单纯追求后空翻、跳舞等炫技动作的时代正在过去,真正决定行业天花板的,是对物理世界的理解深度以及落地的实用性。

现场最直观的感受是“人多”与“态多”。参展企业从去年的80多家激增至200多家,真机超过300台且全部动态运行。这种爆发式增长背后,是产业界对形态认知的彻底觉醒。曾经被视为唯一正解的全尺寸人形机器人,如今让位于轮式、四足、半人马甚至载人机甲。这种形态的多元化,并非技术的倒退,而是市场理性回归的结果。在工业、物流、家庭等具体场景中,单一形态无法通吃,按场景反推本体成为主流逻辑。智元的轮式重载、乐聚的工厂物流全场景自动化,都证明了稳定性与成本优于形态的拟人程度。形态的离散化,标志着具身智能从“科幻概念”迈向“工程实用”的关键一步。

大脑之争:从VLA到世界模型的范式转移

在形态百花齐放的同时,真正的技术暗战发生在机器人的“大脑”里。视觉-语言-动作(VLA)模型曾被视为万能钥匙,但其致命弱点在于对物理世界的理解匮乏,泛化能力在复杂环境中迅速衰减。今年WAIC上,多家头部企业不再局限于VLA的优化,而是纷纷押注“世界模型”,试图让机器人具备“预判”与“想象”的能力。

银河通用发布的WAM-TTT模型展示了一种极具诱惑力的路径:测试时训练(Test-Time Training)。通过冻结预训练参数,仅利用少量人类操作视频即可快速适应新环境。这种“厨师换厨房,厨艺不变”的思路,极大地降低了部署成本。然而,业界专家指出,要达到99%的工业落地标准,仅靠人类视频远远不够,领域专用数据依然是硬门槛。

星尘智能则走出了另一条激进路线——隐式世界动作模型Lumo-2。与生成画面的世界模型不同,Lumo-2在内部进行隐式推理,通过“想象”物体状态的变化来决定动作。例如在煎蛋场景中,模型不会生成画面,而是直接推理出“蛋需滑向锅边”的状态变化并生成相应动作。这种黑盒模式的优势在于省算力、能自主切换场景,但代价是内部过程不可解释,故障排查极度困难。腾讯发布的RxBrain则试图统一推理与想象,通过视觉与语言双通道连接左右脑,虽未直接冠名世界模型,但其架构已触及该方向的核心。这表明,VLA与世界模型并非零和博弈,而是同步进化的两条轨道,共同推动机器人从“记忆者”向“思考者”转变。

数据寒冬与灵巧手觉醒:下一轮竞争的焦点

尽管大脑日益聪明,但具身智能进厂入户的步伐依然沉重。制约落地的两大瓶颈逐渐浮出水面:数据匮乏与末端执行器不灵。

2026年被业内称为“具身数据元年”,数据采集首次成为独立品类。过去,数据封闭在本体厂商体内,形成孤岛。今年,围绕“卖铲子”的业务模式兴起。觅蜂科技推出的MEgo系列,通过轻量化穿戴设备降低数据采集门槛;大晓机器人与世界模型捆绑销售,提供即插即用的数据解决方案。这三种路径反映了行业对标准化、低成本数据供给的迫切需求。世界模型虽缓解了部分数据压力,但高质量、多模态的真实物理交互数据依然是稀缺资源。谁掌握了数据闭环,谁就掌握了进化的速度。

如果说数据是大脑的燃料,那么灵巧手就是机器人的肢体延伸。今年WAIC上,关注点从“腿”转向了“手”。灵心巧手的O30全直驱灵巧手,通过去除减速装置实现亚毫米级定位精度,直击精密装配痛点;超维动力的KAIHand则通过高密度触觉皮肤感知0.1牛的微小力度,并在柔韧性上做出突破。直驱关节成本下降与触觉传感技术跨越量产临界点,使得灵巧手从工业夹爪升级为具身智能的核心终端。然而,如何在复杂非结构化环境中实现如人手般的灵巧操作,仍是未解之谜。

冷静看待:从“能演”到“能干”的漫漫长路

WAIC的热闹终会散去,留给行业的却是冷静的思考。尽管机器人在长程任务(如连续15小时协作拼装积木)和复杂操作(如煎蛋颠锅、打蝴蝶结)上取得了显著进步,但必须承认,当前大部分演示仍是在受控环境下完成的“表演”。在零售、物流、家庭服务等真实场景中,机器人的可靠性、容错率及经济性距离大规模商用仍有巨大差距。

行业正在经历从“技术验证”到“价值验证”的痛苦转型。形态的丰富、大脑的进化、数据的积累,都是为了一个终极目标:让机器人像人一样在物理世界中可靠地工作。这不仅需要算法的突破,更需要产业链上下游的协同——从传感器、关节模组到算力芯片,再到场景数据的持续迭代。具身智能的未来,不属于单一形态的垄断,而属于能够解决具体痛点、具备持续进化能力的系统级解决方案。在这场马拉松中,耐心与务实,比任何炫技都更为重要。