自变量机器人突破:单一模型驱动家庭与物流双重场景的产业化实践
在世界机器人大会的现场,一台看似普通的机器人正在进行着令人惊叹的操作——低头插花。它能够根据观众选择的不同花枝和花器,自主判断长短、角度和配色,自动搭配出一捧错落有致的花束。这样的场景在展会上并不罕见,但真正引人注目的是,这台机器人展现的并非为大会临时编排的演示程序,而是已经规模化运行的真实业务场景。
展台的另一侧,同款机器人正在执行叠衣服、取外卖、从冰箱取饮料等日常任务。再往旁边看,两条机械臂正一递一接,将面单逐一翻转朝上,几乎不停顿地分拣包裹。在之前的一场公开直播实测中,这套生产线跑出了每小时1816件的分拣效率,这一数字远超行业平均水平。
这些看似毫不相关的任务,实际上都是由同一个大脑驱动的。这种统一的控制架构代表了具身智能领域的重要突破,标志着从传统的专用机器人向通用智能机器人的转变。自变量机器人通过这种方式,不仅展示了技术的可能性,更重要的是证明了技术的实用性。
在家庭服务领域,自变量机器人展现出了惊人的适应能力。面对观众提出的各种需求,包括一些意想不到的任务,如铲猫砂,机器人都能够应对。这些任务虽然不在预设的训练清单中,但机器人凭借对物理规律的底层理解,依然能够完成。这种能力的获得,源于机器人在真实环境中的持续学习和进化。
今年3月,自变量与58到家合作推出了机器人上门家政服务,机器人与保洁员搭档,共同完成清洁和收纳工作。5月启动的X家庭成员计划更是让机器人直接在用户家中常住,最长可达一个月,在连续、真实的生活环境中工作。到今年7月,这个项目入选了APEC官方发布的《亚太地区数智赋能案例集》,成为其中唯一一个用具身智能服务民生的案例。
这种真实服务的积累,使得自变量机器人的能力不断扩展。机器人每多进入一个家庭,就会接触到一批训练清单上不存在的新需求,这些交互的成功和失败经验又会反过来提升机器人的整体能力。原本的'想不到的需求'就这样一条条变成'已经会干的活'。
在物流分拣场景中,自变量展现出了更高的技术水平。现场展示的生产线采用了双机械臂加夹爪的配置,处理的是从真实物流场景中来的包裹,大小、形状、材质、重量完全随机。机器人需要做的就是将每个包裹的面单翻到合适位置,有时多个包裹叠在一起还需要将它们分开。
这套系统的分拣效率达到了每小时1816件,相比美国头部具身智能企业Figure AI公布的同类数据1248件/小时,自变量快了45%以上。更值得关注的是成本控制,Figure AI采用的是人形机器人加五指灵巧手的方案,而自变量使用的是双机械臂加夹爪,部署成本仅为前者的约30%,分拣准确率却高达98%。
这种差异反映了两条完全不同的产业发展路径。一条是堆硬件路线,用最像人的身体、最复杂的灵巧手、最精密的传感器,依靠硬件性能去提升能力上限。但这种方法面临成本高昂、设备脆弱、维护困难等问题。工业场景恰恰对成本和稳定性最为敏感,仓库需要的是7×24小时连续运转,而不是需要精密校准和专项维护的'机械艺术品'。
自变量选择的是另一条路径:让身体简单一点,让大脑聪明一点。夹爪结构简单、零部件少,故障率天然较低;双臂构型能直接对接现有仓储工位,无需大幅改造产线,落地快速,易于复制。本质上,这是用通用模型能力的提升来替代硬件的军备竞赛。
驱动家庭和物流两大场景的核心技术是WALL-B端到端世界统一模型。今年4月发布的WALL-B是全球首个基于世界统一模型架构的具身大模型。它将视觉、语言、触觉、动作和物理预测等所有能力放在同一个神经网络中,从零开始联合训练、融为一体。没有模块边界,没有数据搬运损耗,所有能力在同一个网络中原生协同。
这种原生统一带来了几个传统VLA架构难以实现的能力。首先是原生多模态融合与空间推理能力。模型在感知的同时就理解了空间关系,杯子在桌子边缘、地面有水、椅子挡在路上等信息在同一个网络中被即时整合。WALL-B还展现出一种'原生本体感',不需要持续观察自身全身,就能内在感知自己的位置和手臂伸展范围,判断能否通过某个空间或触及某个物体。
其次是对物理规律的深入理解。WALL-B能够理解重力、惯性和摩擦力,推演不同动作可能带来的状态变化。推一个轻盒子和推一个重箱子该用多大力、物体会如何运动、是否会翻倒,模型能够在动作执行前做出准确预测。它不需要见过完全相同的场景,就能够实施推断并采取预防动作。
这种对物理常识的掌握是零样本泛化的基础。物理规律在不同环境中是一致的,模型进入一个从未去过的家庭,可以用对重力和摩擦力的理解来应对新场景,无需重新采集数据、重新训练。
第三个重要特性是记忆与交互式自我进化能力。目前大多数机器人在任务失败后直接停止、返回错误信息。WALL-B的行为模式不同,它会调整策略再次尝试,如果成功,就将这次经验直接更新到模型中。这种机制使得模型在真实环境中可以持续自主迭代,无需返厂重训、无需人工注入新数据。
自变量联合创始人兼CTO王昊曾提出'糖水数据'与'牛奶数据'的概念区分。实验室里光照固定、物体位置固定的干净数据像糖水,好喝但没营养;真实家庭中拖鞋散落、猫跳上桌、灯光忽冷忽热的嘈杂数据像牛奶,难采但有营养。WALL-B的设计目标就是让模型能够直接消化'牛奶数据',在真实世界的随机性中成长,而不是只能在'糖水'里训练、到了真实环境就失效。
这套通过预训练获得的通用能力可以跨本体、跨任务、跨场景复用。今天驱动家庭机器人叠衣服,明天驱动机械臂分拣包裹,底层是同一个模型,无需为每个场景单独采集大量数据、做针对性后训练或定制专用硬件。
这种通用路线并非自变量独有。海外的Physical Intelligence依靠海量真机数据做跨本体VLA泛化,Skild AI做跨本体、跨任务的通用机器人大脑,科技巨头如英伟达Isaac GR00T、Google Gemini Robotics也在押注'一个模型通吃'。但在具体架构上,行业远未收敛。WUM代表的'全能力原生统一'是一条激进且少数派的路径,其长期优势还需要更多场景和更长时间来验证。
家庭和物流两个场景的同时落地,为这条路线提供了第一次集中的实证。同一个预训练模型,不依靠大量的针对性后训练、不依靠定制硬件,同时在最开放的民用场景和最讲究效率的工业场景中跑通了真实业务。这在行业内并不多见。
具身智能的发展,模型只是冰山水面上的一角。作为物理世界的AI,具身智能与大语言模型的逻辑有着巨大差异。LLM可以从互联网上海量的文本和图片中学习,但具身模型所需要的数据——接触、摩擦、重力、物体形变,只有真正进入现实物理环境进行交互才能获得。这类数据的采集成本高、规模受限,是行业当前的瓶颈。

同时存在的还有数据的结构性问题:数据质量失衡、标准割裂导致数据孤岛、闭环迭代效率低下。自变量给出的解决方案是构建一套覆盖数据采集、加工处理、模型训练、真机部署和数据回流的完整工业级数据管线。

在数据采集端,自变量推出了QUANXTA Zero系列无本体数据采集方案。这是业内少数的有自研具身模型和机器人本体的公司从源头定义数采标准,并开源了数采方案与相关方法。在QUANXTA Zero之上,人的动作被采集后,可以转化为机器人可学习的数据。

该系列具备行业唯一的'移动采集数据本体回放'能力,并且采集数据入库有效率超过85%。在此基础上,自变量实验证实了无本体数据与真机数据10∶1的混合配方,可以达到同等规模纯真机数据的效果,用大量低成本的无本体数据搭配少量高精度真机数据,能将模型训练所需的数据成本降低95%。

各家具身智能团队在采集质量、回放精度和数据清洗上的工程差异,才是真正拉开差距的地方。采集之外,自变量自研的数据管线还覆盖数据清洗、自动化标注、质量控制和数据增广,配合自研数据合成模型高保真复现真实世界中稀缺、复杂或危险的场景,将原始数据持续加工为模型可训可用的资产。

这套基础设施的效率有多高?在自变量举办的全球具身智能开发者大会黑客松上,参赛选手仅用三天就完成了从数据采集、模型训练到真机部署的全流程。作为对比,专业研究实验室跑通类似流程通常需要六个月。

模型和数据之上,面向推理与部署,自变量还自研了具身大模型分布式训练与高性能推理框架,近几个月来开源的就有DMuon分布式优化器、HOST单样本学习框架、X-Tokenizer跨模态动作分词器等底层工具。

本体方面,自变量近期还量产了量子一号、量子二号两款机器人,实现机械臂、关节模组、动力驱动器、主控制器等核心零部件全面自研。

从数据到模型、从训练框架到硬件本体,自变量构建的是一条全栈自研的闭环。这种垂直整合的优势在于能够实现端到端的优化,避免了不同组件之间的兼容性问题,提高了整体系统的效率和稳定性。
在WRC现场,最吸引眼球的展台展示的是机器人'能做什么',跳舞、握手、走几步路,demo都很精彩,但距离真实产业应用还有一段距离。自变量展示的是另一个维度:机器人'已经在做什么',已经在哪里产生经济效益了。
家庭一侧,机器人正在走进普通家庭提供常态化服务,项目入选APEC官方案例集;工业的另一侧,分拣方案已在物流产线上常态化运行,通过了企业的经济效益考验。两个场景共享同一个模型底座,家庭场景积累的广泛交互数据驱动模型进化,工业场景验证技术的产业价值,二者形成数据与商业价值的正向循环。
资本也在用脚投票。据公开信息,自变量成立以来获得小米、美团、阿里、字节跳动、红杉中国、IDG资本、中国移动链长基金等30余家机构投资,两个多月内连续完成4轮融资,估值突破200亿人民币。
2026年被普遍视为具身智能走向落地的关键节点。当一家公司能用同一个大脑同时服务C端家庭和B端产线,把模型生产流程从六个月压缩到三天,这说明通用具身智能的产业化拐点可能比大多数人预想的更近。这种跨场景的通用能力展现了人工智能在物理世界应用的巨大潜力,也为整个行业的发展提供了新的思路和方向。