具身智能量产元年:从WAIC看2026机器人商业落地的生死博弈
具身智能的风向标:从“表演”走向“实干”
2026年的世界人工智能大会(WAIC)场馆外,电闪雷鸣仿佛预示着地球新物种的诞生。尚未踏入世博展览馆,人形交通机器人已在路口疏导车流,这种强烈的视觉冲击预示着具身智能已成为本届大会绝对的“C位”。从参展数据来看,这一趋势更为显著:具身智能赛道展商数量从去年的80余家激增至200多家,占据全部展商近五分之一,现场展示的真机超过300台,将无数观展者“硬控”在展台前。

穿行于喧闹的场馆,热闹表象之下暗藏着行业风向的深刻变迁。去年的具身智能多带有浓厚的“表演”性质,而今年,多数企业已将重心转向具体的“打工场景”。汽车线束产线、仓库分拣、药房配药、零售货架整理、洗衣房作业乃至家庭客厅服务,这些真实场景被1:1搬进展馆。异构机器人在其中流畅执行长程任务,不再仅仅是展示单点动作的灵活性,而是被要求真正“干活”,且工种分化日益清晰。

与此同时,具身智能的大脑技术路线也呈现出清晰的分野。过去备受推崇的端到端路线以及随之而来的VLA与世界模型之争,在现场的争论声渐弱。取而代之的,是通过Agent调度原子化技能、实现“一脑控多机”、精准完成规范化任务的路径模式。然而,尽管应用场景和技术架构日趋成熟,数据难题依然是行业无法回避的共同困境。真机数据的稀缺迫使许多展示依赖于展前连夜采集与调试,这意味着模型对多场景的适应能力仍显不足。提升泛化能力,仍是当前商业兑现最直接、最严峻的门槛。

场景分化:机器人如何精准“打工”
2026年,机器人“打工”的可行性达到了前所未有的高度。按场景梳理展馆内容,可以发现机器人的工种划分已相当细致,工业、零售与服务三大领域均释放出了Ready的信号。
工业场景因其对精度和效率的严苛要求,成为具身智能最先实现落地的高密度区域。在分拣环节,极智嘉展示的小型产线中,人形机器人Gino 1能精准抓取充气量不同的薯片袋、透明包装面包乃至不规则毛绒玩具。Gino 1不仅具备单点抓取能力,更能与移动机器人、专用工作站组成自动化编组,自主完成拣选、搬运到投递的全流程,具备较强的抗干扰能力。从交付逻辑看,极智嘉旨在提供提升整条产线OEE(设备综合效率)的系统方案,而非单纯展示单体性能。

在更高精度的操作领域,它石智航的A1机器人专注于汽车线束插接。面对柔软易变形、易缠绕的线束,A1需实时调整抓取策略,完成亚毫米级的孔位插接。传统VLA框架因视频帧数限制常存在几毫米误差,难以胜任此类精细活,而厂商通过优化算法解决了这一痛点。此外,重载搬运也是重要战场。智元与京东物流联合推出的精灵G2 Max,未来将部署于“智狼仓”承担重物搬运;银河通用的Galbot S1则能完成拆垛、搬运和码垛,单箱承重达50公斤,每小时处理80至90箱,续航约10小时。虽然单小时效率尚不及人工,但机器人长时间连续作业的优势在重物场景已初步显现。

To C端的零售和服务场景同样精彩。蚂蚁灵波展位还原了真实药房,机器人能在下单后一分钟内完成接单、取货、上架全流程,并已在国大药房上海门店落地。值得注意的是,展位内乐聚、星尘智能与蚂蚁灵波的三台异构机器人,均共用LingBot-VLA 2.0大脑,实现了“一脑控多形”、“一脑控多手”的架构,这已成为今年的主流选择。

银河通用的Galbot G1在模拟超市中烤面包、倒咖啡,即便遭遇人为干扰(如挪动杯子、遮挡杯口),也能重新规划路径或暂停动作。其自研大模型“银河星脑”已在三类机器人上装机,能完成3到5分钟的长程任务。智平方AlphaBot 2调鸡尾酒、优理奇保姆机器人做手磨咖啡和披萨,这些都不是单一短动作,而是多步骤组成的复杂任务。长程任务的核心价值在于提升了对任务的理解与执行能力,标志着机器人从“做几个动作”向“承担一类工种”的质的飞跃。

技术演进:Agent架构与数据瓶颈的博弈

尽管机器人在运动控制上日益利索,但真正决定其能否大规模使用的,是对物理世界的理解与自主决策能力,这些能力目前仍受制于数据与算法瓶颈。今年最显著的技术变化是,过去言必称的端到端叙事逐渐让位。
前两年,端到端模型被视为具身智能的圣杯,类比自动驾驶,一个模型直接从视觉输入到动作输出。但在今年WAIC现场,长程任务几乎清一色采用了基于Agent的分层架构:上层Agent负责调度与任务理解,下层则是被拆解为抓、放、插、堆等标准化技能的“原子能力”。大模型理解指令后,Agent根据上下文调取技能组合。这一模式兴起的原因在于,端到端虽显示出Scaling Law信号,但在新环境部署时需大量重新训练与调试,耗时数月;而原子能力基于已有技能适配,无需从头训练,部署周期大幅压缩,且技能可在不同本体间复用。
这种架构看似回归到规则时代的智驾逻辑,实则是当前数据与模型约束下的务实选择。它提升了场景与能力的泛化性,能忽略机器人构型差异,但也被视为一种“放下执念”,不太可能通向“通用具身智能”的终点。
数据难题是制约行业发展的核心痛点。截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的两万分之一。要达到高阶智能,真实物理世界的数据量级需达到亿小时级别。为此,行业探索出两条主要数据获取路径:
其一是降低真实数据采集成本。智元推出了轻量化作业和数据采集平台G2Air,通过手持或穿戴设备在真实场景中操作,记录动作、视觉和交互数据,再迁移至机器人模型训练。其核心逻辑是同构化采集,即采集设备与本体原生同构,最大化复用无本体环境采集的数据。许多灵巧手展台也展示了采集手套,通过同步动作降低开发者采集难度,建立数据回流通道。
其二是仿真先行,真机微调。苏度科技等厂商倾向于在虚拟世界中通过物理仿真引擎批量生成数据,先提升机器人基础操作能力。由于仿真与真实世界存在迁移差距,模型训练后还需用真机在不同场景和任务中跑通,用真实数据持续修正模型。
在模型架构上,单纯VLA与世界模型的争吵减少,混合路线成为共识。蚂蚁灵波推出包含具身原生世界动作模型和具身基座模型的LingBot 2.0系列;千寻智能采用VLA加世界模型融合架构;智平方走“皮层-小脑-脊髓”类脑路线;机器科学推出VLOA架构,通过3D点云轨迹描述物体运动变化;极智嘉的双脑协同架构中,小脑Gravity 4D具身模型扩展出二维视频预测能力,实现风险预判后生成稳妥动作序列。当行业无法确信最终形态时,将智能与硬件解耦,实现跨本体复用,已成为跨越数据瓶颈的关键。
量产元年:从样机到商用的生死线
真实世界的商业门票并不廉价。去年,尽管业界高喊量产与商业化,但实际出货结构令人担忧。据新战略咨询数据,2025年国内具身智能机器人出货中,科研教育占比42%,数据采集占19%,真正产生商用价值的工业及物流仅占4%。这意味着,大部分销量仍依赖于过渡性需求,而非真正的市场认可。

要跻身真实应用市场,光证明能干活远远不够,规模化量产能力成为分水岭。2026年被称为具身智能“量产元年”,产能差距直接决定企业生死。IDC数据显示,2025年全球人形机器人出货量近1.8万台,智元、宇树以5000台量级位居第一梯队,智元在2026年3月迎来第10000台下线;乐聚、加速进化、松延动力处于千台级第二梯队,其余厂商多在百台水平或仅有样机。
然而,2026年不能再靠Demo糊弄。宇树年产能规划达19万台,优必选将出货目标上调至5000台,零次方在拿下前置仓大客户后积极联系代工厂与供应商扩产。厂商们正从卖给实验室和展厅,转向抵达真正该用的地方。银河通用进入电池厂与汽车工厂,灵初设备进驻长飞产线,蚂蚁灵波智慧药房投入运营,这些场景分化清晰:“工厂派”聚焦物流、巡检、搬运;“日常派”聚焦零售、服务、家庭。
除了整机出货,数据的量产和模型装机量也是量产的重要内涵。部分玩家选择成为“卖铲人”,如地瓜机器人推出基于具身智能大脑平台的量产方案,适配近10款主流VLA模型,通过“开发套件搭原型、模组调调试、产业链协同量产”三步路径,降低行业量产门槛。
机器人必须走进真实世界积累经验,行业必须走进真实市场获取收入。WAIC八年历程,行业从路线之争、参数比拼,收敛至场景、数据、量产三条主线,完成了成人礼。但现阶段进厂多为建立试点,而非规模化采购。要让工厂复购,还需计算稳定性与ROI。接下来的竞争,既分高下,也决生死。