半年融资六轮,德塔智能如何用原生三维模型重塑人形机器人?

4 阅读

资本加速涌入与“半年六轮”的资本狂欢

在2026年的具身智能赛道上,资本的脚步从未像今天这样急促。德塔智能(Delta Intelligence)近日宣布完成近5亿元天使++轮融资,这一数字背后,不仅是多家上市公司产业方与头部财务投资机构的共识,更是行业对“基础模型”这一核心基础设施价值的重新定价。值得注意的是,这是该公司自2026年1月成立以来的第六轮融资。

在科技创业领域,初创企业通常经历种子轮、A轮、B轮的漫长周期,而“半年六轮”的融资节奏极为罕见。这种高强度的资本注入,折射出当前人形机器人产业从“展示性Demo”向“实质性作业”转型的关键节点。资金的主要流向并非单纯的硬件堆砌,而是明确指向人形机器人基础模型的持续迭代、自研数采设备的量产以及数据闭环的构建。这意味着,行业的竞争焦点正在从单一的机械结构制造,下沉至决定机器人“灵魂”的数据质量与算法架构层面。

这种资本密集型的投入逻辑,本质上是为了解决具身智能落地过程中最致命的短板——有效数据的匮乏。德塔智能通过快速融资迅速建立技术壁垒,试图在通用人形机器人基础模型的标准化进程中占据先发优势。

破解二维视觉盲区:原生三维世界引擎的底层重构

当前主流的人形机器人具身智能模型,大多建立在二维视觉表征之上。这种技术路径存在一个天然的物理缺陷:单目图像缺失真实的深度信息。当机器人面对一个门时,二维像素仅能呈现门的外观,却无法精准计算门把手的绝对距离、开门所需的旋转角度或身体需要避让的空间阈值。在简单的静态场景下,这种偏差或许可以被忽略,但在复杂的真实厂区或家庭环境中,随着长时序连续作业的推进,这些基于像素估算的距离误差会不断累积,最终导致操作失败。

德塔智能选择从底层彻底重构这一认知范式。公司自研了“原生三维世界引擎”,将三维表征作为模型的核心。与传统的计算机视觉不同,该引擎能够直接处理点云、高斯泼溅(Gaussian Splatting)等复杂的三维场景表示。这种原生理解能力赋予了机器人类似人类的“空间直觉”,使其能够在推理过程中直接模拟未来环境的物理状态变化,而非仅仅预测下一帧图像。

这一技术路线的转变具有战略意义。它意味着机器人不再是一个被动接收二维信号的传感器集合,而是一个具备三维空间推理能力的主动探索者。这种底层表征的升级,为后续处理柔性物体形变、多触点受力等复杂物理交互奠定了数学基础,也是德塔智能区别于其他仅停留在视觉识别层面的竞品公司的核心护城河。

“大脑+小脑”架构与Delta D1的数据闭环革命

有了强大的三维大脑,如何获取训练它的数据成为第二道难关。德塔智能提出了“大脑+小脑+力位混合”的三层协同架构,并针对每一层设计了专门的数据获取与训练策略。

在架构设计上,“大脑”负责环境感知、长时序任务规划和高层操作决策。不同于许多依赖大量仿真数据预训练的公司,德塔智能的“大脑”训练几乎完全摒弃仿真数据。原因在于,现有的物理仿真器难以完美复刻现实世界中柔性材料的形变、非刚性物体的多触点受力等复杂物理现象。如果依赖仿真数据,模型将面临严重的“模拟-现实”鸿沟(Sim-to-Real Gap)。因此,“大脑”必须依赖真实的物理交互数据进行训练。

“小脑”则专注于全身平衡与底层运动控制。它在仿真环境中通过强化学习进行海量试错,将“大脑”发出的稀疏高层指令转化为数十至数百赫兹的全身电机控制信号。最后的“力位混合层”则确保输出指令具有柔顺性,防止机器人在接触物体时因刚性过强而损坏自身或物体。

为解决“大脑”所需的数据缺口,德塔智能同步发布了头戴式全身全景数据采集设备Delta D1。这一创新打破了传统数据采集对动捕棚、昂贵标记点或特定机器人本体的依赖。Delta D1允许使用者在正常作业过程中,同步采集第一人称全景视觉与全身关节的运动轨迹。设备的全局定位精度控制在2厘米以内,且无需中断现有生产流程。

更关键的是,Delta D1解决了全身协同数据的标准化问题。市面上多数方案仅采集上肢视频,无法捕捉攀爬、推拉重型门等依赖全身协调的复杂动作。Delta D1输出的结构化数据包含了人体全身百余个关键点的运动轨迹,并与视觉信息在时间轴上精准对齐。这种高质量、全维度的交互数据,是训练具备真正“全身智能”的基础模型所不可或缺的。

开放生态与跨本体适配:从单一厂商到行业标准

具身智能的发展不能依靠单一企业的封闭循环,数据规模必须跨越公司边界。德塔智能采取了一种开放的技术生态策略。它不仅向行业开放Delta D1的采集体系,更与中国信息通信研究院联合发布了“工业数据集2.0”。这一举措旨在构建具身智能的数据基础设施,让采集的数据能够服务于整个行业。

通过跨本体的运动重定向技术,德塔智能将采集的人体全身骨架数据转化为适用于不同人形机器人硬件平台的训练数据。无论是宇树的G1/H2、智元的灵犀X2/A3,还是乐聚的夸父系列或星海图的Kengo,都可以基于同一套底层模型进行适配和微调。这种“一次采集,多处复用”的模式,极大地降低了各本体厂商的训练成本,加速了模型在不同硬件平台间的迁移速度。

这种标准化适配流程包括全身动捕数据采集、跨本体运动重定向、小脑仿真强化学习以及大脑快速微调。面对新的硬件本体,系统无需重新采集大规模数据或从头训练,从而实现了模型的可部署性和可扩展性。德塔智能由此确立了自身作为“基础模型提供方”的角色,成为连接底层硬件与上层应用的关键枢纽。

从实验室走向真实物理作业的场景验证

技术的最终归宿是解决实际问题。德塔智能的基础模型已经走出实验室,进入电网巡检、汽车零部件上下料、SMT料箱分拣等真实工业场景。这些场景对机器人的要求极高:电网全身巡检要求机器人在变电站这类非结构化复杂空间中,边移动边执行精细操作;而工业装配则考验机器人在移动状态下的抓取精度与连续搬运的稳定性。

这些任务正是检验“全身协同能力”是否兑现的试金石。在电网巡检中,机器人需要判断空间距离、调整身体姿态以通过狭窄通道,并操作特定的阀门或开关;在工业场景中,机器人需要具备对柔性线缆或易碎工件的柔顺处理能力。德塔智能的原生三维世界引擎与力位混合控制架构,在此类物理作业中展现出了显著的可靠性。

决定人形机器人能否真正“干活”的,不再是炫目的舞蹈或简单的避障,而是其对三维空间理解的精度,以及将全身几十个关节协调一致的可靠性。德塔智能通过这六轮融资所积累的技术壁垒,正是为了补齐通用人形机器人身上最薄弱的一块拼图——全身智能基座。

随着更多头部厂商接入其生态,以及真实场景数据的不断回流与迭代,德塔智能正在重新定义人形机器人的智能化标准。在具身智能从“展示”走向“生产”的过渡期,这种以数据为驱动、以三维原生理解为核心的技术路线,或许将成为行业标准制定的重要参考。未来的竞争,将是生态效率与数据质量的综合较量,而德塔智能的早期布局,为其在这一长跑中赢得了宝贵的时间窗口与数据优势。