紫东太初开源9B多模态模型ZDTaichu5.0,空间具身能力同档领先

0 阅读

9B模型拿下8项空间理解第一

紫东太初最近开源的通用多模态大模型 ZDTaichu5.0-9B,参数规模只有90亿,但在空间具身智能这条赛道上跑出了意外成绩。

图片

在9项国际权威的空间理解基准测试中,它拿下了8项同参数通用组别的第一名。这些测试涵盖空间感知、跨视角三维推理、具身任务规划等核心能力。对比对象包括 Qwen3.5-9B、STEP3-VL-10B 等主流开源模型,即使把 Gemini 3 Pro、Grok 4 等闭源大模型也拉进来比,ZDTaichu5.0-9B 仍在其中5项上得分最高。

图片

更关键的是,它没为了专精空间任务而牺牲通用能力。在图文理解、OCR、视觉数学、代码生成以及 Agent 能力等常规多模态评测中,它依然稳居第一梯队。比如在11项涉及 Agent、代码、指令遵循和数学推理的测试里,它的表现全面优于同量级开源模型,在 TAU2-Bench 和 IFEval 上甚至略超 Gemini 3 Pro。

图片

这种“既专又通”的平衡,在当前多模态模型普遍面临能力取舍的背景下显得尤为难得。

图片

物理世界任务卡在哪里?

图片

过去几年,多模态大模型在数字世界的能力突飞猛进——看图问答、跨模态检索、复杂文档解析,这些任务的评测分数已经接近天花板。但一旦进入物理世界,问题就复杂得多。

文章配图

想象一个机器人站在操作台前:它得先看清目标工件在哪(空间感知),换了个角度后还能认出它并判断相对位置(跨视角三维推理),再给出一个不违反物理约束的操作方案(具身推理)。这三个环节必须同时在线,缺一不可。而在现有的多模态评测体系里,很少有任务会同时考察这三层能力。

文章配图

更大的挑战来自数据和算力分配。

文章配图

空间具身所需的三维关系标注、操作约束数据,和通用图文数据在分布上差异很大。混在一起训练时,小模型很容易顾此失彼——要么通用能力被拉垮,要么空间推理浮于表面。

文章配图

此外,空间推理任务本身难度不均:有的判断一步就能得出,有的(比如参照系变换、多物体相对关系推演)需要更深的迭代计算。但传统模型的算力分配是线性的,不管题目难易,消耗的计算资源基本一致。这对参数有限的小模型来说,是个真实瓶颈。

图片

ZDTaichu5.0-9B 的解法很直接:用一套完整的数据生产管线解决数据侧的问题,用自适应循环推理机制解决复杂推理和算力分配的问题。

图片

能力链条上的结构性领先

图片

ZDTaichu5.0-9B 的空间能力提升,首先体现在复杂定位任务上。

图片

比如给一张图,要求“找到从左到右第二个银色盒子”,模型不仅要识别属性(银色)、排序(第二个),还要输出精确的归一化坐标。实测中,ZDTaichu5.0-9B 准确命中真值,而 Qwen3.5-9B 和 STEP3-VL-10B 全部定位错误,成了唯一完成正确目标选择的模型。

文章配图

第二层是参照系转换。真实环境中,机器人移动后摄像头视角变化,原本的空间关系也会变。模型需要理解这种变化来自观察角度改变,而非物体移动。

文章配图

典型任务是:先移动到绿框窗帘位置、面向蓝框沙发,再判断红框柜子相对自身的方位。ZDTaichu5.0-9B 给出了正确答案,而其他模型在此类任务上普遍失效。

图片

在 MindCube-tiny 榜单上,它得分78.27,远超 Qwen 的57.6和 STEP3 的62.8。这个差距之所以重要,是因为 MindCube 本质上在测模型是否真正建立了三维空间表征,而不是靠语义匹配蒙对。

文章配图

ERQA 和 RoboSpatial 则聚焦具身交互理解——不仅要知道物体在哪,还得判断“能不能操作”以及“怎么操作”。比如放置任务要求找到杯柄侧的空闲位置,ZDTaichu5.0-9B 输出的坐标落在合理区域,而其他模型的输出全部不符合操作约束,说明它们根本没完成空间推理,只是在猜位置。

文章配图

把这些能力串起来,就是一条完整链条:静态感知 → 动态定位 → 跨视角转换 → 三维推演 → 具身条件判断 → 交互决策。每一环都比上一环难一个数量级,缺任何一环,机器人在真实场景就会卡住。ZDTaichu5.0-9B 在这条链上8/9项同参数第一,且通用能力不降级,属于结构性领先。

文章配图

自适应循环推理:把算力花在刀刃上

ZDTaichu5.0-9B 最核心的技术分岔点,是它的推理机制。

当前处理复杂推理的主流方案有两种:一是思维链(CoT),让模型多生成几步推理文本;二是外部工具调用,遇到难题就调用计算器或代码解释器。

但这两者在物理世界任务中都有局限。CoT 更适合符号推理(如数学、代码),而机器人面对的是持续变化的三维环境,很多判断依赖视觉状态,无法拆解成线性语言步骤。工具调用则会增加系统延迟,在实时交互中不够敏捷。

ZDTaichu5.0-9B 采用的“自适应循环推理”机制,让模型自己判断题目难易。完成一次标准前向计算后,它通过熵门控评估预测的不确定性:如果结果确定,直接输出;如果遇到高不确定性节点(如空间变换、操作校验),就在内部循环执行层块计算,迭代优化隐层表征。

整个过程发生在模型前向传播内部,不依赖外部工具,也不生成额外的思维链文本。这和行业猜测的 GPT-6 Astra 所用的 Loop Transformer 思路类似——都是把复杂推理放入潜空间,让模型根据任务难度自主决定“思考深度”。

为防止循环越算越偏,团队加了三重稳定设计:

  • 阻尼更新:约束每轮特征修正幅度,避免表征偏离原始判断;
  • 双重停止判据:同时监测 KL 散度和隐状态残差;
  • 轨迹读出与状态回滚:保留多轮迭代的中间状态,最终挑选风险最低的一版输出。

这套机制在不明显拉高平均推理成本的前提下,大幅提升了复杂空间任务和长流程任务的正确率,相当于把有限算力精准投向真正需要的问题。

开源权重,更开源“怎么做”

比模型权重更珍贵的,是背后的数据工程方法论。

目前大多数开源模型只发布权重,不公开数据处理管线。但对于想在工业现场落地具身智能的机构来说,光有权重不够——他们需要知道如何用自己的机器人轨迹、实验数据继续训练模型。

ZDTaichu5.0-9B 同步开放了一整套经过验证的数据生产管线方案,覆盖三个核心环节:

预训练阶段,团队将开源图文、网页文档、公开视频、多视角素材和仿真数据统一纳入数据池,经过去重、清晰度过滤、图文相关性筛选、图像重描述、视频抽帧等处理,构建多模态基础样本。

监督微调阶段,样本不再是简单问答对,而是大规模任务轨迹数据,包含真实业务问答、空间具身案例和工具调用轨迹。团队对指令质量打分、校验答案正确性、分层配比难度,并强制校验图像、问题、对象关系、操作约束之间的一致性。还通过多轮对话、多图拼接、视频序列打包等方式,合成带步骤的思维链数据,再经多轮过滤剔除脏样本。

高质量退火 + GRPO 强化学习阶段,团队建立了能力域、难度、质量三维自动标签系统,定向筛选高信息量样本。强化学习采用 GRPO 框架,设置答案正确性奖励、空间框选坐标命中奖励、输出格式合规奖励等可自动校验的信号,把空间点位输出和结构化规划变成可反馈的训练目标。

这套方案的意义在于,它把“如何将工业数据转化为模型能力”这件事,从少数团队的内部经验变成了行业可复用的公开方法论。

从跑分到真实场景验证

具身智能行业有个魔咒:演示好看,落地难产。过去两年,各种机器人抓取、人形行走的视频层出不穷,但真正进入工厂稳定运行的案例寥寥无几。

紫东太初已在科研自动化和智能制造场景对 ZDTaichu5.0-9B 进行了闭环验证。

在科研自动化方向,用户只需输入一个问题,模型就能自主调用工具,完成解析解与数值解求解、结果校验,并生成可视化报告。在试管按序入架的湿实验中,即使试管被抓取移动后位置变化,模型仍能追踪身份、判断状态,并规划下一步操作。

在智能制造方向,它围绕备料配送、机台上下料等典型业务完成实体验证。比如面对一句自然语言工单“把A零件送到3号工位”,模型能理解目标与目的地,完成识别、抓取位置判断和高层任务规划,再由机器人执行双臂协同搬运与放置,跑通从工单理解到实体操作的完整链路。

为什么是9B?为什么能落地?

ZDTaichu5.0-9B 的成功,离不开几个关键判断。

首先是参数档位的选择。真正的终端设备——工业机器人、移动操作平台、实验室自动化系统——对推理延迟和硬件成本极其敏感。70B以上的大模型即使能力再强,也难以在边缘侧实时响应。9B 是当前算力约束下能力与部署的合理折中:能跑在消费级 GPU 上,延迟可控,私有化部署成本低。

其次是通用能力不衰减。工业场景中,机器人要处理的任务远不止空间操作:工单是文字,手册是PDF,异常报告是表格,人机对话需要自然语言理解。如果为了空间能力牺牲 OCR 或指令遵循,系统在非空间环节就会频繁出错。ZDTaichu5.0-9B 证明,空间具身能力可以是对通用能力的增强,而非替代。

第三是数据管线的开放。国内具身智能产业的一大痛点是:各家都在积累操作数据,但缺乏将其转化为模型能力的系统方法。ZDTaichu5.0-9B 提供的工业级验证方案,让企业能在此基础上接入自有数据,快速迭代垂直场景能力。

最后,科研自动化可能成为重要落地入口。相比开放环境,实验室场景流程明确、数据丰富、自动化需求迫切。从滴管液体转移、仪器操作到数据分析,本身就是复杂的具身任务链。ZDTaichu5.0-9B 在此方向的探索,为大模型进入物理世界提供了一条可行路径。

不只是模型,更是生态起点

ZDTaichu5.0-9B 的开源,验证了几件更根本的事:

第一,空间具身能力和通用多模态能力并非零和博弈,在10B以下档位,二者可以兼得;

第二,模型能否真正落地,取决于是否形成从数据工程、推理机制到实体验证的完整闭环,而非单点突破;

第三,把数据生产管线作为开源资产,比单纯开放高分权重更能降低行业研发门槛。

当然,仿真评测和真实物理世界仍有差距,团队也明确表示后续会重点优化仿真到现实的迁移能力。但至少这一次,国内大模型在物理具身智能这条路上,已经从“能不能做”的验证阶段,走到了“好不好用、能不能开放复用”的落地阶段。对机器人、科研自动化、智能制造这些等待大模型基座的产业来说,这是一个值得关注的信号。