ZDTaichu 5.0-9B开源,空间能力八项夺冠

紫东太初于9月15日开源约9B参数的ZDTaichu 5.0-9B,支持图片、长视频和任意分辨率输入。在九大空间理解基准中拿下八项同规模第一,同时保持图文理解、OCR、数学和代码能力的第一梯队表现。
ZDTaichu 5.0-9B开源,空间能力八项夺冠
9月15日,紫东太初正式开源面向物理世界的通用多模态模型 ZDTaichu 5.0-9B。模型参数量约为9B,支持单图、多图、长序列视频和任意分辨率视觉输入,重点解决空间感知、跨视角理解、具身任务规划等问题。
根据团队公布的横向评测结果,ZDTaichu 5.0-9B在九大国际空间理解基准中拿下八项同规模组别第一,被定位为“10B参数以内空间具身能力最强的通用多模态模型”。参与对比的模型包括Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B,以及Gemini、Grok等闭源模型。
这个结果的看点不只是“9B模型赢了几项榜单”,而是它试图解决多模态模型进入机器人和工业现场时最现实的一道坎:模型不仅要看见物体,还要理解物体之间的空间关系,知道什么地方可以放、从哪个角度能抓取,以及改变视角后原有判断是否仍然成立。

从“看见”到“能动手”,空间能力被拆成四层
过去的视觉语言模型,强项通常是识别和描述:这张图里有什么、图片上的文字是什么、两张图有什么差异。但机器人真正执行任务时,需要的不是一段看起来合理的描述,而是可以用于动作规划的空间结论。
比如,机器人面对桌面上的几个盒子,指令是“拿起从左到右第二个银色盒子”。模型需要完成的并非简单的目标检测,而是一条连续判断链:
- 找到所有候选盒子;
- 识别颜色和外观属性;
- 建立从左到右的排列顺序;
- 将语言中的“第二个”映射到具体目标;
- 输出可供机械臂使用的坐标或区域;
- 确认抓取位置不会与其他物体发生碰撞。
紫东太初将ZDTaichu 5.0-9B的能力概括为四个层次:空间感知、复杂三维空间推理、具身条件推理、物理交互决策。这比单纯增加一个“视觉输入”接口更接近机器人系统实际需要的能力链。
在团队披露的视频定位案例中,模型能够准确找出“从左到右第二个银色盒子”并输出目标坐标,而同组其他开源模型出现定位错误。这个案例的价值在于,坐标输出最终可以接到抓取或移动模块;如果模型只是说“第二个盒子在中间偏右”,对于机器人来说还远远不够。
九大空间基准八项第一,但要看清比较口径
此次评测覆盖空间感知、三维推理、多视角变换和机器人交互等方向。团队公布的信息显示,ZDTaichu 5.0-9B在九大基准中取得八项同规模第一。
其中,模型在 MindCubetiny 上取得78.27分,在 ViewSpatial 等跨视角测试中也取得明显领先。团队还表示,在部分测试中,模型相较Gemini 3 Pro领先7%以上。
这些基准主要考察模型能否处理以下问题:
- 根据二维图像还原物体的相对位置;
- 在观察视角改变后,保持稳定的空间拓扑关系;
- 判断物体的前后、左右、上下关系;
- 理解三维结构和遮挡关系;
- 识别机器人可以执行的放置、抓取或移动区域;
- 根据操作前置条件,判断下一步是否可行。
跨视角理解尤其关键。机器人移动过程中,相机位置会不断变化。一个在正面视角下看起来正确的答案,如果换到侧面就发生参照系混乱,模型就很难用于连续任务。团队公布的三视角推理案例显示,ZDTaichu 5.0-9B能够在参照系发生变化后继续输出正确的相对方位,而其他对比模型出现了方向判断错误。
不过,“八项第一”仍然需要放在清晰的评测边界内理解。第一,它是九大基准中的八项,并不是所有空间任务都全面领先;第二,比较重点是10B参数以内的同规模模型,同时加入了部分闭源模型作为参考;第三,现有基准更多是离线测试,和真实机器人在复杂光照、遮挡、动态人群、传感器噪声中的表现仍有差距。
换句话说,这个成绩足以说明模型在空间多模态方向具备竞争力,但还不能直接等同于“拿来就能控制机器人”。从榜单到现场,中间还有视觉定位、运动规划、控制策略、安全约束和硬件适配等多层系统工程。
自适应循环推理:难题让模型多想几轮
ZDTaichu 5.0-9B采用了团队称为“自适应循环推理”的设计。简单理解,它不是让模型对每个问题都固定输出一次,而是在生成过程中判断当前结论是否可靠,必要时继续进行若干轮内部推理。
这类机制可以类比为机器人在执行动作前的“二次确认”:先判断杯子旁边有没有空位,再检查机械臂的落点是否会压到其他物体;如果前后结论冲突,就重新计算,而不是直接把第一答案交给执行器。
空间推理中的错误,往往不是“完全看不见”,而是中间某一步出了问题。例如模型识别出了杯子,也找到了杯柄,却把可放置点预测在杯子已经占用的区域。语言上,这个答案可能仍然通顺;但对机器人来说,动作会直接失败,甚至造成碰撞。
在ERQA和RoboSpatial两项机器人具身交互基准中,团队称ZDTaichu 5.0-9B取得同参数开源模型第一。在“杯柄侧空闲区域选择”案例中,模型输出的点位落在合理空闲区域,对比模型则把点位放在物体占用区域。
这种能力说明模型开始从“知道有什么”走向“知道能做什么”。二者看似接近,实际上是两个层级:目标检测解决的是物体识别,具身推理解决的是动作可行性判断。后者才是视觉模型接入机器人系统时最难补齐的一环。
当然,自适应循环推理也可能带来推理延迟和计算成本上升。对于离线质检或科研自动化,额外几轮推理通常可以接受;对于低延迟机械臂控制、无人机避障等任务,则需要在准确率、响应时间和成本之间做调度。模型是否支持按任务难度动态分配推理预算,将决定这类架构能否真正落地。
9B模型没有牺牲通用能力
空间模型常见的问题是“专项能力上去了,通用能力掉下来了”。训练数据大量转向空间关系、机器人动作和三维场景后,模型可能变得更擅长看位置,却读不懂工单、识别不了复杂文字,也无法调用工具完成任务。
ZDTaichu 5.0-9B试图同时保住两边的能力。团队公布的测试结果显示,模型在图文理解、OCR、视觉数学、指令遵循、数学和代码工具调用等任务上仍处于第一梯队。
部分披露指标包括:
- IFEval:93.7;
- AIME2026:89.2;
- LiveCodeBench v6:73.4;
- AI2D:91.48;
- WeMath:75.9;
- MathVista Mini:84.5;
- OCRBench:85.5。
这些能力对具身系统并不是“锦上添花”。真实工厂或实验室任务通常不会只给机器人一张干净的场景图,而是会同时提供工单、操作规程、设备编号和自然语言约束。模型既要看懂现场,也要读懂指令;既要知道目标在哪里,也要理解先后顺序和安全规则。
如果空间模型不具备基本的OCR和语言推理能力,开发者就得再接一个通用模型,随后处理两个模型之间的意图传递、坐标对齐和状态同步。系统复杂度会快速上升。一个能够同时处理视觉、语言、数学和工具调用的9B模型,至少可以减少这一层拼接成本。
但这里也需要保持谨慎。公开指标来自团队披露,和不同模型在同一硬件、同一推理框架、同一提示词模板下的独立复现结果,并不是一回事。尤其是多模态评测,输入分辨率、图像预处理、上下文长度和是否允许思维链,都会影响最终成绩。开发者在选型时,仍然应该把自有数据集和真实任务成功率放在榜单之前。
真正有价值的开源,不只是放出权重
ZDTaichu 5.0-9B此次开源的另一项重要内容,是对外公开空间多模态数据生产方案。对于开发者来说,这可能比单纯发布权重更有价值。
空间具身模型的效果高度依赖数据。普通的图片问答数据可以教会模型“图里有什么”,却不一定能教会模型“这个物体能否被抓取”“换一个视角后它和另一个物体是什么关系”“机械臂放下去会不会碰撞”。
高质量空间数据通常需要包含:
- 物体检测框、关键点或像素级区域;
- 物体之间的左右、前后、上下和距离关系;
- 相机视角、坐标系和视角转换信息;
- 可执行动作及动作前置条件;
- 错误动作、碰撞风险和不可放置区域;
- 从视觉观察到语言指令、再到动作结果的完整链路。
如果只开源模型权重,开发者可以直接推理,却很难知道模型为什么在某些空间任务上有效,也不容易把能力迁移到自己的机械臂、仓储货架或实验室设备上。公开数据生产管线,则提供了继续训练和领域适配的入口。
据披露,ZDTaichu 5.0-9B已经在科研自动化、智能制造等真实实体场景中完成验证。对于国内开发者而言,9B规模也更适合本地部署和私有化实验:相比几十B甚至更大规模的模型,它在显存、吞吐和部署成本上更容易控制,适合作为机器人感知模块、工业视觉助手或边缘侧多模态模型进行测试。
不过,9B并不意味着部署门槛消失。长视频、任意分辨率输入和循环推理都会增加显存占用与延迟;如果需要同时处理高分辨率图像、历史帧和动作上下文,实际资源需求可能明显高于参数量本身。开发者还需要关注量化方案、视觉编码器占用、KV Cache、视频帧采样策略,以及模型输出坐标和下游控制系统之间的接口设计。
这次开源的意义:竞争从“看图”转向“理解现场”
过去几年,多模态模型的竞争重点是图片描述、视觉问答和OCR。现在,模型厂商开始把能力边界推向物理世界:理解三维空间,预测动作后果,并在环境反馈中不断修正决策。
ZDTaichu 5.0-9B的定位正处于这个转折点。它没有追求超大参数规模,而是把资源集中在空间数据、跨视角推理和具身交互上,同时尽量保留通用模型的语言与工具能力。对于机器人开发者来说,这种“专项能力足够强、通用能力没有明显缩水”的组合,往往比一个只在单项榜单上领先的视觉模型更实用。
接下来真正值得观察的,不是它能否继续刷新某个基准,而是三个问题:
- 能否在真实设备上稳定输出可执行坐标。 离线图片中的正确率,必须转化为抓取成功率、放置成功率和任务完成率。
- 能否处理连续任务。 单步判断正确,不代表模型能在十几步甚至几十步操作中维持世界状态,及时发现环境变化。
- 开源管线能否被开发者复用。 如果数据生产方案、训练流程和评测脚本足够完整,社区才可能围绕仓储、制造、科研等场景继续迭代。
紫东太初团队给出的下一步方向,是把多模态推理、世界状态预测和连续动作生成连接起来,形成“感知—认知—预测—行动—反馈”的闭环。这个方向比单纯增加模型参数更重要,也更难。
总体来看,ZDTaichu 5.0-9B是近期国产开源多模态模型中,空间具身取向最明确的一次发布。九大基准八项第一证明了它的专项竞争力;通用能力保持第一梯队,则降低了开发者把它接入复杂系统的成本。它还不是一个开箱即用的机器人“大脑”,但已经足以成为科研自动化、智能制造和具身智能项目值得实测的基础模型。
模型权重、代码及相关开源资料可通过项目仓库进一步查看。OpenAI Hub目前主要聚合GPT、Claude、Gemini、DeepSeek等模型的API服务;对于ZDTaichu 5.0-9B这类开源模型,开发者更适合根据项目仓库自行部署、量化和评测,而不是把它当作一个闭源API直接调用。
参考来源
- Taichu-AI/ZDTaichu5.0-9B(GitHub):模型开源仓库,包含权重、代码及部署相关资料。
- ZDTaichu 5.0-9B项目组织页(GitHub):紫东太初相关开源项目集合,可用于追踪后续更新。

