AI 快讯紫东太初9B冲进具身第一梯队
模型上新

紫东太初9B冲进具身第一梯队

2026-09-16T15:05:01.952Z
紫东太初9B冲进具身第一梯队

ZDTaichu5.0-9B于9月15日开放权重,在九项空间具身基准中拿下八项同规模第一,并同步公开数据生产方案。

9B模型开始正面挑战空间具身第一梯队

紫东太初昨日(9月15日)正式发布并开源 ZDTaichu5.0-9B,把竞争焦点从图文问答进一步推向三维空间理解和机器人任务规划。按照发布方披露的评测结果,这款约90亿参数的通用多模态模型在九项空间理解与具身智能基准中取得八项同参数组第一,同时保留图文理解、OCR、视觉数学和代码工具调用等通用能力。

**ZDTaichu5.0-9B 是一款面向真实物理世界的通用多模态模型,核心目标是让模型在理解图像和视频之外,进一步判断物体的三维关系、操作条件与行动顺序。**它支持单图、多图、长序列视频和任意分辨率视觉输入,重点覆盖空间感知、跨视角变换、具身条件推理以及物理交互决策。

ZDTaichu5.0-9B从空间感知、三维推理到具身任务规划的四层能力链示意图

这次发布真正值得关注的不是“又一个9B视觉模型”,而是空间能力第一次在10B以内通用模型上被放到如此靠前的位置。过去一年,多模态模型在文档、截图、图表和视频问答上进步很快,但机器人真正需要的不是描述画面,而是确定“哪个零件在夹具左后方”“换到另一侧后方位是否发生变化”“机械臂应该先避障还是先抓取”。二维识别做得好,并不自动等于理解三维世界。

一张表看懂这次发布了什么

**ZDTaichu5.0-9B的产品定位可以概括为:以约9B参数承担通用视觉语言任务,同时重点强化空间具身能力。**目前公开信息能够确认的重点如下。

| 项目 | ZDTaichu5.0-9B公开信息 | 实际意义 | |---|---|---| | 参数规模 | 约9B | 处在可私有化部署、可面向边缘服务器优化的区间 | | 输入形态 | 单图、多图、长序列视频 | 可覆盖文档、监控、机器人视角和跨帧定位任务 | | 图像分辨率 | 支持任意分辨率输入 | 面向货架、零件、仪器面板等高细节画面更实用 | | 空间评测 | 九项基准中八项获同参数组第一 | 说明专项训练没有停留在单一空间问答数据集 | | MindCube-tiny | 78.27分 | 体现复杂三维推演能力,但仍需独立复测 | | 重点能力 | 空间感知、跨视角推理、具身条件推理、交互决策 | 从“看见物体”扩展到“围绕物体规划行动” | | 通用能力 | 图文理解、OCR、视觉数学、指令遵循、数学、代码工具调用 | 发布方称专项强化未明显损害通用底座 | | 开放内容 | 模型权重及空间多模态数据生产方案 | 相比只放权重,更有利于社区复现和继续训练 | | 场景验证 | 科研自动化、智能制造 | 已进入实体任务验证,但尚不等于规模化生产部署 |

9B参数的价值首先体现在部署成本,而不是榜单上的尺寸标签。只计算参数权重,9B模型采用FP16或BF16精度约需18GB显存,INT8约需9GB,INT4理论上约需4.5GB;实际运行还要叠加视觉编码器、KV Cache、激活值和推理框架开销,因此不能简单把理论数字当作整机配置要求。即便如此,它仍明显比数百亿参数模型更适合部署在实验室服务器、工业边缘节点或机器人本地计算单元上。

八项第一说明了什么,又没有说明什么

**空间具身能力是模型感知三维环境、理解物体关系,并据此生成可执行计划的综合能力。**它不是一个单项技能,而是由目标定位、方位判断、参照系转换、可操作区域识别、前置条件推断和动作规划共同组成。

紫东太初把ZDTaichu5.0-9B的能力拆成四层递进链条:空间感知、复杂三维空间推理、具身条件推理和物理交互决策。这个拆法比笼统地宣称“机器人能力更强”更有意义,因为四层能力对应的是完全不同的失败方式。

**空间感知决定模型能否在拥挤画面中找到正确对象。**发布材料展示的案例是从视频画面中寻找“从左到右第二个银色盒子”,ZDTaichu5.0-9B能够返回正确目标坐标,而参与对比的同级开源模型出现定位错误。对聊天机器人而言,答错一个方位可能只是体验问题;对机械臂而言,坐标错误意味着夹空、碰撞或拿错料。

**跨视角推理决定模型在相机和机器人移动后是否仍能维持稳定的空间关系。**人类绕到桌子另一侧,能够自然理解“我的左边”与“物体自身左侧”不是一回事,多模态模型却经常在视角切换后混淆参照系。ZDTaichu5.0-9B在MindCube-tiny上取得78.27分,并在ViewSpatial相关评测中表现突出,指向的正是这种跨机位保持空间拓扑的能力。

**具身条件推理决定模型能否判断一项动作现在是否可做。**例如,“把杯子放到杯柄右侧”不只是识别杯柄,还要判断右侧区域有没有被其他物体占用、机械臂能否到达、放置后会不会发生碰撞。发布方称模型在ERQA与RoboSpatial两项机器人具身交互基准中取得同参数开源模型第一,并能在杯柄附近选择合理空闲区域,而不是把目标点落到已有物体上。

**物理交互决策决定模型能否把自然语言工单转换为连续行动。**在制造场景中,一张工单可能只写“将指定零件配送至二号机台”,模型却需要完成货架定位、相似零件区分、抓取顺序安排、搬运避障和最终放置。ZDTaichu5.0-9B已在备料配送、跨工位运输和机台上料等任务中进行验证,说明它瞄准的不是单轮空间问答,而是“语言指令—环境理解—任务规划”的完整链路。

不过,九项测试拿下八项第一仍然只是阶段性证据,而不是具身智能已经被解决。公开材料目前只披露了MindCube-tiny的78.27分等少量具体结果,九项评测的完整分数、采样设置、提示词模板、推理预算、输入分辨率和复测脚本仍需要随模型卡与仓库资料进一步核验。空间基准尤其容易受到提示格式、坐标表达和图像缩放策略影响,没有统一推理配置时,名次比绝对分数更容易产生误导。

对手不弱,ZDTaichu5.0-9B赢在专项密度

**本次横向比较覆盖了Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B等同规模开源模型,并延伸比较Gemini、Grok等闭源系统。**从已披露结果看,ZDTaichu5.0-9B的优势并非所有多模态任务全面领先,而是在10B以内把空间能力做得更密集。

| 模型 | 参数或形态 | 空间具身定位 | 本次可确认结论 | |---|---:|---|---| | ZDTaichu5.0-9B | 约9B | 空间感知、三维推理、具身规划专项强化 | 九项空间基准八项同组第一 | | Qwen3.5-9B | 约9B | 通用多模态模型 | 被列入同规模横向比较,完整逐项分数待公开 | | STEP3-VL-10B | 约10B | 通用视觉语言模型 | 被列入同规模横向比较,完整逐项分数待公开 | | gemma4-8B-E4B | 8B级 | 轻量通用多模态模型 | 被列入同规模横向比较,完整逐项分数待公开 | | Gemini | 闭源,参数未披露 | 通用多模态与视频理解 | 可作能力参照,但成本、规模和推理策略并不等价 | | Grok | 闭源,参数未披露 | 通用多模态 | 可作能力参照,不能直接视为同尺寸公平竞争 |

这张对比表也暴露了一个需要保持克制的地方:同参数组第一与全球综合第一不是同一个概念。ZDTaichu5.0-9B已经足以进入10B级空间多模态模型的第一梯队,但闭源模型可能使用更多参数、更长思维链、更高测试时算力或额外工具,直接把不同资源条件下的结果放在同一排行榜里,只能说明能力接近,不能证明工程效率相同。

发布材料还提到模型采用“自适应循环推理架构”,并将其与前沿闭源系统的循环推理方向联系起来。**自适应循环推理是让模型根据任务难度重复执行若干轮内部计算,而不是让所有输入都经过完全固定的推理深度。**简单任务可以更早结束,复杂的跨视角或多步规划任务则获得更多计算预算,这相当于让模型在需要时多想几轮。

循环推理是否真正有效,最终要看准确率、延迟和吞吐量三者的交换关系。如果78.27分依赖显著增加推理轮次,那么机器人端到端响应速度可能受到影响;如果模型能够对简单任务快速退出,才有机会在实时控制场景中取得优势。目前发布信息尚未给出不同循环轮次下的延迟、显存占用和性能曲线,因此这一架构亮点仍需要技术报告补齐证据。

最难的不是空间增强,而是不让通用能力掉下去

**空间专项训练最常见的副作用是模型在某些基准变强,却丢失原有的通用视觉语言能力。**空间数据往往包含大量坐标、方位词、相对位置和机器人轨迹,如果训练配比失衡,模型可能更擅长回答“左前方有什么”,却在OCR、图表理解、数学和自然语言指令上退化。

ZDTaichu5.0-9B此次强调“通用能力不打折”,本质上是在回应这种能力跷跷板。根据发布方结果,模型强化空间能力后,图文理解、OCR、视觉数学、数学推理、指令遵循与代码工具调用仍保持第一梯队水平。这一点对实际部署比单项冠军更重要,因为工厂和实验室里的任务并不会按照基准类别整齐切开。

真实的科研自动化任务可能同时要求模型读取仪器屏幕、识别试剂标签、理解实验步骤、判断器皿位置,再调用控制工具完成操作。真实的制造任务也可能要求模型先解析工单表格和零件编号,再从视频中定位货架,最后输出动作规划。一个只能做空间问答的专用模型,往往还需要外接OCR模型、语言模型和规划器;通用底座如果足够稳,系统链路就能减少一次模型切换和一层误差传递。

比权重更重要的是数据生产管线

**空间多模态数据生产管线是一套将图像、视频、三维关系、动作条件和任务轨迹加工成训练样本的方法与流程。**具身模型的真正门槛往往不是Transformer结构,而是怎样低成本生成可验证的空间标注,以及怎样把二维画面与三维关系对应起来。

紫东太初此次不仅开放模型权重,还宣布公开空间多模态数据生产的详细方案,这是发布中比跑分更稀缺的部分。模型权重让开发者能够推理和微调,数据方案则决定社区能否把能力迁移到仓库、实验室、产线或特定机器人平台。对于空间模型而言,只有权重而没有数据工艺,开发者很难判断能力来自哪些数据分布,也很难复现专项训练。

一套有用的数据方案至少需要回答四个问题:如何定义视角和坐标系,如何标注物体间的三维关系,如何生成操作前置条件与可行动区域,以及如何过滤几何上自相矛盾的样本。后续如果开源资料能够进一步提供数据配比、质量过滤规则、困难样本构造方式和训练阶段划分,它对行业的价值可能超过单个9B检查点本身。

从评测冠军到机器人“大脑”,还差闭环验证

**实体场景验证是模型在真实设备和环境中完成实验,但它不等同于达到可规模部署的可靠性标准。**科研自动化与智能制造场景中的演示,证明ZDTaichu5.0-9B具备接入真实流程的可能性;要进入持续生产,还需要公布任务成功率、碰撞率、异常恢复率、连续运行时间和人工接管比例。

机器人系统也不是仅靠一个多模态模型就能运行。ZDTaichu5.0-9B更适合承担高层感知与规划角色,底层仍需要目标检测、位姿估计、运动规划、控制器和安全系统配合。模型可以判断“先抓取外侧零件,再取内侧零件”,但具体关节轨迹是否可达、夹爪力度是否合适,通常仍应交给确定性更强的机器人软件栈。

开发者在采用前还需要核对几项尚未完全明确的信息,包括开源许可证是否允许商用和衍生模型发布、上下文长度与视频采样上限、推荐推理框架、量化后空间能力损失,以及不同GPU上的首Token延迟与吞吐量。对于具身场景,坐标输出格式、置信度校准、拒答机制和安全边界同样重要,这些指标目前比再增加一个问答榜单更值得期待。

判断:这是一款方向比尺寸更重要的模型

**ZDTaichu5.0-9B的意义在于证明空间具身能力不必依赖超大参数模型,也不必以牺牲通用多模态能力为代价。**约9B的规模、九项空间基准八项第一、MindCube-tiny 78.27分,再加上数据生产方案开放,让它成为近期10B以下多模态模型中辨识度很高的一次发布。

这款模型目前最适合被视为“空间理解底座”,而不是已经可以独立控制机器人的端到端大脑。它的榜单表现足够进入第一梯队,但完整评测表、独立复现结果、许可证、推理效率和真实设备长期成功率,仍决定着它能否从一次亮眼发布变成真正可用的工业基础设施。

更大的行业信号是,多模态模型的竞争正在从“能否看懂图片”转向“能否在三维世界中保持一致认知并给出行动计划”。当9B模型也开始处理跨视角、可操作区域和工单到动作的映射,空间智能就不再只是百亿、千亿参数闭源模型的展示项目,而开始成为开发者能够下载、微调和部署的基础能力。

参考来源

相关推荐

查看全部