
9 月 15 日,紫东太初正式开源 ZDTaichu5.0-9B。
相比一次模型版本更新,这次开源更值得关注的,是一个面向物理世界的通用多模态模型,究竟具备怎样的能力。
过去,多模态模型的 "看懂" 更多发生在数字世界:识别一张图片中的物体、理解一段视频的内容、回答关于画面的提问。但当 AI 真正进入机器人、智能制造和科研自动化等物理场景,仅仅知道 "画面里有什么" 远远不够。
机器人真正需要知道的,是物体在哪里、彼此是什么关系、从不同视角看是否还是同一个物体、环境正在发生什么变化、下一步应该做什么,以及自己的动作会带来什么结果。
这意味着,多模态模型进入物理世界后,能力评价的标准正在发生变化:
从 "看见",走向 "理解空间";从 "理解空间",走向 "推演变化";再从 "推演变化",走向 "指导行动"。
ZDTaichu5.0-9B 所做的,正是沿着这条能力链路,把多模态能力进一步向空间智能和具身智能延伸。
对于物理世界而言,视觉信息从来不是平面的。
一张照片里同时存在距离、方向、遮挡、尺度、前后关系以及观察视角。人类看到一个桌面,可以迅速判断杯子在电脑左侧、椅子在桌子后方,也可以想象自己移动到另一侧之后,这些物体在视野中的位置会如何变化。
但对于传统视觉模型而言,"识别物体" 和 "理解物体之间的空间关系" 并不是同一件事。
ZDTaichu5.0-9B 进一步强化的,就是这种面向真实环境的空间理解能力。
模型不仅能够识别 "是什么",还需要进一步回答:
"在哪里?"" 距离多远?""谁在谁的前后左右?"" 从另一个视角看会发生什么?"
这也是 ZDTaichu5.0-9B 空间能力的第一层。
从单张图像中的空间关系判断,到多图之间的空间对应,再到不同观察视角下的关系推演,模型需要建立的已经不是简单的视觉特征匹配,而是对现实环境形成更加稳定的空间表征。
在九项国际空间理解基准评测中,ZDTaichu5.0-9B 取得 8 项通用模型组别第一。更重要的是,这些评测背后对应的并不是单一的 "识图能力",而是模型对位置、关系、深度、视角等物理信息的综合理解。
模型开始从 "看到物体",走向 "理解物体所处的空间"。
这也是它进入具身智能的第一道门槛。
真正复杂的物理场景,不会永远停留在一个固定视角。
机器人在真实环境中不断移动,摄像头的位置会变化,目标会被遮挡,物体之间的相对位置也会随着观察角度发生改变。
因此,空间具身智能更核心的问题不是:
"这一张图里有什么?"
而是:
"如果我换一个位置看,这个世界还是怎样的?"
这要求模型具备跨视角的空间推理能力。
ZDTaichu5.0-9B 面向单图、多图以及长时序视频进行统一处理,可以将不同视觉输入中的空间信息进行关联,并进一步完成视角转换、空间关系判断以及三维结构推演。
这意味着,模型处理的对象不再只是孤立的一张图片,而是一个具有位置、结构和关系的空间。
例如,在多视角场景中,同一个物体可能在不同画面中呈现完全不同的视觉特征;在存在遮挡的情况下,模型需要结合已有信息判断物体之间潜在的空间关系;面对视角变化,还需要推断观察者位置改变后,场景会呈现怎样的变化。
这些能力共同指向一个更重要的变化:
模型开始建立对 "世界结构" 的理解,而不仅仅是在图像中寻找答案。
这也是空间具身智能与传统视觉理解之间最重要的区别之一。
如果说静态空间理解解决的是 "世界是什么样",那么真实的具身任务还需要回答另一个问题:
世界正在发生什么变化?
机器人面对的从来不是一张静止的图片。
人走过来,物体被拿起,机械臂开始运动,生产线上的零件不断移动,实验设备状态发生变化 —— 物理世界始终处于动态过程中。
因此,一个真正服务于具身智能的模型,需要具备对连续视觉信息的理解能力。
ZDTaichu5.0-9B 支持长时序视频输入,可以从连续画面中识别环境变化,并将不同时间点的信息联系起来。
这意味着模型处理的不再只是:
"现在看到了什么?"
而是进一步理解:
"刚才发生了什么?"" 现在发生了什么?""接下来可能发生什么?"
这种从静态理解走向动态理解的能力,是模型进入真实物理环境的重要一步。
因为机器人真正需要的,从来不是一张图片的答案,而是随着环境变化不断更新自己的判断。
具身智能真正困难的地方,还不是让模型 "看懂"。
而是:
看懂之后,能不能做出正确的下一步判断?
例如,机器人面对一个操作任务,模型首先需要识别环境和目标,然后判断目标与周围物体之间的空间关系,再结合任务要求确定执行顺序。
这实际上形成了一条完整的能力链:
视觉感知 → 空间理解 → 任务推理 → 行动规划。
ZDTaichu5.0-9B 进一步将空间理解与任务指令结合,使模型能够在理解环境的基础上进行具身条件推理,并输出面向后续执行的任务决策。
这意味着,模型的输出不再局限于 "这是一个杯子"" 杯子在桌子上 " 这样的描述,而可以进一步进入:
"目标在哪里 → 当前环境是什么状态 → 任务要求是什么 → 应该先做什么 → 下一步如何执行" 这样的决策链路。
这也是为什么空间智能对于具身智能如此关键。
机器人真正缺少的,并不只是一个更大的视觉识别器,而是一个能够把视觉信息、空间关系、任务目标和行动逻辑连接起来的智能中枢。
模型能力最终需要进入真实环境,而真实环境又会不断产生新的数据、新的问题和新的反馈。
因此,具身智能真正需要解决的,是一个持续循环:
模型理解世界 → 进入真实场景 → 产生任务与反馈 → 数据回流 → 模型继续进化。
这也是此次开源同步开放空间多模态数据生产管线方案的意义所在。
紫东太初并没有只交付一个已经训练完成的模型权重,而是进一步开放从数据处理、样本构建到训练调优的一整套生产流程详细方案。
其中包括数据去重、质量筛选、空间能力标签、样本合成、多维一致性校验,以及预训练、SFT、高质量退火、GRPO 等训练环节。
对于产业而言,这意味着模型能力并不是一个只能被调用的 "黑盒"。
企业可以将自身的真机数据、生产数据和场景数据重新输入这套体系,针对具体任务进行训练和优化。
模型负责提供能力起点,真实场景负责不断提出新问题,而数据管线与训练体系则负责把这些问题重新变成模型能力。
这才是具身智能真正能够持续迭代的基础。
ZDTaichu5.0-9B 的开源,因此不应该只被理解为 "又一个 9B 模型"。
它更值得关注的,是紫东太初正在把多年原生多模态技术积累,进一步延伸到物理世界。
从识别图像中的物体,到理解物体之间的空间关系;
从理解静态场景,到理解动态变化;
从回答视觉问题,到结合任务进行推理;
再到进入真实设备,完成感知、决策与行动之间的连接。
这条路径背后,是一个越来越清晰的方向:
让 AI 不止看懂世界,而是真正理解世界中的空间、变化与行动。
而模型开源,只是这套能力开始进入更大范围产业验证的起点。
未来,紫东太初还将持续围绕空间感知、三维推理、动态环境理解、具身决策以及真机闭环等能力进行探索和验证,让 ZDTaichu5.0-9B 的能力从模型评测走向真实世界,在更多机器人、科研自动化和智能制造场景中接受检验。
(来源:中科紫东太初)