7 月 7 日,蚂蚁集团旗下具身智能企业灵波科技正式推出新一代空间感知模型 LingBot-Depth 2.0,搭配业内首款以边界结构为预训练目标的通用视觉基础模型 LingBot-Vision,打通机器人精细空间感知完整技术链路,针对反光、透明材质、远距离测算等视觉痛点实现全方位性能提升。
LingBot-Depth 系列是灵波自研机器人空间感知核心模型,相当于机器人感知三维环境的 “视觉双眼”。上一代 LingBot-Depth 1.0 已经解决玻璃、镜面等难识别材质的感知难题,本次迭代将训练数据规模从 300 万扩充至 1.5 亿,综合能力实现跨越式升级。在深度补全 16 项权威基准测评中,该模型拿下 12 项指标第一;针对大面积深度缺失的室内场景,深度误差相比上代直接减半,RMSE 数值由 0.132 降至 0.062,面对镜面、玻璃、透明件等传统深度相机极易失效的场景,能够完整、平滑还原物体三维结构。
本次同步发布的 LingBot-Vision 视觉基座模型是整套空间感知能力的核心支撑,作为行业首个将物体边界结构作为核心预训练目标的基础视觉模型,拥有亚像素级边界定位与全局空间结构理解能力,为高精度深度估计打下基础。该模型仅依托 1.6 亿张图像完成预训练,数据规模比 DINOv3 低一个数量级,但深度估计精度更优,视频序列中可稳定持续追踪物体完整轮廓。本次灵波开源 ViT-G/L/B/S 四个版本,具备一模多用的通用特性,除支撑 LingBot-Depth 2.0 训练外,还可适配各类机器人视觉下游任务。
LingBot-Depth 2.0 已通过奥比中光深度视觉实验室专业认证,依托奥比中光 Gemini 330 双目 3D 相机原始芯片数据开展实测,模型在边缘细节清晰度、细小物体识别、远距离深度测算、复杂光照与特殊材质场景稳定性上均有显著优化,在多类传感器的空间、时域深度测试中保持高精度稳定输出。
商业化层面,灵波与奥比中光达成深度战略合作。奥比中光旗下无本体数据采集 EGO 设备 RGB-D 版本,将预装专为数据采集场景定制优化的 LingBot-Depth 专属版本,后续还将迭代更高规格商用模型,输出精准完整的三维实景数据,为具身大模型训练夯实数据底座。同时奥比中光将上线内置 LingBot-Depth 能力的配套 SDK,方便搭载 Gemini 330 系列相机的各类机器人快速调用高精度深度感知能力;计划年底推出集成商业版模型的一体化 3D 相机,实现硬件设备与空间感知算法一体化交付,双方后续还将持续拓宽多领域协同场景。
目前两款模型技术报告、LingBot-Vision 全套模型权重已对外开源。蚂蚁灵波表示,将依托开源开放的技术生态共建通用机器人视觉底层基座,解决机器人在真实物理环境中识别模糊、测算不准、环境适配差等行业瓶颈,助力整个具身智能产业加速规模化落地。