近日,通用具身基础模型企业BeingBeyond智在无界正式发布全球首个基于人类视频数据训练的隐式触觉世界动作模型,为行业突破机器人纯视觉感知局限提供全新解决方案。该模型代号Being-H0.8,首次将触觉模态系统性引入大规模具身模型预训练体系,打破传统视觉驱动机器人“看得见、摸不准、控不稳”的行业痛点,构建起视觉、触觉、动作联动的多维感知体系,推动人形机器人从视觉智能迈向物理交互智能新阶段。
长期以来,主流具身智能模型高度依赖纯视觉数据训练,机器人仅能通过画面识别物体形态与空间位置,缺失真实物理交互感知。在现实复杂场景中,物体软硬质感、摩擦系数、受力形变等触觉信息,是精细操作、柔性交互、稳定作业的核心依据。纯视觉方案无法捕捉物理触感细节,导致机器人抓取易碎物品、柔性物体操作、精密装配等场景极易出现用力失衡、滑脱破损等问题,极大限制了具身智能在生活化、工业精细化场景的规模化落地。
本次发布的隐式触觉世界动作模型,最大创新在于依托海量人类行为视频数据,实现触觉认知与动作逻辑的隐性学习。区别于传统依赖机器人真机采集数据的训练模式,该模型以人类自然交互视频为核心训练底座,通过深度解析人类手部操作轨迹、接触姿态、动作力度变化规律,反向推理出场景隐性触觉特征与物理交互逻辑,无需专属触觉采集设备即可完成大规模物理感知预训练,大幅降低具身模型的数据迭代门槛。
在技术架构层面,Being-H0.8创新性将视觉画面、隐性触觉特征、执行动作与环境状态变化统一映射至同一隐空间,实现多模态信息深度融合、协同推理。模型可在观测场景画面的同时,自主预判接触方式、预估受力反馈、动态适配操作力度,提前规避操作失误。相较于前代模型,新版本补齐了物理感知短板,让机器人具备类似人类的“预判式触觉认知”,真正实现“看见、感知、控稳”的一体化智能交互。
该技术突破有效破解了行业长期面临的数据瓶颈。当前机器人真机触觉数据采集成本高、样本量少、场景单一,难以支撑通用模型泛化迭代。而人类日常交互视频储量庞大、场景丰富、动作自然,覆盖居家操作、工业作业、日常精细操控等海量真实场景。智在无界通过自研视频解析与触觉推演算法,从海量公开视频中提炼标准化触觉与动作知识,构建起低成本、大规模、高泛化性的训练体系,彻底摆脱真机数据采集的桎梏。
落地应用层面,全新隐式触觉模型可广泛适配人形机器人灵巧操作、精密工业装配、居家柔性服务、智能分拣等多元场景。依托触觉感知能力,机器人可精准区分物体软硬、轻重、易碎属性,自主调节抓取力度与操作节奏,稳定完成挤牙膏、拿捏水杯、柔性物料分拣等精细化、生活化复杂任务,大幅提升人机交互的自然度与场景适配能力,让机器人操作更贴合人类行为逻辑。
业内分析指出,具身智能的终极核心是物理世界自适应交互,触觉感知是打通仿真智能与真实物理世界的关键桥梁。智在无界此次技术发布,开创了“视频数据孵化触觉智能”的全新范式,重构了具身模型的训练逻辑与感知体系。未来随着该模型持续迭代落地,将全面提升人形机器人的精细化作业与复杂场景泛化能力,加速通用具身智能从实验室示范走向千家万户、千行百业的规模化商用。