煮鸡蛋面、调制柠檬水、收纳整理、精密零件装配、线材梳理…… 机器人精细作业的背后,藏着行业长期悬而未决的痛点:大量场景中视觉定位精准,但物理接触瞬间频频翻车。插头反复无法插接、抓取柔性物体力道失控、折叠布料松手即散落。这类问题直指行业共识:摄像头只能确定空间位置,无法感知接触压力、滑移、形变、边缘阻挡。缺失触觉反馈,是机器人难以胜任真实世界精细操作的核心瓶颈。
在此背景下,新智具身智能(NeoteAI)联合复旦大学可信具身智能研究院正式发布 N0 系列三份技术报告,推动触觉从模型辅助模态,升级为具身智能底层核心基建。整套成果形成完整技术蓝图:一套标准化触觉数据底座,搭配两条差异化技术路线,并且项目数据集、技术方案开源开放。
触觉规模化训练长期面临一大障碍:不同厂商触觉传感器输出格式互不兼容,凝胶形变图像、电容矩阵、六维力向量如同互不互通的 “方言”,难以统一接入模型训练。
团队构建NeoData 大规模视触交互数据集,核心规模:
总时长超3 万小时视觉 - 触觉交互数据,140 万条操作片段、33 亿时间步;
包含 80 亿帧 RGB 图像、100 亿帧触觉图像;
依托 Franka、Piper、UR5e 等 6 类机器人采集,覆盖 450 项长程真实任务(叠衣、插拔接头、倒液、精密装配等);
由 90 名操作员完成数据采集,现已开源 5000 小时视触交互数据。
配套提出NeoForce 统一表征模型,不区分底层传感器硬件类型,学习时序结构化、具备跨设备迁移能力的触觉表征。统一识别受力位置、压力大小、横向滑移等物理信号,打造通用 “触觉普通话”,打通不同硬件之间的数据壁垒,为触觉规模化训练奠定基础。同时这份工作首次验证:触觉模态具备类似视觉的数据 Scaling 潜力。
传统 VLA(视觉 - 语言 - 动作模型)仅依靠视觉感知,存在两大硬伤:触觉信号仅在接触瞬间激活,大部分时间处于静默状态,极易被海量视觉 Token 淹没;触觉反馈属于滞后信号,相当于 “后视镜感知”,动态交互调整永远慢一步。
N0-VTLA(视觉 - 触觉 - 语言 - 动作模型)创新思路:不依赖当前触觉反馈,预测未来 50 步触觉演变趋势。将实时触觉编码为紧凑潜在 Token,结合视觉上下文预判滑移、受力突变,提前调整动作策略。
另一大突破:打破模仿学习只利用成功轨迹的局限。依托触觉信号训练任务进度评估模型,可以识别执行退步、紧急救场等复杂行为。结合离线强化学习,机器人能够充分利用失败交互数据持续迭代。毛巾折叠、书包收纳、纸箱折叠长程任务成功率大幅提升:从 50%→95%、35%→80%、20%→75%。
如果说 N0-VTLA 优化实时动作决策,N0-TWAM 则重塑机器人认知中枢。现有世界模型普遍只预测未来视觉画面,只能 “想象外观”,无法预判抓取是否打滑、夹持会不会形变,视觉推演和真实物理世界存在巨大鸿沟。
N0-TWAM 实现视频、触觉、动作三类序列同步耦合预测。采用混合专家架构,划分视频、触觉、动作异步专家网络;总参数量 72 亿,仅为全宽模型方案一半。
N0 三份报告形成完整逻辑链条:
N0-Foundation:解决数据底座问题,证明触觉可以依靠数据规模实现能力跃升;
N0-VTLA:实现存量路线兼容,触觉可无缝接入主流 VLA 工业体系,快速落地;
N0-TWAM:定义下一代顶层架构,触觉与视觉平权,原生融入世界模型。
长期以来行业信奉 “视觉优先”,认为只要看得足够清晰就能完成作业。这套成果证明:看得见≠拿得稳,认得出≠插得进。机器人需要像人类婴儿一样,依靠主动触摸建立物理世界因果认知。
当然赛道仍存在多重工程挑战:大规模触觉采集成本高昂、跨机器人本体泛化难度大、端侧推理实时性约束。但毋庸置疑,触觉已经从小众研究方向,升级为具身智能产业化的核心基础设施。
未来具身智能竞争主线不再局限于 “看懂世界”,而是“摸透世界”。视触融合新范式,将加速人形机器人、灵巧手在柔性分拣、精密装配、家政服务等非标场景落地。