首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
物理世界模型W0发布,为AI4S下半场再添一把钥匙 | 2026浦江创新论坛
2026-09-14 18:02:06   转载自上海人工智能实验室

近日,上海人工智能实验室(上海 AI 实验室)发布『书生』物理世界模型 W0,为大模型的数字化能力进入物理世界提供关键支撑,进而为科学智能从方案推演走向真实实验打开全新路径。

W0 从设计之初就把视觉、力觉和触觉融为一体,让机器人边感知、边预测、边行动、边修正,四条线同时跑,不用像过去那样按部就班。其核心突破包括:原生力触,让力觉和触觉跟视觉一起进入模型,直接参与状态理解和动作决策;双工协同,让模型在生成语义理解结果、未来预测与动作指令等输出的同时,持续接收视觉、语言语义、力触与身体状态等多模态输入,并根据新反馈修正后续输出。

这意味着,机器人能在视觉受限的精密操作中获得判断依据 —— 针对诸如是否握稳、是否接触到位、下一步该如何调整等等,W0 都能给出可靠的动作指导。

W0 现已接入『书生・端砚』科学发现平台,与书生科学大模型 S2 共同支撑科研人员完成了基因编辑蛋白定向进化、美哌卡因有机合成、脂质纳米颗粒合成等干湿实验闭环。未来,随着人工智能在与物理世界的交互中加速进化,化学、生物、材料等领域的重大科学发现将迎来前所未有的契机。

低延时推理 + 高频动作,让机器人安全完成实验操作

双工协同:让未来预测与动作执行各展所长

湿实验操作既需要前瞻规划,也需要即时反应。机器人需要理解当前任务与后续步骤之间的关系,同时处理物体位置、接触状态和身体姿态的变化。这两类计算有着不同的时间需求。对未来场景和行动结果的预测,需要结合上下文展开判断;动作执行则需要及时响应当前状态,避免计算等待影响操作的连续性。

W0 的 "双工",对应多模态信息的输入与输出两个方向。输入端持续接收语言指令、视觉观测、力触反馈与身体状态等信息;输出端据此生成语义理解结果、未来状态预测与动作指令等内容。这种 "双工" 设计,让接收新信息与生成新输出并行推进:模型在输出过程中仍能处理新的输入,并据此更新预测、调整后续动作。在异步异频架构的支持下,后台规划更新期间,机器人仍能处理新的环境信息、更新后续动作,无需让每一次动作调整都等待新一轮规划完成。

输入与输出通过持续反馈保持协作。多模态输入为理解、预测和行动提供依据,行动产生的新观测再次进入模型,帮助校正状态判断、未来预测与后续动作。机器人由此能够在推进任务的同时,保持对真实环境的响应。

"一心多用" 的核心,正是让感知、预测、行动与修正共同参与持续发生的决策过程。

W0 让机器人边感知、边预测、边行动、边修正

原生力触:让机器人看见变化,也感知接触

在湿实验中,许多关键信息发生在接触之中。视觉能够提供物体的位置、姿态和场景布局,力触信息则能够补充接触与受力状态。对于试管、容器和实验器具的操作,这些信息共同构成机器人判断当前动作是否合适的重要依据。

W0 在视觉之外融入原生力触感知,让接触过程中的反馈与视觉、身体状态共同参与操作判断,进入模型的感知与动作决策过程。当机器人接近物体时,视觉帮助确定操作目标与运动方向;进入接触阶段后,力触反馈进一步提供受力变化的依据;身体状态则反映机器人当前的姿态与运动情况。多种信号相互补充,使动作调整能够依据更完整的现场信息展开。

融合力触感知,让机器人真正 "感受世界"

这种多模态感知方式,将机器人对真实世界的理解延伸到实际接触过程。物体的位置变化、操作中的受力变化,以及执行结果与预期之间的偏差,都能够成为后续决策的参考。对湿实验而言,感知的价值最终体现在操作中:及时发现变化,为修正动作提供依据,让每一步执行与当前状态保持一致。

异步异频:让真实世界的信号更快进入动作

视觉观测、力触反馈、未来预测与动作控制,并不需要遵循完全相同的更新节奏。不同信息变化的速度不同,不同计算环节对响应时间的要求也不同。

为支撑多模态输入与输出的持续协同,W0 采用异步异频的算法架构,让未来预测与动作执行按照各自的计算特点,在不同时间尺度上协同运行。"异步" 使后台规划与实时行动能够并行推进,减少环节之间的等待;"异频" 使较长时间尺度上的预测与高频动作更新相互配合,将计算资源用于各自需要处理的信息。在规划持续更新的同时,动作系统保持对新观测的响应,让视觉、力觉与身体状态等信号更及时地进入决策链路。高效的信号处理与高频动作更新相互配合,有助于缩短环境变化发生到动作作出调整之间的间隔。

更快的响应意味着机器人能够更及时地处理偏差,更高频的动作更新则提供了更密集的调整机会。这些能力共同作用,有助于减少执行中的停顿,使接触操作和连续任务更加连贯。

面对 50 项双臂操作任务,W0 在 RoboTwin 2.0 基准上取得了 93.12% 的平均成功率,W0-Flash 同样达到 92.20%。W0 速度表现更为突出:W0-Flash 的动作生成频率达到 56.95 Hz,约为 FastWAM 的 10 倍以上;推理延迟低至 17.56 毫秒,较 FastWAM 所列的 190 毫秒降低约 90.8%。高成功率与快速动作生成相结合,W0 可为机器人持续感知、及时调整和连贯操作提供支持,让机器人想得到下一步,也更快跟上每一步。

W0 在 RoboTwin2.0 评测的 50 项任务中平均成功率突破 93%,达到国际一流

超低推理延迟 + 高频动作生成,W0 遥遥领先,让动作更稳更安全

走进湿实验:从操作试管到连续实验

湿实验由一系列相互关联的操作组成。每一步都需要观察、判断与执行,前一步的实际结果又会成为后一步的起点。W0 将世界模型的前瞻规划与机器人的即时反应连接起来,面向试管操作、实验台整理和连续实验等场景,探索感知、预测、行动与修正的持续协同。

从取出移液枪到完成移液、再将器具归位,W0 协同机械臂与高自由度灵巧手,连续完成抓取、枪头装配、定量吸液、试管注液、枪头卸载和归位六个操作环节。

精细操作的关键,在于随接触状态变化调整姿态与力度。装配枪头时,结合视觉定位与力觉反馈修正对准姿态、调整插入力度,并判断是否安装到位;吸液时,精细控制按钮的按压力与行程;注液时,感知枪头与试管内壁的接触,实现轻柔贴壁与稳定注液。在卸载枪头和归位过程中,W0 继续依据受力变化调整按压、插入与释放动作。

双工协同让新的视觉与力觉反馈在动作输出过程中持续进入决策,支持机器人边操作、边判断、边修正。对比演示中的装配错位、归位碰撞与卡滞,也直观呈现了接触感知和执行中修正的重要性。上述完整移液流程展现了 W0 将多模态感知、精细力控与多指协同用于真实实验的能力,让长时序、多阶段操作在持续反馈中连贯推进。

从前瞻规划到即时反应:让智能体现在每一步操作中

机器人参与真实实验,需要理解任务目标、预判行动结果,也需要处理接触与运动中不断变化的现场信息。

W0 以原生力触感知拓展对真实世界的感知维度,以多模态输入与输出的双工协同贯通感知、预测、行动与修正,再通过异步异频架构,让新的反馈更及时地参与决策。这一技术路径,也为更复杂的实验操作提供了进一步探索的空间:让预测能够考虑更长的任务过程,让感知能够提供更丰富的接触信息,让动作能够在变化中持续调整,并通过真实湿实验检验协同效果。

眼睛看、大脑想、身体动。上海 AI 实验室希望通过『书生』世界模型 W0,将这种自然的协同方式转化为机器人的操作能力,让机器人一心多用,想得到下一步,也跟得上每一步。

(来源:上海人工智能实验室)

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有