让机械臂夹起虾并放入锅中,识别物体、定位目标并非最大难点,精准把控夹爪闭合的瞬时时机才是关键。动作全程连贯无停顿,不会等待相机采集下一帧再执行操作,但当下绝大多数视觉世界模型依靠离散截取的画面认知时间,仅学习帧与帧之间的状态跳转,无法获取两帧之间完整连续的运动轨迹,一旦出现观测缺失、切换帧率、抓取瞬时动作等场景,预测能力便会受限,难以适配机器人真实物理交互需求。
针对离散时序建模的固有缺陷,清华大学智能产业研究院联合 UC Berkeley BAIR 实验室研发出 ODEWorld,这是全球首款连续时间具身世界模型。该模型跳出传统 “预测下一帧” 的固有思路,直接学习环境在任意物理时刻的变化方向与变化速率,还原一条完整连续、随时间平滑演化的潜空间运动轨迹,相关论文与项目主页均已公开。
这套技术的核心创新并非简单增加补帧功能,依托连续完整的变化轨迹,模型可按需在任意时间节点读取环境状态:调高帧率时增加轨迹采样点,观测画面缺失时还原中间时刻运动过程,追溯动作成因时反向积分推演,原本相互独立的补帧、变速、反向生成功能,全部整合至同一套连续时间求解框架,团队将这套统一预测范式命名为 Physical-Time Flow,简称 PT-Flow。
传统离散世界模型会预先设定固定时间步长完成训练与预测,预测逻辑绑定固定采样频率,当查询时刻落在两帧画面间隙,没有显式连续轨迹支撑计算,预测精度会大幅下降。而 PT-Flow 范式转而学习潜状态对应真实物理时间的导数,构建潜空间速度场表征瞬时变化,给定初始状态后,借助常微分方程求解器积分,就能推演任意时长内完整的环境状态变化。
为搭建适配常微分方程求解的纯净潜空间,研究团队采用动静解耦架构优化特征提取流程。机器人视频中绝大多数画面背景长期保持静止,只有机械臂、目标物体产生动态变化,若直接在像素空间构建速度场,静态背景特征会淹没微弱运动信号。ODEWorld 先使用冻结的 DINOv2 编码器压缩图像视觉特征,再通过动态编解码器剥离静态场景信息,仅保留相对初始画面产生变动的潜变量。
经过动静解耦压缩后,原本高维的 DINO 视觉特征简化为单一 1×768 维度动态 token,速度场仅依靠三层轻量化 MLP 网络即可完成参数化,时间信息通过 FiLM 模块注入,初始状态、当前动态表征与任务指令共同决定瞬时运动速度,大幅降低时序推演计算量。
仅依靠紧凑潜空间无法保证稳定连续动力学,潜空间表征坍缩是以往世界模型普遍存在的痛点,编码器容易将差异化画面映射为近似向量,丢失运动细节信息。ODEWorld 创新采用一阶时间导数直接监督的训练方案,借助链式法则与雅可比向量积,无需构建海量雅可比矩阵,就能把像素空间运动速度映射至动态潜空间,以状态变化速率作为核心训练目标,从根源规避表征坍缩问题。
通过 RankMe 指标测算表征有效秩,在同等采样条件下,ODEWorld 768 维动态 token 平均有效秩达 425.2,高于 DINOv2 单帧特征 376.1 与 V-JEPA 2 1024 维表征 203.7,证明单 token 压缩并未丢失独立运动变化维度,潜空间信息留存更完整。
为消除 DINOv2 单帧编码带来的画面高频噪声,避免噪声干扰速度场学习,团队引入 Savitzky–Golay 导数滤波器估算时序变化速率,在局部时间窗口内完成多项式平滑与求导,过滤抖动干扰的同时完整保留抓取、碰撞、位移等关键动态细节。可视化结果显示,ODEWorld 生成的运动轨迹远平滑于原始 DINO 特征与离散帧预测基线,同时完整保留原始空间几何结构。该模型不拟合固定解析物理公式,而是从数据中提炼适配数值积分、保留任务语义的潜空间动力系统,优先服务机器人时序预测任务。
模型完成训练后,无需反复调用固定步长逐帧预测,依靠 RK4 常微分求解器沿速度场积分,一条统一速度场即可实现三类生成能力。第一,任意分辨率自由生成,可自主调整轨迹采样疏密,适配快慢不同的动作画面,无需针对不同帧率单独训练;第二,跨帧时间补全,即便训练视频降采样至原帧率三分之一,依旧能精准生成中间连贯画面,区别于简单像素插值,所有画面均由动力学轨迹解码生成;第三,时序反向推演,反转积分方向就能输出逻辑合理的逆向运动序列,实现动作回溯。
ODEWorld 的预测效率优势来自两层核心压缩设计,一是动静解耦将运动信息浓缩至单条动态 token,无需每轮预测重复计算静态背景;二是轻量化三层 MLP 速度场,全部时序积分计算在低维潜空间完成,仅在输出画面阶段调用解码器还原像素。在 LIBERO 机器人视频预测测试中,64 帧长时序预测场景下,LDP 耗时 3.953 秒,V-JEPA 2 耗时 0.619 秒,ODEWorld 仅需 0.072 秒;长时预测画面质量同样领先,64 帧画面 PSNR 维持 19.46,LPIPS 低至 0.134,短时 16 帧预测指标表现更优。
整体来看,ODEWorld 实现了世界模型学习逻辑的底层转变,研究重心从离散状态映射转向物理时间变化率建模。动静解耦提纯运动表征、一阶导数约束稳定潜空间、轻量化单 token 加速积分计算,三大核心设计打通任意帧率生成、时序补全、反向推演的统一路径。对于具身智能机器人而言,这套建模方式跳出静态像素识别的局限,让模型直接学习物体接触、位移、抓取的连续动态规律,推动机器人视觉预测从简单逐帧复刻,升级为完整连续的物理世界动态推演,为高精度实时物理交互机器人奠定全新技术基础。