
8月27日,智源学者·具身智能学术研讨会在北京举办。来自北大、清华、北航、中科院自动化所等二十余位专家学者齐聚一堂,针对当前具身智能行业热点与技术卡点开展跨学科思辨,目标推动人工智能从数字虚拟空间延伸到真实物理世界,厘清技术路线,探寻规模化落地可行路径。研讨会围绕世界模型、整体技术架构、灵巧操作三大主线展开,输出多项关键学术判断。
在世界模型专题环节,与会专家指出,目前世界模型技术路线百花齐放,在视频生成、JEPA、3D空间表达等方向均取得阶段性进展,但尚未形成行业统一范式,大规模落地成果仍然有限。世界模型赋能具身智能的关键,在于补齐物理感知与策略学习的完整闭环,消除状态预测到行动执行之间的缺口。在训练数据层面,交互性、多样性是两大核心指标,需要科学调配第一视角、仿真、互联网三类数据的配比。除机器人本体之外,世界模型同样可赋能AI for Science、医疗、游戏、数字孪生等多元领域,行业期待实现快速泛化、上下文学习的关键技术突破。
针对具身智能规模化部署难题,学界提出一个重要判断:制约产业发展的主要矛盾已经不是机器人本体硬件,而是对物理环境的结构化理解与推理能力;同时本体、模型、数据之间缺少统一标准,带来极高的迁移适配成本。分层式架构,大模型‑世界模型‑VLA模块协同联动,成为当下主流探索方向。数据端需要补齐长尾交互行为样本,建立完善的数据分类筛选机制。商业化节奏上,工业垂直场景将率先迎来落地窗口期,真正的通用人形机器人仍需要数年持续攻坚,安全体系与产业生态必须同步配套建设。
灵巧操作是本次研讨的另一大焦点。学者表示,当前机械手综合能力和人手仍存在显著差距,材料科学、传感器是主要短板。虽然驱动器性能已经大幅追赶,但主端遥操作设备普遍缺少力触觉反馈,采集频率难以支撑精细作业。面向泛化任务的高维动作空间训练数据十分稀缺,抓取、异形材质处理这些看似基础的动作依旧是行业难点。视触觉技术尽管在带宽、帧率指标上有所提升,但在产品标准化、运行稳定性、部件耐久性上还有很大改进空间,也是灵巧手实现大规模商用绕不开的关卡。
会上披露,智源研究院已经搭建自底向上的具身智能全栈技术体系,对外发布悟界·RoboBrain、悟界·RoboOS两大成果;正在研发悟界·RoboBrain Orca,该模型以预测下一物理状态为核心,大量融合第一视角交互数据,以此强化世界模型的具身表征能力,推动AI从文本理解升级为对现实物理世界的感知、预测与交互。
本次智源学者研讨会作为常态化高端学术交流平台,将持续促进跨学科思想碰撞。在整机Demo层出不穷、资本热度高涨的当下,来自学术界的冷静研判,有助于行业跳出单点性能比拼,更加重视底层模型、数据质量、统一标准、触觉感知等底层基础设施建设,为具身智能长期技术演进与产业落地提供理论指引。