
近日,华盛顿大学联合艾伦人工智能研究所发布重磅研究论文《FLEX-π:具有计算可调性的多流世界-动作模型》,全新推出FLEX-π世界-动作模型,为通用机器人智能感知与自主作业升级提供全新技术方案。该模型创新性融合多维度感知特征,打破传统机器人视觉识别单一化局限,有效解决智能设备在复杂、陌生场景下作业稳定性不足的行业痛点,推动具身智能机器人向高泛化、高灵活度方向进阶。
传统机器人视觉模型大多依赖单一RGB图像特征识别,仅能依托固定画面、固定场景、固定物体完成预设作业,一旦遭遇环境杂乱、物体外观改动、场景切换等变化,识别精度与执行能力便会大幅下降,难以适配生活化、非结构化的复杂作业场景。而全新的FLEX-π模型突破单一感知壁垒,构建多流融合感知体系,将RGB视觉特征、3D点图几何特征以及DINO物体语义特征深度整合,统一嵌入共享隐空间,让机器人同时具备色彩识别、空间结构感知、物体语义理解三重核心能力,实现从“看见画面”到“看懂场景”的技术升级。
该模型最核心的落地优势为低样本学习与强泛化能力,彻底改变传统机器人需要海量数据、反复训练、逐场景调试的作业模式。搭载FLEX-π模型的机器人,仅需观摩数次人类操作示范,即可快速学习并复刻对应作业动作,自主完成多样化精细实操任务。在实景测试中,机器人可高效完成杂物桌面餐具分拣、厨房规整整理等日常家务,还能胜任拉开柔软笔袋拉链这类高难度柔性操作,适配生活化精细作业场景,突破了传统机器人只能完成刚性固定动作的局限。
更突出的是,该模型具备极强的环境抗干扰能力,适配动态多变的真实生活场景。在测试中,即便更换全新陌生作业环境、更改目标物体颜色、调整物品摆放布局,机器人依旧可以实时感知环境变化,
当前通用具身智能机器人正从标准化工业场景向生活化、民用场景快速渗透,场景碎片化、环境不确定性成为技术落地的主要难题。FLEX-π模型的问世,有效弥补了现有机器人视觉感知与泛化能力的短板,大幅降低机器人场景适配与训练成本,提升智能设备的实用价值与落地范围。未来,这类多流融合、低样本泛化的智能模型,将持续赋能家用服务、商用运维等多领域机器人,加速通用人工智能从技术研发走向规模化民用落地。