央广网上海 7 月 30 日消息,具身全模态理解榜单 DailyOmni 更新最新评测数据,国产自研具身原生全模态大模型 WITA-Omni Preview 拿到 85.21 分综合成绩,登顶榜单,超越多款海内外主流模型,并且在八项细分评测指标中拿下六项第一。
长期以来,人形机器人交互普遍存在割裂感。市面上多数全模态模型面向线上数字交互开发,机器人身处动态变化的物理空间,需要同步感知画面、声音,分辨声源、事件时序、交互对象,传统模块化方案难以完成复杂时序耦合推理,直接造成人机互动生硬、响应时机错位。
WITA-Omni 是行业内首个机器人原生端到端多模态交互大模型。它没有简单将通用对话大模型移植到机器人载体,而是把肢体动作、面部表情提升至和语音同等的一级输出层级,依靠单一原生端到端模型统筹感知、决策与表达。机器人的理解与响应不再是相互割裂的流程,视觉、听觉、语言、表情、肢体动作实现一体化联动,“看、听、说、动” 形成连续闭环,推动机器人从工具转向具备在场感的交互伙伴。
模型性能领先并不依靠盲目扩充参数规模,核心依托适配具身交互的分层数据体系与定制化训练方案。在预训练阶段,WITA-Omni 依托千万小时级多模态数据,升级音画联合推理能力。考虑到公开数据集普遍缺少真实交互里的对话轮次、动作时序、表情信息,智元搭建以人为中心、面向实景交互的高质量数据集,完整保留各类感知信息天然的时序关联。
团队采用 SFT–OPD–RL 三阶段训练策略,不只追求答案准确性,更训练模型自主判断交互逻辑:识别是否需要回应、最佳响应时机以及交互目标对象。该时序交互能力,能够适配各类真实落地场景,是人形机器人实现规模化商用的重要技术支撑。业内表示,原生具身全模态模型的突破,有望持续抹平机器人虚拟感知与物理行动之间的鸿沟。