近日,第三方权威具身全模态理解评测榜单 DailyOmni 公布最新测评成绩。智元自研具身原生全模态大模型 WITA-Omni Preview 凭借突出的音视频联合理解与时序推理能力,拿到 85.21 分综合得分位列全球第一,综合性能超过千问、豆包、英伟达、Gemini 等国内外主流大模型,同时在八项细分评测维度中拿下六项第一,标志着智元在机器人物理世界全模态感知、自然人机交互领域取得关键性技术突破。
DailyOmni 是行业公认的全模态时序推理评测基准,和传统图文短视频评测体系不同,榜单大量采用开放环境真实音视频素材,重点检验模型融合画面、环境声音,识别声画匹配关系、事件先后顺序、跨模态语义关联的综合能力。这类能力正是人形机器人走进工厂、商业空间,开展持续、自然人机交互不可或缺的核心基础。
长久以来,绝大多数机器人交互采用模块化串联方案,视觉、音频、对话大模型、运动控制模块依次执行。信息层层转发不仅带来明显时延,还容易造成语言、肢体动作、面部表情相互脱节,这也是很多机器人只能 “单向对话”,难以参与多人场景持续互动的核心瓶颈。机器人仅仅实现 “听懂指令”,还远远达不到真实场景的交互要求,它需要持续观察环境、辨识声源、区分交互对象,自主判断是否回应、何时启动回应。
WITA-Omni 最大创新,并非简单将通用大模型移植搭载到机器人本体,而是原生面向具身场景重构模型架构,在传统 Thinker–Talker 范式基础上拓展出Thinker–Talker–Actor三层端到端架构,把机器人动作、表情提升至和语音同级别的一级输出。整套系统共享统一认知表征与时间轴,感知、思考、语言生成、肢体表达同步并行,打破流水线式处理模式,实现机器人 “看、听、说、动” 一体化联动。Thinker 承担多模态跨空间联合推理;Talker 流式生成自然对话语音;Actor 同步驱动机器人动作与面部表情,让交互行为连贯且富有节奏感。
模型性能突破,依托千万小时级多模态训练数据体系。公开通用音视频数据集普遍缺少人机交互过程中的轮次沟通、响应时机、肢体动作时序信息,难以训练面向实体机器人的交互模型。为此智元搭建以人为中心、面向真实交互场景的高质量数据集,完整留存画面、声音、语言、动作之间天然时序关联。模型不只追求回答内容准确,更学会在动态场景下把握交互节奏,区分交互主体,适配复杂开放环境。
作为行业首个机器人原生端到端全模态交互大模型,WITA-Omni 的价值不止拓展模态数量,更在于建立统一的具身智能认知框架。传统机器人各项能力相互独立,而新架构实现持续感知、统一决策、同步表达,让机器人交互摆脱机械应答感,拥有真实场景所需的在场感与连续性。
依托 WITA-Omni 打造交互智能底座,智元将持续完善 “三智一体” 技术体系,联动运动智能、作业智能,驱动 “本体-数据-模型-场景” 四维技术飞轮持续迭代。未来,智元将持续迭代 WITA 硅光动语大模型,持续优化自然人机交互能力,面向工业制造、商业服务、文旅展演等多元场景落地,加速具身智能规模化商用进程。