首页
资讯
品牌
机库
评测
选购
租赁
组件
算力
社区
开发者
视频
赛事
活动
人物
展会
排行
------
反馈
科技资讯
超越千问、豆包、英伟达,智元自研具身大模型登顶全球榜单
2026-07-30 20:08:28   具身之家综合

  近日,第三方权威具身全模态理解评测榜单 DailyOmni 公布最新测评成绩。智元自研具身原生全模态大模型 WITA-Omni Preview 凭借突出的音视频联合理解与时序推理能力,拿到 85.21 分综合得分位列全球第一,综合性能超过千问、豆包、英伟达、Gemini 等国内外主流大模型,同时在八项细分评测维度中拿下六项第一,标志着智元在机器人物理世界全模态感知、自然人机交互领域取得关键性技术突破。

  DailyOmni 是行业公认的全模态时序推理评测基准,和传统图文短视频评测体系不同,榜单大量采用开放环境真实音视频素材,重点检验模型融合画面、环境声音,识别声画匹配关系、事件先后顺序、跨模态语义关联的综合能力。这类能力正是人形机器人走进工厂、商业空间,开展持续、自然人机交互不可或缺的核心基础。

  长久以来,绝大多数机器人交互采用模块化串联方案,视觉、音频、对话大模型、运动控制模块依次执行。信息层层转发不仅带来明显时延,还容易造成语言、肢体动作、面部表情相互脱节,这也是很多机器人只能 “单向对话”,难以参与多人场景持续互动的核心瓶颈。机器人仅仅实现 “听懂指令”,还远远达不到真实场景的交互要求,它需要持续观察环境、辨识声源、区分交互对象,自主判断是否回应、何时启动回应。

  WITA-Omni 最大创新,并非简单将通用大模型移植搭载到机器人本体,而是原生面向具身场景重构模型架构,在传统 Thinker–Talker 范式基础上拓展出Thinker–Talker–Actor三层端到端架构,把机器人动作、表情提升至和语音同级别的一级输出。整套系统共享统一认知表征与时间轴,感知、思考、语言生成、肢体表达同步并行,打破流水线式处理模式,实现机器人 “看、听、说、动” 一体化联动。Thinker 承担多模态跨空间联合推理;Talker 流式生成自然对话语音;Actor 同步驱动机器人动作与面部表情,让交互行为连贯且富有节奏感。

  模型性能突破,依托千万小时级多模态训练数据体系。公开通用音视频数据集普遍缺少人机交互过程中的轮次沟通、响应时机、肢体动作时序信息,难以训练面向实体机器人的交互模型。为此智元搭建以人为中心、面向真实交互场景的高质量数据集,完整留存画面、声音、语言、动作之间天然时序关联。模型不只追求回答内容准确,更学会在动态场景下把握交互节奏,区分交互主体,适配复杂开放环境。

  作为行业首个机器人原生端到端全模态交互大模型,WITA-Omni 的价值不止拓展模态数量,更在于建立统一的具身智能认知框架。传统机器人各项能力相互独立,而新架构实现持续感知、统一决策、同步表达,让机器人交互摆脱机械应答感,拥有真实场景所需的在场感与连续性。

  依托 WITA-Omni 打造交互智能底座,智元将持续完善 “三智一体” 技术体系,联动运动智能、作业智能,驱动 “本体-数据-模型-场景” 四维技术飞轮持续迭代。未来,智元将持续迭代 WITA 硅光动语大模型,持续优化自然人机交互能力,面向工业制造、商业服务、文旅展演等多元场景落地,加速具身智能规模化商用进程。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有