首页
资讯
品牌
机库
评测
选购
租赁
组件
算力
社区
开发者
视频
赛事
活动
人物
展会
排行
------
反馈
行业动态
国产具身原生大模型登顶,破解机器人交互割裂难题
2026-07-30 19:19:30   具身之家综合

  央广网上海 7 月 30 日消息,具身全模态理解榜单 DailyOmni 更新最新评测数据,国产自研具身原生全模态大模型 WITA-Omni Preview 拿到 85.21 分综合成绩,登顶榜单,超越多款海内外主流模型,并且在八项细分评测指标中拿下六项第一。

  长期以来,人形机器人交互普遍存在割裂感。市面上多数全模态模型面向线上数字交互开发,机器人身处动态变化的物理空间,需要同步感知画面、声音,分辨声源、事件时序、交互对象,传统模块化方案难以完成复杂时序耦合推理,直接造成人机互动生硬、响应时机错位。

  WITA-Omni 是行业内首个机器人原生端到端多模态交互大模型。它没有简单将通用对话大模型移植到机器人载体,而是把肢体动作、面部表情提升至和语音同等的一级输出层级,依靠单一原生端到端模型统筹感知、决策与表达。机器人的理解与响应不再是相互割裂的流程,视觉、听觉、语言、表情、肢体动作实现一体化联动,“看、听、说、动” 形成连续闭环,推动机器人从工具转向具备在场感的交互伙伴。

  模型性能领先并不依靠盲目扩充参数规模,核心依托适配具身交互的分层数据体系与定制化训练方案。在预训练阶段,WITA-Omni 依托千万小时级多模态数据,升级音画联合推理能力。考虑到公开数据集普遍缺少真实交互里的对话轮次、动作时序、表情信息,智元搭建以人为中心、面向实景交互的高质量数据集,完整保留各类感知信息天然的时序关联。

  团队采用 SFT–OPD–RL 三阶段训练策略,不只追求答案准确性,更训练模型自主判断交互逻辑:识别是否需要回应、最佳响应时机以及交互目标对象。该时序交互能力,能够适配各类真实落地场景,是人形机器人实现规模化商用的重要技术支撑。业内表示,原生具身全模态模型的突破,有望持续抹平机器人虚拟感知与物理行动之间的鸿沟。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有