首页
资讯
品牌
机库
评测
选购
租赁
组件
算力
视频
赛事
专题
人物
展会
社区
排行
------
反馈
行业动态
补齐具身智能拼图,面壁智能向 AGI 迈进一步
2026-07-20 09:54:23   具身之家综合

2026 世界人工智能大会上,长期深耕端侧多模态大模型的面壁智能正式切入具身智能赛道,发布并开源整套 MiniCPM-Robot 系列模型,补齐自身从文本、多模态到物理实体交互的技术版图,向完整 AGI 体系再进一步。面壁智能联合创始人、董事长李大海介绍,企业今年 1 月组建专属具身团队,依托自研 MiniCPM 多模态成熟底座快速完成技术落地,本次核心成果分为两款开源机器人模型,整体锚定打通物理智能的 AGI 长期战略。

MiniCPM-RobotManip 是 1.5B 参数通用 VLA 操作模型,基于成熟的 MiniCPM-V 4.6 多模态基座训练,可独立完成制作三明治等多步骤长程复合任务,综合性能对标 Qwen-VLA、π0.5 等行业主流 VLA 方案;在专门衡量机器人上下文记忆能力的 RMBench 评测中,该模型拿到 53 分,大幅领先 π0.5 仅 10 分的成绩,解决行业主流模型仅能识别单帧画面、丢失历史操作信息的通病。另一款 MiniCPM-RobotTrack 为 0.9B 轻量化跟踪导航模型,未经过下游强化学习优化,三项跟踪任务追踪率分别达到 89.8、73.4、80.4,开源方案里性能最优,同时是业内首款支持纯本地无网络部署的跟踪模型,原生适配宇树 Go2 Edu 机器狗,在设备原生本地算力下稳定跑出 5FPS,端到端响应时延仅 180 毫秒,真机开放环境中可抵御行人穿梭遮挡干扰,电梯、地下停车场等弱网、断网场景也能稳定跟随导航。

当下行业具身智能分化出两条完全不同的技术路线,多数机器人厂商选择垂直专用路径,从抓取、拧螺丝等单一任务逐个突破,依靠叠加专用模块逼近通用能力,该路线短期易实现单项指标突破,但不同任务模型数据相互隔离,长期积累大量难以化解的技术债务;而拥有大模型研发能力的企业普遍选择通用路线,相信统一架构、统一参数更适配 Scaling 规律,依靠海量数据持续迭代实现通用能力质变,面壁智能正是通用路线代表,MiniCPM-RobotManip 从底层架构、训练范式、数据策略全部围绕通用性设计,一套模型可适配不同形态机器人本体,实现跨场景、长流水线自主作业,而非局限单一操作闭环。

成熟多模态底座大幅缩短面壁切入机器人赛道的研发周期,传统机器人团队需要从零搭建视觉感知系统,历经数据采集、标注、训练、场景适配漫长流程,泛化短板突出。面壁自研 MiniCPM-V/O 系列多模态模型经过两年半迭代,全球开发者下载量超 2500 万,在复杂光照、物体遮挡、材质多变等真实场景中完成海量验证,无需重复搭建底层视觉能力,研发重心集中在视觉、语言、动作联合决策核心难题,原生多模态基因让企业处理物理世界复杂信息拥有更低试错成本、更快迭代速度。

长期困扰行业 VLA 模型的长时序记忆算力瓶颈,依靠面壁智能视觉 Token 极致压缩技术实现突破。当前绝大多数机器人模型仅能读取当前单帧画面,丢弃全部历史操作与视觉信息,根源在于多路摄像头持续输出画面会产生海量视觉 Token,一分钟视频即可生成数万至十万级 Token,完整存储历史信息会带来难以承受的算力开销。面壁联合清华研发 LLaVA-UHD v4 架构,采用 ViT 浅层早压缩 + 切片编码双重机制,传统单帧图像编码需要 256 个 Token,该技术实现 4 倍无损压缩,仅需 64 个 Token 即可承载同等视觉信息,编码计算量降低 55.8%,推理速度大幅提升。依托这套压缩方案,模型可低成本留存长时序视觉记忆,完整记录机器人过往动作与环境变化,同时大幅降低硬件部署门槛,让机器人在本地有限算力下流畅完成连续任务推理,打通具身智能落地最关键的性能卡点。

依托全套轻量化端侧具身模型,面壁智能已经走出实验室演示阶段,落地多条商业化场景,与乐聚机器人形成稳定深度合作。早期乐聚导览机器人依赖云端大模型完成多模态交互,网络延迟严重影响体验,双方合作方案将面壁端侧模型部署至机器人本地,实现实时感知、实时决策、实时交互,支持完全离线无网运行导览问答,所有画面、交互数据本地处理,保障企业数据主权安全。展厅导览方案落地验证后,双方进一步拓展园区巡检场景,搭载乐聚本体可自动识别车辆违停、路面破损、设施异常等三十余种问题,检测成功率超 95%,覆盖六大类商用服务场景。同时面壁同步与吉利机器人合作,将 VLA 模型集成至工业仓储机器人,布局制造业产线落地。

2026 年多家头部大模型企业集中入局具身赛道,阿里发布千问 Robot 系列全套具身基座,智谱联合人大推出 26 亿参数端到端 VLA 模型并开源千万级机器人数据集,WAIC 期间腾讯一次性发布三大分层具身基座模型,全行业形成共识,具身智能是 AGI 发展的必经之战。李大海表示,具身智能属于端侧模型自然延伸,并非业务方向大幅转向,行业当下主流云端决策模式不适合机器人,物理世界感知、规划、执行需要毫秒级闭环,决定核心智能能力必须本地部署,长期产业落地会形成 “端侧为主、云端为辅” 的范式,离线完成绝大多数常规任务,仅遇到长尾未知场景时联网调取云端大模型辅助。

过去三年大模型在文本、图像、代码领域实现能力突破,但纯虚拟对话智能仅完成 AGI 一半拼图,真正通用人工智能必须具备感知、改造物理世界的能力,当大模型能力走出数字界面、接入实体机器人,具身赛道就不再只是硬件厂商专属领域,而是所有 AGI 研发企业的核心布局方向。截至 2026 上半年,面壁智能累计三轮融资总额超 50 亿元,估值突破 200 亿,是国内端侧智能赛道估值最高的独角兽,企业发展路径清晰,从端侧文本模型、多模态模型,再到本次补齐物理交互的具身智能模型,完整搭建通往通用人工智能的技术链路。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有