首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
这届机器人从秀肌肉转向拼脑子
2026-08-25 09:48:58   具身之家综合

  又一轮机器人展示绝活的时候来了。2026 年 8 月 19 日到 8 月 23 日世界机器人大会(WRC)在北京举行,相比以往展示机器人各类实操应用的展台更多了,在看客眼中这些展区像是一个个未来生活的切片:一台人形机器人叠起了一摞 T 恤送进洗衣机,另一台正在模拟厨房里翻炒,还有机器人在搭积木、搬箱子…… 它们之中很多并不依靠 "遥控器" 或者固定的驱动程序,而是机器人 "自己指挥自己"。同样地无论是论坛上的专家圆桌还是展台上的广告语也都频繁地提到 "具身大模型" 和 "自主驱动",这些现象共同显示着一个新的行业变化:具身智能的厂商们正在从 "秀肌肉" 转向 "拼脑子"。

  "现在只会做机器人本体已经拿不到融资了,需要同时做机器人大脑;只做本体和运动控制大概率也做不过宇树、智元这些企业。" 一位创投行业人士对《豹变》说,这句话几乎概括了今年具身智能行业最明显的转向。过去两年机器人公司最热衷展示的是 "身体能力":能不能走稳、能不能跑跳、会不会翻跟头、灵巧手能否抓住物品,运动控制和硬件本体是彼时最容易被看见也最容易拿到融资的方向。从今年的 WRC 上能看到一些转向信号,展会上智平方机器人做咖啡,深朴智能机器人在洗衣服,星尘智能机器人在做饭,银河通用和蚂蚁灵波的机器人则在食品、药品零售区忙上忙下,加速进化机器人则上演了一场与人类小孩的点球大战。这些动作未必更炫,但是在接近商业化真正要面对的场景,环境不标准任务可能会变,机器人必须理解自己在做什么并在出错时调整下一步动作。

  厂商们的宣传用词也开始发生变化,其中最多的三个词是 "具身大模型"" 让机器人干活 "和" 自主驱动 ",这三个词有着深刻的内在联系。无论是商业、工业还是家庭场景," 让机器人干活 "都意味着机器人需要在复杂的环境中知道自己在做什么并独立地做出决策,而实现这一目标的技术手段就是具身大模型也就是" 机器人的大脑 "。以洗衣服为例,机器人洗衣服需要先把衣服送进洗衣机关上洗衣机门并启动,在这个过程中衣服如果有边缘露在外面机器人就需要把衣服再往里挪一挪。家庭并不是非常标准化的场景,机器人在执行任务过程中会频繁出现光线和空间感知上的变化,这意味着它需要随时调整自己的动作,如果使用固定的程序机器人很容易因为各类干扰而无法很好地完成任务。进一步说机器人进入家庭也不可能只做" 洗衣服 "这一件事情,需要会做多项家务且能够有条不紊地推进这些家务的完成。" 知道自己的任务是什么(一致性 / 稳健性)""做哪些动作能够完成任务(推理能力和精准动作)"" 会做很多种家务(通用泛化能力)"都需要具身大模型作为" 机器人大脑 "发挥作用,因此开发具身大模型是机器人商业化的必然,对家庭、商业服务和复杂工业场景而言这种能力比" 能走 ""能跳" 更接近真正的门槛。

  当然资本市场早已嗅到这种必然性,风向也在发生变化。随着宇树的科创板敲钟,在一级市场环节机器人本体及运动控制的融资竞争已接近尾声。过去 3 年时间里资本市场其实经历了关注机器人本体到关注机器人大脑的过程:2023 年国内具身项目以机器人本体和小脑(即运动控制)为主;2024 年 5 月后专注本体的初创企业融资占比下降 36.8%;到今年则完全倒向了具身大模型。根据量子位的不完全统计,2026 年上半年国内具身智能融资总额超 430 亿元,其中 50.8% 的资金投向以 "大脑" 为主的公司,另有 18.5% 的资金投向 "大脑 + 本体"。对于一家机器人公司而言只做身体的空间已经越来越窄,下游需求的必然要求和融资的市场动向共同导致行业竞争正在从谁能造出一具更灵活的身体转向谁能让这具身体真正学会思考。

  "具身大模型竞争现在本质上就是数据的竞争。" 具身大模型开发者 Alex 对《豹变》说,这个看法背后是对 "ChatGPT 时刻" 再次出现的期望。所谓 "ChatGPT 时刻" 指的是大语言模型在数据量达到某个临界点后突然 "涌现" 出训练时并未明确教授的能力,比如推理、举一反三、上下文学习等。在具身智能领域整个行业期待类似的 "涌现":当机器人交互数据积累到足够规模时模型可能突然具备通用性甚至近似人类的物理直觉。因此对各家具身大模型厂商来说谁先积累出足量、高质量的物理数据谁的模型就有可能具备更强的泛化能力,从而在物理 AI 之争上抢先一步。而数据则是大厂的强势领域,"现在的具身模型训练通常需要对外采购数据,大厂有资金上的优势。"Alex 透露。目前蚂蚁灵波、字节跳动、京东以及小米纷纷都在推进自己的基座模型:蚂蚁灵波在 2026 年 1 月底发布并开源了空间感知模型、LingBot-VLA 模型和 LingBot-World 模型,并在 7 月又各自发布了 2.0 版本;小米在 2 月 12 日发布并开源 Xiaomi-Robotics-0,在 7 月发布了 2.0 版本;京东则在 4 月 16 日发布 JoyAI-RA 具身大模型。这些模型除了应用在自己开发的机器人以外也提供给一些本体小厂,在 WRC 展会上不止一家厂商透露自己的机器人用的是某家大厂的基座模型,对大厂来说除了增加变现渠道也能够增加数据来源稳固自己的数据优势。

  然而现有的数据量远远无法满足应用的需求,如果说具身大模型的数据训练是一场马拉松现在恐怕还没跑到第一个补水点。"自动驾驶实现需要 10 亿条数据,具身智能要想达到 'ChatGPT 时刻 ' 保守估计需要 100 亿条,而现在行业里的体量大约是 100 万条。" 展会上某家大厂的工作人员说,这也意味着大厂的优势不是绝对的,具身大模型竞争还远远没看出谁能在下一个阶段领先。因此如何采集数据也就成了一个重要的问题,从方式上看数据采集主要包括真机遥操作(人类操作机器人本体完成任务)、第一人称数据 / 便携 UMI(人携带数据采集装备完成日常工作获得数据)和仿真数据这几种。真机遥操太贵,模拟数据不可靠,第一人称数据成本可控且数据可靠泛化性也有保证,是业内的主流数据采集方式,不过也有专家认为模拟数据因为不用考虑现实的时间流速训练效率更高,未来随着拟真数据的可靠性提高会成为主流的数据采集方式。WRC 展台上那些看似只是 "让观众玩一玩" 的互动背后其实也是一场数据争夺,有厂商让观众戴上采集设备完成抓取、摆放等动作,或者通过遥操作让人类示范一段任务流程,对机器人公司来说这些动作不只是展示也是在为模型积累真实世界中的视觉、动作和环境反馈。不过机器人需要的不是单一场景里重复几百万次的抓取数据,而是覆盖不同物体、光线、空间、任务和突发情况的高质量数据,谁能更快建立起 "采集、训练、部署、再采集" 的闭环谁才有可能把数据真正变成模型能力。这也是具身大模型竞争最微妙的地方:数据正在成为新的护城河却还不是胜负已定的答案,行业都在等待一次类似 ChatGPT 的能力跃迁,但没有人能确定足够多的数据是否必然会带来那一刻。

  由于 ChatGPT 时刻还未到来,具身智能产业端存在一种 "壁垒分明" 的状态。"现在的具身开发中基座模型是基座模型主要管机器人的上半身(主要是手臂和灵巧手);运动控制则是运动控制主要管机器人的腿和平衡。"Alex 认为运动控制和具身大模型的统一则要等到 "ChatGPT 时刻" 的来临,到时候市场格局还会发生大的变化。更大的问题是 ChatGPT 时刻必然会来临吗?由于数据的缺乏目前还没有出现被证实可靠的 "具身原生多模态大模型",物理 AI 的技术路线呈现多元分化、尚未收敛的状态。具身大模型的主流路线大致可分为两类:第一类是 VLA(视觉 - 语言 - 动作)路线,早期通过端到端的方式将视觉感知和语言指令直接映射为动作,这严重依赖训练数据覆盖,目前端到端 VLA 正在向快慢系统演进,参数规模较大的 "慢系统" 负责理解场景、解析指令、进行任务规划,参数规模较小的 "快系统" 负责实时输出具体的关节角度、手指力度等低层控制信号;第二类是世界模型(World Model)路线,以李飞飞的 Marble 和 Google 的 Genie 为代表,强调先构建可推演的物理世界内部模型再规划动作,具备更强的因果推理和泛化潜力,在本届展会上标榜自主驱动的厂商大多采用这一路线。VLA 路线落地快、成本低但泛化能力弱;世界模型路线更聪明但算力耗费更高、反馈更慢,新的趋势是两者融合但具体的融合方式、主导模型各家都有自己的判断,这些路线基于开发者的 "技术信仰" 各有拥趸,行业远未形成统一共识。

  技术路线之争没有定论,资本市场的情绪波动几乎不可避免。从 2023 年的 ChatGPT 到 2025 年春节的 "机器人跳舞" 再到今年的 Agent 和机器人干活,市场上始终存在 "AI 和机器人像人类一样工作从而解放人类" 的美丽愿景,也经历了与之关联的市场情绪的变化,创投圈从 FOMO(Fear of Missing Out 害怕错过)到冷却再到 FOMO 新赛道,股票市场随着一次次 Shocking 而上涨下降。对具身智能来说距离真正 "开奖" 还有很长一段路,在这之前可以预计还会经历多次乐观与悲观、狂热与恐惧的市场情绪循环。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有