首页
资讯
品牌
机库
测评
选购
租赁
组件
算力
开发
社区
活动
赛事
视频
人物
展会
排行
------
反馈
科技资讯
看懂银河通用,就读懂具身未来
2026-08-20 14:00:52   具身之家综合

  具身智能的 ChatGPT 时刻,究竟应该怎样定义?8 月 19 日,世界机器人大会现场,在由银河通用主办的「具身智能大模型的进化之路」分论坛上,银河通用创始人兼 CTO 王鹤把这个问题抛给了现场。他的答案是,机器人面对没有专门学习过的常见技能,也能实现零样本泛化;普通用户无需算法背景,就能教会它新的动作。实现这一点,人形机器人需要一颗能够理解物理世界、控制全身和双手,并且持续学习的大脑。在银河通用最新发布的小人形机器人 Galbot ET1("银河星仔")上,这套设想拥有了一副新的身体。据介绍,"银河星仔" 是全球首款具备自主学习能力的智能体人形机器人,它搭载由银河通用自研的 AstraBrain-Agent,可以实时观察环境,理解人类指令,并动态规划行为,人类无需准备动作视频,便能通过互动教它学习新的动作技能。"银河星仔" 灵动的身体背后,是其具身大模型 —— 银河星脑 AstraBrain 的一次最新进化。当具身智能行业仍围绕身体性能展开激烈竞赛,银河通用已经把更重的筹码押在具身大模型上,而这个模型也正在决定机器人的上限。

  "银河星仔" 之所以引起讨论,在于它承载了一种新的产品逻辑。过去两年,Agent 已经成为 AI 行业最热门的概念之一,数字世界里的 Agent 可以在软件之间调用工具,帮助用户查找资料,也可以替人执行线上任务;物理智能体面对的则是持续变化的现实环境,无论是物品形状的变化,还是光线和位置的改变,都需要让模型迅速理解,再驱动身体作出反应。银河通用将 AstraBrain-Agent 定义为 "物理世界原生智能体",它的感知和规划直接面向现实空间,思考的结果最终要变成身体动作,机器人执行动作后环境随之改变,新的反馈又会影响下一步判断。"银河星仔" 的互动自学习能力正是在这套逻辑下产生,它能够实时识别人类舞者的运动轨迹,跟随对方完成街舞动作,面对撑地和倒立等高难度动作依然能够保持身体稳定,这种灵动的身体表现来自银河星脑通用小脑 AstraBrain-WBC 的支持。这套模型背后有超过 10 万小时的人类动作数据,一部分来自高精度动作捕捉,另一部分则由互联网人类视频转换而来,借助这些数据模型能够学习人类如何维持平衡、协调关节和完成连贯动作,再将运动能力迁移到机器人身上,无需提前写好整套动作轨迹。

  这背后是具身大模型技术的进化。过去机器人增加一项技能通常需要专业团队重新采集数据并完成训练,技能也容易与特定本体和场景绑定;AstraBrain-Agent 则希望保留模型已经获得的通用能力,再借助少量互动适应新任务,机器人每学会一项新技能都在持续扩充同一颗大脑。围绕银河星脑,银河通用构建了包含大脑、脑桥和小脑的全脑架构:大脑负责理解环境并规划行动,小脑负责控制全身及双手,脑桥将高层意图传递到具体动作中。其中大脑采用银河通用率先提出的世界 — 动作模型 WAM 架构,VLA 能够根据视觉和语言生成动作,世界模型擅长推演环境将如何变化,WAM 把两种能力纳入统一模型,让机器人理解一个动作可能带来的物理结果,并据此决定下一步行为。AstraBrain WAM 的核心突破是把跨本体、跨场景和多任务能力收进同一套基模 —— 同一颗大脑可以驱动 G1 机器人使用灵巧手在商超取货,也能完成叠衣服等柔性操作;更换机器人本体后它还可以执行全新搬箱任务,模型积累摆脱了硬件和场景的限制,这种广泛的能力迁移在行业中尚属首次。"银河星仔" 还搭载了由银河通用自研的 AstraBrain-WBC 通用小脑基模,它基于大规模人类运动数据训练,可以把 AstraBrain-Agent 生成的意图转化为稳定、连贯的身体动作,模型面对训练中没有出现过的动作时也具备出色的泛化能力。网球是最能检验这套技术能力的场景之一,这项运动具有很强的对抗性,留给机器人的反应时间极短,它既要预测来球轨迹,还要及时调整站位,更要在保持平衡的同时精准击球,而 "银河星仔" 搭载了银河通用 LATENT 高动态网球对抗规控框架,在实际演示中已经能够根据真人来球实时调整动作,完成拟人化对打。从跟随人类再到独立判断,产业逐渐形成了一种新共识:一台人形机器人能够达到怎样的上限,越来越取决于它背后的 "脑" 还能长出多少新能力,而它进入的身体越多,它在物理世界中积累的经验就越丰富,下一台机器人也会因此拥有更高的起点。

  在银河通用的展位上,这颗 "银河星脑" 也被放进了不同的任务中接受检验。最有现场感的是一项看起来寻常的早餐任务:机器人需要连续完成取面包、倒水和摆盘等步骤,执行过程中时常有偶发状况,例如杯子被观众拿走,或者目标物体突然被遮挡,但在现场演示中机器人会根据眼前的新状态重新规划,自如地完成剩余工作。传统机器人在固定环境中执行预设流程,只要某一步的条件发生改变整项任务就容易中断,真实世界却很少严格遵守预先写好的剧本,一个人在桌边伸手、一只杯子被临时移开,都会改变机器人下一秒应该做什么。长程任务的难点就藏在这些临时变化里,动作持续得越久,前面产生的误差越容易影响后续步骤,机器人需要在执行过程中不断更新对环境的理解,同时保持对整项任务的记忆。另一个高难度场景是叠衣服,这很考验具身大模型对柔性物体的理解,衣物并没有固定形态,机器人每抓取一次布料的褶皱都会改变,模型需要重新判断衣服当前的状态、寻找合适的抓取点,任务能否继续取决于模型能否在每一步操作后更新判断。

  当然,对真实的产业场景而言,一次演示成功还远远不够,每天大量重复作业中的准确率才决定客户是否愿意持续为机器人买单。银河通用是最有资格回答这个问题的具身厂商,这家公司已经将产品规模化应用于智慧药房和即时零售,机器人需要在上万种商品中准确找到目标,完成抓取后交给骑手,这样的任务每天会重复大量次数,准确率、运行稳定性和异常处理能力直接影响业务。而在工业场景中,银河通用的 Galbot S1 双臂最大负载达到 50 公斤,能够承担重型物料搬运,负载增加后机器人需要重新调整身体姿态和出力方式,还要判断周围人员的位置确保协作安全。不同场景使用的机器人形态不同,面对的问题也相差很大 —— 一边是柔软易变形的衣服,一边是密集货架,另一边则是工业重物,它们共享银河星脑的技术底座,也验证了银河星脑的泛化能力,而这正是具身大模型具备通用性的起点。对于银河通用而言,模型进入产业还有另一层价值,智慧药房、即时零售和工业产线会持续产生真实数据,这些数据记录了仿真环境难以覆盖的问题,例如包装材质的变化、设备长期运行产生的偏差以及现场人员带来的随机干扰,模型经过新一轮训练后更新的能力又会回到机器人身上。在论坛上,银河通用还宣布将向科技企业和产业伙伴开放仿真平台、数据采集设备、具身基模及强化学习后训练管线,普通开发者也可以围绕 "银河星仔" 创造新的动作和应用,这也是具身大模型走向通用的必经之路:当生态变得越开放,参与者越多,大模型接触的真实问题越丰富,模型的进化速度也会随之加快。

  过去几年,人形机器人行业的聚光灯大多照在身体上。在机器人运控和工程能力上表现突出的宇树科技,8 月 19 日的上市首秀就是一个例证,开盘当天便拿下超过 629% 的涨幅,市值一度达到 4449 亿元,资本市场用一场极为热烈的首秀为人形机器人本体的商业价值给出了高价。机器人跑得快、跳得高、承受巨大冲击的确是技术进展最直观的尺度,但当机器人进入药房、商超和工厂,一台 "能动" 的机器人显然已经无法满足需求,它要理解一句含义模糊的指令,处理训练中没有见过的物体,还要应对人员走动和物品移位。身体决定机器人能够到达哪些地方,大脑则决定了它的能力边界,具身大模型因而成为行业新的分水岭。本体性能可以通过供应链和工程投入加快提升,一颗通用大脑的成长周期则往往更长,它需要在大量任务中学习物理规律并进入真实场景接受检验,当模型经历的任务越丰富,处理新问题时可以调用的经验也会越来越多,后来者即使采用相近的硬件也很难迅速补上这种 know-how。宇树上市彰显了机器人身体的商业价值,具身大模型的竞争则正在定义行业下一阶段的能力坐标。

  银河通用很早就将数据基础设施视为具身大模型的核心,为此银河星数构建了一座五层数据金字塔:互联网数据帮助模型理解语义,人类动作数据提供操作经验,仿真平台可以大规模生成训练样本,真机遥操作数据负责校准精细动作,而在机器人进入实际场景后工作中产生的问题又会回到训练体系。王鹤在论坛上披露,银河通用已经积累 100 万小时人类数据以及 8 万小时真实场景回流数据,早在 2021 年团队便开始建设第一视角人类 — 物体交互数据集,如今数据采集设备、仿真平台和模型测评系统已经被接入同一套基础设施。当更多机器人进入真实场景,银河星脑能够获得更丰富的物理经验;模型能力得到提升后,新机器人和新任务的适配成本也会下降,部署规模与模型能力相互推动,构成不断生长的数据飞轮。

  再回到本届 WRC 讨论度最高的问题:具身智能的 ChatGPT 时刻究竟什么时候到来?王鹤给出的标准是,机器人面对人类无需专门学习的常见技能能够实现零样本泛化,成功率达到 70% 至 80%;普通用户也可以低成本完成后训练,让模型快速适应自己的工作环境,这时具身智能才真正拥有类似 ChatGPT 的普及基础。模型能力达到七八成只是第一步,现实中的客户仍然需要算法工程师采集机器人动作数据再完成标注和调试,高昂的适配成本会把机器人挡在大量中小企业和普通用户门外,具身大模型想要普及还要解决 "谁都能教、谁都能用" 的问题。王鹤在本次论坛演讲中还介绍了 WAM-TTT 测试时训练方案,用户佩戴第一视角相机拍摄自己完成工作的过程,模型便能利用无标签视频进行部署,无需重新采集机器人动作数据,这又把具身智能的通用化向前推进了一步 —— 统一基模负责积累物理世界的通用知识,人类只需展示自己的工作,机器人便有机会快速获得对应能力,当教授机器人的过程足够简单,具身大模型才能真正进入千行百业。

  在论坛演讲结尾,王鹤描绘了一个更远的产业图景:未来的机器人可能拥有接近手机的出货规模,保持汽车级别的产品价值,同时继承大模型持续升级的能力,一套模型完成进化,无数机器人都能获得能力提升,这种由软件带来的规模收益将打开一个万亿级市场。人类用了数十年为数字世界积累语言和图像,物理世界的训练语料仍要由机器人亲自书写,它们会在药房里辨认上万种商品,在工厂里处理意外,也会在普通人的示范中学会一项新工作,每一次真实行动都会成为下一次进化的起点。当同一颗大脑能够进入不同身体,当教会机器人一项技能变得像教人一样自然,具身智能的 ChatGPT 时刻才会真正到来,一颗能够在万千身体中共享经验、持续进化的大脑,将让 AI 真正进入物理世界,也为具身 AGI 打开现实入口。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有