过去两年,如果要在机器人展会上选出一个最拥挤的赛道,大概是 “运动能力”。跑步、跳舞、后空翻,从双足行走到全身控制,机器人公司不断用更复杂的动作证明,一台机器已经越来越像一个能够自由活动的人。但到了今年的 WAIC,一种不那么具有视觉冲击力的动作,正在变得越来越重要:抓东西。我们以三家非常典型的企业 DEMO 为例,试图揭开这一奇特转向背后的技术趋势。今年,苏度科技的机器人站在工作台前,连续抓取陌生物体、操作柔性材料;零次方更是干脆把展台变成一场公开挑战,邀请现场观众拿出各种东西让机器人直接抓,从常规商品,到巧克力豆,再到细软透明的系带,机器人都能顺利抓起来;原力灵机则用 6 台不同构型的机器人,抓取积木连续 15 小时拼装一座由 81920 块微型积木组成的长城。它们看起来都在做 Picking 这件事,但三家企业本质上却在回答三个不同的问题,也走出了三条不同的路径。苏度科技试图回答的是,机器人的能力能否像大模型一样,通过仿真数据和 Scaling 不断增长;零次方把问题放到了真实物理世界,试图探寻能否依靠海量真实交互数据,找到属于 Action 的 Scaling Law 并实现万物皆可抓,推动具身智能物理抓取 API 化;原力灵机则试图回答,一套模型能否在一个足够长、足够复杂的真实任务里一直工作下去。这三个问题背后,都指向了具身智能正在发生的一次重心迁移。今年 WAIC 形成一项行业共识:过去,行业首先要证明机器人 “能动”;现在,越来越多公司开始证明机器人 “能干活”。而从 “能动” 到 “能干活”,最先需要跨过去的一道落地技术门槛,很可能就是最简单、也最基础的 Pick & Place。
抓取当然不是机器人行业的新问题。汽车工厂里的机械臂抓车门,3C 工厂里的机器人抓零件,物流仓库里的机器人抓包裹。过去几十年的工业自动化,本质上已经解决了大量抓取问题。但传统机器人解决的是确定世界里的确定任务。机器人提前知道要抓什么、东西在哪里、应该从哪里下手。为了保证成功率,工程师可以重新设计工位、夹具和物料摆放方式,甚至直接改造整个生产环境。真正困难的模式刚好相反 —— 不再让世界适应机器人,而是让机器人适应变化的世界。例如一个杯子可能正着放,也可能倒着放;一件衣服每次出现都有不同形态;透明玻璃、反光金属、柔性线缆可能直接让传统视觉方案失效;同一个物体被旁边的人碰了一下,原本规划好的轨迹就可能全部作废。因此,今天具身智能公司重新讨论 Pick & Place,讨论的其实已经不是 “机械臂能不能夹住一个东西”,而是机器人能不能面对一个不断变化的开放世界,自主完成感知、判断和执行。这也是为什么,这项看起来已经存在几十年的机器人能力,正在重新成为具身智能落地的一块试金石。因为它足够简单,观众一眼就能看懂成功还是失败;又足够复杂,一个看似简单的 “拿起、放下”,背后同时考验视觉感知、空间理解、抓取点预测、运动规划、实时控制以及失败后的重新决策。更重要的是,它离商业价值足够近。物流需要抓包裹,制造需要抓零件,零售需要拿商品,家庭服务更绕不开杯子、衣服、餐具和各种杂物。如果说行走解决的是机器人如何抵达工作现场,那么 Picking 解决的,就是机器人到达目标地点之后究竟能做什么。于是,今年 WAIC 上值得观察的,不只是机器人开始集体 “练习抓东西”。更重要的变化是,各家开始用完全不同的方法,试图把抓取从一场演示 Demo 转化为稳定落地的实用能力。
苏度科技、零次方、原力灵机代表三条差异化发展路线。苏度科技选择依靠仿真体系推动机器人能力规模化增长。今年 4 月,苏度首次公开全栈自研具身智能平台 sudo R1,实现多类型物品抓取演示;来到 WAIC,其能力进一步拓展到精准放置、柔性物体操作、双手协同、移动抓取和自主导航等十余项技能。苏度把机器人在物理世界中的基础能力拆解为 “原子能力”。抓取是一种,放置是一种,移动是一种,双手协同也是一种。复杂任务不是一个个孤立训练出来的技能包,而应该是这些基础能力不断积累、组合之后形成的结果。这背后是典型的 Scaling 思维。企业认为当数据、模型和算力持续扩张时,模型能够涌现出超出单一训练任务的能力。因此,苏度选择大规模仿真路线,依靠高效率的数据生产方式,让机器人在虚拟世界中接触海量物体、材质与任务场景,再将习得经验迁移到真实世界。在抓取赛道背后,苏度想要解决的核心命题,是机器人能力迭代增长的速度问题。
与苏度侧重仿真不同,零次方选择直面真实物理环境,在现实交互中寻找 Action 的 Scaling Law。其围绕动作打造贴近物理操作原生逻辑的 “具身原生动作模型 ZERITH V2”。抓取问题不能只依靠视觉识别,物体接触后产生滑动、旋转、形变,机器人需要持续处理密集物理接触带来的连续动作决策,这也是零次方重点布局真实交互数据的核心原因。但真实数据采集天然存在成本高、生成速度慢的短板,零次方的解法是依托商业场景构建可持续的数据生产闭环。WAIC 现场举办的开放泛化抓取挑战赛,就是这条技术路线的公开压力测试。连续 4 天,现场观众可以拿出机器人从未见过的物品进行测试,挑战累计稳定运行 24 小时,完成超过 8600 次真实抓取,吸引超过 2800 名观众参与,多次抓取综合成功率达到 99%。现场极具代表性的测试对象是巧克力豆与透明系带:巧克力豆体积微小,考验视觉定位、抓取点判断与末端控制;透明系带兼具纤细、柔软、透光、易形变特征,代表现实场景里无法穷举的长尾物体。“万物皆可抓” 的核心要义,就是当从未提前录入的物体出现时,模型依旧能够自主生成可行动作方案。在此基础上,零次方进一步提出物理抓取 API 构想,目标将抓取能力沉淀为可调用、可迁移、可复用的标准化能力模块,适配不同机器人本体与应用场景。而 API 化落地的前提,是先在真实世界验证动作领域 Scaling 路径的可行性。
原力灵机关注的核心命题,则是机器人能力能否在长时间周期内持续稳定生效。WAIC 现场,6 台不同类型的机器人连续 15 小时,协同拼装一座由 81920 块微型积木组成的长城模型。真正的难点不在于成功抓起第一块积木,而是任务推进到第 5 小时、第 10 小时甚至第 14 小时,机器人依旧能够稳定作业。真实工厂与商业场景不会因为机器人前九次成功,就容忍第十次停机故障。依托 DM0.5 执行模型与 DW0.5 世界模型协同方案,执行模型负责真实环境操作,世界模型在虚拟空间预演动作结果、持续反馈优化,形成完整技术闭环。这条路线重新定义了稳定性指标:稳定性不能只看单次任务成功率,还要经受时间维度的持续考验。过去行业只需要证明 “机器人能够完成任务”,下一阶段的竞争重点,是 “机器人能否长期持续完成任务”。
三家企业分别从仿真数据、真实交互、长时序稳定性三个方向持续推进,但最终都需要直面同一个核心难题 —— 开放世界泛化。苏度科技依靠大规模仿真解决能力增长速度问题,但仿真环境与真实物理世界天然存在鸿沟,摩擦力、形变、光照、碰撞难以完全复刻,仿真习得的能力能否无损迁移到现实,仍需要持续验证。零次方试图依靠海量真实物理交互数据解决泛化问题,底层假设是:机器人接触足够多样的真实场景、积累充足交互数据后,能够自主应对陌生物体,但这条路线需要长期投入验证。原力灵机依靠长时任务测试打磨系统韧性,但长时间稳定运行的前提是任务边界相对明确,面对完全未知的全新物体,持续稳定工作的能力依旧面临考验。三条路线各有侧重,但最终会撞上同一道行业壁垒:真实世界场景、物体形态无法被穷举。这也是具身智能和传统自动化最根本的分界线。传统产线遇到新零件,可以重新设计夹具;仓库新增商品,可以重新采集数据、配置抓取策略。具身智能面向开放世界,当成千上万种从未提前定义的物体出现时,机器人能否顺利完成操作。因此,“泛化” 才是抓取能力背后真正的分水岭,行业技术里程碑不在于穷举所有场景,而是打通 “见过” 与 “没见过” 两类物体之间的能力边界。
行业正在探索三条跨越泛化边界的路径。苏度科技的思路是 “用计算的广度,换取现实的泛化”。当仿真数据规模抵达临界点,模型将产生认知质变,不再单纯记忆特定物体的抓取方式,而是提炼圆柱体、光滑表面这类抽象特征与抓取策略的关联。当现实中出现从未见过的同类形态物体,机器人可以复用抽象知识自主规划动作,实现从 “训练内物体” 到 “未知物体” 的跨越。仿真环境无法复刻全部现实细节,苏度通过在仿真中加入随机噪音,调整纹理、摩擦力、重力等参数,训练模型适应各类非理想条件,缩小虚实差距;机器人部署到真实环境后,利用少量真实交互数据快速微调,弥补仿真带来的偏差。整套路线的底层逻辑是:当虚拟世界样本足够丰富,真实场景的各类情况都可以视作仿真集合的子集。
零次方的路径是 “用商业的密度,换取泛化的宽度”。底层 ZERITH-V2 模型围绕动作构建,优先学习物理交互方式,而非单纯识别物体类别。模型学习的核心不是 “这是什么物品”,而是 “面对该物体,机械末端如何运动”,从底层架构摆脱预定义物体库的限制,适配物理交互的连续性特征。在此之上,依托零售门店等真实商业场景持续产生海量交互数据。机器人在常态化业务运转中不断接触新品类、长尾物品,形成 “能力提升→拓展更多场景→产生更多数据→推动模型进化” 的数据飞轮。WAIC 上万次抓取测试,就是这条路线的集中验证。巧克力豆、透明系带这类物品之所以具备参考价值,不在于物品本身特殊,而是代表现实中无处不在的长尾情况。未来零次方需要持续拓展智慧零售、家庭整理等场景,不断扩大数据飞轮覆盖范围。
原力灵机选择 “用时间的厚度,换取系统的韧性”。传统抓取指标只关注单次抓取成功,原力灵机的目标是长达十数小时任务周期内,全程维持高水平成功率。这意味着模型必须适应持续动态变化的环境,积木堆持续降低、设备电量缓慢衰减等变量,都需要实时纳入决策体系。这种长时间维度下的状态维持能力,本身就是更高阶的泛化能力。但世界模型持续推演需要消耗大量算力,如何在毫秒级决策窗口预测未来状态、输出最优指令,是巨大的工程挑战。依靠 DM0.5 与 DW0.5 形成自我模拟、自我校验闭环,让机器人在漫长任务周期内拥有应对突发变数的能力。三条路线目前很难简单评判优劣,抓取赛道真正的技术门槛,就是面对从未预先定义的物体依旧稳定执行动作。一旦这条技术目标跑通,抓取能力才具备封装为通用物理抓取 API 的基础。只有当能力不再绑定固定物体、固定场景、特定机器人本体,它才具备规模化复制条件,有望迎来行业标志性拐点,真正适配纷繁复杂的现实环境。
解决 Picking 难题之后,更激烈的能力竞争才正式开启。过去几年,行业持续优化机器人硬件,追求更灵活的躯体、更高自由度、更强运动控制。但当机器人伸出机械臂,它面对的不再只是自身运动系统,而是复杂度近乎无限的现实世界。苏度科技、零次方和原力灵机的差异化探索,共同标志机器人行业迈入全新阶段。过去比拼能不能造出机器人硬件;现在竞争重心转向,谁能够更高效地持续生成、迭代机器人的实用能力。这种能力既需要快速迭代成长,也要求长时间运行保持稳定。但所有技术路线最终都必须回答一个根本性问题:遇到从来没有见过的东西,机器人该如何应对。