
过去一两年里具身智能很容易给人一种割裂感,一边是展会、融资、发布会和人形机器人热舞,另一边是真实机器人落地时绕不开的电机、减速器、控制器、传感器、通信延迟、安全边界、维护成本和场景 ROI。如果只看前者它确实像一场被资本和流量推高的狂欢,但如果从控制、强化学习和大模型三条技术线往回看它又不是空中楼阁。我的判断是:具身智能不是虚伪狂欢而是一次真实但尚早的范式转移,它有技术进展也有产业底座,有长期价值也有短期水分,真正的问题不是 "它是不是骗局" 而是哪些能力已经发生了变化哪些还只是演示视频里的未来。
2019 到 2021 年我更多接触的是传统控制世界,在电机、云台等低自由度设备上搞控制,系统辨识、鲁棒控制、MPC、伺服系统、轨迹跟踪、扰动抑制、执行器约束这些词构成了我对机器人和自动化系统的第一层理解,这套体系给人的第一印象是严谨、可靠、可解释,一个伺服系统要跑得稳、跟得准、抗扰好背后不是一句 "智能" 就能解决的,它需要模型、频域分析、约束处理和工程调参,那时候我对 "控制" 的理解更多还是围绕经典控制框架展开:先建模再设计控制器再验证稳定性和鲁棒性。但是当被控对象变得复杂时这套方法似乎很难拓展,腿足机器人要在碎石、坡面、湿滑地面上保持动态平衡,灵巧手要处理接触切换、摩擦不确定和物体形变,移动操作机器人既要移动又要抓取还要和环境发生复杂交互,这时问题不再只是 "让一个轴跟踪一条轨迹",它变成了高维状态空间、非结构化环境、多自由度全身协调以及大量难以精确建模的接触过程,我意识到传统控制仍然重要但单纯依赖人工设计控制律会越来越吃力。
2021 年之后我开始研究强化学习在随机系统中的应用(我的研究跟机器人领域没啥关联),同时也看到了强化学习在机器人领域快速扩展。强化学习简单说就是让智能体在环境中不断试错通过奖励信号学习策略,放到机器人里它不是直接写死 "脚该怎么迈、手该怎么抓" 而是让机器人在仿真中反复练习最后学到一套动作策略,这个过程对我的冲击很大:强化学习改变了机器人控制器设计的范式这不是换一个算法名字那么简单,四足机器人、双足机器人、跌倒恢复、复杂地形适应、部分灵巧操作这些能力如果完全依赖人工编写控制逻辑很难以今天这样的速度迭代。这种新的控制范式不是简单地用神经网络替代控制律,它真正改变的是控制器获得的方式,传统控制更多是工程师手工建模、显式写出控制结构和控制律,强化学习则是工程师设计状态、动作、奖励、仿真环境、随机化范围和安全约束让策略在大量交互中学出复杂行为,简单点说过去设计的是控制律现在设计的是学习问题,这也导致了以往控制器设计复杂性的迁移从模型推导和稳定性分析转移到了奖励设计、仿真可信度、sim-to-real、安全过滤和真实部署。但这也正是强化学习的价值:它把很多过去难以手工建模和调参的问题转化成了仿真训练、奖励设计、安全约束和真实部署的问题,在大规模调参(训练)这一块机器远快于人可以搜索的范围也更大。
再往后大模型 LLM、VLM 出现机器人领域又发生了另一层变化(这一块我了解的较少只谈一些 "宏观" 上的认知),如果说强化学习更多解决 "怎么动" 那么大模型开始触碰的是 "为什么动、往哪里动、任务是什么"。过去机器人可能能完成一个固定动作但未必理解人类语言里的意图,能识别一个物体但未必知道这个物体在任务里的语义角色,比如 "把能用来敲钉子的东西拿给我" 这不是简单识别 "锤子" 两个字,机器人要理解任务目标、物体功能和环境上下文。而 LLM、VLM 在机器人上的拓展应用包括 RT-2、OpenVLA、π0、NVIDIA Isaac GR00T N1、Gemini Robotics 等方案则开始回应并试图解决这个问题:机器人能不能从 "会一个具体技能" 走向 "能理解任务并组合已有技能去完成新任务"?这就是我认为具身智能不是纯概念的原因,它背后确实有模型路线的变化而且已经初具成效:让机器人具备了理解人类世界任务、任务规划、分解执行等能力。
技术变化之外产业底座也在发生变化,身处创新与制造业发达的大湾区我感触良多,这里需要区分两个概念:工业机器人、服务机器人产量的增长并不等于通用具身智能已经成熟,但它说明我国确实拥有较大的机器人应用市场、制造体系和供应链基础。IFR 的 World Robotics 2025 数据显示 2024 年中国工业机器人安装量达到约 29.5 万台占全球部署量的 54%,中国工业机器人运行存量超过 200 万台国内厂商在本土市场份额首次超过外资达到 57%;国家统计局数据也能看到制造端的增长,2025 年中国工业机器人产量为 773,074 套同比增长 28.0%,服务机器人产量为 18,581,081 套同比增长 16.1%,这说明机器人并不只停留在融资新闻、样机视频和展会表演里,至少在工业机器人和部分服务机器人生产端它已经是制造业升级的一部分。人形机器人还很早但已经从 "零" 进入早期市场,IDC 2026 年发布的分析称 2025 年全球人形机器人出货超过 18,000 台收入约 4.4 亿美元,这个数字放在整个工业机器人市场里仍然很小远不能说明通用人形机器人已经成熟,但它也说明人形机器人已经从实验室样机开始进入商业试点。政策端也在加速,《"机器人 +" 应用行动实施方案》提出到 2025 年制造业机器人密度较 2020 年实现翻番,工信部印发的《人形机器人创新发展指导意见》提出到 2025 年初步建立人形机器人创新体系突破 "大脑、小脑、肢体" 等关键技术到 2027 年形成有国际竞争力的产业生态,这些因素叠在一起构成了中国具身智能的现实底座:应用市场、供应链、制造能力、政策牵引和新一代 AI 模型同时出现,但这不等于成功已经发生。
我不认为具身智能是骗局但也不认为今天所有叙事都可信,很多人形机器人展示仍然集中在表演、导览、教育、数据采集和试点验证。IDC 在 2026 年 4 月的分析中提到 2025 年超过 85% 的人形机器人部署集中在表演、教育、数据采集和导览服务等场景主要仍是演示、交互和技术验证,制造与物流场景只是开始出现早期试点,这和真正的长期商业闭环之间还有距离。机器人在工厂、仓储、巡检、养老和家庭中长期稳定创造 ROI 需要回答很多更硬的问题:连续运行时间、故障率、维护成本、安全责任、人员培训、任务可替代性、单位经济性,这些不是演示视频能回答的。国家发改委在 2025 年 11 月也提醒过当前人形机器人在技术路线、商业化模式、应用场景方面尚未完全成熟,中国已有超过 150 家人形机器人企业其中半数以上是初创或跨界进入者,需要防范重复度高的产品 "扎堆" 上市、研发空间被压缩等风险,这个判断很客观,方向是真的但行业需要挤掉水分。
所以我不会把具身智能看成神话也不会把它看成骗局,它更像机器人领域的一次长期工程革命,短期会有水分长期要看落地,短期会有过热长期要看谁能把模型、控制、本体、数据和场景真正闭环。对于做控制和强化学习出身的人来说这是一个很好的时代,具身智能恰好是传统控制、强化学习和大模型三条线的汇合点:传统控制解决可靠执行,强化学习和模仿学习改善复杂技能获取,大模型和 VLA 打开语义理解、任务泛化和跨场景迁移的空间,真正的机器人智能不会只属于其中任何一个学派而会出现在它们的交界处。而当你越接近真实机器人时越会发现控制没有过时,它只是需要和学习、语言、视觉、硬件、数据和工程系统重新组合,经过传统控制训练的学生对控制系统有更深刻的认知:谐振、带宽、鲁棒性等,在大模型的辅助下能快速掌握更多技能向具身智能靠近。最后具身智能不是虚伪狂欢,它是一场真实但尚早的范式转移可能是五年、也可能是十年,但也正好留给了我们转型的时间,真正值得控制人下注的也许不是会跳舞的机器人也许不是最会讲故事的融资 PPT,而是那些能把模型、控制、硬件、数据和场景一层层接起来的系统能力。