长期以来,市场认知中的比亚迪智能化优势集中在供应链整合、规模化落地、天神之眼 ADAS 硬件体系,底层自研 AI 算法、基础大模型的学术成果一直较为稀缺,甚至长期存在依赖外部供应商算法的市场传言。而最新公开的学术论文 HyWorldVLA,彻底打破外界固有印象,比亚迪正式亮出在物理 AI 前沿赛道的自研实力。论文由比亚迪汽车新技术研究院独立完成,无外部高校联合署名,瞄准当下自动驾驶最核心方向:VLA(视觉 - 语言 - 动作)+ 世界模型。
当前自动驾驶领域的世界模型存在两条主流路线,各自存在难以调和的短板。像素级世界模型直接预测未来视频画面,能够捕捉环境细节,但算力开销巨大,极易受到雨雾、光线等视觉噪声干扰;隐空间世界模型在压缩特征空间推演,推理效率更高,却容易丢失真实物理场景细节,造成决策偏差。HyWorldVLA 提出混合世界建模框架,尝试融合两条路线优势。预训练阶段同时开展视频画面重建与隐特征预测,依靠像素监督保证隐表征保留充足环境信息;联合微调阶段舍弃画面预测,仅依靠隐特征输出驾驶动作,兼顾细节理解与推理效率。整套系统形成 “感知环境、理解语义、预测未来场景、输出车辆动作” 完整端到端闭环。
本次评测选用 NAVSIM v1 自动驾驶仿真基准,采用 PDMS 综合指标评判驾驶安全性、通行效率、乘坐平顺性,规避单纯依靠低速行驶刷分的漏洞。HyWorldVLA 拿到 90.59 的 PDMS 分数,刷新公开榜单最优水平。在专项鲁棒性测试中,面对 655 组雨雾恶劣场景,模型得分大幅领先纯像素方案,验证混合架构在复杂天气下的稳定性。消融实验证实,像素监督与隐空间推理缺一不可,任意一条分支移除都会带来明显性能下滑。
同时行业也保持理性共识:仿真环境取得 SOTA,仅仅代表算法框架具备理论潜力,距离大规模车载量产仍存在多重挑战。真实路况海量数据闭环、车载端算力约束、极端长尾场景泛化能力、模型轻量化部署,都是后续需要持续攻克的工程难题。这项成果更大意义在于,证明比亚迪已经搭建起可以自主研发多模态物理 AI 基础模型的内部团队,摆脱单纯依靠工程优化、外部算法采购的发展模式。
论文背后,一支带有浓厚机器人基因的研发团队浮出水面。项目归属杨东生执掌的比亚迪汽车新技术研究院,核心通讯作者 Liulong Ma 出身哈工大机器人技术与系统国家重点实验室;EMoE-Planner 规划模型第一作者 Hongbiao Zhu,履历同样覆盖哈工大、CMU。团队人员研究方向横跨机器人导航、多模态感知、世界模型,并非传统车企转型而来的车载算法团队。
从时间线来看,这支基础 AI 研究小组至少 2024 年前后启动布局,2025 年发布 EMoE-Planner 自动驾驶规划模型,2026 年推出 HyWorldVLA 多模态基础模型,多篇成果持续投向 ICLR、CVPR、NeurIPS 等顶会,属于长期稳定投入的前沿科研力量,而非短期项目制攻关。
最值得关注的战略信号,在于技术路线和比亚迪人形机器人布局高度协同。HyWorldVLA 代表的 VLA + 世界模型体系,本质就是具身智能通用 “感知 - 推理 - 执行” 闭环,自动驾驶是人形机器人物理 AI 在车辆场景的延伸,两者能够共享算法框架、训练思路、人才体系。市场信息显示比亚迪自研工业人形机器人正在厂区内部测试,未来有望和智驾大模型共用底层技术底座。
这一组织模式,和特斯拉 “FSD+Optimus 机器人共用世界模型” 战略不谋而合,区别于绝大多数国内车企将自动驾驶与机器人业务分割研发的模式。其他车企智能化团队大多由汽车电子、ADAS 工程团队延伸组建,比亚迪直接吸纳机器人领域顶尖人才,从物理 AI 第一性原理搭建体系,赛道布局具备更强延展性。
行业竞争格局正在发生深刻转变,智能驾驶的比拼,已经从硬件、感知方案、功能堆叠,逐步升级到物理 AI 基础模型能力竞赛。特斯拉、英伟达、华为、小鹏纷纷加码世界模型与 VLA 架构。作为销量规模领先的车企,比亚迪手握国内体量领先的量产车队数据资源,如今补齐底层基础模型自研能力,竞争逻辑持续升级。
但长期挑战依旧客观存在:基础模型成果转化至车载产品需要漫长工程周期;同时,行业所有世界模型方案仍然处于探索阶段,不存在经过大规模真实路况验证的成熟路线。HyWorldVLA 代表比亚迪迈出关键一步,后续模型迭代、实车部署效果,将成为判断其能否跻身智驾第一梯队的核心观测指标。