
2026 年,是具身智能处于风口浪尖的时刻:市场对其抱有更高期待;但 "泡沫" 与 "落地场景不明确" 的质疑声也未曾停歇。
在喧嚣与杂音之中,蓝驰创投「Booming Talk」播客栏目,决定找身处具身智能研发第一线的技术人员聊一聊。
丁文超,它石智航联合创始人兼首席科学家。2025 年 3 月,蓝驰创投领投它石智航天使轮投资;并在后续多轮加注它石智航。对它石的投资,也打破了蓝驰的单笔投资金额纪录。
本期与丁文超对谈的,是蓝驰投资人陶也了,以及蓝驰品牌及创业者生态负责人向适。
陶也了主要关注 AI、硬科技等技术驱动的前沿方向,从投资它石之初,就持续参与对团队技术路线与产业落地的研究和判断。因此,这场两个小时的对谈并不是一场泛泛而谈的机器人未来畅想,而是一场对具身智能技术底层问题的持续追问,从数据、模型一路延伸到评测、强化学习与真实场景。
在下文中,我们也从这场对谈中整理出了 11 个关键问题,总结出这场讨论中的的核心判断。蓝驰相信,与一线技术人员的持续、深入的交流,才能穿过市场上的喧嚣杂音,留下真正有价值的见解。
而向适与丁文超的讨论,则将问题转向技术背后的 "人":一个 ISTP、为什么 "越来越 J"?在社交媒体上发布机器人 Demo,他为什么强调不用特效,让工程师用手机拍?当向适问他,"丁文超" 还有什么系统参数需要调整?他回答:想要调高精力,更好地利用大模型工具,取得更大的成果。
在技术背后,我们看到了一个十分具体且纯粹的 "技术人"。
"我确实比较少有大的技术焦虑。" 丁文超在对谈中说。
把问题重新拉回第一性原理,是丁文超身上非常鲜明的技术气质。
录制那天,丁文超穿着它石的黑色上衣走进房间,笑称自己 "并没有准备什么,随便问。" 但在和投资人一来一往的交流中,他总是不急不缓,给出十分有逻辑的答案。相信在阅读或收听这期对谈的过程中,你也能看到,这是一位对自己的技术有十分清晰、体系化认知的研究者:他对技术的理解像一座结构完整的大厦,任何一个房间他都随时可以走进去,把灯打开。
全场难得一次长久的停顿,出现在一个与技术无关的问题上:"如果不做技术了,你会做什么?" 丁文超想了很久。说:"我应该会一直被新技术所牵引,围绕技术去做,哪怕不在一线做。"
这是种对技术近乎朴素的坚持,它石智航近期发布通用具身大模型 AWE 3.7,丁文超在自己的社交媒体上连续密集发布一系列任务视频。他要求工程师发布的演示视频 "真的原速、不加速、不剪辑、全自主",用手机和运动相机拍摄、保留电机电流的呜呜声。
"我其实很享受这种声音,因为那种感觉就像智能正在涌现。它突然就能够完成这些事情了。这也是我当时做这个系列最本质的原因。"
而对技术最纯粹的兴趣,也贯穿了它石与蓝驰一贯的交流。在蓝驰,投资人和创业团队间的精彩碰撞,往往从具体的技术问题展开,把团队的专业和愿景问到底。丁文超回忆,与蓝驰的第二次见面是在一间小会议室里:"一进去就被围住了":他现场在白板上手绘 —— 数据怎么做、模型怎么做、3D/4D 监督怎么做、隐空间怎么做、跨本体怎么做。
蓝驰办公室,丁文超与投资团队探讨交流
蓝驰投资团队对专业问题的追问越来越深:凭什么从人身上采集的数据,可以迁移到机器人上?为什么用世界模型,而不用 VLA?线束场景具体需要多少数据?在 World Model 的 latent space 里怎么做 RL?……
双方都有着对技术和产业的长期判断,并愿意沿着判断持续投入。蓝驰对机器人领域的研究和投资已持续十余年,从工业、物流等垂直机器人,到今天的多家具身智能企业,持续观察机器人能力走向真实场景。因此,2024 年底蓝驰遇见它石智航时,尽管当时行业技术路线仍然发散,蓝驰关注的问题已经相对明确:技术是否真正推动了机器人的能力边界,以及团队是否真正理解场景。它石对技术路线的坚定判断,以及对线束等真实场景的深入理解,正是蓝驰决定大手笔下注的重要原因之一。
这背后还有一个更长期的判断:中国拥有完整的制造业体系、供应链和足够丰富的真实产业场景,这些既是机器人技术最好的验证场,也可能成为下一代机器人技术生长的土壤。正如这场谈论中,蓝驰投资人和丁文超话题的最终落点:机器人最终将进入物理世界、替人分担工作,持续拓展生产力的边界。
中国创业者正在从这些真实问题出发,参与定义下一代全球机器人技术。而蓝驰,也在持续和这样的创业者产生 "booming" 的共振。
这就是我们今天为你呈现这场 Booming Talk 的原因。下文是近两个半小时对谈中整理出的 11 个关键问题。
01|具身行业现在处于什么阶段?技术临界点的关键信号是什么?
丁文超认为,具身可能已经来到规模化落地的前夜。过去 12~18 个月,具身在数据和模型两端都取得了关键进展,两条线交叠,让基座模型开始快速发展。"具身并不缺场景,场景其实无处不在。过去真正的问题,是 Adapt 的边际投入太大。" 当基座模型让特定任务的适配成本足够低,更多真实场景也可能被打开。
02|具身需要自己的原生基座模型
无论 VLA 还是基于 Video Model 的 World Model,本质上仍是 "桥接式、拼接式的模型":最主要的能力来自其他领域的模型,再迁移到机器人上。它石从第一天就选择了另一条路:"具身应该拥有自己的基座模型。" 从人的真实世界交互中采集海量数据,从头训练原生模型,而不是局限于迁移已有模型。"因为有海量数据,我们完全可以重构掉整个模型里所有的注意力机制,真正克服一些先天不足。"
03|它石智航预训练模型的第一性是什么?
为什么它石智航选择从人的真实世界经验中训练?丁文超的判断是,"模型最终的智能来源,不会来自任何手工设计的东西,只能来自人类这个超级智能体。" 因此,它石从 human-centric 数据出发,真正要解决的,是如何把人的经验迁移到身体、感知和动作方式都不同的机器人上。"我们后面所有的工作,都是围绕怎么去消减这个 Gap,这是数据的最大价值。"
04|它石智航如何看待具身预训练模型需要的数据,需要多少数据,才能让模型达到相对泛化的结果?
丁文超表示,它石智航真正关心的,是如何高效采集 human-centric 数据,并将其中的高价值信息通过模型迁移到不同的物理本体上。包括数据量级 × 数据多样性 × 数据效率。
其中,不同数据转化为智能的效率并不相同:有的数据能够让模型能力快速涌现,有的数据即使规模很大,对模型的贡献也十分有限;不同类型的数据,其能力增长的斜率和上限也并不一样。因此,真正训练基座模型时,需要寻找 Data Efficiency 更高的数据,并将不同类型的数据共同训练。
具体到不同的数据来源,丁文超认为,合成数据的问题在于,人很难在仿真中完整复刻真实世界;真机数据虽然足够真实,却可能因为场景和动作高度重复,被模型轻易 "背下来"。"模型中一切智能涌现的来源都是多样性。"
因此,仿真、合成还是真机数据都有其价值,真正重要的不是数据来自哪里,而是它能否为预训练提供足够真实、多样且有效的信息。
05|具身有多种技术路线,有没有哪些是更重要的?
丁文超认为,这些技术并不是彼此替代,而是在解决不同层面的问题。比如 Latent Action 能提取更高层次的动作信息,更适合从人迁移到不同机器人本体,但也容易丢失精细的接触信息。它石在实践中发现,最难的问题还是 Contact:"具身相比于大模型最大的差别,就是它在用 Contact 改变物理世界。Contact 是一切具身基座模型的核心。" 所以它石会对触觉特别关注。
06|数据效率和模型架构之间是什么关系?
丁文超在持续迭代后的感受是:"大道至简。" 模型越想 "玩花活",往往越容易绕远路,最终在模型结构层面,大家可能还是会返璞归真。真正的差别可能更像炼丹:什么时候放什么原材料进去,训练到什么阶段,怎么验证这个阶段的能力已经满足要求,再进入下一个阶段。
07|它石已经看到明确的 Scaling 和能力涌现了吗?
丁文超给出了确定的答案:"我觉得这个是确定性的。" 随着预训练持续 Scaling,它石已经观察到比较明确的泛化和能力涌现:一些能力并不需要针对具体任务重新训练,而只需要个位数、十几条甚至几十条后训练数据,就能被激发出来;模型不仅能够完成任务,还开始表现出从错误中恢复,以及做出训练数据中没有明确示教过的行为。
"我现在比较 exciting 的一点是,我觉得具身模型逐渐真的能让你觉得,你在教一个智能体,而不是在教一个傻瓜。" 对丁文超而言,这正是 Scaling 已经开始发生的一个重要信号,接下来要做的,就是继续推动预训练和后训练的 Scaling。
08|Scaling 的斜率是多少?如何评判每单位的数据、算力,转化成模型能力提升的转化效率?
当数据和预训练逐渐解决后,"最终的瓶颈可能就会来到评测。" 现有 Benchmark 规模小、任务固定,很容易被模型 Trick,因此基座模型需要一个真正可靠的 "金标准"。它石正在探索让具备 Physical Interaction 能力的 World Model 成为模型自己的评测器;而更终极的评测,则来自海量真实部署和用户反馈形成的 "物理沙盒"。
09|它石怎么看真机 RL?
丁文超把真机 RL 形容为 "蛋糕上樱桃上的芝麻":"它在用极小的样本量去解决一个超大解空间的问题,而且正反馈非常稀疏。" 因此,它石目前对真机 RL 相对克制,更强调先做好预训练,再用合适的后训练激发能力。
10|数据、模型和硬件未来能够解耦吗?
丁文超认为,"如果将来能分开,对具身来说是好事,但现状是分不开。" 目前模型真正需要优化的能力,并不总在硬件设计的注意力中心,因此数据、模型与硬件仍处于紧耦合状态。但硬件本身也正在逐渐收敛。丁文超认为,未来最关键的两个变量可能是关节和端侧计算:当两者逐渐形成共识,不同机器人本体仍可以保持不同形态,而模型在不同本体之间的迁移,"是可以做到的,是在射程范围之内的"。
11|具身到底能不能真正落地?它石智航为什么选择线束?
它石目前已经 "脱离实验室,在真正的线束工厂里去做部署,而且有一定规模。" 但丁文超认为,具身真正的问题并不是没有场景,而是场景太分散,很多单一任务并不值得投入大量研发资源。因此它石选择线束,就是寻找人不愿意干、招不到人,同时又有足够多人在做的高价值场景。"场景非常多,但核心值得重兵投入的场景是少数。" 随着模型泛化能力提升、适配成本下降,再逐步从工业走向商业和家庭。
另外,家庭场景则是一个 "反直觉" 的场景,它要像一把张开得足够大的剪刀,当硬件和模型两端都足够成熟,关键的家庭应用会自然出现。
(来源:蓝驰创投)