
GPT6 Astra 等 "大脑" 展现出强大的空间理解、语义理解与任务规划能力,但难以用于实时的机器人控制操作,而 VLA 等动作专家 "小脑" 则展现出流畅执行复杂任务的潜力。真正的挑战在于,如何在保持低推理延迟的同时,让大脑的意图准确传递到小脑,并在连续执行中保持一致,使理解、规划与动作高效协同。
例如,一句看似清楚的指令:"把水果放进蓝色篮子,把蔬菜放进粉色篮子。"
人类会根据当前操作阶段确定目标,持续关注目标物体,并随着任务推进调整动作。对机器人来说,上层规划也需要在执行中持续落到具体目标上。
但视觉 - 语言 - 动作(VLA)及 WAM 等动作模型,遵循语言指令的能力仍然有限。
当场景复杂、视觉持续变化时,即使 "大脑" 正确理解了任务,语义意图也可能在传递和执行中逐渐丢失:
大脑知道要做什么,小脑却没有始终围绕同一个目标行动。
近日,智无际(EndlessAI)联合浙江大学团队等提出 HINT(Human-Intent Inception),为长时机器人操作提供了一套连接高层语义与底层动作的 Intent 对齐框架。
HINT 的核心思路,是让高层意图成为底层策略能够持续利用的信号:
在关键阶段重新确认意图,在连续执行中追踪目标,并通过视觉标记与注意力先验,将意图持续注入动作策略。
在三类长时操作任务以及多种分布外(OOD)场景中,HINT 均带来了明显的意图理解和端到端任务成功率提升,并能够作为即插即用接口接入现有动作策略。
01. 大脑想得清楚之后,小脑如何始终跟上同一个意图?
在 Agentic Robotics 中,大模型与动作模型的分工越来越清晰。
上层 "大脑" 理解和规划任务,底层 "小脑" 结合视觉信息生成动作。
但当任务变得复杂、多阶段,仅靠传递语言指令,还不足以保证二者持续对齐:
大脑确定的目标,如何成为小脑每一步动作的依据?
这也是 HINT 关注的核心问题 ——Intent Drift,意图漂移。
例如,一个机器人接收到:
"把指定颜色的模板放进托盘,然后插入对应形状的插销。"
整个任务实际上包含多个连续阶段:
寻找目标 → 接近 → 抓取 → 搬运 → 放置 → 再寻找目标 → 插入。
每一个阶段的视觉状态都在发生变化。
如果动作策略过度依赖当前视觉相关性,就可能出现:
关注了错误的物体;
抓取了视觉上更显眼但并非目标的物体;
在任务切换之后仍然执行上一阶段的动作;
长时间执行后逐渐偏离最初的语言指令。
换句话说:
机器人可能 "动作做得对",但 "事情做错了"。
HINT 将这一意图对齐问题进一步拆解为两个层次:
"What & Where"—— 当前真正要操作的目标是什么、在哪里?
以及:
"How"—— 如何把语义意图传递给 VLA/WAM 等动作模型?
HINT 将意图维护与动作执行解耦,在高层语义与底层动作之间建立持续的对齐接口:
HINT 持续传递并维护 "应该对谁做什么",底层动作策略负责 "具体怎么做"。
这也是整个方法的核心。
02. HINT 的关键:不是每一帧重新思考,而是在 "模式切换" 时重新确认意图
HINT 最重要的设计之一,是引入了 Pattern Router(操作模式路由器)。
例如一个抓取任务,可以自然地划分成:
Free Move → Pre-Contact → Transport Contact → Dexterous Contact
不同阶段,需要关注的信息其实并不一样。
在 Free Move 阶段,机器人更关心:
"我要去哪里?"
进入 Pre-Contact 后,更重要的问题变成:
"我要抓哪个目标?"
进入 Transport 阶段,则需要持续确认:
"我手里的目标应该放置到哪里?"
而进入 Dexterous Contact 后,机器人需要更加关注:
"目标和手之间的精细空间关系。"
HINT 因此并没有让高成本的语义推理模型一直运行,而是通过 Pattern Router 判断:
什么时候需要重新进行语义推理?
此时应该使用哪一个视觉视角?
当前应该关注哪个目标?
在关键操作模式发生变化时,HINT 重新建立一次 Semantic Commitment(语义承诺)。
随后,在同一个操作阶段内部,不再反复重新理解语言指令,而是通过视觉跟踪持续维护这个目标。
这形成了一种非常类似人类的工作机制:
阶段切换 → 重新确认目标
阶段内部 → 持续追踪目标
目标发生变化 → 再次确认
这使得机器人不需要每一帧都重新思考,却能够持续保持任务目标。
03. 从 "大脑意图" 到 "小脑执行":HINT 的双路径意图注入
确定目标之后,还有一个关键问题:
大脑已经知道 "要操作谁",但小脑对语言的遵循还不够稳定,如何让这一判断真正进入连续控制?
HINT 设计了两条互补的 Intent Injection 路径,将高层语义转换为小脑可利用的信号,分别作用于视觉表征和动作计算两个层面。
1. Pixel-Level Semantic Highlighting:把 "目标是谁" 显式写进视觉输入
第一条路径是在图像空间直接突出当前目标。
HINT 利用持续追踪得到的目标 mask,以半透明方式突出目标区域,同时保留目标本身的外观、几何结构以及周围场景信息。这样,高层语义判断不再只是一个抽象的语言结果,而被转换成一个持续存在于视觉输入中的空间指示。
可以把它理解为:
Highlighting 稳定的是 "意图"—— 让策略始终看得见当前要操作的对象。
2. Token-Level Attention Prior:让 "当前目标" 真正进入动作计算
但仅仅把目标标出来,并不意味着动作模型一定会充分利用它。
因此,HINT 进一步把目标 mask 转换成与视觉 token 对齐的 Attention Prior,并直接加入 Transformer 的注意力计算。
这里改变的不是输入图像,而是模型内部的信息分配方式:
哪些视觉信息应该在形成表征和生成动作时获得更多计算权重。
这一先验同时作用于视觉表征和 action-to-vision attention,使动作查询更加关注目标相关的视觉 token,同时仍然保留周围环境提供的空间信息。
因此,它解决的是另一个问题:
不仅要知道 "目标在哪里",还要让目标相关的空间证据真正参与 "下一步怎么动" 的计算。
可以把它理解为:
Attention Prior 稳定的是 "控制"—— 让动作生成持续围绕当前目标组织视觉信息。
3. 两条路径为什么互补?
这正是 HINT 这部分设计最重要的地方:
Highlighting 将意图显式化,Attention Prior 将意图计算化。
因此,两者分别作用于从语义到动作的两个环节:
Semantic Intent ↓ Highlighting:将意图外化为稳定的视觉参照 ↓ Attention Prior:将目标相关信息内化为动作计算先验 ↓ Action Generation
这一过程没有给 Foundation Action Model 增加新的可训练参数:大脑确定 what to act on,HINT 传递并维护意图,小脑负责 how to act。
04. 一个很重要的技术取舍:把 "慢思考" 和 "快执行" 分开
机器人系统有一个天然矛盾:
大脑的语义推理通常较慢,小脑的动作控制却需要低延迟。
如果每一帧都让大模型重新理解:
"我现在到底应该干什么?"
机器人很难实现高频、稳定的实时控制。
但如果完全不做语义推理,又容易发生意图漂移。
HINT 的解决方式是:
稀疏语义推理 + 连续视觉跟踪
也就是:
Semantic Reasoning:低频
负责确定:
当前任务阶段是什么?当前目标是什么?
Visual Tracking:高频
负责确定:
这个目标现在在哪里?
最终形成:
低频地 "想清楚",高频地 "盯住它"。
这种架构实际上将机器人任务中的两个不同时间尺度进行了分离:
语义意图变化是稀疏的,而视觉和动作变化是连续的。
HINT 利用这一结构,让大脑与小脑按各自的节奏工作,同时通过持续的目标跟踪维持意图对齐。
05. 不只是 "看起来有效":HINT 在真实机器人上进行了验证
为了验证这一方法,研究团队在双臂 PiPER 机器人上进行了实验,使用:
1 个全局相机
2 个腕部相机
并选择了三类具有代表性的长时操作任务:
水果 / 蔬菜分类:将水果和蔬菜按颜色分入指定的篮子里。
字母拼写:识别板子前方的物体,然后用字母块按顺序将其拼写出来。
Peg-in-Hole 插入:取出指定颜色的模板,将其放入黑色托盘中,然后插入与之形状匹配的针头。
同时,HINT 作为即插即用接口接入了 Wall-OSS-0.5 和 π₀.₅两个基础动作策略,没有向动作 backbone 增加额外可训练参数。
实验结果显示,在 In-Distribution 场景下,相比 π₀.₅:
整体意图理解得分(Intention Score)
从 52.2% 提升至 91.2%
提升 39.0 个百分点。
而更关键的是:
在水果 / 蔬菜分类任务中,完整任务成功率(Full-Task Success Rate)
从 10.0% 提升至 60.0%
提升 50 个百分点。
在字母拼写任务中,完整任务成功率从:
13.3% → 86.7%
在 Peg-in-Hole 插入任务中,完整任务成功率从:
5.0% → 40.0%。
这些结果说明,HINT 改善的不只是局部动作,还能帮助底层策略在多阶段执行中持续遵循任务意图。
06. 更值得关注的是:面对没见过的场景,机器人仍然能够保持意图
对于机器人而言,真正困难的通常不是训练集里的固定任务,而是:
换一个物体、换一种颜色、换一个布局、换一种指令之后还能不能完成任务?
因此,HINT 进一步设计了 Out-of-Distribution(OOD)测试。
测试中加入了训练阶段没有出现过的:物体、属性、场景布局、任务目标和指令组合,而机器人需要使用的底层运动原语仍然保持不变。
在 OOD 测试中,相比 π₀.₅:
整体 Intent Score:
56.5% → 82.6%
Subtask Success Rate:
52.2% → 80.4%
而完整任务成功率:
0% → 30%。
这意味着,在面对新的语义组合时,HINT 能帮助已有动作策略更好地保持 "高层想要完成什么" 和 "底层当前围绕什么行动" 之间的一致性。
07. HINT 真正值得关注的地方:补上 "大脑" 与 "小脑" 之间的意图对齐层
如果把一个机器人完成真实任务的过程拆开来看:
人类指令
↓
任务理解
↓
子任务分解
↓
当前意图 / 目标确定
↓
目标空间 grounding
↓
技能 / 动作执行
↓
结果判断
↓
进入下一阶段
其中,VLA 等动作模型主要承担的是:
"看到什么,并生成什么动作。"
而 HINT 着力解决的是:
"如何让大脑确定的意图,成为小脑持续行动的依据?"
因此,HINT 在高层语义与现有动作策略之间增加了 Intent Inception / Intent Maintenance 能力,让意图有明确的传递和维护机制。
从机器人系统角度看,这是一种非常重要的结构变化:
大脑负责理解和规划
意图层负责传递和对齐目标
小脑负责生成动作
视觉跟踪负责让目标在真实世界中持续落地
最终形成一个闭环。
08. 结语:大脑与小脑的意图对齐,最终要在持续完成工作中被验证
随着 Astra 等模型展现出更强的理解与规划能力,Agentic Robotics 的问题正在从:
"大脑能不能想清楚要做什么?"
走向:
"小脑能不能持续按照这一意图完成复杂任务?"
再进一步:
"机器人能不能在真实世界中不断完成任务,并让自己的能力持续进化?"
HINT 的探索正好落在大脑与小脑之间的关键接口:
让高层语义成为底层可利用的信号;
让一次性的意图传递,延续为连续执行中的目标对齐。
而对于智无际而言,这也是其机器人能力进化系统长期探索的一部分:
让机器人不只是 "会一个动作",而是真正拥有能够落地完成工作的技能,并在真实世界的持续执行中不断进化。
从这个意义上看,机器人智能还需要在理解、规划与执行之间建立持续的意图一致性:
大脑想清楚的事,小脑能够持续做好,并在真实世界的反复执行中做得更好。
(来源:智无际)