首页
资讯
品牌
选型
社区
活动
视频
排行
------
反馈
科技资讯
智无际联合浙江大学提出 HINT:对齐 “大脑” 与 “小脑” 意图,破解长时任务中的语义传递难题
2026-09-24 11:19:58   转载自智无际

GPT6 Astra 等 "大脑" 展现出强大的空间理解、语义理解与任务规划能力,但难以用于实时的机器人控制操作,而 VLA 等动作专家 "小脑" 则展现出流畅执行复杂任务的潜力。真正的挑战在于,如何在保持低推理延迟的同时,让大脑的意图准确传递到小脑,并在连续执行中保持一致,使理解、规划与动作高效协同。

例如,一句看似清楚的指令:"把水果放进蓝色篮子,把蔬菜放进粉色篮子。"

人类会根据当前操作阶段确定目标,持续关注目标物体,并随着任务推进调整动作。对机器人来说,上层规划也需要在执行中持续落到具体目标上。

但视觉 - 语言 - 动作(VLA)及 WAM 等动作模型,遵循语言指令的能力仍然有限。

当场景复杂、视觉持续变化时,即使 "大脑" 正确理解了任务,语义意图也可能在传递和执行中逐渐丢失:

大脑知道要做什么,小脑却没有始终围绕同一个目标行动。

近日,智无际(EndlessAI)联合浙江大学团队等提出 HINT(Human-Intent Inception),为长时机器人操作提供了一套连接高层语义与底层动作的 Intent 对齐框架。

HINT 的核心思路,是让高层意图成为底层策略能够持续利用的信号:

在关键阶段重新确认意图,在连续执行中追踪目标,并通过视觉标记与注意力先验,将意图持续注入动作策略。

在三类长时操作任务以及多种分布外(OOD)场景中,HINT 均带来了明显的意图理解和端到端任务成功率提升,并能够作为即插即用接口接入现有动作策略。

01. 大脑想得清楚之后,小脑如何始终跟上同一个意图?

在 Agentic Robotics 中,大模型与动作模型的分工越来越清晰。

上层 "大脑" 理解和规划任务,底层 "小脑" 结合视觉信息生成动作。

但当任务变得复杂、多阶段,仅靠传递语言指令,还不足以保证二者持续对齐:

大脑确定的目标,如何成为小脑每一步动作的依据?

这也是 HINT 关注的核心问题 ——Intent Drift,意图漂移。

例如,一个机器人接收到:

"把指定颜色的模板放进托盘,然后插入对应形状的插销。"

整个任务实际上包含多个连续阶段:

寻找目标 → 接近 → 抓取 → 搬运 → 放置 → 再寻找目标 → 插入。

每一个阶段的视觉状态都在发生变化。

如果动作策略过度依赖当前视觉相关性,就可能出现:

关注了错误的物体;

抓取了视觉上更显眼但并非目标的物体;

在任务切换之后仍然执行上一阶段的动作;

长时间执行后逐渐偏离最初的语言指令。

换句话说:

机器人可能 "动作做得对",但 "事情做错了"。

HINT 将这一意图对齐问题进一步拆解为两个层次:

"What & Where"—— 当前真正要操作的目标是什么、在哪里?

以及:

"How"—— 如何把语义意图传递给 VLA/WAM 等动作模型?

HINT 将意图维护与动作执行解耦,在高层语义与底层动作之间建立持续的对齐接口:

HINT 持续传递并维护 "应该对谁做什么",底层动作策略负责 "具体怎么做"。

这也是整个方法的核心。

02. HINT 的关键:不是每一帧重新思考,而是在 "模式切换" 时重新确认意图

HINT 最重要的设计之一,是引入了 Pattern Router(操作模式路由器)。

例如一个抓取任务,可以自然地划分成:

Free Move → Pre-Contact → Transport Contact → Dexterous Contact

不同阶段,需要关注的信息其实并不一样。

在 Free Move 阶段,机器人更关心:

"我要去哪里?"

进入 Pre-Contact 后,更重要的问题变成:

"我要抓哪个目标?"

进入 Transport 阶段,则需要持续确认:

"我手里的目标应该放置到哪里?"

而进入 Dexterous Contact 后,机器人需要更加关注:

"目标和手之间的精细空间关系。"

HINT 因此并没有让高成本的语义推理模型一直运行,而是通过 Pattern Router 判断:

什么时候需要重新进行语义推理?

此时应该使用哪一个视觉视角?

当前应该关注哪个目标?

在关键操作模式发生变化时,HINT 重新建立一次 Semantic Commitment(语义承诺)。

随后,在同一个操作阶段内部,不再反复重新理解语言指令,而是通过视觉跟踪持续维护这个目标。

这形成了一种非常类似人类的工作机制:

阶段切换 → 重新确认目标

阶段内部 → 持续追踪目标

目标发生变化 → 再次确认

这使得机器人不需要每一帧都重新思考,却能够持续保持任务目标。

03. 从 "大脑意图" 到 "小脑执行":HINT 的双路径意图注入

确定目标之后,还有一个关键问题:

大脑已经知道 "要操作谁",但小脑对语言的遵循还不够稳定,如何让这一判断真正进入连续控制?

HINT 设计了两条互补的 Intent Injection 路径,将高层语义转换为小脑可利用的信号,分别作用于视觉表征和动作计算两个层面。

1. Pixel-Level Semantic Highlighting:把 "目标是谁" 显式写进视觉输入

第一条路径是在图像空间直接突出当前目标。

HINT 利用持续追踪得到的目标 mask,以半透明方式突出目标区域,同时保留目标本身的外观、几何结构以及周围场景信息。这样,高层语义判断不再只是一个抽象的语言结果,而被转换成一个持续存在于视觉输入中的空间指示。

可以把它理解为:

Highlighting 稳定的是 "意图"—— 让策略始终看得见当前要操作的对象。

2. Token-Level Attention Prior:让 "当前目标" 真正进入动作计算

但仅仅把目标标出来,并不意味着动作模型一定会充分利用它。

因此,HINT 进一步把目标 mask 转换成与视觉 token 对齐的 Attention Prior,并直接加入 Transformer 的注意力计算。

这里改变的不是输入图像,而是模型内部的信息分配方式:

哪些视觉信息应该在形成表征和生成动作时获得更多计算权重。

这一先验同时作用于视觉表征和 action-to-vision attention,使动作查询更加关注目标相关的视觉 token,同时仍然保留周围环境提供的空间信息。

因此,它解决的是另一个问题:

不仅要知道 "目标在哪里",还要让目标相关的空间证据真正参与 "下一步怎么动" 的计算。

可以把它理解为:

Attention Prior 稳定的是 "控制"—— 让动作生成持续围绕当前目标组织视觉信息。

3. 两条路径为什么互补?

这正是 HINT 这部分设计最重要的地方:

Highlighting 将意图显式化,Attention Prior 将意图计算化。

因此,两者分别作用于从语义到动作的两个环节:

Semantic Intent ↓ Highlighting:将意图外化为稳定的视觉参照 ↓ Attention Prior:将目标相关信息内化为动作计算先验 ↓ Action Generation

这一过程没有给 Foundation Action Model 增加新的可训练参数:大脑确定 what to act on,HINT 传递并维护意图,小脑负责 how to act。

04. 一个很重要的技术取舍:把 "慢思考" 和 "快执行" 分开

机器人系统有一个天然矛盾:

大脑的语义推理通常较慢,小脑的动作控制却需要低延迟。

如果每一帧都让大模型重新理解:

"我现在到底应该干什么?"

机器人很难实现高频、稳定的实时控制。

但如果完全不做语义推理,又容易发生意图漂移。

HINT 的解决方式是:

稀疏语义推理 + 连续视觉跟踪

也就是:

Semantic Reasoning:低频

负责确定:

当前任务阶段是什么?当前目标是什么?

Visual Tracking:高频

负责确定:

这个目标现在在哪里?

最终形成:

低频地 "想清楚",高频地 "盯住它"。

这种架构实际上将机器人任务中的两个不同时间尺度进行了分离:

语义意图变化是稀疏的,而视觉和动作变化是连续的。

HINT 利用这一结构,让大脑与小脑按各自的节奏工作,同时通过持续的目标跟踪维持意图对齐。

05. 不只是 "看起来有效":HINT 在真实机器人上进行了验证

为了验证这一方法,研究团队在双臂 PiPER 机器人上进行了实验,使用:

1 个全局相机

2 个腕部相机

并选择了三类具有代表性的长时操作任务:

水果 / 蔬菜分类:将水果和蔬菜按颜色分入指定的篮子里。

字母拼写:识别板子前方的物体,然后用字母块按顺序将其拼写出来。

Peg-in-Hole 插入:取出指定颜色的模板,将其放入黑色托盘中,然后插入与之形状匹配的针头。

同时,HINT 作为即插即用接口接入了 Wall-OSS-0.5 和 π₀.₅两个基础动作策略,没有向动作 backbone 增加额外可训练参数。

实验结果显示,在 In-Distribution 场景下,相比 π₀.₅:

整体意图理解得分(Intention Score)

从 52.2% 提升至 91.2%

提升 39.0 个百分点。

而更关键的是:

在水果 / 蔬菜分类任务中,完整任务成功率(Full-Task Success Rate)

从 10.0% 提升至 60.0%

提升 50 个百分点。

在字母拼写任务中,完整任务成功率从:

13.3% → 86.7%

在 Peg-in-Hole 插入任务中,完整任务成功率从:

5.0% → 40.0%。

这些结果说明,HINT 改善的不只是局部动作,还能帮助底层策略在多阶段执行中持续遵循任务意图。

06. 更值得关注的是:面对没见过的场景,机器人仍然能够保持意图

对于机器人而言,真正困难的通常不是训练集里的固定任务,而是:

换一个物体、换一种颜色、换一个布局、换一种指令之后还能不能完成任务?

因此,HINT 进一步设计了 Out-of-Distribution(OOD)测试。

测试中加入了训练阶段没有出现过的:物体、属性、场景布局、任务目标和指令组合,而机器人需要使用的底层运动原语仍然保持不变。

在 OOD 测试中,相比 π₀.₅:

整体 Intent Score:

56.5% → 82.6%

Subtask Success Rate:

52.2% → 80.4%

而完整任务成功率:

0% → 30%。

这意味着,在面对新的语义组合时,HINT 能帮助已有动作策略更好地保持 "高层想要完成什么" 和 "底层当前围绕什么行动" 之间的一致性。

07. HINT 真正值得关注的地方:补上 "大脑" 与 "小脑" 之间的意图对齐层

如果把一个机器人完成真实任务的过程拆开来看:

人类指令

任务理解

子任务分解

当前意图 / 目标确定

目标空间 grounding

技能 / 动作执行

结果判断

进入下一阶段

其中,VLA 等动作模型主要承担的是:

"看到什么,并生成什么动作。"

而 HINT 着力解决的是:

"如何让大脑确定的意图,成为小脑持续行动的依据?"

因此,HINT 在高层语义与现有动作策略之间增加了 Intent Inception / Intent Maintenance 能力,让意图有明确的传递和维护机制。

从机器人系统角度看,这是一种非常重要的结构变化:

大脑负责理解和规划

意图层负责传递和对齐目标

小脑负责生成动作

视觉跟踪负责让目标在真实世界中持续落地

最终形成一个闭环。

08. 结语:大脑与小脑的意图对齐,最终要在持续完成工作中被验证

随着 Astra 等模型展现出更强的理解与规划能力,Agentic Robotics 的问题正在从:

"大脑能不能想清楚要做什么?"

走向:

"小脑能不能持续按照这一意图完成复杂任务?"

再进一步:

"机器人能不能在真实世界中不断完成任务,并让自己的能力持续进化?"

HINT 的探索正好落在大脑与小脑之间的关键接口:

让高层语义成为底层可利用的信号;

让一次性的意图传递,延续为连续执行中的目标对齐。

而对于智无际而言,这也是其机器人能力进化系统长期探索的一部分:

让机器人不只是 "会一个动作",而是真正拥有能够落地完成工作的技能,并在真实世界的持续执行中不断进化。

从这个意义上看,机器人智能还需要在理解、规划与执行之间建立持续的意图一致性:

大脑想清楚的事,小脑能够持续做好,并在真实世界的反复执行中做得更好。

(来源:智无际)

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有