直接从图像规划
最初,我们让多模态 AI 智能体直接根据机器人视角图像做规划。它能理解目标,但物理层面的缺口依然存在:精确深度、无碰撞运动、接触、高频控制。这次尝试让语义理解与“让计划真正跑起来”的机器人能力,分成了两件事。
以 AI 智能体为中心的机器人学习 / 上海交通大学
An Agent-Centered Architecture
for General Robot Learning
上海交通大学 自动化与感知学院
少量演示变成可复用的机器人技能,
而模型权重始终不变。
↗ 放大摘要 / 论文摘要
视觉-语言-动作(VLA)与世界动作模型通常需要通过追加机器人数据采集与策略优化,才能吸收不熟悉的操作任务;这种反复出现的再训练负担拖慢了新行为的获得。我们提出 Teach-and-Grow Learning(TGL),一种免训练架构,把少量成功演示转化为可复用的机器人技能。获取新任务不需要梯度更新、微调或强化学习:预训练模型权重保持固定,机器人在此前提下扩展其显式知识。我们的实现使用 OpenAI GPT-6 Astra 进行多模态推理,并用 Codex 把 AI 智能体与机器人工具连接起来。AI 智能体识别演示之间共享的子目标,将其表达为闭环的 Skill Block,并把每个块落实到当前场景。物理反馈引导下一步动作与恢复。经验证的行为进入持久化的 Skill Library;Experience Memory 记录影响后续决策的条件与修复。TGL 在四个 LIBERO 套件上达到 99.9% 的平均成功率,在七个 LIBERO-Plus 扰动类别上达到 92.4%。受控研究显示,在模型权重与执行器相同的条件下,已习得的技能块能够保留并改善相关任务的执行。我们还提出一个缩放假设,把有效可复用经验与未来任务误差、示教需求的下降联系起来。代码与演示视频:https://tgl.changnie.top。
关键词免训练机器人学习 · AI 智能体机器人学 · GPT-6 Astra · Codex · 少样本示教 · 视觉-语言-动作模型 · 终身学习 · 技能组合 · 具身智能
Teach and Grow 属于具身智能与 AI 智能体机器人学(agentic robotics)的研究脉络,面向通用机器人操作。这一领域通常围绕两类方法组织:视觉-语言-动作(VLA)模型把感知与语言直接映射为控制,世界动作模型(WAM)进一步引入学习到的物理动态。两者都通过采集更多机器人数据、优化策略参数来吸收新能力。机器人基础模型为 TGL 提供先验;TGL 改变的是新任务知识存放的位置,先验的强弱则仍由基础模型决定。因此它的邻近方向包括少样本与稀疏示教方法、技能组合与技能库方法、终身学习与持续学习,以及基于 AI 智能体的机器人控制。
01 / 问题从哪里来
一个新容器、一次相机位置变化,或一次不再奏效的抓取,可能只是很小的能力缺口;但为它付出的代价,往往会牵动整个学习系统。
通用机器人策略通过大规模观察–动作数据不断前进。视觉–语言–动作模型(VLA)把语义理解接到控制上,世界–动作模型(WAM)进一步引入学习到的物理动态。两条路线都通过训练把新能力写进模型参数;机器人面对陌生任务时,依靠的正是这份训练出来的先验。
物理交互数据的成本结构与文本、代码不同。它们大多只有在机器人或仿真运行之后才存在:接触需要观察,抓取需要尝试,碰撞风险需要处理,变化需要确认。而物体姿态、相机几何、杂乱程度、材质与机器人本体之间又会相互影响,覆盖其中一个因素,并不等于覆盖它们的组合。
如果通过更新策略来修复一次失败,通常要重新采集数据、再跑一轮优化,并对策略此前支持的所有行为做回归检查。我们把这种反复出现的负担称为 retraining tax(再训练成本)。它在长尾场景中格外明显:一种少见的接触条件、一件特殊的物体,需要的往往是一条具体经验,而不是又一轮宽泛的数据积累。
修复也难以局限在出问题的地方。如果 VLA 夹不稳一种陌生的碗,补充数据并更新参数之后,并不会留下一个可以单独检查和调用的“碗夹持修复模块”——改动分散在权重里,原有行为还得重新验证。换一个传感器或夹爪,同样的问题会在接口层重现:观测格式、标定与动作兼容性都需要重新验证。
长尾经验同样难以变成可复用的纠正。一段成功轨迹,可能恰好没有记录抓取失败之后真正起作用的那些条件;当经验只存在于参数中,失败条件、恢复规则与适用范围就无法被逐项检查和修改。TGL 正是从这个疑问出发:机器人能否把这些对象显式保留下来,并且只更新受影响的那部分行为?
TGL 尝试的是另一种更新机制。少量成功演示给出初始任务结构,机器人把它转成显式技能,通过执行来检验,再把有效的部分连同解释它的经验一起保留下来。预训练模型仍然提供先验,改变的是新任务知识存放的位置。
↗ 放大02 / 研究思路的形成
这套架构源于一个很实际的问题:当多模态 AI 智能体理解了任务,却仍然无法可靠完成时,缺的到底是什么?
大语言模型(LLM)通过 ChatGPT、Claude 这类助手,把语言理解与推理带进了交互界面。Codex、Claude Code 等编程 AI 智能体则给出了一套很适合搬到机器人上的工作方式:查看当前状态、选择工具、执行、读取结果、修正计划。
TGL 把这个循环搬进了物理操作。相机图像对应工作区状态,感知、抓取与运动工具负责实际操作,新的观察报告动作改变了什么。AI 智能体依据这些信息选择下一个子目标与下一个工具——推理负责组织任务,专用机器人组件负责物理执行。
论文的实现使用 OpenAI GPT-6 Astra 做多模态推理,并以 Codex 作为 AI 智能体接口。ChatGPT 与 Claude 在这里只说明 LLM 的背景,Claude Code 用来说明编程 AI 智能体的工作方式。由此产生了后面的问题:当一次错误动作会改变真实物理状态时,这套工作方式还能保留多少?
最初,我们让多模态 AI 智能体直接根据机器人视角图像做规划。它能理解目标,但物理层面的缺口依然存在:精确深度、无碰撞运动、接触、高频控制。这次尝试让语义理解与“让计划真正跑起来”的机器人能力,分成了两件事。
随后,我们接入感知、抓取、规划与控制工具,并在每次短段执行后返回新的观察。当场景与计划不一致时,AI 智能体可以修改路线。结构化记忆保存了这次尝试的条件、结果与修复方式,让一次试错的价值超出它所在的回合。
工具调用使零样本 AI 智能体控制成为可行,但靠反复试错学会一个行为,仍然要消耗大量物理交互与模型调用。成功示教可以提前给出子目标序列,让探索集中在演示没有覆盖的变化、纠错与缺失环节上。这逐渐形成了 Teach-and-Grow 的路线。
示教为探索提供初始结构,执行暴露示教尚未解决的问题,这些缺口又让下一次指导更有针对性。
让 AI 智能体通过感知、抓取、规划与控制工具直接驱动机器人,是能够在完全不做示教的情况下完成操作任务的;我们跑过这个实验,这项工作也正是从这里开始的。它做不到的是积累。每一次执行都从零开始推理,奏效的路线和成功的抓取随着这一回合结束而消失,同一个任务下次仍然要用同样的代价再解一遍。TGL 保留这套 AI 智能体循环,改变的是结果的存放位置:一次成功的任务变成带适用范围与效果判据的显式 Skill Block,条件与修复方式进入经验记忆。此后 AI 智能体是检索而不是重新推导,因为子目标结构已经确定而收敛更快,经过验证的行为可以跨任务复用,积累的经验也能带到后面。这是“一个能解决任务的 AI 智能体”和“一套把解决结果留下来的系统”之间的区别。
自主探索是可行的,零样本的 AI 智能体控制也真实成立,这一点我们跑过。但它不适合作为默认做法,原因有两个:它收敛慢,因为靠反复试错学会一个物理行为要消耗大量机器人交互和大量顺序模型调用;而且在真实硬件上不能放开来跑,因为探索动作就是物理动作,可能损坏物体、夹爪或场景。示教改变的是起点,而不是目标:几条成功演示给出子目标顺序与值得检查的条件,探索就可以集中在演示没有覆盖的变化、纠错与恢复上。示教是加速器,不是前提,它的来源也是开放的。机器人轨迹、仿真、人类视频以及一份书面操作流程都可以,因为只要能说明任务是如何完成的、完成后形成了什么,就能为这套结构提供种子。
示教缩小了寻找有效初始计划的范围。接下来的问题是:要从中保留什么——一次成功回合的记录,还是能够在别的场景里重新落实并执行的行为?
03 / 核心思路
一次演示里其实有两样东西:值得保留的策略,以及只属于那个场景的物理细节。TGL 把它们分开。
以“把碗放到盘子上”为例。不同演示里,接近方向与运动轨迹可以完全不同,但共同结构更稳定:拿到指定的碗,确认它被夹持,朝目标关系移动,再把它释放到盘子上。
TGL 用 Skill Block 表示一次有意义的状态变化。技能块保留目标、可复用策略、适用条件与效果判据;实际的物体姿态、抓取、路径和控制目标来自当前观察。复用时保留的是预期效果,物理实现则可以随场景改变。
这里的 training-free 含义很明确:获取当前任务的过程不包含梯度更新、微调或强化学习阶段。AI 智能体与专用模型可以已经是预训练好的;获取过程中改变的是显式的技能与记忆状态。
完成任务后,机器人留下可以检索、检查和再次执行的能力。
不会,也没有这样设计。TGL 是一种以 AI 智能体驱动的、新的机器人通用操作系统,而它所组织的那些模型,依然是把感知转成快速连续控制的最强手段。在这种分工里,训练好的策略是系统调用的组件:一个能够稳定抓取某一类物体、或打开某一种抽屉的策略,可以注册为某个技能块的执行器,由 AI 智能体选择它、把它落实到当前场景、检查执行结果,并与其他技能块组合。VLA 擅长的地方,TGL 直接使用它,并受益于它的每一次进步;任务是新的、少见的,或者落在策略训练分布之外时,AI 智能体就显式地补齐缺失的结构,而不必等下一轮训练。两者处在技术栈的不同层次上,是互补关系,而不是同一个位置上的竞争。
什么需要改变、先后顺序如何、适用于哪些条件。
物体绑定、抓取几何、无碰撞运动与具体控制。
这种分离界定了“要学什么”。要让它在一台机器人上跑起来,还需另一层连接:每个保留下来的子目标都要能变成当前场景中的动作,而每个动作都要返回足以改变下一步决策的信息。
04 / 架构内部
AI 智能体在有意义的状态变化处组织任务;每个技能块内部,由专用执行器处理几何与连续控制。
↗ 放大系统在“拿到物体”“形成容纳关系”这类有意义的事件处切开演示。片段按完成的效果对齐,即使时间与动作方式不同。共同结构成为候选策略,演示之间的差异决定这个策略可以被主张的范围有多大:只有单个物体的例子时,它就只适用于那个物体,除非有更多证据支持更宽的范围。
每个技能块要回答几个很实际的问题:期望什么效果?什么时候适用?需要什么证据?哪些执行器能实现?如何观察成功?允许什么恢复动作?以抓取为例,夹爪闭合并不足以说明物体已被夹住,验证必须指向预期的物理效果。
当前计划是一组有序的技能块,尚未执行的部分是可以改的。效果通过,进入下一阶段;效果失败或不确定,就可能需要再次观察、换一个执行器,或者修改路线。AI 智能体的推理在这里与物理反馈相接:下一步取决于刚才真正发生了什么。
有希望的候选行为要在示教之外的场景中评估。支持范围、执行器兼容性、效果判据与恢复方式都要先检查,通过后才进入技能库;不够可靠的候选会被缩小范围或修复。技能库的增长因此是对“一个行为及其生效条件”的一次明确判断,而不是每个回合自动累积的结果。
↗ 放大看看哪些信息被保留,哪些决策需要根据当前场景重新做出。
演示提供子目标与顺序,也揭示需要检查的条件,例如搬运前应保持对碗的夹持。原始像素坐标和精确轨迹不属于可复用策略。
技能块将任务中的目标物体绑定到当前观察,由兼容的抓取和运动后端计算具体动作。接触位置可以与教师不同,但希望达到的“已获得物体”状态保持一致。
执行后,验证器检查碗是否确实被夹持。不牢固或失败的抓取会改变下一步决策,AI 智能体可以再次观察,或在放置前修改剩余路线。
通过验证的可执行策略及其范围进入技能库。这次尝试的条件、结果和有用的修复方式进入经验记忆,后续任务可以同时检索两者。
因为 AI 智能体自身的图像感知,精度不足以支撑操作。在我们的实验中,仅凭自己的图像理解,它可以完成简单任务:指的是哪个物体、大致的操作顺序、场景是否像目标状态。不可靠的地方是“测量”。6D 位姿、厘米级的间隙、被遮挡物体的边界、夹爪是否真的夹住了东西、一条路径会不会碰撞,这些都需要从一帧到下一帧都成立的度量结果,而通用模型读一张相机图像只能给出近似答案。检测与分割确定物体身份和边界,RGB-D 几何提供深度与位姿,抓取与运动规划给出无碰撞、可达的动作,控制器以所需频率维持闭环。AI 智能体因此可以腾出来组织任务、选择下一个子目标、读取执行结果、决定下一步。由于每个工具都处在技能块内部,换上更好的检测器也可以重新验证,而不打扰上层的推理与技能库。
论文当前系统使用 OpenAI GPT-6 Astra 和 Codex 进行任务级推理与工具交互。检测、分割、RGB-D 几何、Contact-GraspNet、MPLib 与控制器负责物理场景落地和执行。
05 / 机器人留下了什么
完成一次任务与获得持久能力,是两件事。TGL 把需要保留的两类对象分开。
技能库保存能够被选择并运行的行为:子目标、适用条件、场景落实规则、兼容工具与验证逻辑。单有一句“如何抓取”的描述并不够,技能块还必须把意图接到执行器,以及一个能检验效果的判据上。
经验记忆保存的是使用情境:任务、选中的技能块、观察、结果、诊断与修复。一次失败可能暴露出不合适的抓取方式,或一次含糊的观察;把这些解释保留下来,就能指导下一次选择,而不必把每个回合都变成新的可执行技能。
这种分离也让系统保持可检查。人可以收窄过宽的范围、修改恢复规则,或把某个工具版本标为不兼容。保存了文件,不等于保留了行为能力:系统仍然要检索到正确的技能块、把它落实到当前传感信息上,并成功执行——对一个长期学习的机器人来说,这是几个分别需要回答的问题。
下面的对照视频把这个过程直接呈现出来:先看教师给出的任务结构,再看 TGL 如何用不同的抓取达到同样的结果,以及第一次没能夹稳物体时它会怎么做。
06 / 场景中的行为
五组 LIBERO 视频把教师演示与 Teach and Grow 放在同一任务上对照,覆盖三类套件:Object(把指定物体放入篮子)、Spatial(把物体放到与另一物体的空间关系中)与 Goal(达成某个状态,例如打开炉灶)。
这些是仿真中的定性示例。视频时长不同,同时播放只统一起点,不对齐具体动作;播放倍速针对原视频,不代表实测机器人延迟。
OBJECT /01
将汤罐放入篮子
教师演示提供任务结构:拿到罐子、搬运、放入篮子。TGL 采用了不同的接近方向与抓取方式,仍然完成同一结果——保留下来的是策略,而不是动作本身。
观察重点: 观察抬起罐子前,两侧的接近方向和夹爪朝向。
SPATIAL /02
将碗放到盘子上
TGL 抓取碗沿的位置与教师不同。子目标没有变,接触位置则是根据机器人当前看到的场景重新计算出来的。
观察重点: 对照两段视频中夹爪与碗沿的接触位置。
SPATIAL /03
将柜子上的碗移到盘子上
第一次抓取未能夹稳碗。在这段系统视频中,TGL 重新尝试并完成放置——一次由抬起失败后的观察所触发的恢复。
观察重点: 留意第一次抬起尝试,以及随后重新接近、抓取和搬运的过程。
OBJECT /04
将沙拉酱瓶放入篮子
教师与 TGL 都完成瓶子的搬运。换一个物体之后,同样的三个阶段依然成立:获取、运输、释放。
观察重点: 观察从初始抓取到篮子上方释放的完整过程。
GOAL /05
旋转旋钮,打开炉灶
这项任务的目标不是改变物体的位置,而是操作炉灶旋钮。两段视频都记录了接近旋钮并把它转动的过程。
观察重点: 观察夹爪与旋钮的接触,以及旋钮随后的转动。
07 / 我们研究了什么
视频展示的是单个场景。研究看的则是场景背后:技能从哪里来、一次任务结束后留下什么、什么因素改变了下一次执行。
来自两个相关 LIBERO-Object 任务的十段演示被切分为 40 个预测阶段。有序角色/类型准确率为 1.000,20 个可观察的获取与释放效果全部得到确认。帧边界的表现要弱得多:精确帧 F1 为 0.10,放宽到两个采样帧之内为 0.90。这项研究有意限定在确定性视觉线索与类型化规则上,用来单独考察表示与验证机制,它清楚地分开了两件事:阶段顺序可以恢复,精确帧位置不能。
三条教师轨迹产生两个技能块:获取指定物体,按所需关系释放。在分离的评估状态上成功率 3/3,保存并重载后仍然是 3/3。在更远的 6–8 号状态上,路线会停在第一个缺失的语义效果处——正是这一点阻止了局部错误在任务中继续传播。
在线轨迹考察了两类决策:在碗放置任务中重规划剩余路线,以及在开抽屉任务的验证结果不确定时再看一次。另一组失败试验进一步定位了剩余尝试的问题所在:两次发生在运动规划之前,四次与路径一致性或标定有关,两次出现在夹爪闭合环节。
一项受控试验固定执行器、随机种子与预算,只增加学得的获取与释放技能块。相关任务的成功情况,是在这两个技能块入库之后才发生变化的,而执行器与评估条件始终未变。样本很小,因此论文把它记为方向性观察,而不是基准结论。
实验协议、定量结果和方法对比表请参阅论文。
阅读实验部分 ↗08 / 更长远的研究方向
这些研究跟踪了从示教任务到可复用技能的过程。下一个问题涉及更长的时间尺度:当这个过程在机器人的整个工作周期中反复发生时,会带来什么变化?
存储更多轨迹并不必然带来更多能力。只有能够在新场景中被检索、落实和组合的经验,才具有复用价值。Teach-and-Grow 假设将这种有效可复用经验与未来任务误差、示教需求的下降联系起来。它讨论的是终身能力积累,而当前实验还没有拟合出普适缩放定律。
↗ 放大AI 智能体获取行为时需要反复观察、推理与调用工具。这种细致处理适合机器人尚不熟悉的任务,成熟行为则由学习策略在“慢教师–快学生”的分工下执行。
在新任务上确实慢,而这个取舍是有意做的:推理放在子目标边界上,下面的执行器以完整频率跑连续控制。由此有三点。第一,成本本身在下降:每一代推理模型在同等能力上都更快、更便宜,提示缓存、工具调用批处理与更强的多模态感知也在持续减少一个任务所需的顺序调用次数,所以把推理放在语义边界上的架构会直接受益于这个趋势。第二,慢速获取正是 TGL 成为强数据来源的原因。一个能获取陌生操作任务的通用方法,在过程中会产出经过验证的轨迹:真实观察、真实动作、真实结果,而且已经对照明确的成功判据检查过。这正是小而快的策略、VLA 或 WAM 所需要的监督信号,覆盖的也正是最难人工采集的长尾条件,因此这套系统可以作为它此后要调用的那些快速模型的数据生成器。第三,两个层次处在不同位置,而不是互相竞争:AI 智能体层强而慢,负责新任务、罕见条件与数据采集;快速层窄而快,以策略速度执行成熟行为。数据从慢的一侧流向快的一侧;快速策略遇到能力之外的情况时,控制权回到 AI 智能体,由它诊断缺口并扩充技能库。
学习策略可以实现某个技能块、执行熟悉的技能组合,或成为未来的学生。几何规划器可以连接两个技能,视觉伺服可以完成局部闭环,触觉可以加强接触检查。TGL 提供语义契约与反馈结构,让这些组件共同服务于任务。
同样的思路也适用于示教来源。机器人轨迹、仿真、人类视频与书面操作流程提供不同类型的证据。手册可能揭示操作顺序,却没有解决抓取方式。架构保留这种区别:语义知识指导获取,机器人相关的场景落地与验证决定哪些行为真正能够运行。
确实有一些近期工作在相邻的环节上,论文中已经引用:LRLL、ASPIRE、SkillMemo、SCE 与 PACTS 研究终身技能获取、AI 智能体探索、记忆与组合复用,PhyAgentOS、AEROS 与 RoboBridge 则在构建机器人运行层。单个要素——技能库、AI 智能体工具调用、情景记忆、演示分解——都不是新的。TGL 是第一个把这种方法作为整体提出的系统:一个以 AI 智能体驱动的机器人通用操作系统,把稀疏示教、带适用范围与效果判据的显式闭环技能块、权重固定的执行、物理反馈与重新组合、结构化的失败记忆,以及持久积累,连接成同一个学习循环。相邻方法覆盖的是这个循环的一部分,所以这里的贡献是循环本身,以及各部分之间的接口。正是这种整体视角,才让更快收敛、验证后复用、经验跨任务与跨本体保留,以及作为快速策略的数据来源这些性质一起成立,而不是各自单独存在。
↗ 放大如果场景落地、验证、兼容性检查和检索成本保持可控,局部增加技能就可能避免重新更新整个学习系统。这些条件至关重要:不受限制的两两兼容性检查同样可能使技能库增长变得昂贵。论文分析不同的成本情形,而不把低成本增长视为自动成立。
↗ 放大09 / 论文与资源
论文包含问题定义、Skill Block 契约、LIBERO 与 LIBERO-Plus 评测、受控研究以及缩放假设,并在附录中给出成本模型与实验细节。
方法实现在 IRMVLab/TGL 仓库维护,安装与运行说明请见该仓库 README。
@misc{nie2026teachandgrow,
title = {Teach and Grow: An Agent-Centered Architecture for General Robot Learning},
author = {Nie, Chang and Liu, Zhe and Wang, Hesheng},
year = {2026},
eprint = {2608.17209},
archivePrefix = {arXiv},
primaryClass = {cs.RO},
doi = {10.48550/arXiv.2608.17209},
url = {https://arxiv.org/abs/2608.17209v2}
}术语表 / 关键术语
常见问题 / 问答
Teach and Grow(TGL)是一种面向通用机器人学习的免训练架构。预训练 AI 智能体把少量成功演示转化为显式、可复用的技能,机器人在预训练模型权重保持固定的前提下获得新的操作任务能力。
指获取当前任务的过程中不进行梯度更新、不做微调、也不包含强化学习阶段。AI 智能体及其专用模型本身可以是预训练好的;任务获取过程中改变的是显式的技能与记忆状态,而不是权重。
指通过策略更新修复机器人行为所付出的反复代价:新增数据采集、又一轮优化,以及对策略此前支持过的所有行为的回归检查。它之所以被称为“税”,是因为每遇到新任务、新传感器或新夹爪,这笔代价都会再次出现,并且随已有能力的增多而增大。
VLA 与世界动作模型通过采集更多机器人数据、优化策略参数来吸收新行为。TGL 则通过显式的 Skill Block 来修复和扩展行为。学习策略依然可以参与其中:它既可以充当技能块内部的执行器,也可以在今后作为接收已验证轨迹的学生。
Skill Block 是可复用行为的单元:包含目标、可复用策略、适用条件、兼容执行器与结果检验。被保留下来的是语义效果,而物理实现(物体绑定、抓取几何、无碰撞运动)则根据当前场景重新计算。例如,抓取类技能块不会仅凭“夹爪已闭合”就判定成功。
实现使用 OpenAI GPT-6 Astra 进行多模态推理,并使用 Codex 把 AI 智能体与机器人工具连接起来。检测、分割、RGB-D 几何、Contact-GraspNet、MPLib 与控制器负责物理落地与执行,并在 LIBERO 仿真套件中评测。
因为“完成一次任务”和“建立一套会持续变强的系统”是两件事。我们正是从那个实验开始的:让 AI 智能体通过感知、抓取、规划与控制工具直接驱动机器人,在完全不做示教的情况下完成了操作任务。没有发生的是积累。每一次执行都从零开始推理,成功的路线和奏效的抓取随着这一回合结束而消失,一个已经成熟的行为也不会在第二次变得更便宜。TGL 保留同一套 AI 智能体循环,改变的是结果的存放位置。一次成功的任务会被拆解为显式的 Skill Block,写明适用范围与效果判据,条件与修复方式进入经验记忆。此后 AI 智能体是检索已有技能,而不是重新推导一遍;因为子目标结构已经确定,收敛更快;经过验证的行为可以跨任务复用,积累下来的经验也能带到后续工作中。AI 智能体本身完全有能力独立解决任务,而这套架构的作用,是把那次一次性的成功变成一个会不断长大的系统,而不是一次用完即走的浪费。
自主探索是可行的,我们也跑过零样本的 AI 智能体控制,所以这是一种设计选择,不是能力上的限制。但它不适合作为默认做法,原因有两个。一是收敛慢:靠反复试错学会一个物理行为,要消耗大量机器人交互和大量顺序模型调用,因为每次尝试都需要一次新的决策。二是在真实场景中无限制地自主探索并不安全:探索动作就是物理动作,做错一次可能损坏物体、夹爪或场景。少样本示教改变的是起点,而不是目标:几条成功演示给出子目标顺序与值得检查的条件,探索就可以集中在演示没有覆盖的变化、纠错与恢复上。示教是加速器,不是前提。示教的来源同样是开放的。机器人轨迹、仿真、人类视频,以及一份书面操作流程都可以,因为只要能说明任务是如何完成的、完成后形成了什么,就能为这套结构提供种子。手册可能揭示操作顺序,却没有解决抓取方式;架构保留这种区分:语义知识指导获取,机器人相关的场景落实与验证决定哪些行为真正能够运行。
因为 AI 智能体自身的图像感知能力,精度不足以支撑实际操作。在我们的实验中发现,仅凭自身的图像理解,它可以完成简单任务:认出指的是哪个物体、给出大致的操作顺序、看出场景是否像目标状态。不可靠的地方是“测量”。6D 位姿、厘米级的间隙、被遮挡物体的边界、夹爪是否真的夹住了东西、一条路径会不会碰撞,这些都需要从一帧到下一帧都成立的度量结果,而通用模型读一张相机图像只能给出近似答案。专用工具补上这个缺口:检测与分割确定物体身份和边界,RGB-D 几何提供深度与位姿,抓取与运动规划给出无碰撞、可达的动作,控制器以所需频率维持闭环。AI 智能体因此可以腾出来做它擅长的事:组织任务、选择下一个子目标、读取执行结果、决定下一步。这种分工也让系统可维护,因为检测器是技能块内部可替换的组件,可以在技能块内替换并重新验证,而不必改动推理、技能库或整条流水线。
TGL 是一种以 AI 智能体驱动的、新的机器人通用操作系统,它与 VLA、世界动作模型(WAM)是配合关系,而不是替代关系。两者处在不同的层次上。VLA 与 WAM 依然是把感知转成快速连续控制的最强手段;TGL 提供它上面的运行层,负责决定下一个子目标是什么、这个场景该用哪种能力、刚才实际发生了什么、什么值得保留下来。在这种分工里,学习策略是系统调用的组件。一个在有限任务上训练好的策略,比如抓取某一类物体或打开某一种抽屉,可以注册为某个技能块的执行器:由 AI 智能体选择它、把它落实到当前场景、检查执行结果,并与其他技能块组合;当行为足够稳定之后,成熟的技能块也可以完全交给快速策略来跑。所以两者的关系是组合,而不是竞争。VLA 擅长的地方,TGL 直接使用它,并受益于它的每一次进步;任务是新的、少见的,或者落在策略训练分布之外时,AI 智能体就显式地补齐缺失的结构,而不必等下一轮训练。
在新任务上确实慢,而且这个取舍是有意做的:推理放在子目标边界上,下面的执行器以完整频率跑连续控制。由此有三点。第一,成本本身在下降:每一代推理模型在同等能力上都更快、更便宜,提示缓存、工具调用批处理与更强的多模态感知也在持续减少一个任务所需的顺序调用次数,所以把推理放在语义边界上的架构会直接受益于这个趋势。第二,慢速获取正是 TGL 成为强数据来源的原因。一个能获取陌生操作任务的通用方法,在过程中会产出经过验证的轨迹:真实观察、真实动作、真实结果,而且已经对照明确的成功判据检查过。这正是小而快的策略、VLA 或 WAM 所需要的监督信号,覆盖的也正是最难人工采集的长尾条件,因此这套系统可以作为它此后要调用的那些快速模型的数据生成器。第三,两个层次处在不同位置,而不是互相竞争:AI 智能体层强而慢,负责新任务、罕见条件与数据采集;快速层窄而快,以策略速度执行成熟行为。数据从慢的一侧流向快的一侧;快速策略遇到能力之外的情况时,控制权回到 AI 智能体,由它诊断缺口并扩充技能库。
确实有一些近期工作在相邻的环节上,论文中也已经引用:LRLL、ASPIRE、SkillMemo、SCE 与 PACTS 研究终身技能获取、AI 智能体探索、记忆与组合复用,PhyAgentOS、AEROS 与 RoboBridge 则在构建机器人运行层。单个要素,比如技能库、AI 智能体工具调用、情景记忆、演示分解,都不是新的,TGL 也不主张这些。TGL 是第一个把这种方法作为整体提出的系统:一个以 AI 智能体驱动的机器人通用操作系统,把稀疏示教、带适用范围与效果判据的显式闭环技能块、权重固定的执行、物理反馈与重新组合、结构化的失败记忆,以及持久积累,连接成同一个学习循环。相邻方法各自覆盖这个循环的一部分,所以这里的贡献是循环本身,以及各部分之间的接口。正是这种整体视角,才让那些实际性质得以成立:在新任务上更快收敛、复用已经验证过的行为而不是重新推导、让经验跨任务与跨本体保留下来,并作为快速策略的数据来源。