以 AI 智能体为中心的机器人学习 / 上海交通大学

基于 AI Agent 的机器人学习 · GPT-6 Astra + Codex

Teach and Grow.

An Agent-Centered Architecture
for General Robot Learning

Chang Nie ↗·Zhe Liu·Hesheng Wang

上海交通大学 自动化与感知学院

少量演示变成可复用的机器人技能,
而模型权重始终不变。

01 / TEACH少量演示子目标与共同结构
02 / ACT + VERIFYAI Agent + Skill Blocks以物理反馈形成闭环
03 / GROW技能与经验用于下一个任务
↖ 可复用知识回到下一次决策 ↵
PRETRAINED WEIGHTS / FIXEDEXECUTABLE EXPERIENCE / EVOLVING
概念封面:Franka 机器人在变化的场景中将毛绒玩具放入碗中;少量示教与智能体指导,对照 VLA/WAM 的数据和训练成本↗ 放大
场景变化,技能复用:通过少量示教与 AI 智能体指导,在模型权重固定的条件下适应任务。概念封面。

摘要 / 论文摘要

摘要

视觉-语言-动作(VLA)与世界动作模型通常需要通过追加机器人数据采集与策略优化,才能吸收不熟悉的操作任务;这种反复出现的再训练负担拖慢了新行为的获得。我们提出 Teach-and-Grow Learning(TGL),一种免训练架构,把少量成功演示转化为可复用的机器人技能。获取新任务不需要梯度更新、微调或强化学习:预训练模型权重保持固定,机器人在此前提下扩展其显式知识。我们的实现使用 OpenAI GPT-6 Astra 进行多模态推理,并用 Codex 把 AI 智能体与机器人工具连接起来。AI 智能体识别演示之间共享的子目标,将其表达为闭环的 Skill Block,并把每个块落实到当前场景。物理反馈引导下一步动作与恢复。经验证的行为进入持久化的 Skill Library;Experience Memory 记录影响后续决策的条件与修复。TGL 在四个 LIBERO 套件上达到 99.9% 的平均成功率,在七个 LIBERO-Plus 扰动类别上达到 92.4%。受控研究显示,在模型权重与执行器相同的条件下,已习得的技能块能够保留并改善相关任务的执行。我们还提出一个缩放假设,把有效可复用经验与未来任务误差、示教需求的下降联系起来。代码与演示视频:https://tgl.changnie.top。

关键词免训练机器人学习 · AI 智能体机器人学 · GPT-6 Astra · Codex · 少样本示教 · 视觉-语言-动作模型 · 终身学习 · 技能组合 · 具身智能

这项工作处在什么位置

Teach and Grow 属于具身智能与 AI 智能体机器人学(agentic robotics)的研究脉络,面向通用机器人操作。这一领域通常围绕两类方法组织:视觉-语言-动作(VLA)模型把感知与语言直接映射为控制,世界动作模型(WAM)进一步引入学习到的物理动态。两者都通过采集更多机器人数据、优化策略参数来吸收新能力。机器人基础模型为 TGL 提供先验;TGL 改变的是新任务知识存放的位置,先验的强弱则仍由基础模型决定。因此它的邻近方向包括少样本与稀疏示教方法、技能组合与技能库方法、终身学习与持续学习,以及基于 AI 智能体的机器人控制。

arXiv 预印本 · 上海交通大学 · 2026

01 / 问题从哪里来

端到端机器人学习的成本,卡在哪里?

一个新容器、一次相机位置变化,或一次不再奏效的抓取,可能只是很小的能力缺口;但为它付出的代价,往往会牵动整个学习系统。

通用机器人策略通过大规模观察–动作数据不断前进。视觉–语言–动作模型(VLA)把语义理解接到控制上,世界–动作模型(WAM)进一步引入学习到的物理动态。两条路线都通过训练把新能力写进模型参数;机器人面对陌生任务时,依靠的正是这份训练出来的先验。

物理交互数据的成本结构与文本、代码不同。它们大多只有在机器人或仿真运行之后才存在:接触需要观察,抓取需要尝试,碰撞风险需要处理,变化需要确认。而物体姿态、相机几何、杂乱程度、材质与机器人本体之间又会相互影响,覆盖其中一个因素,并不等于覆盖它们的组合。

如果通过更新策略来修复一次失败,通常要重新采集数据、再跑一轮优化,并对策略此前支持的所有行为做回归检查。我们把这种反复出现的负担称为 retraining tax(再训练成本)。它在长尾场景中格外明显:一种少见的接触条件、一件特殊的物体,需要的往往是一条具体经验,而不是又一轮宽泛的数据积累。

修复也难以局限在出问题的地方。如果 VLA 夹不稳一种陌生的碗,补充数据并更新参数之后,并不会留下一个可以单独检查和调用的“碗夹持修复模块”——改动分散在权重里,原有行为还得重新验证。换一个传感器或夹爪,同样的问题会在接口层重现:观测格式、标定与动作兼容性都需要重新验证。

长尾经验同样难以变成可复用的纠正。一段成功轨迹,可能恰好没有记录抓取失败之后真正起作用的那些条件;当经验只存在于参数中,失败条件、恢复规则与适用范围就无法被逐项检查和修改。TGL 正是从这个疑问出发:机器人能否把这些对象显式保留下来,并且只更新受影响的那部分行为?

TGL 尝试的是另一种更新机制。少量成功演示给出初始任务结构,机器人把它转成显式技能,通过执行来检验,再把有效的部分连同解释它的经验一起保留下来。预训练模型仍然提供先验,改变的是新任务知识存放的位置。

获取陌生行为的两种路径↗ 放大
论文中的概念对比:一侧通过策略优化获取新行为,另一侧通过显式技能构建与验证完成学习。

02 / 研究思路的形成

从“会规划”的 AI 智能体,到“能积累”的机器人。

这套架构源于一个很实际的问题:当多模态 AI 智能体理解了任务,却仍然无法可靠完成时,缺的到底是什么?

从大语言模型与 ChatGPT,到会调用工具的 AI 智能体

大语言模型(LLM)通过 ChatGPT、Claude 这类助手,把语言理解与推理带进了交互界面。Codex、Claude Code 等编程 AI 智能体则给出了一套很适合搬到机器人上的工作方式:查看当前状态、选择工具、执行、读取结果、修正计划。

TGL 把这个循环搬进了物理操作。相机图像对应工作区状态,感知、抓取与运动工具负责实际操作,新的观察报告动作改变了什么。AI 智能体依据这些信息选择下一个子目标与下一个工具——推理负责组织任务,专用机器人组件负责物理执行。

论文的实现使用 OpenAI GPT-6 Astra 做多模态推理,并以 Codex 作为 AI 智能体接口。ChatGPT 与 Claude 在这里只说明 LLM 的背景,Claude Code 用来说明编程 AI 智能体的工作方式。由此产生了后面的问题:当一次错误动作会改变真实物理状态时,这套工作方式还能保留多少?

01

直接从图像规划

最初,我们让多模态 AI 智能体直接根据机器人视角图像做规划。它能理解目标,但物理层面的缺口依然存在:精确深度、无碰撞运动、接触、高频控制。这次尝试让语义理解与“让计划真正跑起来”的机器人能力,分成了两件事。

02

加入工具,并让物理反馈回到决策中

随后,我们接入感知、抓取、规划与控制工具,并在每次短段执行后返回新的观察。当场景与计划不一致时,AI 智能体可以修改路线。结构化记忆保存了这次尝试的条件、结果与修复方式,让一次试错的价值超出它所在的回合。

03

用少量示教提供有效起点

工具调用使零样本 AI 智能体控制成为可行,但靠反复试错学会一个行为,仍然要消耗大量物理交互与模型调用。成功示教可以提前给出子目标序列,让探索集中在演示没有覆盖的变化、纠错与缺失环节上。这逐渐形成了 Teach-and-Grow 的路线。

教学相长

示教为探索提供初始结构,执行暴露示教尚未解决的问题,这些缺口又让下一次指导更有针对性。

为什么不直接让 AI 智能体自己把任务做完?

让 AI 智能体通过感知、抓取、规划与控制工具直接驱动机器人,是能够在完全不做示教的情况下完成操作任务的;我们跑过这个实验,这项工作也正是从这里开始的。它做不到的是积累。每一次执行都从零开始推理,奏效的路线和成功的抓取随着这一回合结束而消失,同一个任务下次仍然要用同样的代价再解一遍。TGL 保留这套 AI 智能体循环,改变的是结果的存放位置:一次成功的任务变成带适用范围与效果判据的显式 Skill Block,条件与修复方式进入经验记忆。此后 AI 智能体是检索而不是重新推导,因为子目标结构已经确定而收敛更快,经过验证的行为可以跨任务复用,积累的经验也能带到后面。这是“一个能解决任务的 AI 智能体”和“一套把解决结果留下来的系统”之间的区别。

为什么要示教?让机器人自主探索不是更好吗?

自主探索是可行的,零样本的 AI 智能体控制也真实成立,这一点我们跑过。但它不适合作为默认做法,原因有两个:它收敛慢,因为靠反复试错学会一个物理行为要消耗大量机器人交互和大量顺序模型调用;而且在真实硬件上不能放开来跑,因为探索动作就是物理动作,可能损坏物体、夹爪或场景。示教改变的是起点,而不是目标:几条成功演示给出子目标顺序与值得检查的条件,探索就可以集中在演示没有覆盖的变化、纠错与恢复上。示教是加速器,不是前提,它的来源也是开放的。机器人轨迹、仿真、人类视频以及一份书面操作流程都可以,因为只要能说明任务是如何完成的、完成后形成了什么,就能为这套结构提供种子。

示教缩小了寻找有效初始计划的范围。接下来的问题是:要从中保留什么——一次成功回合的记录,还是能够在别的场景里重新落实并执行的行为?

03 / 核心思路

把“可执行的能力”本身作为学习对象。

一次演示里其实有两样东西:值得保留的策略,以及只属于那个场景的物理细节。TGL 把它们分开。

以“把碗放到盘子上”为例。不同演示里,接近方向与运动轨迹可以完全不同,但共同结构更稳定:拿到指定的碗,确认它被夹持,朝目标关系移动,再把它释放到盘子上。

TGL 用 Skill Block 表示一次有意义的状态变化。技能块保留目标、可复用策略、适用条件与效果判据;实际的物体姿态、抓取、路径和控制目标来自当前观察。复用时保留的是预期效果,物理实现则可以随场景改变。

这里的 training-free 含义很明确:获取当前任务的过程不包含梯度更新、微调或强化学习阶段。AI 智能体与专用模型可以已经是预训练好的;获取过程中改变的是显式的技能与记忆状态。

θ
预训练模型权重任务获取过程中保持固定
FIXED
B
Skill Library可执行行为、适用范围与契约
GROWS
M
Experience Memory条件、结果、诊断与修复
GROWS

完成任务后,机器人留下可以检索、检查和再次执行的能力。

这套操作系统会取代 VLA 与世界动作模型吗?

不会,也没有这样设计。TGL 是一种以 AI 智能体驱动的、新的机器人通用操作系统,而它所组织的那些模型,依然是把感知转成快速连续控制的最强手段。在这种分工里,训练好的策略是系统调用的组件:一个能够稳定抓取某一类物体、或打开某一种抽屉的策略,可以注册为某个技能块的执行器,由 AI 智能体选择它、把它落实到当前场景、检查执行结果,并与其他技能块组合。VLA 擅长的地方,TGL 直接使用它,并受益于它的每一次进步;任务是新的、少见的,或者落在策略训练分布之外时,AI 智能体就显式地补齐缺失的结构,而不必等下一轮训练。两者处在技术栈的不同层次上,是互补关系,而不是同一个位置上的竞争。

RETAIN

语义效果与策略

什么需要改变、先后顺序如何、适用于哪些条件。

×
RECOMPUTE

当前物理实现

物体绑定、抓取几何、无碰撞运动与具体控制。

这种分离界定了“要学什么”。要让它在一台机器人上跑起来,还需另一层连接:每个保留下来的子目标都要能变成当前场景中的动作,而每个动作都要返回足以改变下一步决策的信息。

04 / 架构内部

上层围绕子目标推理,下层完成几何与控制。

AI 智能体在有意义的状态变化处组织任务;每个技能块内部,由专用执行器处理几何与连续控制。

TGL 的示教、智能体执行与持久积累↗ 放大
一个任务经历示教、组合、执行、验证与持久化。形成的技能库与经验记忆成为下一个任务的起点。
A

把演示读成状态变化的证据

系统在“拿到物体”“形成容纳关系”这类有意义的事件处切开演示。片段按完成的效果对齐,即使时间与动作方式不同。共同结构成为候选策略,演示之间的差异决定这个策略可以被主张的范围有多大:只有单个物体的例子时,它就只适用于那个物体,除非有更多证据支持更宽的范围。

B

让每个技能与当前场景建立明确契约

每个技能块要回答几个很实际的问题:期望什么效果?什么时候适用?需要什么证据?哪些执行器能实现?如何观察成功?允许什么恢复动作?以抓取为例,夹爪闭合并不足以说明物体已被夹住,验证必须指向预期的物理效果。

C

机器人动作后,再决定剩余计划

当前计划是一组有序的技能块,尚未执行的部分是可以改的。效果通过,进入下一阶段;效果失败或不确定,就可能需要再次观察、换一个执行器,或者修改路线。AI 智能体的推理在这里与物理反馈相接:下一步取决于刚才真正发生了什么。

D

验证通过后,候选行为才进入复用流程

有希望的候选行为要在示教之外的场景中评估。支持范围、执行器兼容性、效果判据与恢复方式都要先检查,通过后才进入技能库;不够可靠的候选会被缩小范围或修复。技能库的增长因此是对“一个行为及其生效条件”的一次明确判断,而不是每个回合自动累积的结果。

Skill Block 的字段与运行时闭环↗ 放大
技能契约连接语义子目标、落实到当前场景的执行,以及可观察的结果证据。
一个贯穿方法的概念示例

“把碗放到盘子上。”

看看哪些信息被保留,哪些决策需要根据当前场景重新做出。

理解示教

获取 → 搬运 → 释放

演示提供子目标与顺序,也揭示需要检查的条件,例如搬运前应保持对碗的夹持。原始像素坐标和精确轨迹不属于可复用策略。

落实到当前场景

当前目标碗 → 可行抓取

技能块将任务中的目标物体绑定到当前观察,由兼容的抓取和运动后端计算具体动作。接触位置可以与教师不同,但希望达到的“已获得物体”状态保持一致。

读取动作结果

物理效果 → 继续/再观察/修复

执行后,验证器检查碗是否确实被夹持。不牢固或失败的抓取会改变下一步决策,AI 智能体可以再次观察,或在放置前修改剩余路线。

保留可复用经验

已验证行为 + 有用的条件信息

通过验证的可执行策略及其范围进入技能库。这次尝试的条件、结果和有用的修复方式进入经验记忆,后续任务可以同时检索两者。

为什么还要调用目标检测这类外部工具?AI 智能体自己不是能看图吗?

因为 AI 智能体自身的图像感知,精度不足以支撑操作。在我们的实验中,仅凭自己的图像理解,它可以完成简单任务:指的是哪个物体、大致的操作顺序、场景是否像目标状态。不可靠的地方是“测量”。6D 位姿、厘米级的间隙、被遮挡物体的边界、夹爪是否真的夹住了东西、一条路径会不会碰撞,这些都需要从一帧到下一帧都成立的度量结果,而通用模型读一张相机图像只能给出近似答案。检测与分割确定物体身份和边界,RGB-D 几何提供深度与位姿,抓取与运动规划给出无碰撞、可达的动作,控制器以所需频率维持闭环。AI 智能体因此可以腾出来组织任务、选择下一个子目标、读取执行结果、决定下一步。由于每个工具都处在技能块内部,换上更好的检测器也可以重新验证,而不打扰上层的推理与技能库。

论文当前系统使用 OpenAI GPT-6 Astra 和 Codex 进行任务级推理与工具交互。检测、分割、RGB-D 几何、Contact-GraspNet、MPLib 与控制器负责物理场景落地和执行。

05 / 机器人留下了什么

技能保存行为,记忆保存使用它的经验。

完成一次任务与获得持久能力,是两件事。TGL 把需要保留的两类对象分开。

B / EXECUTABLE

Skill Library

技能库保存能够被选择并运行的行为:子目标、适用条件、场景落实规则、兼容工具与验证逻辑。单有一句“如何抓取”的描述并不够,技能块还必须把意图接到执行器,以及一个能检验效果的判据上。

M / CONTEXTUAL

Experience Memory

经验记忆保存的是使用情境:任务、选中的技能块、观察、结果、诊断与修复。一次失败可能暴露出不合适的抓取方式,或一次含糊的观察;把这些解释保留下来,就能指导下一次选择,而不必把每个回合都变成新的可执行技能。

这种分离也让系统保持可检查。人可以收窄过宽的范围、修改恢复规则,或把某个工具版本标为不兼容。保存了文件,不等于保留了行为能力:系统仍然要检索到正确的技能块、把它落实到当前传感信息上,并成功执行——对一个长期学习的机器人来说,这是几个分别需要回答的问题。

下面的对照视频把这个过程直接呈现出来:先看教师给出的任务结构,再看 TGL 如何用不同的抓取达到同样的结果,以及第一次没能夹稳物体时它会怎么做。

06 / 场景中的行为

理解任务,灵活执行。

五组 LIBERO 视频把教师演示与 Teach and Grow 放在同一任务上对照,覆盖三类套件:Object(把指定物体放入篮子)、Spatial(把物体放到与另一物体的空间关系中)与 Goal(达成某个状态,例如打开炉灶)。

左:教师 · 右:TGL · 点击播放

这些是仿真中的定性示例。视频时长不同,同时播放只统一起点,不对齐具体动作;播放倍速针对原视频,不代表实测机器人延迟。

OBJECT /01

同一个目标,不同的抓取方式

将汤罐放入篮子

抓取适应
教师演示
Teach and Grow · 我们的方法

教师演示提供任务结构:拿到罐子、搬运、放入篮子。TGL 采用了不同的接近方向与抓取方式,仍然完成同一结果——保留下来的是策略,而不是动作本身。

观察重点: 观察抬起罐子前,两侧的接近方向和夹爪朝向。

SPATIAL /02

换一个接触位置,完成同一子目标

将碗放到盘子上

场景适应
教师演示
Teach and Grow · 我们的方法

TGL 抓取碗沿的位置与教师不同。子目标没有变,接触位置则是根据机器人当前看到的场景重新计算出来的。

观察重点: 对照两段视频中夹爪与碗沿的接触位置。

SPATIAL /03

抓取未成功,观察后再次尝试

将柜子上的碗移到盘子上

反馈纠错
教师演示
Teach and Grow · 我们的方法

第一次抓取未能夹稳碗。在这段系统视频中,TGL 重新尝试并完成放置——一次由抬起失败后的观察所触发的恢复。

观察重点: 留意第一次抬起尝试,以及随后重新接近、抓取和搬运的过程。

OBJECT /04

从演示中的步骤到自主执行

将沙拉酱瓶放入篮子

技能执行
教师演示
Teach and Grow · 我们的方法

教师与 TGL 都完成瓶子的搬运。换一个物体之后,同样的三个阶段依然成立:获取、运输、释放。

观察重点: 观察从初始抓取到篮子上方释放的完整过程。

GOAL /05

将任务目标变成可观察的物理变化

旋转旋钮,打开炉灶

关节式物体操控
教师演示
Teach and Grow · 我们的方法

这项任务的目标不是改变物体的位置,而是操作炉灶旋钮。两段视频都记录了接近旋钮并把它转动的过程。

观察重点: 观察夹爪与旋钮的接触,以及旋钮随后的转动。

07 / 我们研究了什么

四项研究,考察机制本身的行为。

视频展示的是单个场景。研究看的则是场景背后:技能从哪里来、一次任务结束后留下什么、什么因素改变了下一次执行。

从演示到语义效果

来自两个相关 LIBERO-Object 任务的十段演示被切分为 40 个预测阶段。有序角色/类型准确率为 1.000,20 个可观察的获取与释放效果全部得到确认。帧边界的表现要弱得多:精确帧 F1 为 0.10,放宽到两个采样帧之内为 0.90。这项研究有意限定在确定性视觉线索与类型化规则上,用来单独考察表示与验证机制,它清楚地分开了两件事:阶段顺序可以恢复,精确帧位置不能。

从候选行为到持久技能

三条教师轨迹产生两个技能块:获取指定物体,按所需关系释放。在分离的评估状态上成功率 3/3,保存并重载后仍然是 3/3。在更远的 6–8 号状态上,路线会停在第一个缺失的语义效果处——正是这一点阻止了局部错误在任务中继续传播。

从物理反馈到修正决策

在线轨迹考察了两类决策:在碗放置任务中重规划剩余路线,以及在开抽屉任务的验证结果不确定时再看一次。另一组失败试验进一步定位了剩余尝试的问题所在:两次发生在运动规划之前,四次与路径一致性或标定有关,两次出现在夹爪闭合环节。

从技能库扩充到相关任务复用

一项受控试验固定执行器、随机种子与预算,只增加学得的获取与释放技能块。相关任务的成功情况,是在这两个技能块入库之后才发生变化的,而执行器与评估条件始终未变。样本很小,因此论文把它记为方向性观察,而不是基准结论。

实验协议、定量结果和方法对比表请参阅论文。

阅读实验部分 ↗

08 / 更长远的研究方向

让机器人真正能够复用的经验持续增长。

这些研究跟踪了从示教任务到可复用技能的过程。下一个问题涉及更长的时间尺度:当这个过程在机器人的整个工作周期中反复发生时,会带来什么变化?

存储更多轨迹并不必然带来更多能力。只有能够在新场景中被检索、落实和组合的经验,才具有复用价值。Teach-and-Grow 假设将这种有效可复用经验与未来任务误差、示教需求的下降联系起来。它讨论的是终身能力积累,而当前实验还没有拟合出普适缩放定律。

Teach-and-Grow 缩放假设与未来快速策略路径↗ 放大
概念性预测:可复用经验的积累,有望降低未来任务误差和相关任务的示教需求。曲线为示意。

对陌生行为进行细致获取,让熟悉行为高效执行。

AI 智能体获取行为时需要反复观察、推理与调用工具。这种细致处理适合机器人尚不熟悉的任务,成熟行为则由学习策略在“慢教师–快学生”的分工下执行。

靠 AI 智能体驱动比策略慢,这个问题怎么处理?

在新任务上确实慢,而这个取舍是有意做的:推理放在子目标边界上,下面的执行器以完整频率跑连续控制。由此有三点。第一,成本本身在下降:每一代推理模型在同等能力上都更快、更便宜,提示缓存、工具调用批处理与更强的多模态感知也在持续减少一个任务所需的顺序调用次数,所以把推理放在语义边界上的架构会直接受益于这个趋势。第二,慢速获取正是 TGL 成为强数据来源的原因。一个能获取陌生操作任务的通用方法,在过程中会产出经过验证的轨迹:真实观察、真实动作、真实结果,而且已经对照明确的成功判据检查过。这正是小而快的策略、VLA 或 WAM 所需要的监督信号,覆盖的也正是最难人工采集的长尾条件,因此这套系统可以作为它此后要调用的那些快速模型的数据生成器。第三,两个层次处在不同位置,而不是互相竞争:AI 智能体层强而慢,负责新任务、罕见条件与数据采集;快速层窄而快,以策略速度执行成熟行为。数据从慢的一侧流向快的一侧;快速策略遇到能力之外的情况时,控制权回到 AI 智能体,由它诊断缺口并扩充技能库。

VLA、WAM 与经典机器人方法都可以进入这一系统。

学习策略可以实现某个技能块、执行熟悉的技能组合,或成为未来的学生。几何规划器可以连接两个技能,视觉伺服可以完成局部闭环,触觉可以加强接触检查。TGL 提供语义契约与反馈结构,让这些组件共同服务于任务。

同样的思路也适用于示教来源。机器人轨迹、仿真、人类视频与书面操作流程提供不同类型的证据。手册可能揭示操作顺序,却没有解决抓取方式。架构保留这种区别:语义知识指导获取,机器人相关的场景落地与验证决定哪些行为真正能够运行。

好像已经有方法和我们类似,TGL 新在哪里?

确实有一些近期工作在相邻的环节上,论文中已经引用:LRLL、ASPIRE、SkillMemo、SCE 与 PACTS 研究终身技能获取、AI 智能体探索、记忆与组合复用,PhyAgentOS、AEROS 与 RoboBridge 则在构建机器人运行层。单个要素——技能库、AI 智能体工具调用、情景记忆、演示分解——都不是新的。TGL 是第一个把这种方法作为整体提出的系统:一个以 AI 智能体驱动的机器人通用操作系统,把稀疏示教、带适用范围与效果判据的显式闭环技能块、权重固定的执行、物理反馈与重新组合、结构化的失败记忆,以及持久积累,连接成同一个学习循环。相邻方法覆盖的是这个循环的一部分,所以这里的贡献是循环本身,以及各部分之间的接口。正是这种整体视角,才让更快收敛、验证后复用、经验跨任务与跨本体保留,以及作为快速策略的数据来源这些性质一起成立,而不是各自单独存在。

TGL 生态中的模型、工具、示教来源与反馈↗ 放大
系统整体视角。虚线路径表示流向快速策略训练与多机器人共享的轨迹。

为什么局部技能更新可能改变能力获取成本

如果场景落地、验证、兼容性检查和检索成本保持可控,局部增加技能就可能避免重新更新整个学习系统。这些条件至关重要:不受限制的两两兼容性检查同样可能使技能库增长变得昂贵。论文分析不同的成本情形,而不把低成本增长视为自动成立。

条件性的能力获取成本模型↗ 放大
在不同覆盖需求与局部兼容性假设下的分析性成本情形。

09 / 论文与资源

阅读全文。

论文包含问题定义、Skill Block 契约、LIBERO 与 LIBERO-Plus 评测、受控研究以及缩放假设,并在附录中给出成本模型与实验细节。

阅读论文 · arXiv ↗

方法实现在 IRMVLab/TGL 仓库维护,安装与运行说明请见该仓库 README。

BibTeX

@misc{nie2026teachandgrow,
  title = {Teach and Grow: An Agent-Centered Architecture for General Robot Learning},
  author = {Nie, Chang and Liu, Zhe and Wang, Hesheng},
  year = {2026},
  eprint = {2608.17209},
  archivePrefix = {arXiv},
  primaryClass = {cs.RO},
  doi = {10.48550/arXiv.2608.17209},
  url = {https://arxiv.org/abs/2608.17209v2}
}

术语表 / 关键术语

关键术语

Teach-and-Grow Learning(TGL)
一种免训练的机器人学习架构:在预训练模型权重保持固定的前提下,把少量成功演示转化为可复用、可验证的技能。新任务知识存放在技能与记忆存储中,而不是写进权重。
免训练机器人学习
在没有梯度更新、微调或强化学习的情况下获得新的机器人能力。预训练权重保持固定,新任务知识存放在显式的技能库与经验记忆中。
Skill Block(技能块)
TGL 中可复用机器人行为的单元:目标、可复用策略、适用条件、兼容执行器与结果检验。语义效果被保留,物理实现则根据当前场景重新计算。判定成功的是这个效果本身,因此夹爪闭合并不能让一个抓取类技能块自动通过验证。
Skill Library(技能库)
经验证的 Skill Block 的持久化存储,包含其适用范围、契约与执行器兼容性。它在验证之后才增长,而非每个回合都增长;因此保存了文件,也不等于保留了行为能力。
Experience Memory(经验记忆)
记录一次尝试的任务、所选技能块、观测、结果、诊断与修复的上下文存储,使后续决策既能复用行为,也能复用条件。
再训练成本(retraining tax)
通过策略更新修复机器人行为所带来的反复成本:新增数据采集、优化,以及对既有能力的回归验证。

常见问题 / 问答

方法问答

Teach and Grow 是什么?

Teach and Grow(TGL)是一种面向通用机器人学习的免训练架构。预训练 AI 智能体把少量成功演示转化为显式、可复用的技能,机器人在预训练模型权重保持固定的前提下获得新的操作任务能力。

这里的“免训练”具体指什么?

指获取当前任务的过程中不进行梯度更新、不做微调、也不包含强化学习阶段。AI 智能体及其专用模型本身可以是预训练好的;任务获取过程中改变的是显式的技能与记忆状态,而不是权重。

什么是“再训练成本”(retraining tax)?

指通过策略更新修复机器人行为所付出的反复代价:新增数据采集、又一轮优化,以及对策略此前支持过的所有行为的回归检查。它之所以被称为“税”,是因为每遇到新任务、新传感器或新夹爪,这笔代价都会再次出现,并且随已有能力的增多而增大。

这与训练 VLA 或世界动作模型有什么不同?

VLA 与世界动作模型通过采集更多机器人数据、优化策略参数来吸收新行为。TGL 则通过显式的 Skill Block 来修复和扩展行为。学习策略依然可以参与其中:它既可以充当技能块内部的执行器,也可以在今后作为接收已验证轨迹的学生。

什么是 Skill Block?

Skill Block 是可复用行为的单元:包含目标、可复用策略、适用条件、兼容执行器与结果检验。被保留下来的是语义效果,而物理实现(物体绑定、抓取几何、无碰撞运动)则根据当前场景重新计算。例如,抓取类技能块不会仅凭“夹爪已闭合”就判定成功。

实现使用了什么机器人与 AI 智能体?

实现使用 OpenAI GPT-6 Astra 进行多模态推理,并使用 Codex 把 AI 智能体与机器人工具连接起来。检测、分割、RGB-D 几何、Contact-GraspNet、MPLib 与控制器负责物理落地与执行,并在 LIBERO 仿真套件中评测。

为什么不直接用 GPT、Codex、Claude Code 这类 AI 智能体一次性完成机器人操作任务?

因为“完成一次任务”和“建立一套会持续变强的系统”是两件事。我们正是从那个实验开始的:让 AI 智能体通过感知、抓取、规划与控制工具直接驱动机器人,在完全不做示教的情况下完成了操作任务。没有发生的是积累。每一次执行都从零开始推理,成功的路线和奏效的抓取随着这一回合结束而消失,一个已经成熟的行为也不会在第二次变得更便宜。TGL 保留同一套 AI 智能体循环,改变的是结果的存放位置。一次成功的任务会被拆解为显式的 Skill Block,写明适用范围与效果判据,条件与修复方式进入经验记忆。此后 AI 智能体是检索已有技能,而不是重新推导一遍;因为子目标结构已经确定,收敛更快;经过验证的行为可以跨任务复用,积累下来的经验也能带到后续工作中。AI 智能体本身完全有能力独立解决任务,而这套架构的作用,是把那次一次性的成功变成一个会不断长大的系统,而不是一次用完即走的浪费。

为什么要用少样本示教?让机器人自主探索不好吗?

自主探索是可行的,我们也跑过零样本的 AI 智能体控制,所以这是一种设计选择,不是能力上的限制。但它不适合作为默认做法,原因有两个。一是收敛慢:靠反复试错学会一个物理行为,要消耗大量机器人交互和大量顺序模型调用,因为每次尝试都需要一次新的决策。二是在真实场景中无限制地自主探索并不安全:探索动作就是物理动作,做错一次可能损坏物体、夹爪或场景。少样本示教改变的是起点,而不是目标:几条成功演示给出子目标顺序与值得检查的条件,探索就可以集中在演示没有覆盖的变化、纠错与恢复上。示教是加速器,不是前提。示教的来源同样是开放的。机器人轨迹、仿真、人类视频,以及一份书面操作流程都可以,因为只要能说明任务是如何完成的、完成后形成了什么,就能为这套结构提供种子。手册可能揭示操作顺序,却没有解决抓取方式;架构保留这种区分:语义知识指导获取,机器人相关的场景落实与验证决定哪些行为真正能够运行。

为什么还要调用目标检测这类外部工具?AI 智能体自己不是能看图吗?

因为 AI 智能体自身的图像感知能力,精度不足以支撑实际操作。在我们的实验中发现,仅凭自身的图像理解,它可以完成简单任务:认出指的是哪个物体、给出大致的操作顺序、看出场景是否像目标状态。不可靠的地方是“测量”。6D 位姿、厘米级的间隙、被遮挡物体的边界、夹爪是否真的夹住了东西、一条路径会不会碰撞,这些都需要从一帧到下一帧都成立的度量结果,而通用模型读一张相机图像只能给出近似答案。专用工具补上这个缺口:检测与分割确定物体身份和边界,RGB-D 几何提供深度与位姿,抓取与运动规划给出无碰撞、可达的动作,控制器以所需频率维持闭环。AI 智能体因此可以腾出来做它擅长的事:组织任务、选择下一个子目标、读取执行结果、决定下一步。这种分工也让系统可维护,因为检测器是技能块内部可替换的组件,可以在技能块内替换并重新验证,而不必改动推理、技能库或整条流水线。

TGL 和 VLA、WAM(世界动作模型)是什么关系?

TGL 是一种以 AI 智能体驱动的、新的机器人通用操作系统,它与 VLA、世界动作模型(WAM)是配合关系,而不是替代关系。两者处在不同的层次上。VLA 与 WAM 依然是把感知转成快速连续控制的最强手段;TGL 提供它上面的运行层,负责决定下一个子目标是什么、这个场景该用哪种能力、刚才实际发生了什么、什么值得保留下来。在这种分工里,学习策略是系统调用的组件。一个在有限任务上训练好的策略,比如抓取某一类物体或打开某一种抽屉,可以注册为某个技能块的执行器:由 AI 智能体选择它、把它落实到当前场景、检查执行结果,并与其他技能块组合;当行为足够稳定之后,成熟的技能块也可以完全交给快速策略来跑。所以两者的关系是组合,而不是竞争。VLA 擅长的地方,TGL 直接使用它,并受益于它的每一次进步;任务是新的、少见的,或者落在策略训练分布之外时,AI 智能体就显式地补齐缺失的结构,而不必等下一轮训练。

靠 AI 智能体驱动,速度太慢怎么办?

在新任务上确实慢,而且这个取舍是有意做的:推理放在子目标边界上,下面的执行器以完整频率跑连续控制。由此有三点。第一,成本本身在下降:每一代推理模型在同等能力上都更快、更便宜,提示缓存、工具调用批处理与更强的多模态感知也在持续减少一个任务所需的顺序调用次数,所以把推理放在语义边界上的架构会直接受益于这个趋势。第二,慢速获取正是 TGL 成为强数据来源的原因。一个能获取陌生操作任务的通用方法,在过程中会产出经过验证的轨迹:真实观察、真实动作、真实结果,而且已经对照明确的成功判据检查过。这正是小而快的策略、VLA 或 WAM 所需要的监督信号,覆盖的也正是最难人工采集的长尾条件,因此这套系统可以作为它此后要调用的那些快速模型的数据生成器。第三,两个层次处在不同位置,而不是互相竞争:AI 智能体层强而慢,负责新任务、罕见条件与数据采集;快速层窄而快,以策略速度执行成熟行为。数据从慢的一侧流向快的一侧;快速策略遇到能力之外的情况时,控制权回到 AI 智能体,由它诊断缺口并扩充技能库。

好像已经有方法和你们类似,TGL 新在哪里?

确实有一些近期工作在相邻的环节上,论文中也已经引用:LRLL、ASPIRE、SkillMemo、SCE 与 PACTS 研究终身技能获取、AI 智能体探索、记忆与组合复用,PhyAgentOS、AEROS 与 RoboBridge 则在构建机器人运行层。单个要素,比如技能库、AI 智能体工具调用、情景记忆、演示分解,都不是新的,TGL 也不主张这些。TGL 是第一个把这种方法作为整体提出的系统:一个以 AI 智能体驱动的机器人通用操作系统,把稀疏示教、带适用范围与效果判据的显式闭环技能块、权重固定的执行、物理反馈与重新组合、结构化的失败记忆,以及持久积累,连接成同一个学习循环。相邻方法各自覆盖这个循环的一部分,所以这里的贡献是循环本身,以及各部分之间的接口。正是这种整体视角,才让那些实际性质得以成立:在新任务上更快收敛、复用已经验证过的行为而不是重新推导、让经验跨任务与跨本体保留下来,并作为快速策略的数据来源。