常见问题

Teach and Grow 是什么?

Teach and Grow(TGL)是一种面向通用机器人学习的免训练架构。预训练 AI 智能体把少量成功演示转化为显式、可复用的技能,机器人在预训练模型权重保持固定的前提下获得新的操作任务能力。

这里的“免训练”具体指什么?

指获取当前任务的过程中不进行梯度更新、不做微调、也不包含强化学习阶段。AI 智能体及其专用模型本身可以是预训练好的;任务获取过程中改变的是显式的技能与记忆状态,而不是权重。

什么是“再训练成本”(retraining tax)?

指通过策略更新修复机器人行为所付出的反复代价:新增数据采集、又一轮优化,以及对策略此前支持过的所有行为的回归检查。它之所以被称为“税”,是因为每遇到新任务、新传感器或新夹爪,这笔代价都会再次出现,并且随已有能力的增多而增大。

这与训练 VLA 或世界动作模型有什么不同?

VLA 与世界动作模型通过采集更多机器人数据、优化策略参数来吸收新行为。TGL 则通过显式的 Skill Block 来修复和扩展行为。学习策略依然可以参与其中:它既可以充当技能块内部的执行器,也可以在今后作为接收已验证轨迹的学生。

什么是 Skill Block?

Skill Block 是可复用行为的单元:包含目标、可复用策略、适用条件、兼容执行器与结果检验。被保留下来的是语义效果,而物理实现(物体绑定、抓取几何、无碰撞运动)则根据当前场景重新计算。例如,抓取类技能块不会仅凭“夹爪已闭合”就判定成功。

实现使用了什么机器人与 AI 智能体?

实现使用 OpenAI GPT-6 Astra 进行多模态推理,并使用 Codex 把 AI 智能体与机器人工具连接起来。检测、分割、RGB-D 几何、Contact-GraspNet、MPLib 与控制器负责物理落地与执行,并在 LIBERO 仿真套件中评测。

为什么不直接用 GPT、Codex、Claude Code 这类 AI 智能体一次性完成机器人操作任务?

因为“完成一次任务”和“建立一套会持续变强的系统”是两件事。我们正是从那个实验开始的:让 AI 智能体通过感知、抓取、规划与控制工具直接驱动机器人,在完全不做示教的情况下完成了操作任务。没有发生的是积累。每一次执行都从零开始推理,成功的路线和奏效的抓取随着这一回合结束而消失,一个已经成熟的行为也不会在第二次变得更便宜。TGL 保留同一套 AI 智能体循环,改变的是结果的存放位置。一次成功的任务会被拆解为显式的 Skill Block,写明适用范围与效果判据,条件与修复方式进入经验记忆。此后 AI 智能体是检索已有技能,而不是重新推导一遍;因为子目标结构已经确定,收敛更快;经过验证的行为可以跨任务复用,积累下来的经验也能带到后续工作中。AI 智能体本身完全有能力独立解决任务,而这套架构的作用,是把那次一次性的成功变成一个会不断长大的系统,而不是一次用完即走的浪费。

为什么要用少样本示教?让机器人自主探索不好吗?

自主探索是可行的,我们也跑过零样本的 AI 智能体控制,所以这是一种设计选择,不是能力上的限制。但它不适合作为默认做法,原因有两个。一是收敛慢:靠反复试错学会一个物理行为,要消耗大量机器人交互和大量顺序模型调用,因为每次尝试都需要一次新的决策。二是在真实场景中无限制地自主探索并不安全:探索动作就是物理动作,做错一次可能损坏物体、夹爪或场景。少样本示教改变的是起点,而不是目标:几条成功演示给出子目标顺序与值得检查的条件,探索就可以集中在演示没有覆盖的变化、纠错与恢复上。示教是加速器,不是前提。示教的来源同样是开放的。机器人轨迹、仿真、人类视频,以及一份书面操作流程都可以,因为只要能说明任务是如何完成的、完成后形成了什么,就能为这套结构提供种子。手册可能揭示操作顺序,却没有解决抓取方式;架构保留这种区分:语义知识指导获取,机器人相关的场景落实与验证决定哪些行为真正能够运行。

为什么还要调用目标检测这类外部工具?AI 智能体自己不是能看图吗?

因为 AI 智能体自身的图像感知能力,精度不足以支撑实际操作。在我们的实验中发现,仅凭自身的图像理解,它可以完成简单任务:认出指的是哪个物体、给出大致的操作顺序、看出场景是否像目标状态。不可靠的地方是“测量”。6D 位姿、厘米级的间隙、被遮挡物体的边界、夹爪是否真的夹住了东西、一条路径会不会碰撞,这些都需要从一帧到下一帧都成立的度量结果,而通用模型读一张相机图像只能给出近似答案。专用工具补上这个缺口:检测与分割确定物体身份和边界,RGB-D 几何提供深度与位姿,抓取与运动规划给出无碰撞、可达的动作,控制器以所需频率维持闭环。AI 智能体因此可以腾出来做它擅长的事:组织任务、选择下一个子目标、读取执行结果、决定下一步。这种分工也让系统可维护,因为检测器是技能块内部可替换的组件,可以在技能块内替换并重新验证,而不必改动推理、技能库或整条流水线。

TGL 和 VLA、WAM(世界动作模型)是什么关系?

TGL 是一种以 AI 智能体驱动的、新的机器人通用操作系统,它与 VLA、世界动作模型(WAM)是配合关系,而不是替代关系。两者处在不同的层次上。VLA 与 WAM 依然是把感知转成快速连续控制的最强手段;TGL 提供它上面的运行层,负责决定下一个子目标是什么、这个场景该用哪种能力、刚才实际发生了什么、什么值得保留下来。在这种分工里,学习策略是系统调用的组件。一个在有限任务上训练好的策略,比如抓取某一类物体或打开某一种抽屉,可以注册为某个技能块的执行器:由 AI 智能体选择它、把它落实到当前场景、检查执行结果,并与其他技能块组合;当行为足够稳定之后,成熟的技能块也可以完全交给快速策略来跑。所以两者的关系是组合,而不是竞争。VLA 擅长的地方,TGL 直接使用它,并受益于它的每一次进步;任务是新的、少见的,或者落在策略训练分布之外时,AI 智能体就显式地补齐缺失的结构,而不必等下一轮训练。

靠 AI 智能体驱动,速度太慢怎么办?

在新任务上确实慢,而且这个取舍是有意做的:推理放在子目标边界上,下面的执行器以完整频率跑连续控制。由此有三点。第一,成本本身在下降:每一代推理模型在同等能力上都更快、更便宜,提示缓存、工具调用批处理与更强的多模态感知也在持续减少一个任务所需的顺序调用次数,所以把推理放在语义边界上的架构会直接受益于这个趋势。第二,慢速获取正是 TGL 成为强数据来源的原因。一个能获取陌生操作任务的通用方法,在过程中会产出经过验证的轨迹:真实观察、真实动作、真实结果,而且已经对照明确的成功判据检查过。这正是小而快的策略、VLA 或 WAM 所需要的监督信号,覆盖的也正是最难人工采集的长尾条件,因此这套系统可以作为它此后要调用的那些快速模型的数据生成器。第三,两个层次处在不同位置,而不是互相竞争:AI 智能体层强而慢,负责新任务、罕见条件与数据采集;快速层窄而快,以策略速度执行成熟行为。数据从慢的一侧流向快的一侧;快速策略遇到能力之外的情况时,控制权回到 AI 智能体,由它诊断缺口并扩充技能库。

好像已经有方法和你们类似,TGL 新在哪里?

确实有一些近期工作在相邻的环节上,论文中也已经引用:LRLL、ASPIRE、SkillMemo、SCE 与 PACTS 研究终身技能获取、AI 智能体探索、记忆与组合复用,PhyAgentOS、AEROS 与 RoboBridge 则在构建机器人运行层。单个要素,比如技能库、AI 智能体工具调用、情景记忆、演示分解,都不是新的,TGL 也不主张这些。TGL 是第一个把这种方法作为整体提出的系统:一个以 AI 智能体驱动的机器人通用操作系统,把稀疏示教、带适用范围与效果判据的显式闭环技能块、权重固定的执行、物理反馈与重新组合、结构化的失败记忆,以及持久积累,连接成同一个学习循环。相邻方法各自覆盖这个循环的一部分,所以这里的贡献是循环本身,以及各部分之间的接口。正是这种整体视角,才让那些实际性质得以成立:在新任务上更快收敛、复用已经验证过的行为而不是重新推导、让经验跨任务与跨本体保留下来,并作为快速策略的数据来源。

TGL 是什么的缩写?

Teach-and-Grow Learning(教与长学习)。论文标题为 “Teach and Grow: An Agent-Centered Architecture for General Robot Learning”。

TGL 与微调机器人策略有什么不同?

微调通过改变模型参数来吸收新行为,可能影响此前已支持的行为,并且需要回归检查。TGL 保持参数不变,把新能力存为显式、可检查的 Skill Block。

一次 TGL 运行实际产出什么?

两份持久化存储:一份是 Skill Library,保存经验证的可执行行为及其适用范围与契约;另一份是 Experience Memory,记录任务、所选技能块、观测、结果、诊断与修复。

TGL 如何让机器人持续积累技能?

办法是把技能写进显式存储,而不是写进权重。在与示教演示分开的用例上通过验证的行为,带着适用范围与结果检验进入 Skill Library;每次尝试的条件、结果、诊断与修复进入 Experience Memory。后续任务从两者中检索,因此同一任务的第二次尝试会从第一次已经确立的东西开始。

Skill Block 只是一段固定动作脚本吗?

不是。固定脚本规定了轨迹;Skill Block 规定的是意图效果与适用条件,并把动作委托给兼容的执行器,因此同一个块可以在几何不同的场景中运行。

Skill Block 与函数调用有什么不同?

函数调用假定前置条件成立。Skill Block 会声明其支持条件与结果检验,执行循环在允许进入下一阶段之前会检查效果。

GPT-6 可以控制机械臂吗?

可以——但它是作为推理层,而不是控制器。GPT-6 级模型解读视觉场景、决定应当发生什么,然后调用机器人控制工具或编写一小段程序。它并不以控制频率输出关节指令,那是专用组件的职责。

什么是 GPT-6 机械臂?

这个说法指的是由 GPT-6 级多模态模型驱动的机械臂:模型提供任务级推理与工具选择,感知、抓取与运动由机器人侧组件完成。TGL 的实现正是用 OpenAI GPT-6 Astra 承担这一角色(arXiv:2608.17209)。

大模型如何控制机械臂?

2026 年的文献里出现三条路线。作为规划器:模型产出一段由下层执行的序列。作为策略:直接输出动作,即视觉-语言-动作路线。作为 AI 智能体:留在回路内,调用工具或编写程序,并根据物理结果修正。TGL 走第三条路线。

TGL 与 GPT-6 机械臂演示是什么关系?

TGL 就是这类系统中的一个,其报告是对这种安排的完整研究:GPT-6 Astra 负责推理,Codex 把 AI 智能体与机器人工具连接起来,新任务的获取发生在权重之外。站内的成对 LIBERO 视频展示了同一任务上教师与 TGL 的对照。

TGL 与直接用前沿模型控制机器人有何不同?

直接控制要求模型产出动作;TGL 要求它产出并检查一段可复用的过程——每个子目标变成带结果检验的 Skill Block,通过验证的被存下来。两种情况下模型权重相同,区别在于是否有东西被留存。

TGL 能配合未来更强的多模态 AI 智能体吗?

这正是设计意图。架构中没有任何部分依赖某一个特定模型——更强的 AI 智能体应当能更好地落实子目标、更好地诊断失败,而 Skill Library 与 Experience Memory 原样沿用。

GPT-6 直接控制机械臂吗?

不是。它提供任务级推理与工具选择。关节级几何与连续控制由专用组件完成,由模型调用它们。

TGL 为 GPT-6 机械臂增加了什么?

持久性。TGL 把每个子目标包进带结果检验的 Skill Block,把通过验证的块存入 Skill Library,并把条件、结果、诊断与修复记入 Experience Memory,使后续任务不只是从一份日志开始。

Agent as Policy 与用 LLM 做规划是一回事吗?

不完全是。规划把模型放在执行之前,并对一份计划作出承诺;Agent as Policy 让它在执行期间持续运行,因此可以检查物理结果并修正。

Agent as Policy 需要任务特定训练吗?

不需要,这正是它的核心主张。Jia 等人展示了通用 AI 智能体在无需任务特定或环境特定训练的条件下驱动物理机器人完成任务。

AI 智能体可以直接控制真实机器人吗?

可以,这正是 AGP 的核心展示:Jia 等人表明通用 AI 智能体在无需任务特定或环境特定训练的条件下驱动物理机器人完成任务。它产出的是可执行程序与通过机器人接口发出的运动指令,而不是关节力矩。

TGL 与 Agent as Policy 是什么关系?

TGL 采用同一个回路,并加上持久化层。两者都由 AI 智能体排列子目标并根据物理反馈修正;在 TGL 中,通过验证的行为还会进入 Skill Library,每次尝试的诊断进入 Experience Memory,因此重复任务会从第一次已确立的东西开始。

AI 智能体产出的是动作还是程序?

通常是程序或工具调用,而不是关节目标。在写代码的变体中,AI 智能体产出一段由机器人侧执行的程序;在工具调用的变体中,它选择子目标并调用控制原语。

什么是面向机器人的 coding AI Agent?

指会检查机器人状态、调用工具、编写并运行一小段程序、再读取结果的模型。它适合机器人,是因为机器人需要的通常是一小段过程而不是一条指令,也因为程序能在步骤之间保存中间结果。

Codex 这类 AI 智能体能控制机器人吗?

它们能通过工具驱动机器人,但不会输出控制频率的关节指令。在 TGL 中,Codex 把 AI 智能体与机器人工具连接起来,而检测、RGB-D 几何、Contact-GraspNet、MPLib 与控制器负责物理执行。

TGL 与 coding AI Agent 是什么关系?

Codex 就是 TGL 实现中的 coding AI Agent。TGL 增加的是每次调用周围的契约:子目标被包进带声明效果与结果检验的 Skill Block,因此「运行了程序」与「假定它成功了」不是同一件事。

机器人可以只看一个视频就学会新任务吗?

可以借此获得任务的结构——操作顺序与值得检查的条件——并且无需改变任何权重。视频提供不了的是物理实现:当前场景所需的位姿、抓取与运动。TGL 的答案是:把每个子目标落到机器人上,并保留通过验证的部分。

物理上下文学习与终身机器人学习有什么不同?

终身学习问的是系统如何在不遗忘的前提下持续获取任务;物理上下文学习问的是如何在不更新权重的前提下获取任务。这是两个不同的轴。TGL 同时落在两者上:获取在上下文内完成,留存是显式的。

「免重训」等于零样本吗?

不等。零样本通常指完全没有任务特定示例。免重训学习仍然使用少量演示;它避免的是策略更新,而不是示教。

什么替代了策略更新?

对显式状态的编辑:新增或收窄一个 Skill Block、修改一条恢复规则,或者在 Experience Memory 中留下一条记录,改变下次检索到哪个块。

机器人记忆对 AI 智能体有什么用?

它改变了 AI 智能体在第二次尝试时能做什么。一次失败之后记录下来的诊断,能让后续检索换用不同的抓取方式或观测,而不是把同一个计划再跑一遍。仅有结果——成功或失败——是弱证据;解释才是有用的部分。

什么是机器人 AI 智能体的经验库?

尝试过什么、结果如何的记录:任务、所选技能块、观测、结果、诊断与任何修复。在 TGL 中它就是 Experience Memory,与 Skill Library 分开保存,使「经验证的行为」与「上下文历史」各自独立增长。