Agent as Policy 与用 LLM 做规划是一回事吗?
不完全是。规划把模型放在执行之前,并对一份计划作出承诺;Agent as Policy 让它在执行期间持续运行,因此可以检查物理结果并修正。
Agent as Policy(AGP)把通用 AI 智能体放在执行回路之内,而不是把它限制在离线规划。AI 智能体观察机器人与环境、在运行时推理、调用控制工具或可执行程序、检查物理结果、修正下一步动作。Jia 等人在 2026 年 9 月为该方法命名,并在真实操作任务上做了验证。
Agent-as-Policy 机器人学把通用 AI 智能体放进执行回路,而不是把它限制在离线规划。AI 智能体观察机器人与环境、在运行时推理、调用控制工具或可执行程序、检查物理结果、修正下一步动作。
《Agent as Policy for Robotic Manipulation》(Jia 等人,arXiv:2609.12541,2026 年 9 月)提出 AGP,并展示了通用 AI 智能体在无需任务特定或环境特定训练的条件下驱动物理机器人完成任务:给定任务与机器人接口,AI 智能体解读视觉证据、编写可执行程序、发出运动指令,并根据物理结果修正动作——覆盖精细操作、动态运动与可变形物体任务。
与之对照的是基础策略(foundation policy)路线:视觉-语言-动作模型把观测直接映射为动作。AGP 让 AI 智能体留在回路内,交给它的是程序与工具,而不是关节目标。
区别在于做决定的组件所处的位置:在回路之外,产出一份由下层执行的计划;或者在回路之内,对机器人实际观察到的内容作出反应。物理执行会产生证据——一次失败的抓取、一个被移动的物体、一个没有打开的抽屉——而只有仍在运行的组件才能对它采取行动。
代价是延迟与每步成本。对每个动作都推理,远比前馈推理昂贵,这也是为什么这种安排通常留给陌生情形:不熟悉的物体、诊断与恢复。
Agent as Policy(AGP)——Jia 等人,arXiv:2609.12541,2026:通用 AI 智能体在无需任务特定训练的条件下驱动真实机器人完成操作任务。
Agentic Robot——Yang 等人,arXiv:2505.23450,2025:面向视觉-语言-动作模型的框架,为长时程操作加入动作协调协议与执行期验证。
Push-T 与 AI 智能体机器人——Xie、Chen、Goldberg,arXiv:2608.18227,2026:LLM coding AI Agent 在没有任何演示数据的条件下写出 Push-T 的解法,并与视觉运动模仿策略对比。
Code as Policies——Liang 等人,arXiv:2209.07753,2022:程序即策略的前身,语言模型在感知原语之上写出策略代码。
SayCan——Ahn 等人,arXiv:2204.01691,2022:把语言模型的计划落到机器人真正做得到的事情上。
ReKep——Huang 等人,arXiv:2409.01652,2024:面向闭环操作的关系关键点约束,是解决同一问题的空间推理路线。
两者共享同一控制位置——AI 智能体在回路之内——差别在于什么被留存下来。就一个需要长期获取任务的机器人而言,可以从这些维度比较:
控制位置:相同。两者都把 AI 智能体留在执行回路内。
任务获取:AGP 从任务描述与机器人接口获取;TGL 从少量演示获取,演示提供子目标结构与值得检查的条件。
运行时推理:相同。两者都在任务运行期间推理。
技能持久化:AGP 未定义持久存储;在 TGL 中,经验证的行为以 Skill Block 的形式进入 Skill Library。
记忆:AGP 在任务内携带状态;TGL 另设 Experience Memory,跨任务保存结果、诊断与修复。
经验复用:AGP 在重复任务上重新推导解法;TGL 检索已验证的技能块。
演示的使用:AGP 不需要演示;TGL 使用少量演示。
任务特定重训:两者都不更新策略——这是共同的立场。
物理反馈:两者都会检查物理结果;TGL 把效果检验写进每个 Skill Block 的契约。
向未来任务迁移:这是 TGL 的明确主张与报告中的缩放假设;AGP 并未提出这一点。
TGL 遵循 Agent-as-Policy 的设计,并加上持久化层。AI 智能体排列子目标、选择工具、修正路线;经验证的行为积累在 Skill Library,每次尝试的条件、结果、诊断与修复积累在 Experience Memory。报告提出的「慢教师–快学生」拆分,会随后让学习到的策略接手成熟行为,把 AI 智能体式的深思留给陌生情形。
不完全是。规划把模型放在执行之前,并对一份计划作出承诺;Agent as Policy 让它在执行期间持续运行,因此可以检查物理结果并修正。
不需要,这正是它的核心主张。Jia 等人展示了通用 AI 智能体在无需任务特定或环境特定训练的条件下驱动物理机器人完成任务。
可以,这正是 AGP 的核心展示:Jia 等人表明通用 AI 智能体在无需任务特定或环境特定训练的条件下驱动物理机器人完成任务。它产出的是可执行程序与通过机器人接口发出的运动指令,而不是关节力矩。
TGL 采用同一个回路,并加上持久化层。两者都由 AI 智能体排列子目标并根据物理反馈修正;在 TGL 中,通过验证的行为还会进入 Skill Library,每次尝试的诊断进入 Experience Memory,因此重复任务会从第一次已确立的东西开始。
通常是程序或工具调用,而不是关节目标。在写代码的变体中,AI 智能体产出一段由机器人侧执行的程序;在工具调用的变体中,它选择子目标并调用控制原语。