AI 智能体机器人学(Agentic Robotics)

AI 智能体机器人学指让推理 AI 智能体——通常是一个大型多模态模型——决定机器人下一步该做什么,而由专用组件负责几何与连续控制。AI 智能体读取场景、选择子目标与工具、观察结果、修正计划。Teach-and-Grow Learning(TGL)正是建立在这一循环之上的以 AI 智能体为中心的架构。

循环

一个系统是否“AI 智能体化”,与其说取决于模型,不如说取决于它的循环:观察、决策、行动、读取结果、修正。在工作空间中,这意味着相机观测充当状态、感知与运动工具执行物理操作、执行器回执描述实际发生了什么。AI 智能体的下一次选择取决于这些回执,而不是一段固定脚本。

这正是让工具型语言 AI 智能体在软件中变得有用的模式,只是被放到了更不宽容的场合:一次错误动作会改变物理世界,而纠正必须来自机器人实际观察到的东西。

为什么分工重要

语言模型无法输出关节力矩,操作策略也无法规划数分钟长的任务。两者的需求互不相容——一边需要长上下文与缓慢深思,另一边需要数十赫兹。AI 智能体机器人学选择把它们拆开,而不是试图让一个模型同时胜任;后者得到的要么太慢无法控制,要么太浅无法规划。

AI 智能体帮不上忙的地方

AI 智能体对它能看到的世界进行推理,而它只能看到工具报告的内容。如果低层接口悄悄丢弃了什么——比如掉在两次决策之间的一段短暂事件——那么这个信息在 AI 智能体的世界模型里同样缺失,它的规划就建立在并不完整的图景上。这就是为什么低层接口属于 AI 智能体层面的问题,而不只是控制细节。

TGL 的位置

TGL 在设计上以 AI 智能体为中心。AI 智能体识别演示之间共享的子目标,把它们表达为闭环的 Skill Block,将每个块落实到当前场景,并决定保留什么。机器人侧执行器提供几何与控制。在论文的实现中,推理由 OpenAI GPT-6 Astra 完成,Codex 负责把 AI 智能体与机器人工具连接起来。

相关页面