大模型机器人学(LLM Robotics)
大模型机器人学指把大语言模型用进机器人的控制栈。它们贡献的是任务分解、工具选择、状态跟踪与恢复——也就是对符号与结果的推理。它们无法贡献的是控制信号,因为它们运行的频率远达不到机器人所需。
大模型在这里真正擅长什么
把「煮咖啡」分解为有序步骤,基本上是符号化问题,语言模型处理得很好。选择下一个调用哪个工具、注意到某个结果与计划矛盾、并提出替代方案,同样如此。这些正是受益于长上下文与缓慢深思的环节。
多模态模型把这一点扩展到读取场景。一个能看着相机画面、看出抽屉没有打开的 AI 智能体,就有了具体的对象可以推理,而不只是对一段文字状态描述做推理。
大模型做不到什么
它无法产生关节力矩,而在每条底层指令之前重新运行一次大模型,在控制频率下并不可行。实践中两层被分开:AI 智能体决定做什么,机器人侧组件处理怎么做。
这也意味着 AI 智能体只知道工具告诉它的内容。一个丢弃信息的低层接口,限制的不只是控制,还有 AI 智能体的推理。
TGL 如何使用大模型
在 Teach-and-Grow Learning 中,多模态 AI 智能体识别演示之间共享的子目标,把它们表达为闭环的 Skill Block,并根据机器人观察到的结果修正剩余计划。论文的实现使用 OpenAI GPT-6 Astra 完成这一推理,并用 Codex 把 AI 智能体与机器人工具连接起来。检测、分割、RGB-D 几何、Contact-GraspNet、MPLib 与控制器提供物理落地。