GPT 与机械臂
「GPT 机械臂」指的是借助大型预训练模型控制的机械臂。这件事发生在两个层面:语言模型可以用文字规划并编排任务,视觉-语言-动作模型可以直接驱动机械臂。两者都可行。但两者都不能免除对机械臂物理动作结果的检查。
层面一:规划
语言模型可以把目标分解为步骤、选择工具、并从某些失败中恢复,因为这类推理基本上是符号化的。它接触不到关节角,也不需要。这一层面已经相当成熟,主要是软件集成问题。
层面二:直接动作
视觉-语言-动作模型以图像、指令与本体感觉为输入,输出连续动作。它之所以可行,是因为骨干的预训练已经产生了场景与语言对齐的表示,因此接上动作头所需的机器人数据相对较少。
两个层面都不提供什么
模型可以规划得很好,同时对世界判断错误——因为计划不是证据。需要有东西观察物理结果,并判断意图中的效果是否真的发生:夹爪闭合并不证明物体被拿住了。正是这一检查把一串指令变成了一个具有明确适用范围的「行为」。
它也正使修复变得局部。当结果与声明的效果对照检查时,一次失败指向的是某个行为,而不是整个策略。
TGL 如何把它们组合起来
Teach-and-Grow Learning 使用 GPT 级别的多模态 AI 智能体做任务级推理与工具交互,并把每个子目标包装进带有结果检验的 Skill Block。AI 智能体决定应该改变什么;机器人侧执行器决定怎么做,并回报实际发生了什么。