机器人运行时推理

运行时推理指决定下一步做什么的组件在任务执行期间仍在运行。这正是「在执行前承诺的计划」与「能对机器人在任务中途实际观察到的内容作出反应的决策」之间的差别。

为什么值得这个代价

运行时推理每步的成本远高于前馈推理。它换来的是对「只在执行期间才存在的证据」作出反应的能力:没有夹稳的抓取、没有打开的抽屉、被移动的物体。离线规划器看不到这些,因为它在这些事情发生之前就已经结束了。

通常的折中

实践中两者是被组合使用的,而不是二选一。深思被留给陌生情形、诊断与恢复,成熟行为则跑在廉价的学习策略上。TGL 的报告提出的正是这一拆分——把慢教师留给知识的前沿,把快学生留给已经确立的部分——并把从经验证轨迹蒸馏视为未来扩展,而不是当前系统的一部分。

它要真正起作用需要什么

推理组件必须收到足够推理用的证据。如果机器人接口只报告「指令已发出」,运行时推理就无从下手,它会重新推导出同样的计划。这就是为什么接口——一个子目标对自身效果的汇报——和推理本身同样重要。

TGL 的关系

TGL 让 AI 智能体在整个任务期间保持运行,并给它可推理的东西:每个 Skill Block 都带结果检验,而它的结果正是 AI 智能体所读取的。效果通过就推进计划;失败或不确定则触发再一次观察、更换执行器,或修改后续路线。

相关页面