通用机器人学习

通用机器人学习的目标是:用一套系统处理多种任务、物体与场景,而不必为每一个都重建。主流路线通过扩大数据与参数来追求这一点。Teach-and-Grow Learning 走的是一条互补路线:保持预训练栈不变,让显式的可复用技能持续积累。

为什么通用性最难

学会了把一个物体拿起来的机器人,对下一个物体几乎一无所知。物理交互数据的昂贵程度不同于文本和代码:它必须通过操作机器来产生。物体位姿、相机几何、杂乱程度、材质与本体形态彼此耦合,覆盖一个因素并不等于覆盖它们的组合。通用系统必须在这个乘积上泛化,而不是在单个轴上。

路线一:规模化

在广泛的跨本体语料上训练大型策略,使其表示可迁移,再按任务微调。这是现代视觉-语言-动作模型背后的路线,而且它有效。它的代价是结构性的:新能力被吸收进共享参数,因此修复一个行为意味着重新检查其它行为,而这种开销会在每次更换物体、传感器或夹爪时反复出现。

路线二:显式能力

互补路线不去试图让一套权重覆盖一切。它保留预训练先验,转而增长一份显式的经验证行为存储——每个行为都带有明确适用范围与结果检验——外加一份记录其使用条件的记忆。通用性因此来自检索与组合,而不是来自参数的覆盖范围。

两条路线并不互斥。学习策略可以实现其中某个显式技能;几何规划器可以连接其中两个。改变的是新任务知识被写在哪里。

路线二的代价

它转移了困难,而不是消除困难。场景落地、验证、兼容性检查与检索都必须保持可控,否则显式存储的增长成本会和重训参数一样高。TGL 分析的是这些成本情形,而不是把低成本增长视为自动成立。

相关页面