终身机器人学习

终身机器人学习的目标是:机器人不是训练一次就被冻结,而是在整个工作周期中持续获得新任务。核心困难在于学习新任务不能抹掉旧任务。Teach-and-Grow Learning 通过把新能力放进显式存储、而不是共享参数,来应对这一点。

遗忘问题

当策略通过更新参数来吸收新行为时,这次更新会触及同时也支撑着此前所学内容的权重。结果可能是早期任务性能下降——经典稳定性-可塑性权衡——而常见的缓解手段是回放或正则化,两者都有代价。

在机器人上,实际症状比指标下降更糟:一个原本可靠的机器人,在被教了另一个任务之后,在前一个任务上变得不可靠,而这种失效可能只在现场才暴露出来。

一种替代机制

如果新知识被存为显式对象而不是写进权重,那么新增它就不会覆盖任何东西。TGL 的 Skill Library 保存带适用范围的经验证行为,Experience Memory 保存条件与修复。获取一个新任务就是往这些存储里添加内容。

这并不意味着遗忘不可能发生。检索仍然可能选错技能块,落地也可能在新场景中失败。被移除的是「学一件事直接损坏另一件事」这个机制。

要做到这一点需要满足什么

两个条件很重要。条目需要有明确的适用范围,这样过度泛化的技能才能被收窄,而不是被悄悄误用。兼容性必须保持可检查:如果每个新技能都要与所有既有技能逐一验证,增长会变成平方级,优势就消失了。论文对这些情形做了明确分析。

缩放假设

报告提出一个假设,把有效的可复用经验与未来任务误差、示教需求的下降联系起来,二者都趋向不可约的下限。它是作为需要在顺序获取实验中检验的假设提出的,而不是拟合出的定律。

相关页面