免训练机器人学习
免训练机器人学习指在没有梯度更新、微调或强化学习的情况下获得新的机器人能力。预训练模型权重保持固定,关于新任务学到的东西被显式存放,而不是写进参数。Teach-and-Grow Learning(TGL)就是建立在这一约束上的架构。
精确含义
这个术语比字面上听起来要窄。这里的“免训练”描述的是获取路径,而不是模型:预训练 AI 智能体、感知组件与控制组件都是由别人训练出来的,TGL 假定它们足够强。该术语排除的是:当机器人遇到新任务时进行梯度更新、做任务特定微调,或进入强化学习阶段。
新知识去了哪里
如果能力不写进权重,它就必须存在一个可被人检查的地方。TGL 使用两份显式存储。Skill Library 保存经验证的行为——目标、可复用策略、支持条件、兼容执行器与结果检验。Experience Memory 保存使用情境:哪个任务、选了哪些技能块、观察到什么、发生了什么、诊断是什么、应用了什么修复。
为什么这个约束有意思
物理交互数据的昂贵程度不同于文本和代码:它必须通过操作机器人或仿真器来产生。由于端到端策略把新行为吸收进共享参数,一个局部失败可能要求一次耦合面很广的修复。把参数更新从获取路径中移除,能让更新变成本地的——前提是场景落地、验证、兼容性与检索保持可控,而这是论文分析的条件,不是假定的条件。
它不是什么
它不是“不学习”:行为确实被获得了,技能库与记忆也在增长。它不是“不预训练”——强大的先验正是这条路线可行的原因。它也不主张参数永远不应被改动:论文提出的“慢教师–快学生”路线会用经验证的轨迹去训练策略,这是有意的扩展,而不属于免训练获取这一步。