「免重训」等于零样本吗?
不等。零样本通常指完全没有任务特定示例。免重训学习仍然使用少量演示;它避免的是策略更新,而不是示教。
免重训机器人学习指在不更新策略的前提下获得新任务:没有梯度步、没有任务特定微调、也没有强化学习阶段。机器人学到的东西被显式存放,而不是写进权重,因此获取一个任务不会扰动其它任务。
被避免的是策略更新。它在数据上昂贵,因为机器人交互数据必须通过操作机器来产生。它在风险上也昂贵,因为参数更新会触及同时也支撑着此前所学行为的权重,因此一次局部失败可能要求一次耦合面很广的修复,以及对其它一切的回归检查。
报告把这种反复出现的成本命名为再训练成本。避免它并不是为了省算力,而是为了让修复保持本地。
两份显式存储。一份是 Skill Library,保存经验证的行为,每条带有目标、可复用策略、支持条件、兼容执行器与结果检验。另一份是 Experience Memory,记录任务、所选技能块、观测、结果、诊断与修复。
它不是「不学习」——行为确实被获得,两份存储都在增长。它不是「不预训练」——强大的预训练栈正是这条路线可行的原因。它也不意味着权重永不可变:报告提出的「慢教师–快学生」路线会随后用经验证的轨迹训练策略,那是有意的扩展,不属于获取这一步。
两者都避免参数更新。上下文适配把改变限定在一次会话内;TGL 把它写进能活过会话的存储。两者互补——上下文是传达任务的好方式,显式存储是保存其结果的好地方。
不等。零样本通常指完全没有任务特定示例。免重训学习仍然使用少量演示;它避免的是策略更新,而不是示教。
对显式状态的编辑:新增或收窄一个 Skill Block、修改一条恢复规则,或者在 Experience Memory 中留下一条记录,改变下次检索到哪个块。