再训练成本(Retraining Tax)

再训练成本指通过一次策略更新来修复机器人行为所付出的反复代价,包括新增数据采集、优化,以及对策略此前已支持的全部能力做回归验证。该术语由 Teach and Grow 论文提出,用来引出一种替代方案:把新能力显式存起来,让权重保持不动。

为什么这个代价会反复出现

端到端策略把新行为吸收进共享参数。这正是它们具备通用性的原因,也正是局部失败很少有局部修复方案的原因:追加纠正数据并改动参数,并不会产生一个针对某个物体或某种接触条件的、可单独定位的修复。此前已支持的行为可能需要重新检查。新增传感器或更换夹爪时同样如此——这会引入需要验证的观测接口、标定与动作兼容性。

为什么长尾会暴露它

当改动幅度大且不频繁时,这个代价是可以承受的。它会在长尾中显现:某种罕见接触条件或某个不寻常的物体,需要的是一条具体的经验,而不是又一轮宽泛的经验积累。单次纠正本应越便宜,共享参数路线的相对成本就越高。

TGL 的做法

TGL 保持预训练栈不变,把新能力存放在显式对象中:带明确适用范围与结果检验的 Skill Block,以及记录条件与修复的 Experience Memory。一次纠正变成对其中某个对象的编辑。论文分析的是这种路线在什么条件下才真正更便宜——场景落地、验证、兼容性检查与检索都必须保持可控——而不是假定它总是更便宜。

这个术语该怎么用

再训练成本是对一种成本结构的框定方式,不是论文中的实测量。它适合用来追问:对任何机器人学习系统而言,修复一个行为时需要重做哪些事情。不应当把它当作实证测量值引用。

相关页面