在不重训的前提下适配 VLA 模型

视觉-语言-动作(VLA)模型通常通过采集更多机器人数据、更新策略来吸收不熟悉的任务。Teach-and-Grow Learning 问的是一个更窄的问题:当预训练 VLA 权重保持冻结时,还有什么可以被适配?它的回答是把新能力存为显式的 Skill Block,让模型保持不动。

预训练模型仍然负责什么

冻结权重并不会让模型变得无所作为。VLA 栈仍然提供感知、语言 grounding 与控制先验,使机器人能够理解场景并在其中运动。它不提供的,是存放新任务的地方——因为在端到端路线中,唯一这样的地方就是参数。

TGL 增加了第二个地方。AI 智能体把子目标组合为 Skill Block,每个块都落实到当前观测并接受结果检验,通过检验的会被保存下来。

适配实际发生在哪里

获取过程中有三样东西改变,而它们都不是权重:可用 Skill Block 的集合、在它们之间做选择的检索、以及记录实际发生了什么的 Experience Memory。因此适配是 AI 智能体所推理的显式状态发生了变化,而不是模型发生了变化。

在新场景中,同一个技能块可以产生不同的物理实现,因为物体绑定、抓取几何与无碰撞运动都会根据机器人当前观测重新计算。

这样做能换来什么,换不来什么

它换来了局部性:修复一个行为是对单个显式对象的编辑,而不是一次带有全局回归风险的参数更新。它换不来无限的能力——冻结的先验仍然限制着机器人能感知和能做到的范围,落地也仍然可能失败。它也没有取消对适用范围的验证需求:过度泛化的技能块是真实的失效模式,这正是候选必须在示教演示之外接受检验的原因。

与其他适配路线的关系

提示、上下文内适配与参数高效微调也在试图避免完整重训。它们的区别在于适配后的知识存放在哪里:在上下文窗口里、在一小部分适配器权重里,或者在 TGL 的情况下——在一个可被人阅读、收窄或回退的行为存储里。

相关页面