物理 AI 与具身智能

物理 AI 与具身智能是当下用来指代“通过传感器与执行器在物理世界中感知和行动、而非生成文本或图像的系统“的术语。标签背后是一组具体的工程问题:策略的感官接口应当如何设计、当决策被延迟时它会如何表现,以及训练数据从哪里来。

标签与实质

物理 AI 是产业界的说法,具身智能(embodied AI / embodied intelligence)更偏学术。三者指向同一个转变:语言模型预测下一个词元,而物理 AI 智能体必须应对自己行动在一个会「顶回来」的世界中造成的后果。质量、摩擦、惯性与接触都不在文本的训练分布里,因此物理 AI 智能体需要的表示并不是聊天机器人需要的表示。

真正困难的地方

数据。互联网文本与视频丰富且是第三人称视角。机器人需要第一人称证据——它自己行动之后世界变成了什么样——而这类数据的采集很昂贵。

感官接口。多数工作假定视觉已足够。但并非如此:接触、力与隐藏的内部状态对相机不可见,而能够报告它们的模态各自带有独特的时间结构。

时序。物理 AI 智能体在延迟下运行,而它们最有能力的策略运行得很慢。任何必须在两次决策之间被注意到的东西都会掉进这个空档。

评测。到达目标不等于行为正确。一个策略可以在几何指标上看起来成功,却在真正重要的意义上出错。

TGL 的位置

Teach and Grow 是一个物理 AI 系统。它的主题是 AI 智能体与物理世界的接口:机器人通过行动、观察结果、保留经验证的内容来获得新的操作能力。它的主张是:对处于延迟控制下的 AI 智能体而言,把发生过的事情保留下来是一项要求,而不是可选的改进。

相关页面