End-to-End VLA
VLA = 视觉-语言-动作模型。一个端到端神经网络:左边输入摄像头画面 + 自然语言指令,右边输出关节速度。这是过去三年具身 AI 最热的赛道。
先读这三篇。
RT-1 把动作 token 化 → RT-2 把网络知识带进来 → OpenVLA 把整个范式开源民主化。
-
1
RT-1: Robotics Transformer for Real-World Control at Scale
Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式在物理世界同样有效。
-
2
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
把机器人动作翻译成一句话,让会看图聊天的 AI 用写句子的方式开口指挥机器人——它会写字,就能动手。
-
3
OpenVLA: An Open-Source Vision-Language-Action Model
把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。
2022 到 2026,44 篇怎么排开。
祖师爷
经典
前沿