Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 68

FROMAGe: Grounding LLMs to Images

15 min read · 5391 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

把一个会说话的大模型整个冻住不动,只在它前后各加一层薄薄的"翻译片",就让它能看图、找图、还能图文混着聊天。

所以这一节是想说:FROMAGe 用最省的办法(只训两个线性层)给纯文本大模型接上了"看图 + 找图"的能力。


这是个什么场景

你手机相册里堆了一万张照片。朋友随口一句"去年那次海边烧烤的图发我",你要翻五分钟。

要是有个聊天 AI 能听懂这种自然描述,直接帮你把对应的图捞出来——边聊边出图——岂不是很方便?

普通做法很贵:相当于把一个只会用中文交流、知识渊博的同事送去脱产培训三个月,让他重新学一套带图的语言(即从零训练一个多模态大模型,烧一堆 GPU)。

FROMAGe 的做法更省:不培训同事,而是在他面前放一副翻译耳机和一个翻译麦克风。耳机把图片实时翻成"他听得懂的文字向量",麦克风把他想表达的"找图意图"翻成"图像检索能用的向量"。同事本人一节课都不用上,只需训这两个小翻译设备。

代价小、迁移快,但天花板也被同事原本的语言能力锁死了。

大语言模型(LLM,Large Language Model):一个只吃文字、只吐文字的超大聊天 AI,比如 GPT、LLaMA。它本身看不见图。

所以这一节是想说:场景是"边聊边找图/看图",FROMAGe 想用最小代价把这能力嫁接到现成 LLM 上。


FROMAGe — 场景示意:这论文要解决的现实问题
Plate Nº IFROMAGe — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 从零训练多模态大模型(如 VL-BERT、ViLBERT):把视觉和语言一起从头训,成本高、数据贵。
  • 微调整个 LLM:拿 GPT/LLaMA 把所有参数解冻一起训,效果好但显存压力大,还容易把语言能力训坏(catastrophic forgetting,灾难性遗忘)。
  • Frozen / Flamingo 路线:开始流行"冻 LLM 主干",但 Flamingo 仍在 LLM 内部插入大量 cross-attention 层(交叉注意力,让文本能"看"到图像 token),训练成本依然高。
  • CLIP 系列:只做"图文对齐",图像和文本各有编码器,但不会生成自由文本,更不能做交错对话。
  • BLIP / BLIP-2:BLIP-2 也走"冻主干 + 加桥接模块(Q-Former)",但 Q-Former 参数不算少,且以"看图回答"为主,弱在图像检索。

灾难性遗忘(catastrophic forgetting):模型学新东西时把旧本领忘了。全参数微调 LLM 学看图,容易把它原本的说话能力搞坏。

FROMAGe 把"冻得更彻底、加得更少"推到极致:只加两个线性层。

所以这一节是想说:前人要么贵、要么伤原能力、要么不会检索,FROMAGe 想又省又保住语言能力还能检索。


这篇论文的新想法

三个连环动作:

  1. 图 → 文向量空间:用一个视觉编码器(visual encoder,论文用 CLIP 风格模型)抽出图像特征,再加一个线性层把它投射到 LLM 的输入嵌入(input embedding)空间。等于让 LLM"误以为"自己在读一段文本 token,其实那是图。
  2. 文 → 图向量空间:在 LLM 输出端加一个特殊 token(论文里叫 [RET]),这个 token 出现时,把它对应的隐藏状态通过另一个线性层投射回图像检索空间,用来去图库里捞匹配的图。
  3. 主干完全不动:LLM 全部参数、视觉编码器全部参数都冻结,只训这两个线性层 + [RET] token 的嵌入。训练任务就是图文配对的 caption 数据 + 图像检索损失。

最妙的副作用:因为 LLM 主干没动,它原本的语言能力、上下文学习能力都完整保留。所以你可以扔给它一段交错的"文字-图-文字-图-文字",它能自然续写下一段,甚至决定下一张该检索什么图。

token(词元):LLM 处理文字时的最小积木块。FROMAGe 的关键花招是把图片切成几块"长得像 token"的东西混进去。

所以这一节是想说:新想法 = 输入端把图翻成假 token,输出端加一个 [RET] 触发检索,中间大模型一动不动。


它分几步做的(方法)

这是全篇最核心部分,分四块,每块交代"进什么、做什么、出什么"。

1. 输入侧:把图片翻成几张便签塞给同事

输入:一张图片。

处理:图片先过视觉编码器(把图变成一串数字的"拍照机")抽出特征,再用一个可训练的线性层把它"翻译"成 k 个假 token(k 是个小数字,具体需读原文),插进 LLM 的输入序列里。对 LLM 来说,图和字长得一模一样——都是 token。

输出:k 个"混在文字序列里的图像 token"。

等等,先慢一拍——线性层是什么?就是最简单的一层网络,做一次矩阵乘法 y = Wx + b,效果是"把一种编码翻译成另一种编码"。FROMAGe 的空间翻译全靠它。

2. 输出侧(文本生成):同事正常说话

输入:前面拼好的"图 token + 文字 token"序列。

处理:LLM 像往常一样一个 token 一个 token 往外吐。但它的词表里被偷偷塞了一个新词 [RET],意思是"这儿该插一张图"。这个新词的嵌入也是可训练的。

输出:一段自然语言回复,中间可能出现 [RET]

3. 输出侧(图像检索):像图书馆查书

输入:当 [RET] 蹦出来时,取它对应位置的隐藏状态(hidden state,模型脑子里那一刻的"想法向量")。

处理:把这个隐藏状态过一个可训练的输出线性层,得到一个"查询牌";图库里每张图也用同一套流程算出"候选牌";两边做点积(dot product,比相似度的简单方法),最像的那张图就是答案。

输出:从图库中检索出的最匹配图片。

隐藏状态(hidden state):模型内部某一层、某一位置的向量,可以理解成"模型此刻在想什么"的数字表示。

4. 训练目标:两份作业一起做

输入:图文配对数据(图 + 描述)。

处理:一边做 captioning 损失(让模型看图能写出描述),一边做 retrieval 损失(让 [RET] 的查询向量贴近正确的图、远离错的图,类似 CLIP 的 InfoNCE 对比损失)。因为只有两层薄翻译片在更新,单机就能跑,也不需要海量数据。

输出:训练好的两个线性层 + [RET] 嵌入;主干和视觉编码器纹丝不动。

InfoNCE / 对比损失:让"匹配的图文"相似度高、"不匹配的"相似度低的训练目标,CLIP 同款。

ASCII 总览:

图片 ──►[视觉编码器(冻)]──►[输入线性层(训)]──► k个假token
                                                   │
文字 tokens ───────────────────────────────────────┤
                                                   ▼
                              [ LLM 主干 (完全冻结) ]
                                     │            │
                              文本输出         [RET]隐藏状态
                                                   │
                                        [输出线性层(训)]──► 查询向量
                                                   │ 点积图库
                                                   ▼
                                            检索出的图片

5. 为什么"冻结主干"是整篇的核心赌注

FROMAGe 最反直觉的决定,是把那颗昂贵的大语言模型整个冻住,一个参数都不改。这一节讲清楚它为什么敢这么做、又付出了什么。

输入:一个已经预训练好的纯文本 LLM,和一个已经预训练好的视觉编码器。

处理:常规做法是把整个大模型和视觉部分一起微调,让它们"融合"。但这么做有两个大麻烦:一是贵,动辄要多卡集群;二是"灾难性遗忘"——为了学看图,模型可能把原本的语言能力搞退化了。FROMAGe 反过来赌一把:大模型的语言能力已经足够好,不要动它;图像只要能被翻译成它能听懂的 token,它自然就会用。于是它只在输入和输出各插一片可训练的"薄翻译层",主干和视觉编码器全程冻结。这样单机就能训、数据也不用海量,而且语言能力一点不掉,因为根本没碰它。

输出:一个训练成本极低、语言能力零退化的多模态模型。

代价要说清楚:因为主干没被"教过"怎么深度推理图像内容,FROMAGe 的视觉理解深度不如那些把主干一起微调的模型(如后来的 LLaVA 系列)。它换来的是效率和语言能力的保全,牺牲的是视觉推理的上限。这是一个非常清醒的工程取舍。

打个比方:与其把一位资深翻译重新培训成画家(又贵又可能把翻译本事搞生疏),不如给他配两个小助手,一个把画讲给他听、一个把他的意思翻回画——他本人一点不用变。

6. 图像 token 和文本 token 到底怎么"平起平坐"

输入:k 个图像假 token + 若干真实文本 token。

处理:关键在于两者被放进了同一个序列、同一个嵌入空间。LLM 的工作方式是"看着前面所有 token,预测下一个 token",它并不关心某个 token 当初是从文字来的还是从图片来的——只要维度对得上、位置编码正常,它就一视同仁地做自注意力。输入线性层的职责,就是把视觉特征投影到"和文本 token 同一个坐标系"里,让图像 token 混进去毫无违和感。于是"一段话里夹着一张图"这种交错输入,对 LLM 来说就是一条普通的 token 序列,它照常做上下文建模。

输出:图文自由交错、被统一处理的上下文——这是它能做"看图对话""图文交错检索"的底层原因。

所以这一节是想说:把图投影进文本的嵌入空间,图就变成了大模型眼里的"另一种字",一切多模态能力都从这个统一表示长出来。

7. 为什么是"检索图"而不是"生成图"

输入[RET] 触发时那一刻的隐藏状态。

处理:这里要澄清一个常见误解——FROMAGe 不画图,它是从一个真实图库里挑图。输出线性层把隐藏状态变成一个查询向量,去和图库里每张图的向量做点积,选最像的返回。这样做的好处是:返回的永远是真实存在的图片(不会像生成模型那样画出手指数量不对的怪图),而且检索又快又稳。代价是它只能返回图库里有的图,无法凭空创造新画面。配合文本生成,它就能产出"文字 + 穿插相关图片"的交错回复——这在当年是很新的形态。

输出:一张来自真实图库、与当前对话语义最贴合的图片。

8. 两个损失各教会模型一半本事

输入:图文配对数据。

处理:两份"作业"分工明确,缺一不可:

  • captioning 损失(看图写话):主要训练输入侧的翻译层。要让模型能根据图 token 写出正确描述,输入线性层就必须把图像特征翻译得足够准,否则模型"看不懂"图。
  • retrieval 损失(对比学习):主要训练输出侧的翻译层和 [RET] 嵌入。它用一批数据里的其它图当负样本(in-batch negatives),逼着 [RET] 的查询向量靠近正确图、远离所有错的图,本质就是 CLIP 那套 InfoNCE。
  • 两个损失一起优化,一个打通"图进得来",一个打通"图出得去",才凑成完整的图文双向能力。

输出:一套让"输入能读图、输出能取图"同时成立的薄翻译层参数。

再补一个训练上的细节直觉:因为可训练参数极少(只有两片线性层和一个新嵌入),过拟合风险和训练不稳定性都很低,学习率、batch 这些超参也比全参数微调好调很多。这也是"参数高效"路线的普遍红利——你动的东西少,能出错的地方就少,实验迭代快。反过来,能力上限也被这几片薄层卡住,想再强就得解冻更多东西,那就走向了后来 LLaVA 那类"投影层 + 微调主干"的路线。

所以这一节是想说:输入线性层把图变假 token,[RET] 触发输出线性层做检索,主干全冻,只训两片薄翻译;冻结换来了效率与语言保全,两个损失分别打通图的"进"与"出"。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【FROMAGe: Grounding LLMs to Images · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

FROMAGe — 方法示意:核心 pipeline
Plate Nº IIFROMAGe — 方法示意:核心 pipeline

关键数字(What works)

FROMAGe 的卖点不是刷榜数字,而是"用极少可训练参数达到能用水平且语言能力不退化"。精确指标需以原文为准,本笔记不编造。

关注点 对比对象 结果方向(原文为准) 具体数值
可训练参数量 全参数微调 / BLIP-2 的 Q-Former 极少(仅两个线性层 + [RET]) 原文未在本笔记转录
零样本图像检索 CLIP 等 长描述/多轮对话检索有竞争力 原文未在本笔记转录
图文交错生成 Flamingo 等 保留 in-context 能力 定性证据为主
语言能力退化 全参数微调 几乎不退化(主干冻结) 定性/见原文

提醒:任何具体数值请以 arXiv 原文(2301.13823)为准。

所以这一节是想说:FROMAGe 用"参数极少 + 语言不退化 + 能检索"这三点立身,不靠刷分。


实验结果说明了什么

  • 冻主干 + 训轻量翻译层是可行的:只训两个线性层就能让 LLM 看图、检索、图文交错生成,说明"借用大模型能力、只训接口"这条路走得通。
  • 上下文学习能力被保住了:因为主干没动,FROMAGe 面对"文-图-文-图"的交错上下文能自然续写,这是全参数微调容易破坏的能力。
  • 检索是它的强项[RET] + 对比损失让它在"根据长描述/多轮对话找图"上表现突出,这比"看图回答"更贴近相册助手场景。
  • 深度理解不如 Flamingo:加得少的代价是看图理解的深度不如内部插了大量交互层的 Flamingo。省和强之间有取舍。

所以这一节是想说:实验证明"最小改动"能换来可用的多模态能力,且不伤语言,但深度理解要让位于更重的方案。


你应该懂的几个新词

frozen backbone(冻结主干):训练时固定模型某些参数不更新,只训新增部分。省显存、保护原能力。

linear projection / 线性层:最简单的全连接层 y = Wx + b,本文用它做"空间翻译"。

interleaved image-text(图文交错):输入或输出是"文字-图-文字-图"穿插的序列。

retrieval token [RET]:词表里新加的特殊 token,专门标记"这里要去捞一张图"。

in-context learning(上下文学习):LLM 不更新参数、只看 prompt 里几个例子就学会新任务的能力。

InfoNCE / 对比损失:让匹配图文相似、不匹配的疏远的训练目标。

所以这一节是想说:抓住"冻主干、线性层、图文交错、[RET]、对比损失"五个词,就抓住了 FROMAGe。


它有什么搞不定的

  • 理解深度受限:只加线性层,图像信息进 LLM 的"带宽"很窄,细粒度视觉理解不如 Flamingo/BLIP-2。
  • 天花板被 LLM 锁死:主干冻结意味着它的推理能力、知识面完全继承自原 LLM,原 LLM 不会的它也不会。
  • 检索受限于图库[RET] 只能从给定图库里捞图,不能凭空生成新图(不是图像生成模型)。
  • 视觉编码器也冻结:视觉端能力上限被预训练的 CLIP 风格编码器决定,遇到分布外图像会吃力。
  • 交错生成质量参差:能续写图文交错内容,但连贯性和准确性不如后来更重的多模态模型。

所以这一节是想说:省的代价是浅——理解深度、视觉上限、生成能力都被"只训两层 + 全冻主干"限制住了。


它和别的几篇是什么关系

  • 承接 CLIP:视觉编码和图像检索逻辑沿用 CLIP 的对比学习范式。
  • 承接 Frozen / Flamingo:同是"冻 LLM"思路,但 FROMAGe 加得更少(不在 LLM 内部插层),代价是理解深度不如 Flamingo。
  • 对比 BLIP-2:BLIP-2 加 Q-Former(更大桥接模块),FROMAGe 只加线性层;BLIP-2 偏 VQA,FROMAGe 偏检索 + 交错生成。
  • 影响 LLaVA:LLaVA 早期版本就是"MLP 投射 + 冻 LLM",和 FROMAGe 精神一脉相承。
  • 与 embodied 路线的差异PaLM-E 想让 LLM 控制机器人,FROMAGe 只关心图文,没碰动作空间。

所以这一节是想说:FROMAGe 是"冻主干 + 轻桥接"多模态潮流里最极简的一员,是 LLaVA 等的精神先祖。


和本导读的关系

  • 主线章节:Ch09 从 BLIP-2 到 LLaVA。FROMAGe 是"冻 LLM + 轻量对齐"这一支的极简代表,读它能理解为什么后来 LLaVA 只用一个投射层。
  • 多模态生态:Ch18 多模态生态。它把"检索"这一模态接进对话,是多模态融合的一种范式。
  • CLIP 地基:Ch08 CLIP。FROMAGe 的检索机制直接建在 CLIP 的对比学习上。

所以这一节是想说:FROMAGe 落在 Ch08(CLIP)、Ch09(LLaVA 家族)、Ch18(多模态)三章的交点。


思考题

Q1:为什么冻结 LLM 主干反而是优点而不是妥协?

提示

冻结保住了原有的语言能力和上下文学习能力,避免灾难性遗忘,还大幅省显存和数据——省和稳一举两得。

Q2:[RET] token 是怎么工作的?为什么需要一个专门的特殊 token 来做检索?

提示

它像一个"开关",出现时就取其隐藏状态投射成查询向量去图库检索。专门 token 让模型学会"在合适位置主动发起找图",而非把每个位置都当检索点。

Q3:FROMAGe 只加两个线性层,为什么理解深度不如 Flamingo?

提示

线性层是很窄的信息通道,图像信息进 LLM 的带宽小;Flamingo 在 LLM 内部插了多层交叉注意力,图文交互更充分但也更贵。

Q4:FROMAGe 能"生成"图片吗?它的"出图"和文生图模型有何本质区别?

提示

不能生成,只能从已有图库检索。文生图是从零画一张新图,FROMAGe 是"从相册里找一张最匹配的"。

Q5:如果换一个更强的 LLM 主干,FROMAGe 会不会自动变强?上限在哪?

提示

语言侧会随主干变强,但视觉理解仍被冻结的视觉编码器和窄线性层限制,视觉上限不会随语言主干等比提升。

Q6:对比损失(InfoNCE)在 FROMAGe 里具体保证了什么?

提示

保证 [RET] 产生的查询向量在向量空间里靠近正确图、远离错误图,从而检索准确。

所以这一节是想说:想清楚这些题,你就理解了"冻结的价值""[RET] 的机制""检索 vs 生成"这三件核心事。


一些好奇心问答(FAQ)

Q:FROMAGe 名字什么意思?

它是 "Frozen Retrieval Over Multimodal Data for Autoregressive Generation" 的缩写(也就是"冻结 + 检索 + 多模态 + 自回归生成"),顺便谐音法语"奶酪"。

Q:它需要多大算力训练?

因为只训两个线性层,单机就能跑,远比全参数微调便宜。具体资源需读原文。

Q:它和 LLaVA 谁更强?

定位不同。LLaVA 更强于看图对话理解,FROMAGe 更强于图文交错 + 图像检索。FROMAGe 更早、更极简。

Q:视觉编码器为什么也冻结?

它已经在海量图文上预训练过,FROMAGe 手里数据少,动它只会变差;冻结既省又稳。

Q:这套思路今天还有用吗?

有。各种 adapter、LoRA、投射层本质都是"冻主干 + 训轻量接口"的家族,FROMAGe 是这个思想在多模态上的清晰样本。

所以这一节是想说:FROMAGe 对初学者极友好——架构干净、参数少、概念集中,是理解多模态对齐的最佳入门样本之一。


如果你想再深入

  1. 前置:CLIP —— 先懂对比学习和图文对齐,才明白检索机制。
  2. 对照:BLIP-2 —— 看 Q-Former 这种更重的桥接,和 FROMAGe 的线性层对比取舍。
  3. 对照:Flamingo —— 看内部插交叉注意力的更强但更贵的路线。
  4. 续读:LLaVA —— 看"投射层 + 冻 LLM"如何被发扬光大成开源 VLM 标准。
  5. 想动手 —— 看原文的训练目标和 [RET] 实现细节,代码量很小,适合复现练手。

所以这一节是想说:先补 CLIP,再把 FROMAGe 当"最极简的多模态对齐样本",然后顺着 BLIP-2/Flamingo/LLaVA 看这条路怎么加码。


原文信息

@inproceedings{koh2023fromage,
  title  = {Grounding Language Models to Images for Multimodal Inputs and Outputs},
  author = {Koh, Jing Yu and Salakhutdinov, Ruslan and Fried, Daniel},
  booktitle = {International Conference on Machine Learning (ICML)},
  year   = {2023},
  note   = {arXiv:2301.13823}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_fromage_2026,
  title       = {(readable note) FROMAGe: Grounding LLMs to Images},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/fromage/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?