Long-CLIP: Unlocking the Long-Text Capability of CLIP
这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话,术语第一次出现一定给类比。读完你应该能对别人讲清楚"CLIP 为什么读不了长句子,Long-CLIP 用了哪两个小手术把它治好"。
一句话讲什么(TL;DR)
给一个只能读 77 字短纸条、而且实际上超过 20 个字就看糊的 CLIP,做两个精准的小手术,让它能读 248 字的长描述,同时又没忘掉原来认识的那些短词——而且换上去就能用,不用改下游任何代码。
所以这一节是想说:这篇论文用最小的代价,把 CLIP 的"文字阅读能力"从短句扩到了长段。
这是个什么场景
想象你在用一个图片搜索 App。你输入"一只猫",它就翻出一堆猫的照片。这背后干活的模型叫 CLIP——它像一对双胞胎:哥哥专门看图,弟弟专门读文字,两人从小被训练成"一对上号就齐刷刷点头"。你打的字和某张图越搭,它俩输出的数字就越像。
但弟弟有个怪癖:他只能读不超过 77 个字的纸条(这是 CLIP 文本编码器写死的最大输入长度)。你随手输个"猫"没问题;可一旦你想找"穿着小毛衣、坐在窗台上、阳光打在橘色花纹上、旁边还有一杯冒热气咖啡的英短"——这种细节满满的长描述,他要么把后半句直接剪掉,要么读得稀里糊涂。更糟的是论文实测发现:CLIP 文字端的有效长度其实连 20 个字都不到,后面就算塞进去也基本没起作用。
而现在大家越来越想"说人话"地搜东西、画东西:用 Stable Diffusion 画图要喂长 prompt,做图文检索想用整段描述当查询词,AI 自动给图片配的 caption 也越来越啰嗦。Long-CLIP 要解决的就是这个尴尬:给弟弟做个不大不小的手术,让他能读 248 个字的长纸条,但又不能让他把原来背得滚瓜烂熟的短词都忘了。
所以这一节是想说:CLIP 是图文搜索/生成的底层地基,但它读文字的能力被 77 字(实际不到 20 字)卡死了,这在"长描述时代"越来越碍事。

之前的人怎么做的,为什么不够好
- 直接截断:超过 77 token 的部分丢掉。最简单,但信息全损,长描述里最关键的细节往往在后半句。
- 从头重训一个长版 CLIP:代价巨大(要几亿图文对),而且很容易把原来练好的 zero-shot 能力(不用额外训练就能分类)搞坏。
- 把文本端换成一个支持长上下文的语言模型(比如接 T5):需要海量数据重新对齐图文两端,费钱费时,而且换了文本端,原来所有依赖 CLIP latent space 的下游模型都得跟着改。
- 位置编码外推(RoPE 式那一套):在大语言模型圈很常见,但 CLIP 用的是"可学习的绝对位置编码",硬外推效果不稳。
- 粗暴微调:直接拿长文本 fine-tune 一下——论文明确指出这会导致 CLIP 原有性能显著下降,得不偿失。
一句话总结痛点:要么太贵(重训),要么会把老本行搞丢(粗暴微调),要么破坏生态(换文本端)。
所以这一节是想说:把 CLIP 扩长这件事,看起来只是"改个长度",实际上一不小心就会把它原来的能力弄坏或者成本爆炸。
这篇论文的新想法
作者像装修队进老房子前先勘察,发现了两条关键线索:
第一,位置编码不能整体一刀切地拉长。 打个比方:CLIP 文字端有 77 个"座位"(每个位置一个可学习的位置向量)。你想扩成 248 个座位,最偷懒的办法是把每个座位都按同一比例拉宽。但前排那 20 个座位是"骨干常客"——CLIP 最依赖的检索信号都集中在前 20 个 token,动它们就跟拆承重墙一样,整栋楼都晃。
第二,光给模型看长文本还不够,得教它分清主次。 CLIP 当年是用很短的图文对(5–15 个词)训出来的,"金毛在草地上"这种短句看得很熟。现在你突然丢给它一段 200 字的细节描写,它分不清哪些词是主干(金毛、草地)、哪些只是修饰(毛色、光线、姿态)。
所以方案是两步走,对应两个英文缩写:KPS(Knowledge-Preserved Stretching,保留知识的拉伸)——只把后排座位拉宽、前排骨干原封不动;PCM(Primary Component Matching,主成分匹配)——显式告诉模型"长描述里抽掉修饰、剩下的主干,应该跟图里最显眼的部分对上号"。整套方案只用了额外 100 万条长图文对,训练成本极低,而且换上去即插即用。
所以这一节是想说:核心创新是"分段保护位置编码 + 双粒度对齐",用小改动避开了重训和遗忘两个坑。
它分几步做的(方法)
Long-CLIP 的方法可以拆成四块:位置编码手术(KPS)、造长文本训练料、双粒度匹配(PCM)、以及保住老能力的约束。下面每一块我都按"输入 → 处理 → 输出"讲清楚。
1. KPS:只给后排座位加长的位置编码插值
类比。 一个 77 座的小礼堂要扩成 248 座。前排 20 个座位是老骨干,一动就晃;后排 57 个座位关系不大,可以按比例拉宽塞人。
输入。 CLIP 原本训好的 77 个可学习位置向量(learnable absolute positional embedding,就是"告诉模型这是第几个字"的一串向量)。
处理。 把这 77 个位置切成两段:
- 前 20 个位置:一动不动,原样保留。因为 CLIP 文本编码最后用 EOS token(句子结尾的特殊符号,它的输出被当成整段文字的"总摘要",类似 BERT 里的 CLS token)来概括全句,而这份摘要主要靠前面这段扎实训练过的位置。
- 后 57 个位置:做 4 倍插值拉开。所谓插值(interpolation),就是"你只有第 20、24、28 个位置的向量,现在要补出第 21、22、23 个",用相邻位置按比例算出中间值。57 × 4 = 228,再加上前面保留的 20,凑成 20 + 228 = 248 的新长度。
等一下——"插值"到底是什么?想象你只知道 20、30、40 三个数据点,现在要补出 25、35。最简单的办法是"取相邻两个的平均"。位置编码插值就是把已经训好的位置向量,按比例算出中间没见过的位置该长什么样,这样模型不用重新学就能"认识"更长的位置。
输出。 一套支持 248 长度、但前段完全保留原知识的新位置编码。这是全文最不平凡的设计选择:不是"平均稀释所有位置",而是"保护训练最充分的前段,只拉伸不重要的后段"。
所以这一节是想说:KPS 通过"前段保留 + 后段插值"把长度扩到 248,同时护住了 CLIP 最依赖的那部分位置知识。
2. 造长文本训练料:给只看过短图说的模型换绘本
输入。 原 CLIP 的训练对大多是"金毛在草地上"这种 5–15 词的短句,不够长。
处理。 论文引入约 100 万条长图文对(来自 ShareGPT4V 这类用强模型自动生成的长描述数据集,单条普遍 100–200 token)。同时,为每张图额外准备一句短摘要(primary/short caption),这条短摘要是下一步 PCM 的关键素材。于是每张图现在有两份文字:一份长描述、一份短摘要。
输出。 一套"长描述 + 短摘要"配对的训练数据,规模才 100 万——相比从头训 CLIP 要的几亿对,这点量非常省。
所以这一节是想说:只用 100 万条长图文对当"新教材",成本极低,还顺手给每张图配了长短两种文字,为双粒度对齐铺路。
3. PCM:让长描述配整图、短摘要配主体
这是全篇的第二个创新点,目的是教模型"分清主次"。
类比。 一个好学生既要会写"命题作文"(长描述整体对应整张图),也要会写"一句话主旨概括"(短摘要对应图里最显眼的主体)。
输入。 图像 embedding(一张图的数字摘要向量)、长描述 embedding、短摘要 embedding。
处理。 分两条对齐线:
- 主线:长描述 ↔ 完整图像 embedding。整段细节配整张图。
- 副线(PCM 的核心):把图像 embedding 做主成分分解(PCA,principal component analysis,找出向量里贡献最大的那几个方向,相当于"图里最显眼的主体信息"),抽出主分量,强制它和短摘要的 embedding 靠近。
这样一来,模型显式地学到:长描述里把修饰词都剥掉、剩下的主干,对应的就是图里最显眼的那个东西。粒度被拆成了两层:细节层和主体层。
**主成分(principal component)**是什么?想象一堆散点,你想用一根最能"代表大方向"的箭头去概括它们,这根箭头就是第一主成分。对图像向量做这件事,就是找出"这张图最主要在讲什么"。
输出。 一个既能匹配长描述细节、又不丢失"图像主体 ↔ 短概括"这层粗粒度对齐的文本编码器。
所以这一节是想说:PCM 用"长配整图、短配主体"的双粒度约束,教会模型在长描述里分辨主干和修饰。
4. 保住老能力:别把短文本本事练丢了
输入。 训练过程中同时面对新长文本任务和旧短文本能力。
处理。 训练时施加约束,让模型在学新长描述的同时,尽量对齐/保持原 CLIP 的行为(论文强调"aligns the CLIP latent space",即让改造后的表示空间仍与原 CLIP 兼容,具体损失形式需读原文)。这就是为什么 Long-CLIP 可以即插即用——它的 latent space 和原 CLIP 对齐,下游框架(比如 Stable Diffusion)里直接把 CLIP 换成它,不需要任何再适配。
输出。 一个在长文本上大涨、在短文本/zero-shot 上不掉甚至略涨、且能无缝替换原 CLIP 的模型。
下面用一张 ASCII 图把整条流水线串起来:
┌──────────── 长描述(100~200 token)────────────┐
│ "一只穿毛衣的橘猫坐在窗台,阳光洒在花纹上..." │
└───────────────┬───────────────────────────────┘
│ 文本编码器(位置编码已被 KPS 扩到 248)
▼
前20位置[保留] + 后57位置[×4插值] ──► 长文本 embedding ──┐
│ 主线对齐
短摘要 "一只橘猫" ──► 短文本 embedding ──┐ ▼
│ [完整图像 embedding]
└─PCM副线─►[图像主成分]
再用一张 ASCII 图看清 KPS"分段处理座位"的直觉(前段护住、后段拉伸):
原始 77 座: [1..20 骨干常客·原封不动][21..77 后排·较少依赖]
│保留 │×4 插值拉开
▼ ▼
扩后 248 座: [1 .. 20 原样][ 20 + 57×4 = 248 个新座位 ]
└─承重墙不动─┘└──────── 外延墙加长 ────────┘
方法这一大块占了本文最核心的篇幅——记住两把手术刀就够了:KPS 管"读得长",PCM 管"分得清"。
所以这一整节是想说:Long-CLIP = 位置编码分段扩长(KPS)+ 双粒度对齐(PCM)+ 保持原空间的约束,四步合起来实现"读长不忘短、换上即能用"。

关键数字(What works)
下面这些数字全部来自论文摘要(arXiv:2403.15378)明确报告的结论;未在摘要中给出的细项标注为"原文未报告细节"。
| 指标 | 结果 | 说明 |
|---|---|---|
| CLIP 文本最大长度 | 77 token | 写死的上限 |
| CLIP 文本有效长度 | < 20 token | 实测超过约 20 字后几乎不起作用 |
| Long-CLIP 支持长度 | 248 token | KPS 扩长后的新上限 |
| 额外训练数据 | ~100 万 长图文对 | 相比重训 CLIP 的几亿对极省 |
| 长描述图文检索提升 | 约 +20% | 相对原 CLIP |
| 传统短文本检索提升(COCO / Flickr30k) | 约 +6% | 说明没牺牲老能力,反而略涨 |
| 位置编码策略 | 前 20 保留 + 后段 4× 插值 | KPS 的具体配置 |
数字要传达的三件事:第一,CLIP 的"有效长度不到 20"这个实测发现,本身就颠覆了很多人"CLIP 能读 77 字"的直觉;第二,长文本检索 +20% 是本文最亮眼的收益;第三,短文本还能 +6%,证明"扩长没有把老本行搞丢"——这才是它能即插即用替换 CLIP 的底气。
所以这一节是想说:用 100 万条数据换来"长文本大涨 + 短文本不掉反涨",这笔投入产出比极高。
实验结果说明了什么
论文的实验主要回答三类问题:
- 长文本图文检索(如 ShareGPT4V 长描述集、Urban-1k 等):Long-CLIP 相对原 CLIP 大幅提升(摘要给出约 +20%),证明 KPS + PCM 确实解锁了读长句的能力。
- 短文本检索 + zero-shot 分类:这是"保命实验"——要证明扩长后没把原能力搞坏。结果在 COCO/Flickr30k 上还涨了约 6%,zero-shot 分类保持或略好。这说明"分段保护位置编码"的思路成功避免了灾难性遗忘。
- 下游即插即用:把 Long-CLIP 当 Stable Diffusion 的文本编码器直接替换原 CLIP,就能处理更长、更细节的 prompt,生成更符合描述的图。这个演示性实验是它社区影响力的重要来源——因为它意味着"不换大模型、不改代码"就能升级。
综合来看,实验想传达的信号是:一次设计良好的微创手术,可以在不破坏原能力、不重训的前提下,补上一个被广泛感知的痛点。
所以这一节是想说:实验从"长文本涨、短文本不掉、下游能直接换"三个角度,验证了 KPS+PCM 这套小手术是有效且安全的。
你应该懂的几个新词
- CLIP(Contrastive Language-Image Pre-training):OpenAI 2021 年的图文对比学习模型,把图和文各编码成向量,训练成"配对的图文向量互相靠近"。文本端最大 77 token,被广泛用作 SD、BLIP、早期 LLaVA 的文本组件。
- 位置编码(positional embedding):告诉 Transformer"这是第几个 token"的向量。CLIP 用的是可学习的绝对位置编码(每个位置一个独立训练出来的向量),不像 RoPE 那样天然可外推。
- KPS(Knowledge-Preserved Stretching):本文术语。前段位置编码保留、后段插值拉伸的扩长策略。
- PCM(Primary Component Matching):本文术语。让图像主成分对齐短摘要、长描述对齐完整图像,形成双层语义粒度。
- EOS token:文本编码器句尾的特殊符号,它的输出被当作整段文字的表示(类似 BERT 的 CLS)。
- 主成分分析(PCA):从一堆向量里找出"最能代表大方向"的几根轴,用来抽取图像的主体信息。
- 即插即用(plug-and-play):因为 latent space 与原 CLIP 对齐,可直接替换而无需下游再训练。
- ShareGPT4V:一个用强多模态模型给图像自动生成长描述的数据集,是长描述训练的常用素材。
所以这一节是想说:把这几个词和生活类比挂钩,以后看任何"改 CLIP"的工作都会反复用到。
它有什么搞不定的
- 248 仍然是有限的:扩到 248 token 已经能覆盖绝大多数长描述,但对超长文档(上千 token)依然无能为力,那种场景还是得换真正的长上下文语言模型。
- 依赖长描述数据的质量:训练料里的长描述若由模型自动生成,可能带有幻觉或风格偏差,会被 Long-CLIP 一并学进去。
- PCA 主成分是一种近似:用"主分量 ↔ 短摘要"来代表"图像主体 ↔ 概括",是个巧妙但粗糙的假设;当图里没有明显主体(比如复杂街景)时,这条副线的意义会被稀释。
- 仍是绝对位置编码的路子:KPS 是针对 CLIP 这种可学习绝对位置的定制方案,不像 RoPE 那样有统一优雅的外推理论,换到别的架构未必照搬有效。
- 没有改视觉端的分辨率:Long-CLIP 只治了"文字太短",图像端该看不清小物体、细纹理的老问题依旧存在。
所以这一节是想说:它治好了"读得短",但没治"读得超长""看得细",而且方案是 CLIP 专属的定制手术。
它和别的几篇是什么关系
- 承上:CLIP(Radford 2021)是直接的修改对象,本笔记的一切都建立在你先理解 CLIP 之上。
- 同代竞品:DCI、各类 LongCLIP-style 方案都在给 CLIP 加长,但 Long-CLIP 因为方法简单、可即插即用,是被引用最多的方案之一。
- 邻居:SigLIP、EVA-CLIP、MetaCLIP 是"改 CLIP"的另几个方向(改损失、改数据、改训练),和 Long-CLIP 的"改文本长度"是互补的微创新。
- 下游受益者:Stable Diffusion 系列、PixArt、各类多模态 RAG 系统。SD3 已选择 T5-XXL 当长文本端,但 Long-CLIP 给"不想换大模型、只想小修小补"的人留了一条路。
- 和 LLM 上下文外推的关系:思想相通(不重训只调位置编码),但 CLIP 用绝对可学习位置编码,技术细节差别较大。
所以这一节是想说:Long-CLIP 是"改 CLIP"家族里主打"扩文本长度"的代表作,和改损失/改数据的兄弟们互补。
和本导读的关系
本笔记对应导读 Ch08: VLM 地基 (I)——CLIP,教 AI 同时认图和认字。那一章讲清了 CLIP 如何用对比学习把图和文对齐,以及它为什么成了几乎所有多模态系统的地基。Long-CLIP 正是这块地基的一次关键补强:它让你在读到任何"用 CLIP 做 X"的工作时,都能多问一句"它的 77 token(实际 <20)限制怎么办"。读完本篇,再回看同章的 clip、siglip、eva-clip,能串出"CLIP 及其各种微创新"的完整地图。
所以这一节是想说:把 Long-CLIP 放进 Ch08 的 CLIP 家族里读,你会更清楚"地基组件可以怎么被打补丁"。
思考题
Q1:为什么 KPS 要保留前 20 个位置不动,而不是把所有位置均匀插值?
提示
想想 CLIP 文本端最后用什么 token 概括整句、那个总摘要主要依赖哪段位置的训练;再想"承重墙"和"外延墙"的区别。均匀插值会把训练最充分的前段一起稀释。
Q2:论文说 CLIP 的"有效长度不到 20",这个发现为什么比"上限是 77"更重要?
提示
上限是硬约束,有效长度是软事实。如果连 77 都用不满,说明问题不只是"截断",而是"训练时就没见过长句",这决定了要不要额外造长文本训练料。
Q3:PCM 用图像主成分对齐短摘要,如果一张图没有明显主体(比如密集街景),这条副线还有意义吗?
提示
主成分假设"图里有个最显眼的主体"。当信息均匀分散时,第一主成分未必对应人类眼中的"主体",对齐信号会变弱。想想这是不是一个隐含前提。
Q4:为什么 Long-CLIP 强调"latent space 与原 CLIP 对齐",这对下游意味着什么?
提示
Stable Diffusion 等模型是围绕原 CLIP 的向量空间训练的。如果新模型输出的向量空间"长得不一样",直接替换就会崩。对齐空间才能"即插即用"。
Q5:如果要把文本长度从 248 再扩到 1000,KPS 这套思路会遇到什么问题?
提示
插值倍数越大,后段位置向量越"糊";而且训练料里超过 248 的长描述本就稀少。想想插值的极限和数据的极限哪个先到。
Q6:只用 100 万条长图文对就够,说明了什么?如果给到 1 亿条会怎样?
提示
这说明"扩长"更像微调而非重训——只需教会模型"用起后面的位置 + 分清主次",不需要重学图文对齐。更多数据可能边际收益递减,但也许能提升长描述的多样性覆盖。
Q7:Long-CLIP 只治了文字端,没治图像端分辨率。你能设计一个"图像端也扩容"的类比手术吗?
提示
类比 KPS:图像 patch 的位置编码能不能也分段扩?或者像 LLaVA-NeXT 那样把大图切块分别编码再拼?想想"保留主分辨率 + 扩展细节区域"的可能性。
一些好奇心问答(FAQ)
Q:我能直接下载 Long-CLIP 换掉我项目里的 CLIP 吗?
可以,这正是它的卖点。因为 latent space 对齐,多数框架里替换权重即可,不用改结构、不用再训练。当然最好先在你的任务上做个 A/B 对比。
Q:它比"直接接一个大语言模型当文本端"差在哪、好在哪?
好在极省(100 万数据、即插即用、不破坏生态);差在长度上限只有 248,处理不了超长文档。要真正的长上下文,还是得换 T5/大模型那条路,但代价高得多。
Q:KPS 里"前 20、后段 ×4"这些数字是拍脑袋定的吗?
不是随手定的,是围绕"CLIP 有效长度约 20"这个实测事实设计的——前 20 恰好覆盖训练最充分的段落。具体的插值比例与消融需读原文实验章节。
Q:Long-CLIP 会继承 CLIP 的偏见吗?
会。它是在 CLIP 基础上微调的,原有的数据偏见(职业/性别刻板印象等)会一并保留,长描述数据若由模型生成还可能引入新的偏差。
Q:读完这篇接着读什么?
建议读 SigLIP(改对比损失)和 EVA-CLIP(改数据与训练),把"改 CLIP"的三条主线(改长度 / 改损失 / 改数据)凑齐。
所以这一节是想说:实操层面它几乎零门槛替换,但要清楚它的能力边界(248 上限)和继承来的偏见。
如果你想再深入
- 前置:CLIP(Radford 2021) — 不懂 CLIP 就无法真正理解本文的每一个手术为什么这么做。
- 同族:SigLIP / EVA-CLIP / MetaCLIP — 看"改 CLIP"的其它方向,建立比较锚点。
- 下游:Stable Diffusion / PixArt — 理解长 prompt 的实际需求,体会 Long-CLIP 的即插即用价值。
- 数据:ShareGPT4V — 理解长描述训练料是怎么来的,以及它的质量隐患。
- 对照:LLM 的位置编码外推(RoPE / NTK-aware) — 对比"绝对可学习位置"和"相对位置"两条外推路线的差异。
所以这一节是想说:把 CLIP → Long-CLIP → SigLIP/EVA-CLIP → 下游生成模型串起来,就能看清"地基组件微创新"这条线的全貌。
原文信息
- 标题:Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 作者:Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang
- 会议:ECCV 2024
- arXiv:https://arxiv.org/abs/2403.15378
@inproceedings{zhang2024longclip,
title = {Long-CLIP: Unlocking the Long-Text Capability of CLIP},
author = {Zhang, Beichen and Zhang, Pan and Dong, Xiaoyi and Zang, Yuhang and Wang, Jiaqi},
booktitle = {European Conference on Computer Vision (ECCV)},
year = {2024},
url = {https://arxiv.org/abs/2403.15378}
}
◼
引用本笔记 / Cite this note
@online{eai_long_clip_2026,
title = {(readable note) Long-CLIP: Unlocking the Long-Text Capability of CLIP},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/long-clip/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?