Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 142

Long-CLIP: Unlocking the Long-Text Capability of CLIP

17 min read · 5776 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话,术语第一次出现一定给类比。读完你应该能对别人讲清楚"CLIP 为什么读不了长句子,Long-CLIP 用了哪两个小手术把它治好"。

一句话讲什么(TL;DR)

给一个只能读 77 字短纸条、而且实际上超过 20 个字就看糊的 CLIP,做两个精准的小手术,让它能读 248 字的长描述,同时又没忘掉原来认识的那些短词——而且换上去就能用,不用改下游任何代码。

所以这一节是想说:这篇论文用最小的代价,把 CLIP 的"文字阅读能力"从短句扩到了长段。


这是个什么场景

想象你在用一个图片搜索 App。你输入"一只猫",它就翻出一堆猫的照片。这背后干活的模型叫 CLIP——它像一对双胞胎:哥哥专门看图,弟弟专门读文字,两人从小被训练成"一对上号就齐刷刷点头"。你打的字和某张图越搭,它俩输出的数字就越像。

但弟弟有个怪癖:他只能读不超过 77 个字的纸条(这是 CLIP 文本编码器写死的最大输入长度)。你随手输个"猫"没问题;可一旦你想找"穿着小毛衣、坐在窗台上、阳光打在橘色花纹上、旁边还有一杯冒热气咖啡的英短"——这种细节满满的长描述,他要么把后半句直接剪掉,要么读得稀里糊涂。更糟的是论文实测发现:CLIP 文字端的有效长度其实连 20 个字都不到,后面就算塞进去也基本没起作用。

而现在大家越来越想"说人话"地搜东西、画东西:用 Stable Diffusion 画图要喂长 prompt,做图文检索想用整段描述当查询词,AI 自动给图片配的 caption 也越来越啰嗦。Long-CLIP 要解决的就是这个尴尬:给弟弟做个不大不小的手术,让他能读 248 个字的长纸条,但又不能让他把原来背得滚瓜烂熟的短词都忘了。

所以这一节是想说:CLIP 是图文搜索/生成的底层地基,但它读文字的能力被 77 字(实际不到 20 字)卡死了,这在"长描述时代"越来越碍事。


Long-CLIP — 场景示意:这论文要解决的现实问题
Plate Nº ILong-CLIP — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 直接截断:超过 77 token 的部分丢掉。最简单,但信息全损,长描述里最关键的细节往往在后半句。
  • 从头重训一个长版 CLIP:代价巨大(要几亿图文对),而且很容易把原来练好的 zero-shot 能力(不用额外训练就能分类)搞坏。
  • 把文本端换成一个支持长上下文的语言模型(比如接 T5):需要海量数据重新对齐图文两端,费钱费时,而且换了文本端,原来所有依赖 CLIP latent space 的下游模型都得跟着改。
  • 位置编码外推(RoPE 式那一套):在大语言模型圈很常见,但 CLIP 用的是"可学习的绝对位置编码",硬外推效果不稳。
  • 粗暴微调:直接拿长文本 fine-tune 一下——论文明确指出这会导致 CLIP 原有性能显著下降,得不偿失。

一句话总结痛点:要么太贵(重训),要么会把老本行搞丢(粗暴微调),要么破坏生态(换文本端)

所以这一节是想说:把 CLIP 扩长这件事,看起来只是"改个长度",实际上一不小心就会把它原来的能力弄坏或者成本爆炸。


这篇论文的新想法

作者像装修队进老房子前先勘察,发现了两条关键线索:

第一,位置编码不能整体一刀切地拉长。 打个比方:CLIP 文字端有 77 个"座位"(每个位置一个可学习的位置向量)。你想扩成 248 个座位,最偷懒的办法是把每个座位都按同一比例拉宽。但前排那 20 个座位是"骨干常客"——CLIP 最依赖的检索信号都集中在前 20 个 token,动它们就跟拆承重墙一样,整栋楼都晃。

第二,光给模型看长文本还不够,得教它分清主次。 CLIP 当年是用很短的图文对(5–15 个词)训出来的,"金毛在草地上"这种短句看得很熟。现在你突然丢给它一段 200 字的细节描写,它分不清哪些词是主干(金毛、草地)、哪些只是修饰(毛色、光线、姿态)。

所以方案是两步走,对应两个英文缩写:KPS(Knowledge-Preserved Stretching,保留知识的拉伸)——只把后排座位拉宽、前排骨干原封不动;PCM(Primary Component Matching,主成分匹配)——显式告诉模型"长描述里抽掉修饰、剩下的主干,应该跟图里最显眼的部分对上号"。整套方案只用了额外 100 万条长图文对,训练成本极低,而且换上去即插即用。

所以这一节是想说:核心创新是"分段保护位置编码 + 双粒度对齐",用小改动避开了重训和遗忘两个坑。


它分几步做的(方法)

Long-CLIP 的方法可以拆成四块:位置编码手术(KPS)、造长文本训练料、双粒度匹配(PCM)、以及保住老能力的约束。下面每一块我都按"输入 → 处理 → 输出"讲清楚。

1. KPS:只给后排座位加长的位置编码插值

类比。 一个 77 座的小礼堂要扩成 248 座。前排 20 个座位是老骨干,一动就晃;后排 57 个座位关系不大,可以按比例拉宽塞人。

输入。 CLIP 原本训好的 77 个可学习位置向量(learnable absolute positional embedding,就是"告诉模型这是第几个字"的一串向量)。

处理。 把这 77 个位置切成两段:

  • 前 20 个位置:一动不动,原样保留。因为 CLIP 文本编码最后用 EOS token(句子结尾的特殊符号,它的输出被当成整段文字的"总摘要",类似 BERT 里的 CLS token)来概括全句,而这份摘要主要靠前面这段扎实训练过的位置。
  • 后 57 个位置:做 4 倍插值拉开。所谓插值(interpolation),就是"你只有第 20、24、28 个位置的向量,现在要补出第 21、22、23 个",用相邻位置按比例算出中间值。57 × 4 = 228,再加上前面保留的 20,凑成 20 + 228 = 248 的新长度。

等一下——"插值"到底是什么?想象你只知道 20、30、40 三个数据点,现在要补出 25、35。最简单的办法是"取相邻两个的平均"。位置编码插值就是把已经训好的位置向量,按比例算出中间没见过的位置该长什么样,这样模型不用重新学就能"认识"更长的位置。

输出。 一套支持 248 长度、但前段完全保留原知识的新位置编码。这是全文最不平凡的设计选择:不是"平均稀释所有位置",而是"保护训练最充分的前段,只拉伸不重要的后段"。

所以这一节是想说:KPS 通过"前段保留 + 后段插值"把长度扩到 248,同时护住了 CLIP 最依赖的那部分位置知识。

2. 造长文本训练料:给只看过短图说的模型换绘本

输入。 原 CLIP 的训练对大多是"金毛在草地上"这种 5–15 词的短句,不够长。

处理。 论文引入约 100 万条长图文对(来自 ShareGPT4V 这类用强模型自动生成的长描述数据集,单条普遍 100–200 token)。同时,为每张图额外准备一句短摘要(primary/short caption),这条短摘要是下一步 PCM 的关键素材。于是每张图现在有两份文字:一份长描述、一份短摘要。

输出。 一套"长描述 + 短摘要"配对的训练数据,规模才 100 万——相比从头训 CLIP 要的几亿对,这点量非常省。

所以这一节是想说:只用 100 万条长图文对当"新教材",成本极低,还顺手给每张图配了长短两种文字,为双粒度对齐铺路。

3. PCM:让长描述配整图、短摘要配主体

这是全篇的第二个创新点,目的是教模型"分清主次"。

类比。 一个好学生既要会写"命题作文"(长描述整体对应整张图),也要会写"一句话主旨概括"(短摘要对应图里最显眼的主体)。

输入。 图像 embedding(一张图的数字摘要向量)、长描述 embedding、短摘要 embedding。

处理。 分两条对齐线:

  • 主线:长描述 ↔ 完整图像 embedding。整段细节配整张图。
  • 副线(PCM 的核心):把图像 embedding 做主成分分解(PCA,principal component analysis,找出向量里贡献最大的那几个方向,相当于"图里最显眼的主体信息"),抽出主分量,强制它和短摘要的 embedding 靠近。

这样一来,模型显式地学到:长描述里把修饰词都剥掉、剩下的主干,对应的就是图里最显眼的那个东西。粒度被拆成了两层:细节层和主体层。

**主成分(principal component)**是什么?想象一堆散点,你想用一根最能"代表大方向"的箭头去概括它们,这根箭头就是第一主成分。对图像向量做这件事,就是找出"这张图最主要在讲什么"。

输出。 一个既能匹配长描述细节、又不丢失"图像主体 ↔ 短概括"这层粗粒度对齐的文本编码器。

所以这一节是想说:PCM 用"长配整图、短配主体"的双粒度约束,教会模型在长描述里分辨主干和修饰。

4. 保住老能力:别把短文本本事练丢了

输入。 训练过程中同时面对新长文本任务和旧短文本能力。

处理。 训练时施加约束,让模型在学新长描述的同时,尽量对齐/保持原 CLIP 的行为(论文强调"aligns the CLIP latent space",即让改造后的表示空间仍与原 CLIP 兼容,具体损失形式需读原文)。这就是为什么 Long-CLIP 可以即插即用——它的 latent space 和原 CLIP 对齐,下游框架(比如 Stable Diffusion)里直接把 CLIP 换成它,不需要任何再适配。

输出。 一个在长文本上大涨、在短文本/zero-shot 上不掉甚至略涨、且能无缝替换原 CLIP 的模型。

下面用一张 ASCII 图把整条流水线串起来:

             ┌──────────── 长描述(100~200 token)────────────┐
             │  "一只穿毛衣的橘猫坐在窗台,阳光洒在花纹上..."   │
             └───────────────┬───────────────────────────────┘
                             │  文本编码器(位置编码已被 KPS 扩到 248)
                             ▼
   前20位置[保留] + 后57位置[×4插值] ──► 长文本 embedding ──┐
                                                            │ 主线对齐
   短摘要 "一只橘猫" ──► 短文本 embedding ──┐               ▼
                                            │        [完整图像 embedding]
                                            └─PCM副线─►[图像主成分]

再用一张 ASCII 图看清 KPS"分段处理座位"的直觉(前段护住、后段拉伸):

   原始 77 座:  [1..20 骨干常客·原封不动][21..77 后排·较少依赖]
                     │保留                    │×4 插值拉开
                     ▼                        ▼
   扩后 248 座: [1 .. 20 原样][   20 + 57×4 = 248 个新座位   ]
                 └─承重墙不动─┘└──────── 外延墙加长 ────────┘

方法这一大块占了本文最核心的篇幅——记住两把手术刀就够了:KPS 管"读得长",PCM 管"分得清"

所以这一整节是想说:Long-CLIP = 位置编码分段扩长(KPS)+ 双粒度对齐(PCM)+ 保持原空间的约束,四步合起来实现"读长不忘短、换上即能用"。


Long-CLIP — 方法示意:核心 pipeline
Plate Nº IILong-CLIP — 方法示意:核心 pipeline

关键数字(What works)

下面这些数字全部来自论文摘要(arXiv:2403.15378)明确报告的结论;未在摘要中给出的细项标注为"原文未报告细节"。

指标 结果 说明
CLIP 文本最大长度 77 token 写死的上限
CLIP 文本有效长度 < 20 token 实测超过约 20 字后几乎不起作用
Long-CLIP 支持长度 248 token KPS 扩长后的新上限
额外训练数据 ~100 万 长图文对 相比重训 CLIP 的几亿对极省
长描述图文检索提升 +20% 相对原 CLIP
传统短文本检索提升(COCO / Flickr30k) +6% 说明没牺牲老能力,反而略涨
位置编码策略 前 20 保留 + 后段 4× 插值 KPS 的具体配置

数字要传达的三件事:第一,CLIP 的"有效长度不到 20"这个实测发现,本身就颠覆了很多人"CLIP 能读 77 字"的直觉;第二,长文本检索 +20% 是本文最亮眼的收益;第三,短文本还能 +6%,证明"扩长没有把老本行搞丢"——这才是它能即插即用替换 CLIP 的底气。

所以这一节是想说:用 100 万条数据换来"长文本大涨 + 短文本不掉反涨",这笔投入产出比极高。


实验结果说明了什么

论文的实验主要回答三类问题:

  • 长文本图文检索(如 ShareGPT4V 长描述集、Urban-1k 等):Long-CLIP 相对原 CLIP 大幅提升(摘要给出约 +20%),证明 KPS + PCM 确实解锁了读长句的能力。
  • 短文本检索 + zero-shot 分类:这是"保命实验"——要证明扩长后没把原能力搞坏。结果在 COCO/Flickr30k 上还涨了约 6%,zero-shot 分类保持或略好。这说明"分段保护位置编码"的思路成功避免了灾难性遗忘。
  • 下游即插即用:把 Long-CLIP 当 Stable Diffusion 的文本编码器直接替换原 CLIP,就能处理更长、更细节的 prompt,生成更符合描述的图。这个演示性实验是它社区影响力的重要来源——因为它意味着"不换大模型、不改代码"就能升级。

综合来看,实验想传达的信号是:一次设计良好的微创手术,可以在不破坏原能力、不重训的前提下,补上一个被广泛感知的痛点。

所以这一节是想说:实验从"长文本涨、短文本不掉、下游能直接换"三个角度,验证了 KPS+PCM 这套小手术是有效且安全的。


你应该懂的几个新词

  • CLIP(Contrastive Language-Image Pre-training):OpenAI 2021 年的图文对比学习模型,把图和文各编码成向量,训练成"配对的图文向量互相靠近"。文本端最大 77 token,被广泛用作 SD、BLIP、早期 LLaVA 的文本组件。
  • 位置编码(positional embedding):告诉 Transformer"这是第几个 token"的向量。CLIP 用的是可学习的绝对位置编码(每个位置一个独立训练出来的向量),不像 RoPE 那样天然可外推。
  • KPS(Knowledge-Preserved Stretching):本文术语。前段位置编码保留、后段插值拉伸的扩长策略。
  • PCM(Primary Component Matching):本文术语。让图像主成分对齐短摘要、长描述对齐完整图像,形成双层语义粒度。
  • EOS token:文本编码器句尾的特殊符号,它的输出被当作整段文字的表示(类似 BERT 的 CLS)。
  • 主成分分析(PCA):从一堆向量里找出"最能代表大方向"的几根轴,用来抽取图像的主体信息。
  • 即插即用(plug-and-play):因为 latent space 与原 CLIP 对齐,可直接替换而无需下游再训练。
  • ShareGPT4V:一个用强多模态模型给图像自动生成长描述的数据集,是长描述训练的常用素材。

所以这一节是想说:把这几个词和生活类比挂钩,以后看任何"改 CLIP"的工作都会反复用到。


它有什么搞不定的

  • 248 仍然是有限的:扩到 248 token 已经能覆盖绝大多数长描述,但对超长文档(上千 token)依然无能为力,那种场景还是得换真正的长上下文语言模型。
  • 依赖长描述数据的质量:训练料里的长描述若由模型自动生成,可能带有幻觉或风格偏差,会被 Long-CLIP 一并学进去。
  • PCA 主成分是一种近似:用"主分量 ↔ 短摘要"来代表"图像主体 ↔ 概括",是个巧妙但粗糙的假设;当图里没有明显主体(比如复杂街景)时,这条副线的意义会被稀释。
  • 仍是绝对位置编码的路子:KPS 是针对 CLIP 这种可学习绝对位置的定制方案,不像 RoPE 那样有统一优雅的外推理论,换到别的架构未必照搬有效。
  • 没有改视觉端的分辨率:Long-CLIP 只治了"文字太短",图像端该看不清小物体、细纹理的老问题依旧存在。

所以这一节是想说:它治好了"读得短",但没治"读得超长""看得细",而且方案是 CLIP 专属的定制手术。


它和别的几篇是什么关系

  • 承上:CLIP(Radford 2021)是直接的修改对象,本笔记的一切都建立在你先理解 CLIP 之上。
  • 同代竞品:DCI、各类 LongCLIP-style 方案都在给 CLIP 加长,但 Long-CLIP 因为方法简单、可即插即用,是被引用最多的方案之一。
  • 邻居:SigLIP、EVA-CLIP、MetaCLIP 是"改 CLIP"的另几个方向(改损失、改数据、改训练),和 Long-CLIP 的"改文本长度"是互补的微创新。
  • 下游受益者:Stable Diffusion 系列、PixArt、各类多模态 RAG 系统。SD3 已选择 T5-XXL 当长文本端,但 Long-CLIP 给"不想换大模型、只想小修小补"的人留了一条路。
  • 和 LLM 上下文外推的关系:思想相通(不重训只调位置编码),但 CLIP 用绝对可学习位置编码,技术细节差别较大。

所以这一节是想说:Long-CLIP 是"改 CLIP"家族里主打"扩文本长度"的代表作,和改损失/改数据的兄弟们互补。


和本导读的关系

本笔记对应导读 Ch08: VLM 地基 (I)——CLIP,教 AI 同时认图和认字。那一章讲清了 CLIP 如何用对比学习把图和文对齐,以及它为什么成了几乎所有多模态系统的地基。Long-CLIP 正是这块地基的一次关键补强:它让你在读到任何"用 CLIP 做 X"的工作时,都能多问一句"它的 77 token(实际 <20)限制怎么办"。读完本篇,再回看同章的 clipsiglipeva-clip,能串出"CLIP 及其各种微创新"的完整地图。

所以这一节是想说:把 Long-CLIP 放进 Ch08 的 CLIP 家族里读,你会更清楚"地基组件可以怎么被打补丁"。


思考题

Q1:为什么 KPS 要保留前 20 个位置不动,而不是把所有位置均匀插值?

提示

想想 CLIP 文本端最后用什么 token 概括整句、那个总摘要主要依赖哪段位置的训练;再想"承重墙"和"外延墙"的区别。均匀插值会把训练最充分的前段一起稀释。

Q2:论文说 CLIP 的"有效长度不到 20",这个发现为什么比"上限是 77"更重要?

提示

上限是硬约束,有效长度是软事实。如果连 77 都用不满,说明问题不只是"截断",而是"训练时就没见过长句",这决定了要不要额外造长文本训练料。

Q3:PCM 用图像主成分对齐短摘要,如果一张图没有明显主体(比如密集街景),这条副线还有意义吗?

提示

主成分假设"图里有个最显眼的主体"。当信息均匀分散时,第一主成分未必对应人类眼中的"主体",对齐信号会变弱。想想这是不是一个隐含前提。

Q4:为什么 Long-CLIP 强调"latent space 与原 CLIP 对齐",这对下游意味着什么?

提示

Stable Diffusion 等模型是围绕原 CLIP 的向量空间训练的。如果新模型输出的向量空间"长得不一样",直接替换就会崩。对齐空间才能"即插即用"。

Q5:如果要把文本长度从 248 再扩到 1000,KPS 这套思路会遇到什么问题?

提示

插值倍数越大,后段位置向量越"糊";而且训练料里超过 248 的长描述本就稀少。想想插值的极限和数据的极限哪个先到。

Q6:只用 100 万条长图文对就够,说明了什么?如果给到 1 亿条会怎样?

提示

这说明"扩长"更像微调而非重训——只需教会模型"用起后面的位置 + 分清主次",不需要重学图文对齐。更多数据可能边际收益递减,但也许能提升长描述的多样性覆盖。

Q7:Long-CLIP 只治了文字端,没治图像端分辨率。你能设计一个"图像端也扩容"的类比手术吗?

提示

类比 KPS:图像 patch 的位置编码能不能也分段扩?或者像 LLaVA-NeXT 那样把大图切块分别编码再拼?想想"保留主分辨率 + 扩展细节区域"的可能性。


一些好奇心问答(FAQ)

Q:我能直接下载 Long-CLIP 换掉我项目里的 CLIP 吗?

可以,这正是它的卖点。因为 latent space 对齐,多数框架里替换权重即可,不用改结构、不用再训练。当然最好先在你的任务上做个 A/B 对比。

Q:它比"直接接一个大语言模型当文本端"差在哪、好在哪?

好在极省(100 万数据、即插即用、不破坏生态);差在长度上限只有 248,处理不了超长文档。要真正的长上下文,还是得换 T5/大模型那条路,但代价高得多。

Q:KPS 里"前 20、后段 ×4"这些数字是拍脑袋定的吗?

不是随手定的,是围绕"CLIP 有效长度约 20"这个实测事实设计的——前 20 恰好覆盖训练最充分的段落。具体的插值比例与消融需读原文实验章节。

Q:Long-CLIP 会继承 CLIP 的偏见吗?

会。它是在 CLIP 基础上微调的,原有的数据偏见(职业/性别刻板印象等)会一并保留,长描述数据若由模型生成还可能引入新的偏差。

Q:读完这篇接着读什么?

建议读 SigLIP(改对比损失)和 EVA-CLIP(改数据与训练),把"改 CLIP"的三条主线(改长度 / 改损失 / 改数据)凑齐。

所以这一节是想说:实操层面它几乎零门槛替换,但要清楚它的能力边界(248 上限)和继承来的偏见。


如果你想再深入

  1. 前置:CLIP(Radford 2021) — 不懂 CLIP 就无法真正理解本文的每一个手术为什么这么做。
  2. 同族:SigLIP / EVA-CLIP / MetaCLIP — 看"改 CLIP"的其它方向,建立比较锚点。
  3. 下游:Stable Diffusion / PixArt — 理解长 prompt 的实际需求,体会 Long-CLIP 的即插即用价值。
  4. 数据:ShareGPT4V — 理解长描述训练料是怎么来的,以及它的质量隐患。
  5. 对照:LLM 的位置编码外推(RoPE / NTK-aware) — 对比"绝对可学习位置"和"相对位置"两条外推路线的差异。

所以这一节是想说:把 CLIP → Long-CLIP → SigLIP/EVA-CLIP → 下游生成模型串起来,就能看清"地基组件微创新"这条线的全貌。


原文信息

  • 标题:Long-CLIP: Unlocking the Long-Text Capability of CLIP
  • 作者:Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang
  • 会议:ECCV 2024
  • arXiv:https://arxiv.org/abs/2403.15378
@inproceedings{zhang2024longclip,
  title     = {Long-CLIP: Unlocking the Long-Text Capability of CLIP},
  author    = {Zhang, Beichen and Zhang, Pan and Dong, Xiaoyi and Zang, Yuhang and Wang, Jiaqi},
  booktitle = {European Conference on Computer Vision (ECCV)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2403.15378}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_long_clip_2026,
  title       = {(readable note) Long-CLIP: Unlocking the Long-Text Capability of CLIP},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/long-clip/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?