Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 140

LLaVA-NeXT-Interleave

15 min read · 5255 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

教 AI 像刷图文并茂的小红书:图和字按顺序穿着读,多图、视频、3D 都用这一招,不用各训一个模型。

所以这一节是想说:LLaVA-NeXT-Interleave 用"图文交错"这一种格式,把多图、视频、3D 三类任务统一进一个模型。


这是个什么场景

你周末刷小红书看一篇西湖游记。博主是这么排版的:

"早上到了西湖(图 1),先走苏堤(图 2),划船看断桥拍了正面和侧面两张(图 3、图 4),晚上吃了这家片儿川(图 5)。"

你读的时候图和字是穿着看的——文字告诉你这是哪、在干嘛,图告诉你具体长啥样。要是博主把所有图堆最前面、文字全塞最后,你会看得很累。

可之前大多数 VLM(视觉语言模型,能看图说话的 AI)只会"盯一张照片回答一个问题",相当于只会看单张照片、不会读图文混排的笔记。这篇论文想让模型也能像你刷小红书一样,自然处理"图字穿插"的输入。

而且这一招还能顺便搞定两件事

  • 视频 = 一串按时间排的图(早 → 中 → 晚)。
  • 3D 场景 = 一串从不同角度拍的图(正面/侧面/背面)。

它们本质上都是"多张图 + 几段文字",只是图的来源不同。所以一种"图文穿插"的格式,可以一口气覆盖三类任务。

VLM(Visual-Language Model):能同时处理图像和文字的模型,输入图、输出字。

所以这一节是想说:场景是"多图/视频/3D 各自为战",本文用图文交错格式把它们统一起来。


LLaVA-NeXT-Interleave — 场景示意:这论文要解决的现实问题
Plate Nº ILLaVA-NeXT-Interleave — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 单图 VLM(LLaVA-1.5、BLIP-2、Qwen-VL 早期):一次只看一张图回答问题,遇到多图、视频直接歇菜或只能选一帧。
  • 视频专用模型(Video-LLaMA、VideoChat、Video-LLaVA):专为视频设计架构,加时间编码器或时序 pooling,但跟单图任务不通用。
  • 多图专用模型(Mantis、VPGTrans 等):处理多图但不擅长视频或 3D。
  • 3D 场景模型:单独一个分支,往往用点云 + 专用编码器,不复用 2D VLM 的能力。
  • 共同问题:每加一个新模态就要重训一个新模型,能力分散、scaling 慢、benchmark 各做各的、模型间能力不互通。

模态(modality):信息的种类,比如图像、视频、3D、文本。以前每种模态常常各训一个模型。

所以这一节是想说:以前每种"多图形态"都要单独造模型,能力分散、不互通,本文想用一种格式打通。


这篇论文的新想法

一个格式统一三类任务:把多图、视频、3D 都重新表达成"图文交错序列(interleaved image-text sequence)",然后一个模型一起训练、一起推理。

具体三个 insight:

  1. 数据视角统一:多图问答、视频 caption、3D 场景描述,本质都是"多张图 + 文字",差别只是图来自哪儿(不同物体/不同时刻/不同视角)。
  2. 架构最小改动:在 LLaVA-NeXT 已有的单图架构上扩展,不引入特殊的时序/3D 模块;图们各自走 vision encoder,token 拼起来交给 LLM 处理。
  3. 任务能力可迁移(cross-task transfer):在交错格式上训出的能力,在不同模态间可以互相增强——多图训练的"对比能力"会帮视频"找差异帧"。

图文交错(interleaved image-text):图和文字按出现顺序穿插的序列,如 [文字][图][图][文字][图],区别于"先全部图再文字"。

所以这一节是想说:新想法 = 把三类任务统一成图文交错、架构最小改动、并让能力跨任务迁移。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 数据格式(M4-Instruct):图文混排的菜谱

输入:多图问答、视频、3D 等各类原始数据。

处理:菜谱不会把"步骤 1、2、3"全堆一起再把"翻面图、出锅图、装盘图"塞最后;它会"步骤 1 + 这张图、步骤 2 + 那张图"穿着写。作者照这思路做了 M4-Instruct(M4 = Multi-image 多图 / Multi-frame 多帧 / Multi-view 多视角 / Multi-patch 多切片)统一指令数据集。每条样本长这样:<文字> <图 1> <文字> <图 2> ... <文字>。多图任务塞 2-3 张图找不同,视频按时间塞帧,3D 按视角塞图。具体规模和混合比例需读原文。

输出:一个覆盖四种"多图"场景的统一指令数据集。

等等,先慢一拍——instruction(指令)数据集是什么?简单说:每条都长得像"用户提问 + 标准答案"。比如"对比这两张图哪里不一样?答:左边那只猫多了条领结。"模型靠看大量这种样本,学会"被问就照样回答"。

M4-Instruct:作者构造的统一指令数据集,覆盖 multi-image / multi-frame / multi-view / multi-patch 四种"多图"场景。

2. 模型架构:原班人马接新活

输入:图文交错序列。

处理:不重新装修厨房,只多请几个传菜员——基本沿用 LLaVA-NeXT。配方是 vision encoder(视觉编码器,CLIP/SigLIP 系,具体需读原文)+ projector(投影层,把视觉 token 翻译成 LLM 听得懂的"词")+ LLM backbone(语言主干,Qwen 或 LLaMA 多个尺寸)。多张图来时,每张各走一遍编码器拿到自己的视觉 token,再按顺序穿插进文字 token,整队一起送进 LLM。

输出:LLM 对整个交错序列的理解和回答。

视觉 token(visual token):图片经 vision encoder 后变成的一组向量,每个像 LLM 词表里的一个"词",所以能和文字 token 拼在同一序列里。

3. 训练范式:先认字,再答题

输入:大规模图文对 + M4-Instruct。

处理:走标准 instruction tuning(指令微调)两步——第一步在大规模图文对上预训练,让 vision 端和 LLM 端"对上暗号";第二步在 M4-Instruct 上做指令微调,教模型读懂"图文穿插"的提问方式。是否分更细阶段、各阶段数据比例、超参需读原文。

输出:一个会处理图文交错输入的多模态模型。

4. 推理时的统一接口:一个口子三种点单

输入:用户给 2 张图(多图问答)、16 帧视频(视频问答)或 8 个视角(3D 场景描述)。

处理:像便利店收银台不分早餐、午餐、夜宵,都从同一个口子结账——模型都用同一套 prompt 模板处理。

输出:对三类任务的统一回答。这就是论文说的"a single model handles three multi-image scenarios"——一个模型,吃三类活。

ASCII 总览:

多图/视频/3D ──►[统一成图文交错 M4-Instruct]
                     <文字><图1><文字><图2>...<文字>
                              │
   每张图 ─►[vision encoder]─►[projector]─► visual tokens
                              │  与文字token穿插
                              ▼
                        [LLM backbone]
                              │
   同一 prompt 模板 ══► 多图问答 / 视频问答 / 3D 场景描述

5. 为什么"图文交错"这个格式是统一的钥匙

这一节讲清楚为什么"交错格式"能把看似八竿子打不着的几类任务收进一个模型。

输入:多图问答、视频、多视角 3D 这几类表面上很不一样的任务。

处理:过去的多模态模型大多是"单图 + 一段文字"的固定结构,一次只吃一张图,遇到"两张图找不同""一段视频""一个物体的多个视角"就没法自然表达。LLaVA-NeXT-Interleave 的核心洞察是:这几类任务其实都可以写成同一种形状——图和文字按顺序穿插的一条序列。多图问答是 <文字><图1><文字><图2>;视频是把帧按时间顺序排成 <图t1><图t2>...;3D 是把不同视角的图按顺序排开;高分辨率大图则切成多个小块(patch)依次排列。一旦所有输入都被"翻译"成同一种交错序列,任务之间的边界就消失了——对模型来说它们都只是"一条图文混排的序列",用同一套机制处理即可。这就是"用数据格式的统一,换来任务的统一"。

输出:一个能把多图/视频/多视角/多切片全部收编的通用输入表示。

打个比方:与其为看漫画、看相册、看连环画各造一台专用机器,不如认识到它们都是"图配字、按顺序翻",一台会翻页的机器就全搞定了。

6. 为什么刻意"几乎不改架构"

输入:一个已经很能打的单图模型 LLaVA-NeXT。

处理:面对新任务,最容易想到的是设计新架构,但作者反其道而行——几乎原封不动沿用 LLaVA-NeXT 的三件套(视觉编码器 + 投影层 + LLM 主干),创新几乎全放在数据格式和训练上。为什么?因为单图 LLaVA 已经把"如何把一张图翻译成 LLM 听得懂的 token"这件事解决得很好了;处理多图,本质上只是"把多张图各自编码成 token,再按交错顺序拼进文字序列",LLM 的自注意力天生就能处理任意长的 token 序列、天生就懂 token 的先后顺序。所以根本不需要新结构,只要把图 token 按正确顺序摆进序列即可。这么做的好处是:能直接继承单图模型辛苦攒下的能力,训练也更省、更稳,还避免了引入新结构带来的不确定性。

输出:一个复用成熟单图能力、以最小改动获得多图能力的模型。

所以这一节是想说:真正的创新在"把任务翻译成交错格式",而不在动架构——因为 LLM 处理有序 token 序列的本事本来就够用。

7. 跨任务能力迁移:一起训为什么会"涌现"惊喜

输入:M4-Instruct 里同时包含多图、多帧、多视角、多切片四类交错数据。

处理:把这几类任务混在一起训练,会产生一个单独训练得不到的好处——跨任务迁移。因为它们共享同一种交错表示,模型在一类任务上学到的"如何在多张图之间比较、关联、追踪"的能力,会自然地迁移到别的任务上。比如从"多图找不同"学到的图间对比能力,能帮到"视频里追踪一个物体的变化";从"多视角"学到的空间关联能力,能帮到多图推理。论文观察到模型甚至能处理一些没被显式训练过的组合场景,这种"1+1>2"的涌现,正是统一格式 + 多样数据混训的红利。反过来说,如果把每类任务各训一个专用模型,这种互相帮忙就完全被浪费了。

输出:一个因共享表示而具备跨任务迁移、甚至涌现新能力的多模态模型。

8. 视频、3D、高清大图具体怎么落到同一条序列

输入:时间维度的视频、空间维度的多视角、分辨率维度的大图。

处理:这一步把"统一"落到实处。视频被抽成若干关键帧,按时间先后当作一串有序图像放进序列,模型据此理解"随时间发生了什么";多视角 3D 把同一物体/场景的不同角度图按视角排列,模型据此拼出空间结构;一张超高分辨率图则被切成多个小块(multi-patch),每块单独编码后按空间顺序排入序列,既保住细节又不超模型处理能力。三种维度(时间、空间视角、分辨率)最终都被"拍平"成同一种东西:一串有顺序的图像 token。序列里的先后顺序承载了原本的时间/空间/位置信息,LLM 靠位置编码就能读懂。

输出:一套把三种不同维度信息统一编码进单一有序序列的具体映射方案。

所以这一节是想说:把多图/视频/多视角/多切片统一成图文交错数据(这是真正的钥匙),用 LLaVA-NeXT 原架构编码穿插(复用成熟单图能力、最小改动),混训带来跨任务迁移与涌现,指令微调后一个接口吃三类活。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【LLaVA-NeXT-Interleave · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

LLaVA-NeXT-Interleave — 方法示意:核心 pipeline
Plate Nº IILLaVA-NeXT-Interleave — 方法示意:核心 pipeline

关键数字(What works)

LLaVA-NeXT-Interleave 是 arXiv 2024 论文,各 benchmark 精确分数、数据规模需以原文为准,本笔记不编造。下表说明它"测什么、和谁比"。

关注点 对比对象 结果方向(原文为准) 具体数值
多图 benchmark Mantis 等多图模型 单一模型达到/接近专用 SOTA 原文未在本笔记转录
视频 benchmark Video-LLaVA/VideoChat 不用专用时序模块也有竞争力 原文未在本笔记转录
3D benchmark 3D 专用模型 多视角整合有效 原文未在本笔记转录
消融:单模态 vs 三类混训 —— 混训在 cross-task 更强 见原文
模型尺寸 scaling 7B/14B 等 更大更强 见原文

提醒:任何分数与数据规模请以 arXiv 原文(2407.07895)为准。

所以这一节是想说:核心看"单一模型能否在三类任务追平专用 SOTA + 混训是否带来 cross-task 提升",具体值回原文。


实验结果说明了什么

  • 一种格式真能统一三类任务:单一模型在多图/视频/3D 上都达到或接近专用 SOTA,说明图文交错格式的统一性不以牺牲单任务性能为代价。
  • cross-task transfer 真实存在:混训(三类一起)比只训单一模态在跨任务上更强,印证"多图对比能力会迁移到视频找差异帧"这一主张。
  • 不必为每模态加新模块:不引入专用时序/3D 模块也能打,说明"把数据格式改对"往往比"加网络结构"更有效。
  • 数据格式设计 ≥ 架构设计:M4-Instruct 数据集可能比架构改动贡献更大,提醒研究者重视数据视角。

所以这一节是想说:实验证明"统一格式 + 混训"能一个模型吃三类活,且数据格式设计的价值不亚于甚至超过架构。


你应该懂的几个新词

Interleaved image-text format(图文交错格式):图和文字按顺序穿插的输入序列,区别于"先全图再文字"。

Multi-image instruction tuning(多图指令微调):在多图样本上做指令微调,让模型处理"输入有多张图"的任务。

Cross-task transfer(跨任务迁移):一种能力(多图对比)在另一模态(视频帧差异)上自然涌现,不用单独训。

Multi-view(多视角):从不同角度拍同一 3D 物体/场景的多张 2D 图。把 3D 任务降维成多视角图片。

Visual token(视觉 token):图片编码后的向量,能和文字 token 拼在同一序列。

M4-Instruct:覆盖 multi-image/multi-frame/multi-view/multi-patch 的统一指令数据集。

所以这一节是想说:抓住"图文交错、多图指令微调、跨任务迁移、多视角、M4-Instruct"这几个词,就抓住了本文。


它有什么搞不定的

  • 3D 只是"多视角图片"的近似:把 3D 降维成多视角 2D,丢了真实几何/深度信息,对需要精确 3D 结构的任务不够。
  • 无专用时序模块的代价:视频靠"多帧拼序列"处理,长视频、精细时序推理可能不如专门设计时序建模的模型。
  • token 数量爆炸:多图/多帧/多视角意味着大量视觉 token,序列变长、计算和显存压力大。
  • 依赖数据配比:cross-task 效果高度依赖 M4-Instruct 的构造和混合比例,配不好收益有限。
  • 单图能力上限被继承:架构是 LLaVA-NeXT 小改,单图理解上限受限于底座。

所以这一节是想说:本文靠格式统一取胜,但 3D 近似、长视频、token 爆炸、数据依赖都是它的边界。


它和别的几篇是什么关系

  • 承接 LLaVA / LLaVA-1.5 / LLaVA-NeXT:是 LLaVA 系列的多图扩展,单图能力来自 LLaVA-NeXT。
  • 对标 Mantis / VPGTrans:同想做多图 VLM,但本文更统一(覆盖视频和 3D)。
  • 对标 Video-LLaVA / VideoChat:视频理解但不引入专用时序模块,靠交错格式复用单图能力。
  • 铺垫 LLaVA-OneVision / InternVL-2.5 / Qwen2-VL:后续"统一 VLM"基本都接受交错格式作为标准输入,本文是这个范式较早期的代表。
  • 呼应 Flamingo:Flamingo 也处理图文交错,但走 few-shot in-context 范式;本文走 instruction-following 范式。

所以这一节是想说:本文是 LLaVA 家族"多图统一"的中间锚点,上承 LLaVA-NeXT,下启 OneVision/Qwen2-VL。


和本导读的关系

  • 主线章节:Ch09 从 BLIP-2 到 LLaVA。本文是 LLaVA 家族向多图/视频/3D 扩展的关键一步。
  • 多模态:Ch18 多模态生态。图文交错是多模态融合的一种统一范式。
  • 对具身的指引:机器人输入天然是"多摄像头 + 多帧 + 多步骤",正是交错格式擅长的,可当 embodied VLM 输入设计参考。

所以这一节是想说:本文落在 Ch09(LLaVA 家族)与 Ch18(多模态)之间,对具身 VLM 输入设计有启发。


思考题

Q1:为什么"视频"和"3D 场景"能被统一成同一种输入格式?

提示

两者本质都是"多张图 + 文字"——视频是按时间排的图,3D 是按视角排的图,差别只是图的来源。

Q2:什么是 cross-task transfer?举一个本文里的例子。

提示

一种能力在别的模态上自然涌现。例:多图训练学到的"跨图对比"能力,迁移到视频上帮助"找差异帧"。

Q3:本文为什么不给视频加专用时序模块?这有什么好处和风险?

提示

好处是架构统一、复用单图能力、加模态不加模块;风险是长视频/精细时序推理可能不如专门时序建模。

Q4:把 3D 表示成"多视角图片"丢失了什么?

提示

丢失了精确的三维几何和深度关系,对需要真实 3D 结构(如精确测量、遮挡推理)的任务不够。

Q5:为什么说"数据格式设计 ≥ 架构设计"在本文成立?

提示

架构只是 LLaVA-NeXT 小改,真正让模型学会统一处理三类任务的是 M4-Instruct 的数据格式与配比。

Q6:多图/多帧输入带来 token 爆炸,这对部署意味着什么?

提示

序列变长导致计算和显存开销大,长视频或多视角输入可能超出上下文/算力预算,需要压缩或采样。

所以这一节是想说:想清楚这些题,你就理解了"为何能统一""跨任务迁移""无时序模块的取舍""数据格式的价值"这几件核心事。


一些好奇心问答(FAQ)

Q:LLaVA-NeXT-Interleave 开源吗?

是,LLaVA 系列一贯开源,模型和 M4-Instruct 相关资源可获取。

Q:它和 LLaVA-OneVision 什么关系?

同组后续。OneVision 进一步把"单图 + 多图 + 视频"的训练配方系统化,本文是它的前身之一。

Q:视频最多能塞多少帧?

受上下文长度和显存限制,帧数有上限,太长要采样。具体设置需读原文。

Q:它能直接处理点云 3D 吗?

不能。它把 3D 降维成多视角 2D 图片,不吃原始点云。

Q:为什么不为每种任务训专用模型更好?

专用模型能力分散、不互通、维护成本高;统一模型能力互相增强、部署简单,是趋势。

所以这一节是想说:本文对做多模态/具身输入设计的人很有参考价值,核心启示是"改对数据格式能省掉很多架构工作"。


如果你想再深入

  1. 看 Figure 1 + 主表 —— 理解交错格式长啥样、统一了哪些任务。
  2. 前置:LLaVA / LLaVA-NeXT —— 懂单图 VLM 的基础架构。
  3. 读数据章节 —— M4-Instruct 的构造、来源、四类场景占比是真正贡献。
  4. 看 cross-task 消融 —— 验证混训是否真带来迁移。
  5. 续读:LLaVA-OneVision → Qwen2-VL → InternVL-2.5 —— 看统一 VLM 这条线怎么走。

所以这一节是想说:先看格式和主表,补 LLaVA-NeXT,重点读数据章节和 cross-task 消融,再顺到 OneVision。


原文信息

  • 标题:LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
  • arXiv:https://arxiv.org/abs/2407.07895
  • 发表:技术报告(arXiv)
  • 年份:2024
@article{li2024llavainterleave,
  title  = {LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models},
  author = {Li, Feng and others},
  journal = {arXiv preprint arXiv:2407.07895},
  year   = {2024}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_llava_next_interleave_2026,
  title       = {(readable note) LLaVA-NeXT-Interleave},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/llava-next-interleave/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?