Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 141

LLaVA-OneVision: Easy Visual Task Transfer

14 min read · 5054 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

一套配方教会一个模型同时看懂单张图、几张图和视频,开源圈第一次在视频上明显接近顶级闭源模型。

所以这一节是想说:LLaVA-OneVision 靠"喂什么数据、按什么顺序喂"这套配方,让一个模型通吃单图/多图/视频三场景。


这是个什么场景

想象你拿出手机相册,问 AI 三件事:

  • "这张照片里那只猫在干嘛?"(单张图)
  • "我拍了两张菜,你帮我看看哪盘炒得更熟?"(多张图对比)
  • "这段 30 秒的监控里小孩什么时候摔倒的?"(视频)

放在 2024 年之前,开源圈得给你三个不同的 App:一个看单图、一个比对照片、一个看视频,三家用的模型、教材、考试都不一样。在单图 App 里训练得再好的模型,换到视频 App 还是相当于从幼儿园重读。

LLaVA-OneVision 干的事就像把这三个 App 合成一个:同一个 AI,三种场景都能用。而且它还发现:让模型先学会"两张图找不同",它再去看视频时反而更敏锐了——因为视频本质就是"很多张图按时间排好",多图训练出的对比能力会自动迁移过去。

VLM(Visual-Language Model):能同时处理图像和文字的模型,输入图、输出字。

所以这一节是想说:场景是"单图/多图/视频各自为战",OneVision 用一套配方把它们合到一个模型里,还实现能力迁移。


LLaVA-OneVision — 场景示意:这论文要解决的现实问题
Plate Nº ILLaVA-OneVision — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • LLaVA-1.5 / LLaVA-NeXT 系列:主打单图理解,多图和视频是后来零散打补丁加上的。
  • 视频 VLM(VideoChat、Video-LLaVA 等):通常另起炉灶,数据和单图模型不互通。
  • 多图对比任务(Mantis 等):被当成第三类小赛道,规模小、数据稀缺。
  • 闭源模型(GPT-4V、Gemini):天生在三场景统一训练,但权重和数据都拿不到。
  • 结果:开源社区缺的不是模型结构,是"覆盖三场景的高质量数据集 + 训练阶段切分"。

task transfer(任务迁移):在 A 任务上训练,模型在没专门训练的 B 任务上也表现不错。这是本文的核心宣称。

所以这一节是想说:以前开源三场景割裂、数据不互通,缺的正是统一的高质量数据配方和训练阶段切分。


这篇论文的新想法

像教孩子读书一样:先学单字(图)、再学比较(多图)、最后才看动画片(视频)。每个阶段都是下一阶段的台阶,不需要重新教。

核心赌注:视觉任务之间是能"互相借力"的——只要前面的课程喂得对,单图学到的本事能自己"长"到多图和视频上,不必为视频专门造一个新模型。

具体说:

  • 训练分成几个阶段(语言-图像对齐 → 高质量知识灌输 → 视觉指令微调),每阶段端上桌的数据都是精心配比的。
  • 视频不是从零开始(cold start),而是建在"已经会看单图和多图"的模型之上,所以视频数据量可以少,但要精。
  • 视觉编码器用 SigLIP,语言部分用 Qwen-2,结构本身没什么花活——所有创新都压在"喂什么数据、按什么顺序喂"上。

所以这一节是想说:新想法 = 分阶段课程式训练 + 视频建在多图之上 + 把创新全押在数据配方而非架构。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 架构:像三明治一样朴素

输入:图像(单图/多图/视频抽帧)+ 文本。

处理:眼睛(视觉编码器 SigLIP)+ 翻译官(projector)+ 大脑(LLM Qwen-2)。和前几代 LLaVA 几乎一模一样,没加什么花哨的跨模态 attention 或 Q-Former。作者故意保持简单,就是想说:"瞧,不靠结构,光靠配方就能赢。"

输出:LLM 对图文输入的理解和回答。

等等,先慢一拍——visual token 是什么?想象 LLM(语言大脑)只认识"词",给它一张图它一脸懵;那就把图切成一格一格,每格压成一个"假词"喂给它,这个假词就叫 visual token。一张图 = 一段假句子,几张图 = 几段假句子拼起来,视频 = 抽几帧拼成的假句子。对 LLM 来说,三种情况都是"一长串词",没区别——这就是统一的诀窍。

SigLIP:Google 提出的图文对齐模型,用 sigmoid loss 替代 CLIP 的 softmax,训练更稳;这里当视觉特征提取器。

2. Higher AnyRes:动态切图

输入:任意分辨率的图像/多图/视频帧。

处理:就像扫描一张大海报,扫描仪一次只能放 A4 大小,那就把海报切成 A4 一张张扫再拼起来。一张高清图被切成多个 sub-image 分别编码;多张图各扫各的拼一起;视频按时间抽几帧再扫。最后都变成同一种"一串 visual token + 文字"的格式。

输出:统一格式的视觉 token 序列,避免暴力 resize 丢信息。

AnyRes / Higher AnyRes:动态分辨率方案,把任意尺寸的图切成固定大小的 patch 再喂给视觉编码器,保留细节。

3. 训练数据配方:像孩子上学

输入:分阶段的不同数据。

处理

  • 幼儿园:海量普通图文对做语言-图像对齐,先认得"猫狗汽车"。
  • 小学:喂高质量知识密集数据(OCR 文字识别、图表、文档),灌"硬知识"。
  • 中学:才上单图/多图/视频混合的指令微调(具体配比和数据集列表需读原文)。
  • 视频数据量相对少,但因为前两阶段打了底,少量也够用。

输出:一个经过"课程式"培养、三场景都能用的模型。

cold start(冷启动):从零开始训某能力。OneVision 让视频不冷启动,而是建在已会单图/多图的模型上。

4. 任务迁移的证据

输入:训练好的模型 + 它没专门刷过的视频测试集。

处理:作者发现模型在很多它"没专门刷过"的视频测试集上也表现不错。他们把功劳归给多图阶段——模型在多图里练出了"跨画面对比"的肌肉,看视频(本质上就是跨帧对比)时自然就会了。

输出:可量化的任务迁移证据,把"迁移"从口号变成实验结论。

ASCII 总览:

                眼睛 SigLIP ─►[Higher AnyRes 切图]─► visual tokens
                                          │
                            projector 翻译成"假词"
                                          │
                                   大脑 LLM Qwen-2
   训练课程:
     幼儿园(图文对齐) → 小学(OCR/图表/文档硬知识) → 中学(单图+多图+视频指令微调)
                                          │
     多图阶段练出"跨画面对比" ══► 看视频(跨帧对比)时自然会 = task transfer

5. 为什么"把一切都变成一串 visual token"是通吃三场景的地基

这一节讲清楚 OneVision 名字里"One"的真正含义。

输入:单图、多图、视频三种表面上很不同的输入。

处理:LLM 只认识"一串有顺序的 token",它不在乎这些 token 当初是文字还是图片、是一张图还是好几张。OneVision 抓住这一点,把三种场景全部翻译成同一种东西:一段视觉 token + 文字 token 的混合序列。单图 = 一段视觉 token;多图 = 几段视觉 token 拼起来;视频 = 抽若干帧、每帧编码成视觉 token 再按时间拼起来。对 LLM 来说,这三者读进来都只是"一长串词",处理机制完全一样。这就是为什么它能用一个模型、一套架构通吃三类任务——不是因为它为每类任务各设计了一个模块,而是因为它在输入端就把三类任务抹平成了同一种形状。这个统一表示,是后面所有"能力互相迁移"能发生的物理前提。

输出:一个把单图/多图/视频统一成同构序列的输入表示。

打个比方:不管是一张照片、一本相册还是一段录像,最后都被翻译成"一串按顺序排列的画面词",语言大脑读起来毫无区别。

6. Higher AnyRes:为什么不能简单地把图缩小了事

输入:任意分辨率的图,尤其是高清文档、图表、密集文字。

处理:视觉编码器通常只吃固定的、不大的分辨率。最省事的做法是把大图暴力缩小到这个尺寸,但这对文档、图表、小字这类"细节即信息"的图是灾难——缩完字都糊了,OCR、看图表根本没法做。Higher AnyRes 的办法是:不缩,而是把大图切成多个固定大小的子块(sub-image),每块单独编码,再把所有块的 token 拼起来,这样细节被完整保留。多图就各自切各自拼,视频就每帧切了拼。当然这有代价——切得越细 token 越多、算力越贵,所以要在"保细节"和"token 预算"之间权衡。这个动态切图方案,是 OneVision 能在文档理解、图表问答这类细节敏感任务上打得动的关键工程。

输出:一个既保住高分辨率细节、又把不同尺寸输入统一成同一格式的切图机制。

所以这一节是想说:AnyRes 用"切块而非缩小"解决了固定分辨率编码器丢细节的老问题,同时顺手做了格式统一。

7. 课程式数据配方为什么要按这个顺序

输入:性质递进的多批数据。

处理:OneVision 把训练排成一条像人上学的课程,顺序很讲究:

  • 先做图文对齐(幼儿园):用海量普通图文对,让视觉端和语言端先"对上暗号",模型先认得世界上有猫、狗、车这些基本概念。
  • 再灌知识密集数据(小学):OCR、图表、文档这类"硬知识",把模型的视觉理解从"认得出"提升到"读得懂细节"。
  • 最后上指令微调(中学):单图/多图/视频混合的指令数据,教它按人类的提问方式回答,并把多场景能力串起来。

顺序不能乱——没有前面的对齐和知识打底,直接上复杂指令,模型是学不扎实的。特别值得一提的是视频不做冷启动:它不是从零开始学看视频,而是建立在已经会单图、会多图的模型之上,所以即便视频数据量相对少,也够用。这正是课程设计省数据的地方。

输出:一个能力层层递进、且让稀缺的视频数据用得很省的训练课程。

8. 为什么"任务迁移"是这篇论文真正想证明的东西

输入:一个在单图、多图上练得很好,但视频没怎么专门刷的模型。

处理:OneVision 的核心论点(也是它区别于"堆数据刷榜"的地方)是:不同视觉场景之间的能力是可以迁移的。它观察到模型在很多没专门训练过的视频测试上也表现不错,并把功劳归给多图训练阶段——因为"看视频"本质上就是"跨帧对比与追踪",而这正是模型在"多图找不同、多图推理"里练出来的肌肉。换句话说,多图能力自然地迁移成了视频能力。这把"迁移"从一句口号变成了可测量的实验结论,也解释了为什么用相对少的视频数据就能获得不错的视频能力。论文还在 0.5B / 7B / 72B 三档规模上验证这套配方,说明它是可随规模放大的通用方法,而非某个尺寸的偶然。

输出:一个证明"跨视觉场景能力可迁移"、且在多个规模上都成立的统一视觉模型。

所以这一节是想说:朴素三明治架构 + 把一切统一成 visual token 序列(迁移的地基)+ Higher AnyRes 保细节切图 + 课程式数据配方,让能力从单图长到多图、再自然迁移到视频——"任务迁移"才是 OneVision 真正的主张。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【LLaVA-OneVision: Easy Visual Task T… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

LLaVA-OneVision — 方法示意:核心 pipeline
Plate Nº IILLaVA-OneVision — 方法示意:核心 pipeline

关键数字(What works)

LLaVA-OneVision 是 arXiv 2024 论文。可确认的是做了 0.5B / 7B / 72B 三档规模;各 benchmark 精确分数需以原文为准,本笔记不编造。

关注点 对比对象 结果方向(原文为准) 具体数值
单图 benchmark LLaVA-NeXT/InternVL/Qwen-VL 开源领先 原文未在本笔记转录
多图 benchmark Mantis/BLINK 多图能力"不是白送" 原文未在本笔记转录
视频 benchmark 视频专用模型/GPT-4V 参考 明显接近顶级闭源 原文未在本笔记转录
模型档位 —— 0.5B / 7B / 72B 原文报告
消融 数据配比/阶段顺序 影响显著 见原文

提醒:除三档规模外,任何分数请以 arXiv 原文(2408.03326)为准。

所以这一节是想说:能确认的是"三档规模",具体分数回原文;核心看视频是否真接近闭源、任务迁移是否可量化。


实验结果说明了什么

  • 一套配方真能通吃三场景:单图/多图/视频都达到或接近对应最强,说明"统一训练"不必牺牲单任务性能。
  • 任务迁移可量化:模型在没专门训的视频集上也不错,且能归因到多图阶段,说明"能力互相借力"是真实且可验证的。
  • 竞争从结构转向数据:架构只是 SigLIP + projector + Qwen-2 的朴素组合,收益来自数据配方,印证"2024 年 VLM 的 delta 大多不在网络结构上"。
  • 视频不必冷启动:建在多图之上,用少量精数据就能把视频做好,省数据、省算力。

所以这一节是想说:实验证明"课程式数据配方"能让一个朴素架构通吃三场景,并把任务迁移变成可量化结论。


你应该懂的几个新词

VLM(Visual-Language Model):同时处理图像和文字的模型。

AnyRes / Higher AnyRes:动态分辨率方案,把任意尺寸图切成固定 patch 再编码,避免暴力 resize 丢信息。

SigLIP:Google 的图文对齐模型,用 sigmoid loss,训练更稳;这里当视觉编码器。

Visual Instruction Tuning:用"看图回答"格式的数据对 VLM 做监督微调,是 LLaVA 系列招牌。

Task Transfer(任务迁移):在 A 任务训练,B 任务上也表现不错。

Visual Token(视觉 token):图像切片编码后的向量,LLM 可无差别处理。

所以这一节是想说:抓住"AnyRes、SigLIP、视觉指令微调、任务迁移、视觉 token"这几个词,就抓住了 OneVision。


它有什么搞不定的

  • 数据未完全开源:训练 recipe 写得清楚,但不是所有数据都公开,完全复刻仍有门槛。
  • 72B 部署成本高:最强档位对普通用户太重,实际多用 7B 档。
  • 视频仍靠抽帧:视频当"多帧图片"处理,长视频、精细时序推理受抽帧策略限制。
  • 依赖阶段顺序和配比:课程式训练对数据顺序和比例敏感,配错收益大打折扣。
  • 单图上限受底座限制:架构朴素,单图理解上限仍由 SigLIP + Qwen-2 决定。

所以这一节是想说:OneVision 强在配方,但数据未全开、大模型贵、视频靠抽帧、对配比敏感都是边界。


它和别的几篇是什么关系

  • 直接前作LLaVA、LLaVA-1.5、LLaVA-NeXT——架构传承几乎一比一,OneVision 是数据维度的扩展。
  • 近亲LLaVA-NeXT-Interleave——同组前身,先统一了多图/视频/3D 的输入格式,OneVision 把训练配方系统化。
  • 同期开源对手InternVL(2.5)、Qwen-VL、DeepSeek-VL——相似路线(统一架构 + 大量数据),各家配方不同。
  • 视觉编码器:用 SigLIP 作前端,和 CLIP / EVA-CLIP 系是一支。
  • embodied 关联:对 OpenVLART-2 这类机器人 VLA 很重要——VLA 的视觉塔就是 VLM,OneVision 这种"全场景统一"的塔可直接搬过来。

所以这一节是想说:OneVision 是 LLaVA 家族"用数据配方统一三场景"的集大成者,紧接 Interleave 之后。


和本导读的关系

  • 主线章节:Ch09 从 BLIP-2 到 LLaVA。OneVision 是 LLaVA 家族统一三场景的代表,标志"竞争从结构转向数据"。
  • 多模态:Ch18 多模态生态。它是通用视觉塔的候选。
  • 对具身:具身场景是多摄像头 + 多帧,OneVision 这种统一塔可直接当 VLA 的视觉前端。

所以这一节是想说:OneVision 落在 Ch09(LLaVA 家族)与 Ch18(多模态)之间,是具身 VLA 的现成视觉塔候选。


思考题

Q1:为什么"先学多图对比"能帮模型"看视频"?

提示

视频本质是"多张图按时间排",多图训练练出的跨画面对比能力,迁移到视频的跨帧对比上自然生效。

Q2:本文说"竞争从结构转向数据",你怎么理解?

提示

架构只是 SigLIP + projector + Qwen-2 的朴素组合,性能提升主要来自数据配方和训练阶段设计,而非新网络结构。

Q3:Higher AnyRes 解决了什么问题?如果直接把大图 resize 成小图会怎样?

提示

它把大图切块分别编码,保留细节;直接 resize 会丢失小字、细纹理等信息,损害细粒度理解。

Q4:为什么视频数据可以"少但精"?

提示

因为前面单图/多图阶段已经打好底,视频不用冷启动,少量精数据就能把时序对比能力激活。

Q5:课程式训练(幼儿园→小学→中学)如果打乱顺序会怎样?

提示

能力递进被破坏——没先对齐图文就灌硬知识、没打底就上视频,效果会明显下降。

Q6:OneVision 和 Interleave 的分工是什么?

提示

Interleave 先统一了"多图/视频/3D 的输入格式";OneVision 把"单图+多图+视频的训练配方"系统化并做出更强模型。

所以这一节是想说:想清楚这些题,你就理解了"任务迁移""数据 > 结构""AnyRes 的必要""课程顺序"这几件核心事。


一些好奇心问答(FAQ)

Q:LLaVA-OneVision 开源吗?

是,模型权重和训练 recipe 大量公开,是想复刻 VLM 训练的好教材。

Q:我该用哪个档位?

做下游应用(embodied/agent)通常用 7B;72B 太重,0.5B 适合轻量场景。

Q:它比 GPT-4V 强吗?

在视频上"明显接近"顶级闭源,具体高下需看同设定评测,本笔记不编造分数。

Q:为什么用 SigLIP 而不是 CLIP?

SigLIP 用 sigmoid loss,训练更稳、在这套配方里表现更好。

Q:视频最多几帧?

受上下文和显存限制,靠抽帧,帧数有上限。具体需读原文。

所以这一节是想说:OneVision 是想复刻 VLM 训练的人的好教材,核心启示是"把数据配方做对"。


如果你想再深入

  1. 看 abstract + 数据配方总览图 + 主表 —— 搞清统一三场景具体指什么、收益多大。
  2. 前置:LLaVA-1.5 / LLaVA-NeXT / Interleave —— 懂架构传承和输入格式。
  3. 读方法节的训练阶段切分和数据混合 —— 这是真正贡献,结构可快速扫。
  4. 看 ablation —— 哪个阶段最关键?多图加进来后视频涨多少?
  5. 横向:InternVL / Qwen2-VL / DeepSeek-VL —— 对比不同家配方。

所以这一节是想说:先看配方图和主表,补 LLaVA 前作,重点读训练阶段与消融,再横向对比同期对手。


原文信息

@article{li2024llavaonevision,
  title  = {LLaVA-OneVision: Easy Visual Task Transfer},
  author = {Li, Bo and others},
  journal = {arXiv preprint arXiv:2408.03326},
  year   = {2024}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_llava_onevision_2026,
  title       = {(readable note) LLaVA-OneVision: Easy Visual Task Transfer},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/llava-onevision/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?