Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 143

Pixtral 12B

13 min read · 4434 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过多模态模型"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么 Pixtral 能直接吃任意分辨率、任意长宽比的图,还能一次看很多张,而且在变强看图的同时没把说话能力搞丢"。

一句话讲什么(TL;DR)

Mistral 开源的一个 120 亿参数的多模态大模型:它用一个从零训练的新视觉编码器,能按图片原始分辨率和长宽比直接读图(你想用多少 token 描述一张图都行),在 12.8 万 token 的超长上下文里塞进任意多张图;它在多模态测评上超过同级甚至更大的开源模型,同时文字能力也没退化,还用 Apache 2.0 协议完全开源。

所以这一节是想说:这篇论文交出的是一个"看图强、说话不弱、还全开源"的高性价比多模态模型。


这是个什么场景

你想要一个开源的助手,既能像 ChatGPT 那样正常聊天、写代码、做推理,又能看图——而且是真的会看图:看懂一张高清截图里的小字表格、读懂一份多页文档、一次对比好几张图。理想情况是:一个模型全包了,还能免费商用、自己部署。

现实里有两个别扭:

  • "看图"和"说话"常常此消彼长:很多开源多模态模型为了看图变强,把原本的纯文字能力练退化了——变成一个"会看图但不太会聊天"的偏科生。
  • 图片被强行压成小方块:多数视觉模型要求把图缩放/裁剪成固定尺寸(比如 224×224 或 336×336)。高清截图、长图、文档一压缩,小字和细节就糊了;而且不管图大图小都用一样多的 token,浪费或不足。

Pixtral 12B 要同时解决这两件事:既不牺牲文字能力,又能按原始分辨率灵活读图。

所以这一节是想说:目标是造一个"文字不退化 + 能读原始分辨率任意长宽比图"的全能开源多模态模型。


Pixtral 12B — 场景示意:这论文要解决的现实问题
Plate Nº IPixtral 12B — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 固定分辨率视觉编码器(如原版 CLIP/SigLIP 接进 VLM):把图缩到固定尺寸,长图/文档/高清图细节丢失;token 数固定,不能按图的信息量灵活分配。
  • 为看图牺牲文字:不少开源多模态模型在多模态训练后,纯文本任务(推理、代码)明显退步,成了偏科。
  • 短上下文:上下文窗口有限,塞不下多张高清图或长文档。
  • 闭源或不可商用:能力强的往往闭源,或协议受限,社区没法自由用。
  • 共同短板:要么图读得糊、要么文字变弱、要么装不下多图、要么不能自由用。

所以这一节是想说:以前的开源多模态要么读图糊、要么文字退化、要么上下文短、要么不开放,Pixtral 想一次补齐。


这篇论文的关键想法

三个关键设计:

第一,从零训练一个新的视觉编码器(Pixtral-ViT),支持原始分辨率与长宽比。 不再把图强行压成固定小方块,而是让编码器直接吃图片的原生分辨率和长宽比,图越大/越细就切出越多 patch、用越多 token;图小就用少 token。这给了用户"用多少 token 处理一张图"的灵活度,也保住了高清图和文档里的细节。

第二,超长上下文(128K token)+ 任意多张图。 128K 的上下文窗口意味着可以一次塞进很多张图或很长的文档,做多图对比、长文档理解。

第三,多模态变强但文字不退化。 Pixtral 刻意保证纯文本能力不被多模态训练拖垮——它同时是"同级里一流的文本模型"。这让它不是偏科生,而是全能选手。

顺带贡献:发布 MM-MT-Bench,一个面向实际使用场景评测多模态模型的开源基准,并提供标准化评测协议和代码。全部 Apache 2.0 开源。

所以这一节是想说:核心是"原生分辨率视觉编码器 + 128K 长上下文多图 + 文字不退化",外加开源基准和宽松协议。


Pixtral 12B — 方法示意:核心 pipeline
Plate Nº IIPixtral 12B — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:原生分辨率视觉编码器、视觉与语言的连接、长上下文多图、训练与不退化。逐块按"输入 → 处理 → 输出"讲。

1. Pixtral-ViT:按原始分辨率与长宽比读图

输入。 任意分辨率、任意长宽比的图片(不强制缩放到固定尺寸)。

处理。 一个从零训练的视觉 Transformer(ViT)。它把图片按固定大小的 patch(小方块)切开——图越大切出的 patch 越多,因此产生的视觉 token 数量随图片尺寸变化,而不是固定死。为支持任意长宽比,编码器在位置编码等设计上做了适配(让模型知道每个 patch 在原图的哪个位置,即使图是长条形或方形)。这样高清图/文档的细节能保留,用户也能通过图的分辨率控制花多少 token。

ViT(Vision Transformer):把图片切成一格格 patch,当成"视觉的词",用 Transformer 处理。patch 越多,token 越多,能表达的细节越丰富。

输出。 数量可变、保留原图细节和空间信息的视觉 token。

所以这一节是想说:Pixtral-ViT 让"图想多细就用多少 token",从源头保住高清与文档细节。

2. 视觉—语言连接:把视觉 token 接进语言模型

输入。 Pixtral-ViT 产出的视觉 token + 文字 token。

处理。 通过一个连接模块把视觉 token 投影到语言模型的输入空间,与文字 token 拼在一起,喂给 12B 的语言主干(Mistral 系)。语言主干像正常聊天一样,把图和文一起理解、生成回答。图片在序列里的位置被妥善处理,使得"任意多张图 + 文字"能自由交错排列。

输出。 图文交错的统一输入序列,交给语言模型处理。

所以这一节是想说:视觉 token 被投影后与文字并肩塞进语言主干,实现图文统一理解。

3. 长上下文与多图:128K 窗口塞下很多图/长文档

输入。 多张图 + 长文本(可能很长)。

处理。 语言主干支持 128K token 的上下文窗口。因为图片用可变数量的视觉 token 表示,长上下文让模型可以一次容纳多张高清图或整份长文档,做跨图对比、多页推理。图片数量不设固定上限("任意数量的图片")。

输出。 能在一次对话里处理多图 + 长文的多模态理解。

所以这一节是想说:128K 上下文让 Pixtral 能一次吞下多张图和长文档,支撑复杂多图任务。

4. 训练与"文字不退化"

输入。 大规模图文数据 + 纯文本数据。

处理。 训练时精心平衡多模态与纯文本目标,确保多模态能力提升的同时,纯文本推理、代码等能力不被牺牲(论文强调 Pixtral 是"同级里出色的文本模型")。同时用统一的评测协议在多基准上验证,并发布 MM-MT-Bench 评测实际场景表现。

输出。 一个多模态强、文字也强的 12B 模型,Apache 2.0 开源。

下面用 ASCII 图把架构画出来:

   任意分辨率/长宽比图片 ─► Pixtral-ViT(切patch, token数随尺寸变) ─► 视觉token(可变数量)
                                                                        │  投影
   文字 ─────────────────────────────────────────────────────────────► 拼接
                                                                        ▼
                            12B 语言主干 (128K 上下文, 可容纳任意多张图) ─► 文字回答

再用一张 ASCII 图对比"固定分辨率 vs 原生分辨率":

   固定分辨率:  [高清文档]→压成224×224→小字糊成一团, token数固定
   Pixtral:     [高清文档]→按原分辨率切patch→小字清晰, token随信息量增减

所以这一整节是想说:Pixtral 12B = 原生分辨率 ViT + 视觉语言连接 + 128K 多图上下文 + 文字不退化训练,四步合成一个全能开源多模态模型。


关键数字(What works)

数字来自论文摘要(arXiv:2410.07073);各基准的具体分数属正文表格,标注"需读原文"。

项目 数值/结论 说明
参数量 12B(120 亿) 中等规模
视觉编码器 从零训练的新 ViT 支持原生分辨率/长宽比
上下文窗口 128K token 可容纳多图/长文档
图片数量 任意多张 长上下文支撑
vs 同级开源 超过 Llama-3.2 11B、Qwen-2-VL 7B 多模态基准
vs 更大模型 超过 Llama-3.2 90B(自身小 7 倍) 性价比亮点
文本能力 同级一流,未退化 不偏科
开源协议 Apache 2.0 可自由商用
新基准 MM-MT-Bench 实际场景评测

三个要点:第一,用 12B 打过 90B(自身小 7 倍还更强)是最抓眼的性价比证据;第二,原生分辨率 + 128K 多图是它区别于固定分辨率老 VLM 的架构优势,尤其利于文档和多图任务;第三,文字不退化 + Apache 2.0 让它成为真正好用、能自由部署的全能选手。

所以这一节是想说:以小胜大、原生分辨率多图、文字不退化、完全开源,是 Pixtral 的四张王牌。


实验结果说明了什么

论文实验主要证明:

  • 多模态能力领先同级:在多模态基准上超过 Llama-3.2 11B、Qwen-2-VL 7B,甚至超过大 7 倍的 Llama-3.2 90B,说明架构和训练选择有效。
  • 文字不退化:纯文本任务保持同级一流水平,证明"看图变强"没有以"说话变弱"为代价——这是很多开源多模态模型做不到的。
  • 原生分辨率的价值:在文档、细节丰富的图上,按原始分辨率读图带来实打实的优势(细节评测需读原文)。
  • 实际场景评测:MM-MT-Bench 面向真实使用场景,弥补了传统学术基准与实用之间的差距。

所以这一节是想说:实验证明它多模态领先、文字不退化、原生分辨率有用,并推动了更贴近实用的评测。


你应该懂的几个新词

  • 多模态大模型(multimodal LLM / VLM):能同时理解图和文、用语言回答的大模型。
  • ViT(Vision Transformer):把图切成 patch 当"视觉词"用 Transformer 处理的视觉骨干。
  • 原生分辨率(native resolution)/ 长宽比(aspect ratio):按图片本来的尺寸和形状读图,不强行压成固定方块。
  • 视觉 token:图片被切成 patch 后对应的向量,数量可随图尺寸变化。
  • 上下文窗口(context window):模型一次能处理的 token 上限;128K 很长,能塞多图长文。
  • Apache 2.0:宽松开源协议,可自由商用。
  • MM-MT-Bench:本文发布的多模态实际场景评测基准。
  • 不退化(no compromise):多模态训练后纯文本能力仍保持。

所以这一节是想说:原生分辨率、视觉 token、长上下文是理解 Pixtral 架构优势的三个关键词。


它有什么搞不定的

  • 12B 仍有规模上限:性价比高,但在最顶尖的复杂推理上,超大闭源模型仍可能更强。
  • 原生分辨率 = 计算可变:大图产生更多 token,处理更慢、更耗显存;不是免费午餐。
  • 文档/OCR 有极限:能读小字,但极端密集或极低质量的文档仍会出错。
  • 多图长上下文的实际效率:128K 上下文塞满多张高清图时,推理成本和延迟显著上升。
  • 仍会幻觉:和所有多模态大模型一样,会编造图里没有的细节。

所以这一节是想说:它性价比高、灵活,但受规模上限、可变计算成本、文档极限和幻觉等约束。


它和别的几篇是什么关系

  • 地基:CLIP/SigLIP 定义了"视觉编码器 + 语言模型"的 VLM 范式;LLaVA 定义了对话模板。Pixtral 换上了自研原生分辨率 ViT。
  • 同级对手:Llama-3.2(11B/90B)、Qwen-2-VL(7B)是它直接对标并超越的开源多模态模型。
  • 原生分辨率同道:Qwen-VL 系、InternVL 也在推动"任意分辨率读图",Pixtral 是这条路线的开源代表之一。
  • 出品方:Mistral 系(Pixtral 的语言主干来自 Mistral),延续其"高性价比开源"路线。

所以这一节是想说:Pixtral 是 LLaVA/CLIP 范式上、走"原生分辨率 + 不退化 + 全开源"路线的高性价比新代表。


和本导读的关系

本笔记对应导读 Ch09: VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力。Ch09 讲的是"视觉编码器 + 语言模型"这套 VLM 范式如何演进。Pixtral 是这条线上的前沿一环:它在保持对话/文本能力的同时,把"视觉端"升级为原生分辨率、长上下文多图。读完本篇再看同章的 llava(范式起点)、internvl-2-5/qwen-vl(原生分辨率同道),能理解 VLM 的视觉端如何从"固定小方块"走向"任意分辨率"。

所以这一节是想说:把 Pixtral 放进 Ch09,它代表 VLM 视觉端走向原生分辨率、且不牺牲文字的一步。


思考题

Q1:为什么"把图压成固定小方块"会伤害文档和高清图的理解?

提示

小字和细节在缩放中丢失;固定 token 数无法按信息量分配。想想把一页 A4 文档压成 224×224 会怎样。

Q2:原生分辨率让 token 数随图变化,这带来什么好处和代价?

提示

好处是细节保留、灵活分配;代价是大图更慢更耗显存。想想"按需付费"的两面。

Q3:为什么很多开源多模态模型"看图变强就说话变弱"?Pixtral 怎么避免?

提示

多模态训练可能挤占/干扰文本能力。需要平衡纯文本与多模态目标。想想训练数据配比的作用。

Q4:12B 打过 90B(小 7 倍还更强)说明了什么?规模就是一切吗?

提示

架构、数据质量、训练策略同样关键。想想"更大不总是更好"的道理。

Q5:128K 上下文对多图任务的意义是什么?塞满高清图会有什么问题?

提示

能一次对比多图/读长文档;但视觉 token 很占位,塞满后推理慢、贵。想想上下文的"容量 vs 成本"。

Q6:作者为什么要专门发布 MM-MT-Bench,而不只用已有学术基准?

提示

学术基准可能与真实使用脱节。面向实际场景的基准更能反映用户体验。想想"刷分"和"好用"的差距。

Q7:Apache 2.0 全开源对社区意味着什么?对 Mistral 的商业策略呢?

提示

社区可自由用/改/商用,推动生态;对厂商是靠开放建立影响力和生态位。想想开源的战略价值。


一些好奇心问答(FAQ)

Q:Pixtral 能读一整份 PDF 里的小字吗?

因为按原生分辨率读图 + 128K 上下文,它对文档和小字比固定分辨率模型强得多,但极端密集/低质文档仍会出错。

Q:它和 Qwen-VL、InternVL 谁更强?

各基准互有胜负,Pixtral 的卖点是"文字不退化 + 原生分辨率 + Apache 2.0"的综合性价比。具体对比看论文和各自评测。

Q:我能商用吗?

能。Apache 2.0 是宽松协议,允许自由使用和商用。

Q:为什么要自己从零训视觉编码器,而不用现成 CLIP?

现成 CLIP 多是固定分辨率、且未必适配长上下文多图。从零训能定制"原生分辨率 + 灵活 token"这套需求,视觉编码器与语言主干也能更好地协同设计。

Q:原生分辨率会不会让不同图片产生的 token 数量差异很大,影响训练稳定?

会带来变长序列的工程挑战:小图几十个视觉 token、大图上千个,批处理和显存分配都更复杂。作者在位置编码和序列组织上做了适配来应对这种可变长度,这也是"从零训一个新视觉编码器"而非直接套用固定分辨率 CLIP 的重要原因之一。换来的回报是:用户可以按任务需要,用一张缩略图省 token、或用高清原图保细节,灵活地在"速度"和"精度"之间自己权衡。

Q:Pixtral 适合做哪些实际任务?

它尤其擅长文档理解、图表/表格阅读、多图对比、以及需要长上下文的复杂多模态推理;同时因为文字能力没退化,也能正常承担写代码、纯文本推理这类任务,是个"看图说话两不误"的全能底座。

所以这一节是想说:它是"文档友好、可自由商用"的全能开源多模态,代价是可变的计算成本。


如果你想再深入

  1. 范式:LLaVA / BLIP-2 — 理解 VLM 的"编码器 + 投影 + LLM"基本盘。
  2. 视觉地基:CLIP / SigLIP — 理解视觉编码器的来源与局限。
  3. 原生分辨率同道:Qwen-VL / InternVL — 对比另几条"任意分辨率"路线。
  4. 对手:Llama-3.2 Vision — 看它对标超越的开源多模态。
  5. 语言主干:Mistral — 理解其文本能力来源。

所以这一节是想说:把 CLIP → LLaVA → Qwen-VL/InternVL → Pixtral 串起来,能看清 VLM 视觉端从固定到原生分辨率的演进。


原文信息

@article{agrawal2024pixtral,
  title   = {Pixtral 12B},
  author  = {Agrawal, Pravesh and others (Mistral AI)},
  journal = {arXiv preprint arXiv:2410.07073},
  year    = {2024},
  url     = {https://arxiv.org/abs/2410.07073}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_pixtral_12b_2026,
  title       = {(readable note) Pixtral 12B},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/pixtral-12b/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?