Pixtral 12B
这是一份写给"完全没接触过多模态模型"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么 Pixtral 能直接吃任意分辨率、任意长宽比的图,还能一次看很多张,而且在变强看图的同时没把说话能力搞丢"。
一句话讲什么(TL;DR)
Mistral 开源的一个 120 亿参数的多模态大模型:它用一个从零训练的新视觉编码器,能按图片原始分辨率和长宽比直接读图(你想用多少 token 描述一张图都行),在 12.8 万 token 的超长上下文里塞进任意多张图;它在多模态测评上超过同级甚至更大的开源模型,同时文字能力也没退化,还用 Apache 2.0 协议完全开源。
所以这一节是想说:这篇论文交出的是一个"看图强、说话不弱、还全开源"的高性价比多模态模型。
这是个什么场景
你想要一个开源的助手,既能像 ChatGPT 那样正常聊天、写代码、做推理,又能看图——而且是真的会看图:看懂一张高清截图里的小字表格、读懂一份多页文档、一次对比好几张图。理想情况是:一个模型全包了,还能免费商用、自己部署。
现实里有两个别扭:
- "看图"和"说话"常常此消彼长:很多开源多模态模型为了看图变强,把原本的纯文字能力练退化了——变成一个"会看图但不太会聊天"的偏科生。
- 图片被强行压成小方块:多数视觉模型要求把图缩放/裁剪成固定尺寸(比如 224×224 或 336×336)。高清截图、长图、文档一压缩,小字和细节就糊了;而且不管图大图小都用一样多的 token,浪费或不足。
Pixtral 12B 要同时解决这两件事:既不牺牲文字能力,又能按原始分辨率灵活读图。
所以这一节是想说:目标是造一个"文字不退化 + 能读原始分辨率任意长宽比图"的全能开源多模态模型。

之前的人怎么做的,为什么不够好
- 固定分辨率视觉编码器(如原版 CLIP/SigLIP 接进 VLM):把图缩到固定尺寸,长图/文档/高清图细节丢失;token 数固定,不能按图的信息量灵活分配。
- 为看图牺牲文字:不少开源多模态模型在多模态训练后,纯文本任务(推理、代码)明显退步,成了偏科。
- 短上下文:上下文窗口有限,塞不下多张高清图或长文档。
- 闭源或不可商用:能力强的往往闭源,或协议受限,社区没法自由用。
- 共同短板:要么图读得糊、要么文字变弱、要么装不下多图、要么不能自由用。
所以这一节是想说:以前的开源多模态要么读图糊、要么文字退化、要么上下文短、要么不开放,Pixtral 想一次补齐。
这篇论文的关键想法
三个关键设计:
第一,从零训练一个新的视觉编码器(Pixtral-ViT),支持原始分辨率与长宽比。 不再把图强行压成固定小方块,而是让编码器直接吃图片的原生分辨率和长宽比,图越大/越细就切出越多 patch、用越多 token;图小就用少 token。这给了用户"用多少 token 处理一张图"的灵活度,也保住了高清图和文档里的细节。
第二,超长上下文(128K token)+ 任意多张图。 128K 的上下文窗口意味着可以一次塞进很多张图或很长的文档,做多图对比、长文档理解。
第三,多模态变强但文字不退化。 Pixtral 刻意保证纯文本能力不被多模态训练拖垮——它同时是"同级里一流的文本模型"。这让它不是偏科生,而是全能选手。
顺带贡献:发布 MM-MT-Bench,一个面向实际使用场景评测多模态模型的开源基准,并提供标准化评测协议和代码。全部 Apache 2.0 开源。
所以这一节是想说:核心是"原生分辨率视觉编码器 + 128K 长上下文多图 + 文字不退化",外加开源基准和宽松协议。

它分几步做的(方法)
方法分四块:原生分辨率视觉编码器、视觉与语言的连接、长上下文多图、训练与不退化。逐块按"输入 → 处理 → 输出"讲。
1. Pixtral-ViT:按原始分辨率与长宽比读图
输入。 任意分辨率、任意长宽比的图片(不强制缩放到固定尺寸)。
处理。 一个从零训练的视觉 Transformer(ViT)。它把图片按固定大小的 patch(小方块)切开——图越大切出的 patch 越多,因此产生的视觉 token 数量随图片尺寸变化,而不是固定死。为支持任意长宽比,编码器在位置编码等设计上做了适配(让模型知道每个 patch 在原图的哪个位置,即使图是长条形或方形)。这样高清图/文档的细节能保留,用户也能通过图的分辨率控制花多少 token。
ViT(Vision Transformer):把图片切成一格格 patch,当成"视觉的词",用 Transformer 处理。patch 越多,token 越多,能表达的细节越丰富。
输出。 数量可变、保留原图细节和空间信息的视觉 token。
所以这一节是想说:Pixtral-ViT 让"图想多细就用多少 token",从源头保住高清与文档细节。
2. 视觉—语言连接:把视觉 token 接进语言模型
输入。 Pixtral-ViT 产出的视觉 token + 文字 token。
处理。 通过一个连接模块把视觉 token 投影到语言模型的输入空间,与文字 token 拼在一起,喂给 12B 的语言主干(Mistral 系)。语言主干像正常聊天一样,把图和文一起理解、生成回答。图片在序列里的位置被妥善处理,使得"任意多张图 + 文字"能自由交错排列。
输出。 图文交错的统一输入序列,交给语言模型处理。
所以这一节是想说:视觉 token 被投影后与文字并肩塞进语言主干,实现图文统一理解。
3. 长上下文与多图:128K 窗口塞下很多图/长文档
输入。 多张图 + 长文本(可能很长)。
处理。 语言主干支持 128K token 的上下文窗口。因为图片用可变数量的视觉 token 表示,长上下文让模型可以一次容纳多张高清图或整份长文档,做跨图对比、多页推理。图片数量不设固定上限("任意数量的图片")。
输出。 能在一次对话里处理多图 + 长文的多模态理解。
所以这一节是想说:128K 上下文让 Pixtral 能一次吞下多张图和长文档,支撑复杂多图任务。
4. 训练与"文字不退化"
输入。 大规模图文数据 + 纯文本数据。
处理。 训练时精心平衡多模态与纯文本目标,确保多模态能力提升的同时,纯文本推理、代码等能力不被牺牲(论文强调 Pixtral 是"同级里出色的文本模型")。同时用统一的评测协议在多基准上验证,并发布 MM-MT-Bench 评测实际场景表现。
输出。 一个多模态强、文字也强的 12B 模型,Apache 2.0 开源。
下面用 ASCII 图把架构画出来:
任意分辨率/长宽比图片 ─► Pixtral-ViT(切patch, token数随尺寸变) ─► 视觉token(可变数量)
│ 投影
文字 ─────────────────────────────────────────────────────────────► 拼接
▼
12B 语言主干 (128K 上下文, 可容纳任意多张图) ─► 文字回答
再用一张 ASCII 图对比"固定分辨率 vs 原生分辨率":
固定分辨率: [高清文档]→压成224×224→小字糊成一团, token数固定
Pixtral: [高清文档]→按原分辨率切patch→小字清晰, token随信息量增减
所以这一整节是想说:Pixtral 12B = 原生分辨率 ViT + 视觉语言连接 + 128K 多图上下文 + 文字不退化训练,四步合成一个全能开源多模态模型。
关键数字(What works)
数字来自论文摘要(arXiv:2410.07073);各基准的具体分数属正文表格,标注"需读原文"。
| 项目 | 数值/结论 | 说明 |
|---|---|---|
| 参数量 | 12B(120 亿) | 中等规模 |
| 视觉编码器 | 从零训练的新 ViT | 支持原生分辨率/长宽比 |
| 上下文窗口 | 128K token | 可容纳多图/长文档 |
| 图片数量 | 任意多张 | 长上下文支撑 |
| vs 同级开源 | 超过 Llama-3.2 11B、Qwen-2-VL 7B | 多模态基准 |
| vs 更大模型 | 超过 Llama-3.2 90B(自身小 7 倍) | 性价比亮点 |
| 文本能力 | 同级一流,未退化 | 不偏科 |
| 开源协议 | Apache 2.0 | 可自由商用 |
| 新基准 | MM-MT-Bench | 实际场景评测 |
三个要点:第一,用 12B 打过 90B(自身小 7 倍还更强)是最抓眼的性价比证据;第二,原生分辨率 + 128K 多图是它区别于固定分辨率老 VLM 的架构优势,尤其利于文档和多图任务;第三,文字不退化 + Apache 2.0 让它成为真正好用、能自由部署的全能选手。
所以这一节是想说:以小胜大、原生分辨率多图、文字不退化、完全开源,是 Pixtral 的四张王牌。
实验结果说明了什么
论文实验主要证明:
- 多模态能力领先同级:在多模态基准上超过 Llama-3.2 11B、Qwen-2-VL 7B,甚至超过大 7 倍的 Llama-3.2 90B,说明架构和训练选择有效。
- 文字不退化:纯文本任务保持同级一流水平,证明"看图变强"没有以"说话变弱"为代价——这是很多开源多模态模型做不到的。
- 原生分辨率的价值:在文档、细节丰富的图上,按原始分辨率读图带来实打实的优势(细节评测需读原文)。
- 实际场景评测:MM-MT-Bench 面向真实使用场景,弥补了传统学术基准与实用之间的差距。
所以这一节是想说:实验证明它多模态领先、文字不退化、原生分辨率有用,并推动了更贴近实用的评测。
你应该懂的几个新词
- 多模态大模型(multimodal LLM / VLM):能同时理解图和文、用语言回答的大模型。
- ViT(Vision Transformer):把图切成 patch 当"视觉词"用 Transformer 处理的视觉骨干。
- 原生分辨率(native resolution)/ 长宽比(aspect ratio):按图片本来的尺寸和形状读图,不强行压成固定方块。
- 视觉 token:图片被切成 patch 后对应的向量,数量可随图尺寸变化。
- 上下文窗口(context window):模型一次能处理的 token 上限;128K 很长,能塞多图长文。
- Apache 2.0:宽松开源协议,可自由商用。
- MM-MT-Bench:本文发布的多模态实际场景评测基准。
- 不退化(no compromise):多模态训练后纯文本能力仍保持。
所以这一节是想说:原生分辨率、视觉 token、长上下文是理解 Pixtral 架构优势的三个关键词。
它有什么搞不定的
- 12B 仍有规模上限:性价比高,但在最顶尖的复杂推理上,超大闭源模型仍可能更强。
- 原生分辨率 = 计算可变:大图产生更多 token,处理更慢、更耗显存;不是免费午餐。
- 文档/OCR 有极限:能读小字,但极端密集或极低质量的文档仍会出错。
- 多图长上下文的实际效率:128K 上下文塞满多张高清图时,推理成本和延迟显著上升。
- 仍会幻觉:和所有多模态大模型一样,会编造图里没有的细节。
所以这一节是想说:它性价比高、灵活,但受规模上限、可变计算成本、文档极限和幻觉等约束。
它和别的几篇是什么关系
- 地基:CLIP/SigLIP 定义了"视觉编码器 + 语言模型"的 VLM 范式;LLaVA 定义了对话模板。Pixtral 换上了自研原生分辨率 ViT。
- 同级对手:Llama-3.2(11B/90B)、Qwen-2-VL(7B)是它直接对标并超越的开源多模态模型。
- 原生分辨率同道:Qwen-VL 系、InternVL 也在推动"任意分辨率读图",Pixtral 是这条路线的开源代表之一。
- 出品方:Mistral 系(Pixtral 的语言主干来自 Mistral),延续其"高性价比开源"路线。
所以这一节是想说:Pixtral 是 LLaVA/CLIP 范式上、走"原生分辨率 + 不退化 + 全开源"路线的高性价比新代表。
和本导读的关系
本笔记对应导读 Ch09: VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力。Ch09 讲的是"视觉编码器 + 语言模型"这套 VLM 范式如何演进。Pixtral 是这条线上的前沿一环:它在保持对话/文本能力的同时,把"视觉端"升级为原生分辨率、长上下文多图。读完本篇再看同章的 llava(范式起点)、internvl-2-5/qwen-vl(原生分辨率同道),能理解 VLM 的视觉端如何从"固定小方块"走向"任意分辨率"。
所以这一节是想说:把 Pixtral 放进 Ch09,它代表 VLM 视觉端走向原生分辨率、且不牺牲文字的一步。
思考题
Q1:为什么"把图压成固定小方块"会伤害文档和高清图的理解?
提示
小字和细节在缩放中丢失;固定 token 数无法按信息量分配。想想把一页 A4 文档压成 224×224 会怎样。
Q2:原生分辨率让 token 数随图变化,这带来什么好处和代价?
提示
好处是细节保留、灵活分配;代价是大图更慢更耗显存。想想"按需付费"的两面。
Q3:为什么很多开源多模态模型"看图变强就说话变弱"?Pixtral 怎么避免?
提示
多模态训练可能挤占/干扰文本能力。需要平衡纯文本与多模态目标。想想训练数据配比的作用。
Q4:12B 打过 90B(小 7 倍还更强)说明了什么?规模就是一切吗?
提示
架构、数据质量、训练策略同样关键。想想"更大不总是更好"的道理。
Q5:128K 上下文对多图任务的意义是什么?塞满高清图会有什么问题?
提示
能一次对比多图/读长文档;但视觉 token 很占位,塞满后推理慢、贵。想想上下文的"容量 vs 成本"。
Q6:作者为什么要专门发布 MM-MT-Bench,而不只用已有学术基准?
提示
学术基准可能与真实使用脱节。面向实际场景的基准更能反映用户体验。想想"刷分"和"好用"的差距。
Q7:Apache 2.0 全开源对社区意味着什么?对 Mistral 的商业策略呢?
提示
社区可自由用/改/商用,推动生态;对厂商是靠开放建立影响力和生态位。想想开源的战略价值。
一些好奇心问答(FAQ)
Q:Pixtral 能读一整份 PDF 里的小字吗?
因为按原生分辨率读图 + 128K 上下文,它对文档和小字比固定分辨率模型强得多,但极端密集/低质文档仍会出错。
Q:它和 Qwen-VL、InternVL 谁更强?
各基准互有胜负,Pixtral 的卖点是"文字不退化 + 原生分辨率 + Apache 2.0"的综合性价比。具体对比看论文和各自评测。
Q:我能商用吗?
能。Apache 2.0 是宽松协议,允许自由使用和商用。
Q:为什么要自己从零训视觉编码器,而不用现成 CLIP?
现成 CLIP 多是固定分辨率、且未必适配长上下文多图。从零训能定制"原生分辨率 + 灵活 token"这套需求,视觉编码器与语言主干也能更好地协同设计。
Q:原生分辨率会不会让不同图片产生的 token 数量差异很大,影响训练稳定?
会带来变长序列的工程挑战:小图几十个视觉 token、大图上千个,批处理和显存分配都更复杂。作者在位置编码和序列组织上做了适配来应对这种可变长度,这也是"从零训一个新视觉编码器"而非直接套用固定分辨率 CLIP 的重要原因之一。换来的回报是:用户可以按任务需要,用一张缩略图省 token、或用高清原图保细节,灵活地在"速度"和"精度"之间自己权衡。
Q:Pixtral 适合做哪些实际任务?
它尤其擅长文档理解、图表/表格阅读、多图对比、以及需要长上下文的复杂多模态推理;同时因为文字能力没退化,也能正常承担写代码、纯文本推理这类任务,是个"看图说话两不误"的全能底座。
所以这一节是想说:它是"文档友好、可自由商用"的全能开源多模态,代价是可变的计算成本。
如果你想再深入
- 范式:LLaVA / BLIP-2 — 理解 VLM 的"编码器 + 投影 + LLM"基本盘。
- 视觉地基:CLIP / SigLIP — 理解视觉编码器的来源与局限。
- 原生分辨率同道:Qwen-VL / InternVL — 对比另几条"任意分辨率"路线。
- 对手:Llama-3.2 Vision — 看它对标超越的开源多模态。
- 语言主干:Mistral — 理解其文本能力来源。
所以这一节是想说:把 CLIP → LLaVA → Qwen-VL/InternVL → Pixtral 串起来,能看清 VLM 视觉端从固定到原生分辨率的演进。
原文信息
- 标题:Pixtral 12B
- 作者:Pravesh Agrawal 等(Mistral AI 团队,42 位作者)
- 发表:arXiv 2024
- arXiv:https://arxiv.org/abs/2410.07073
@article{agrawal2024pixtral,
title = {Pixtral 12B},
author = {Agrawal, Pravesh and others (Mistral AI)},
journal = {arXiv preprint arXiv:2410.07073},
year = {2024},
url = {https://arxiv.org/abs/2410.07073}
}
◼
引用本笔记 / Cite this note
@online{eai_pixtral_12b_2026,
title = {(readable note) Pixtral 12B},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/pixtral-12b/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?