Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 139

The Llama 3 Herd of Models

15 min read · 5305 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

Meta 把训练 Llama 3 大模型的全套"菜谱"公开了——用了什么料、多少张卡、跑多久、考多少分,从后厨到摆盘一条龙。

所以这一节是想说:Llama 3 报告不是发明新架构,而是把"如何训一个前沿大模型"的完整工程细节透明化。


这是个什么场景

想象你常去的米其林三星餐厅,平时只把成品端上桌,菜谱、食材产地、火候温度一概不说。某天他突然把整本后厨工作手册甩出来:哪个农场的牛肉、几号灶台、几度烤几分钟、试菜请了多少评委、评委打了几分——一口气全摊给你看。Llama 3 这份报告就是这种级别的"全套菜谱"。

市面上的对手是 GPT-4 / Claude 这类"只让你尝菜不让看后厨"的闭源餐厅;Meta 干脆把后厨大门打开,告诉你训一个前沿大模型到底要烧掉多少本钱。

大语言模型(LLM):会读写文字的超大 AI。参数越多、训练数据越多,通常越强,但训练成本也越高。

所以这一节是想说:场景是"闭源模型只给结果不给过程",Llama 3 反其道而行,把训练全过程摊开。


The Llama 3 Herd of Models — 场景示意:这论文要解决的现实问题
Plate Nº IThe Llama 3 Herd of Models — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 闭源派(GPT-4 / Gemini / Claude):只放 API 和有限技术报告,数据规模、算力、训练细节都藏着。
  • 早期 Llama(Llama 2):开源权重 + 较粗的报告,多模态能力缺失。
  • 其他开源基座(Mistral / Qwen / DeepSeek 早期版本):规模更小,或只放权重不公开训练曲线。
  • 多模态接法(LLaVA / BLIP-2):在小语言模型上接视觉,但底座本身不是前沿规模。
  • 结果:开源社区缺一个"接近 GPT-4 级别 + 训练栈完全透明 + 自带视觉支路"的参考实现。

开源权重 vs 开源过程:很多"开源模型"只放训练好的权重,不告诉你怎么训出来的。Llama 3 的贡献是把"过程"也大量公开。

所以这一节是想说:以前要么闭源、要么开源但不透明、要么规模不够,缺一个"前沿规模 + 全栈透明"的开源标杆。


这篇论文的新想法

三件事一起做:

  1. 把规模拉到 405B:开源模型第一次正面冲击闭源 SOTA 量级,证明开源社区可以触及前沿。
  2. 训练全栈透明:数据 pipeline、tokenizer、并行策略、训练损失曲线、故障恢复、scaling law 拟合,都写进报告。
  3. 视觉适配器后挂:保留语言主干不动,把图像编码器通过 cross-attention 适配器接进去,避免重新训练破坏语言能力。

核心立场是"规模 + 数据质量 + 工程稳定性 = 大部分能力",没有引入新的架构奇技淫巧(仍然是稠密 Transformer,没上 MoE)。

SOTA(State Of The Art,最先进水平):某任务上当前最好的成绩。

所以这一节是想说:新想法 = 用 405B 冲前沿 + 全栈透明 + 视觉后挂,靠"规模 + 数据 + 工程"而非新架构取胜。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 预训练数据:像采购食材

输入:从几百个网站抓来的海量原始文本。

处理:先去几百个网站抓原料,再过一遍质检流水线把烂菜叶挑出去。约 15T(15 万亿)tokens(Llama 2 是 1.8T,扩了近 10 倍),多语言、代码、推理类样本占比上调。整套 pipeline 包括去重、质量分类器、毒性过滤、个人信息脱敏。比例怎么配也不是拍脑袋——先用小模型当替身(proxy)试不同搭配,效果好的那套再喂给大模型。

输出:一份约 15T tokens、经过清洗和配比的预训练语料。

token(词元):文本被切成的最小处理单位。15T tokens 是说训练时模型总共"读"了约 15 万亿个词元。

data mixing(数据配比):不同来源(网页/代码/书/多语言)按什么比例喂入。比例选错性能差异巨大。

2. 架构与 scaling:盖楼前先算钢筋用量

输入:目标模型规模(最大 405B)+ 数据预算(15T tokens)。

处理:稠密 decoder-only Transformer,配上 GQA(分组查询注意力)+ RoPE + SwiGLU,上下文 128K(先 8K 训完再扩展)。盖之前论文先拟合一条 scaling law(规模与效果的经验曲线),用来反推 405B 在 15T tokens 下该停在哪、loss 该到多少。预训练动用了约 16K 张 H100 GPU 量级,跑了数月(具体数字需读原文)。

输出:训练好的 8B / 70B / 405B 三档基础模型。

等等,先慢一拍——稠密 Transformer 是什么?稠密(dense)= 每过一次模型,所有参数都要参与计算;与之相对的 MoE(专家混合)= 每次只激活其中一小部分专家,省算力。Llama 3 选了"老老实实全员上场"这条路。

GQA(Grouped-Query Attention,分组查询注意力):多个 query head 共享一组 key/value,省 KV 缓存。类比:一群学生(query)共用一份课本(kv)。

Scaling Law(规模定律):参数量、数据量、算力之间的经验幂律关系,用来在小规模拟合后预测大规模该停在哪。

3. 后训练:反复试菜调味

输入:预训练好的基础模型 + 人类偏好数据。

处理:先 SFT(监督微调,教它说人话),再用 DPO(直接偏好优化,直接告诉它"这个回答比那个好")配上拒绝采样(生成 N 个候选挑最好),来回约 6 轮。没用更复杂的 PPO(强化学习那套),因为 DPO 更稳更便宜。

输出:一个对齐好、听话的对话模型。

DPO(Direct Preference Optimization,直接偏好优化):给一对回答(好 vs 坏)直接优化模型,不用先训 reward model 再 RL,比 PPO 简单。

拒绝采样(Rejection Sampling):让模型生成 N 个候选,用判别器挑最好那个加进训练集,相当于自己给自己出"优等生答案"。

4. 多模态适配器:主菜上加配菜

输入:训练好的语言主干 + 图像/视频/语音编码器。

处理:语言主干这道主菜不动,旁边接一个图像 encoder(ViT 类)+ 一组 cross-attention 层(让语言模型能"看见"图像 token)。分阶段训练:先冻住主干只训配菜部分,再联合微调。视频和语音也走同样的挂载思路,一个语言主干长出多条感知支路。

输出:具备图像/视频/语音理解能力的多模态版本。

Cross-attention 适配器:在已有 Transformer 层之间插入新的注意力层,让外部信息(如图像 token)能被"看见",而不动原始主干权重。

ASCII 总览:

海量网页 ──►[去重/质量分类/脱敏/配比]──► ~15T tokens
                                            │
             [稠密 Transformer 8B/70B/405B, GQA+RoPE+SwiGLU]
             (scaling law 预先算好规模与 loss;~16K H100)
                                            │
             后训练: SFT → (DPO + 拒绝采样) × ~6 轮
                                            │
             多模态: 主干冻结 + 图像/视频/语音 encoder + cross-attn 适配器

5. 为什么刻意选"稠密"而不是当红的 MoE

这是 Llama 3 一个反潮流、却很能说明其哲学的决定。

输入:一个"要把 405B 参数训好、还要好部署"的目标。

处理:当时很多前沿模型转向 MoE(专家混合,每次只激活一小部分参数,省算力)。Llama 3 偏偏选了老老实实的稠密 Transformer——每次前向所有参数都参与。为什么?团队的核心信念是"把已知会成功的东西做到极致,比赌一个更复杂的架构更靠谱"。稠密模型训练更稳、行为更可预测、工程链路成熟、推理性能容易估算,出问题也更好排查。在动辄几个月、烧掉巨额算力的一次性大训练里,稳定性和可预测性本身就是巨大的价值——你输不起中途炸炉。他们把"聪明"这个额度不花在架构花样上,而是全砸在数据规模和质量、以及训练工程的可靠性上。

输出:一个训练稳、易部署、行为可预测的稠密基础模型。这背后是"用规模和数据取胜,而非用架构取巧"的路线选择。

打个比方:与其冒险用一套没完全吃透的新炉子做满汉全席,不如用一口用惯了的大锅,把火候和食材做到极致。

6. 为什么"数据质量与配比"才是真正的护城河

输入:从几百个网站抓来的、良莠不齐的海量原始文本。

处理:Llama 3 报告花了大量篇幅讲数据,因为在架构趋同的今天,数据才是拉开差距的地方。它做了几件关键的事:一是极其严格的清洗流水线(去重、用质量分类器打分、毒性过滤、个人信息脱敏),把烂数据挡在门外——垃圾进垃圾出;二是精心设计"数据配比",即网页、代码、数学推理、多语言各占多少。这个比例不是拍脑袋定的,而是先用小模型当"替身"去试各种配比、看谁效果好,再把胜出的配方用到昂贵的大模型上——相当于用便宜的小实验去搜索昂贵大训练的最优菜谱。三是训练后期做数据退火(提高高质量数据比例)。这些做法把"数据工程"从辅助工作提升成了模型质量的核心决定因素。

输出:一份约 15T tokens、清洗到位且配比经过实证优化的语料——Llama 3 强,一大半强在这里。

所以这一节是想说:架构可以抄,数据配方和清洗工艺才是真正难复制、真正决定上限的东西。

7. 为什么后训练用 DPO + 拒绝采样,而不是 PPO

输入:预训练好的基础模型 + 人类偏好数据。

处理:对齐(让模型听话、有用、无害)有两条主流路线:一是 RLHF 里的 PPO(先训奖励模型,再用强化学习优化),二是 DPO(直接拿"好回答 vs 坏回答"的偏好对优化模型)。PPO 效果强但出了名的难调、不稳、贵。Llama 3 选了更"无聊但可靠"的组合:SFT(先教它说人话)→ DPO(直接对齐偏好)→ 拒绝采样(让模型生成 N 个候选、挑最好的加回训练集,等于自己给自己出优等生范文),如此反复约 6 轮。这条路线的哲学和它选稠密架构一脉相承——在能拿到稳定结果的前提下,选更简单、更可控的方案。反复多轮迭代则保证了对齐质量能逐步爬升,而不必承担 PPO 的调参风险。

输出:一个对齐良好、且训练过程稳定可控的对话模型。

8. "组合式多模态"是什么取舍

输入:一个已经训得很好的纯语言主干 + 图像/视频/语音编码器。

处理:把模型变多模态有两条路。一条是"原生多模态"——从头就把图文一起训进一个模型。另一条是 Llama 3 走的"组合式":语言主干基本不动,在旁边挂上视觉/语音编码器,再插入一组 cross-attention 适配层让语言模型能"看见"这些外部 token,并分阶段训练(先冻主干只训适配器,再联合微调)。这么做的好处很实在:保住了辛苦训出来的强语言能力不被多模态训练冲淡,模块可以分别迭代,风险和成本都可控。代价是视觉和语言的融合不如原生方案那么深。这又一次体现了 Llama 3 的整体风格——用工程上稳妥、可解耦的方式,一点点把能力加上去,而不追求一步到位的激进设计。

输出:在保住语言能力的前提下、可控地长出图像/视频/语音理解的多模态版本。

所以这一节是想说:数据像采购(真正的护城河)、架构像算钢筋(稳妥选稠密)、后训练像试菜(选可控的 DPO 而非难驯的 PPO)、多模态像加配菜(组合式不伤主干)——四步背后是同一条哲学:把已知有效的东西做到极致,用规模与数据取胜,而非用花招取巧。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【The Llama 3 Herd of Models · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

The Llama 3 Herd of Models — 方法示意:核心 pipeline
Plate Nº IIThe Llama 3 Herd of Models — 方法示意:核心 pipeline

关键数字(What works)

Llama 3 报告公开了大量数字。以下为可确认的关键规模;各 benchmark 精确分数需以原文为准,本笔记不编造。

关注点 说明 具体数值
最大模型规模 稠密参数 405B(原文报告)
预训练数据 tokens 总量 约 15T(原文报告,Llama 2 约 1.8T)
上下文长度 支持的最长上下文 128K(先 8K 再扩展)
训练算力 GPU 量级 约 16K 张 H100(原文报告)
模型档位 参数尺寸 8B / 70B / 405B
各项评测 MMLU/GSM8K/HumanEval/MATH 等 具体分数需读原文

提醒:规模类数字(405B、15T、128K、16K H100)来自原文报告;各 benchmark 具体分数请以 arXiv 原文(2407.21783)为准。

所以这一节是想说:可确认的是"405B / 15T tokens / 128K 上下文 / 16K H100"这几个规模,具体刷榜分数回原文。


实验结果说明了什么

  • 开源能触及闭源前沿:405B 在多项评测上对标 GPT-4 档位,证明开源社区凭"规模 + 数据 + 工程"也能做到接近闭源旗舰。
  • 不需要架构奇技:坚持稠密 Transformer、没上 MoE 也能到前沿,说明当前阶段"把已知配方做扎实"比"发明新结构"更决定成败。
  • DPO 足够好用:后训练用 DPO + 拒绝采样迭代,比 PPO 更稳更省,说明对齐不一定要上复杂 RL。
  • 视觉后挂是稳妥模板:"主干冻结 + 适配器后挂 + 分阶段联合训"能加多模态而不伤语言,成为后续 VLM/视频/语音模型反复用的范式。

所以这一节是想说:实验证明"扎实的工程 + 足够的规模和数据"能让开源追上前沿,且透明的后训练/多模态配方可复用。


你应该懂的几个新词

GQA(Grouped-Query Attention):多 query head 共享一组 key/value,省 KV 缓存。

DPO(Direct Preference Optimization):用好/坏回答对直接优化模型,比 PPO 简单的对齐方法。

拒绝采样(Rejection Sampling):生成 N 个候选挑最好加入训练集。

Cross-attention 适配器:插入注意力层让外部信息(图像)被看见,不动主干。

Scaling Law(规模定律):参数/数据/算力的经验幂律,用来预测大模型该多大。

Data mixing(数据配比):不同来源数据的混合比例,影响巨大。

稠密 vs MoE:稠密每次全参数参与;MoE 每次只激活部分专家,省算力。

所以这一节是想说:抓住"GQA、DPO、拒绝采样、适配器、scaling law、数据配比、稠密/MoE"这几个词,就抓住了 Llama 3 报告。


它有什么搞不定的

  • 成本极高:15T tokens + 16K H100 数月训练,只有极少数机构负担得起,普通人只能用权重不能复现训练。
  • 没上 MoE 的效率代价:稠密路线推理时全参数参与,同等能力下算力/显存开销比稀疏 MoE 更大。
  • 数据未完全开源:报告公开了流程,但训练数据本身没有完整放出,"透明"是过程透明,不是数据透明。
  • 多模态是后挂而非原生:视觉/视频/语音靠适配器接入,理解深度未必比原生多模态训练的模型强。
  • 对齐仍有局限:DPO + 拒绝采样能对齐,但幻觉、越狱、偏见等问题并未根除,安全仍是持续工作。

所以这一节是想说:Llama 3 强在透明和规模,但训练贵、稠密低效、数据未全开、多模态后挂、安全未根除都是边界。


它和别的几篇是什么关系

  • 承接 Llama 2(2023):同家族升级,规模约 ×10,加多模态分支。
  • 对标闭源前沿:GPT-4、Gemini 1.5、Claude 3——同档位的稠密大模型。
  • 对比 MoE 路线:Mixtral / DeepSeek-V2 / Qwen-MoE 走稀疏激活,Llama 3 坚持稠密。
  • 多模态思路相关Flamingo(cross-attention 视觉适配器祖师爷)、LLaVA(投影层接法)、BLIP-2(Q-Former)——Llama 3 视觉支路接近 Flamingo 派。
  • 透明度对标:BLOOM/OPT/GPT-NeoX 报告——但 Llama 3 是第一份"前沿规模 + 全栈细节"的开源报告。
  • 下游底座:成为 2024–2025 开源基座事实标准,大量 RLHF/agent/VLA(如很多具身工作)直接 finetune Llama 3。

所以这一节是想说:Llama 3 是开源前沿基座的标杆,视觉接法承 Flamingo,成为无数下游(含具身)工作的地基。


和本导读的关系

所以这一节是想说:Llama 3 落在 Ch09(多模态接法)与 Ch12(VLA 底座)之间,是下游具身应用的地基。


思考题

Q1:Llama 3 报告的核心贡献是"新架构"还是别的?

提示

不是新架构(仍是稠密 Transformer)。核心贡献是"前沿规模 + 全栈训练透明",证明规模 + 数据 + 工程决定大部分能力。

Q2:为什么后训练选 DPO 而不是 PPO?

提示

DPO 直接用好/坏回答对优化,不用先训 reward model 再跑 RL,更稳、更便宜,工程复杂度低。

Q3:为什么用小模型当 proxy 先试数据配比,再喂大模型?

提示

大模型训练极贵,先用小模型低成本试出好的配比,再用到大模型上,避免在大模型上瞎试烧钱。

Q4:Llama 3 坚持稠密而不上 MoE,代价和好处各是什么?

提示

好处是训练/部署简单、稳定;代价是推理时全参数参与,同等能力下算力/显存开销更大。

Q5:视觉"后挂适配器"相比原生多模态训练,有什么取舍?

提示

后挂能保住语言能力、成本低、模块化;但视觉理解深度可能不如从头联合训练的原生多模态模型。

Q6:"开源"在 Llama 3 这里到底开到什么程度?

提示

开了权重和大量训练过程细节,但训练数据本身没完全公开——是"过程透明"而非"数据全开"。

Q7:为什么说 Llama 3 是很多具身 AI 工作的"地基"?

提示

大量 VLA/agent 直接在 Llama 系底座上微调,理解它的训练与多模态接法,才懂下游论文的起点。

所以这一节是想说:想清楚这些题,你就理解了"透明的价值""DPO 的选择""稠密的取舍""后挂多模态"这几件核心事。


一些好奇心问答(FAQ)

Q:Llama 3 权重能商用吗?

Llama 系列有自己的许可协议,允许一定条件下的商用,具体以官方 license 为准。

Q:405B 我跑得动吗?

单机基本不行,需要多卡集群。个人更适合用 8B/70B,或用托管 API。

Q:15T tokens 的数据能下载吗?

不能。报告公开了数据处理流程,但训练数据本身未完整放出。

Q:它的多模态版和 GPT-4V 比如何?

定位是开源可用,具体高下需看同设定评测,本笔记不编造分数。视觉是后挂适配器路线。

Q:为什么这份报告对工程师价值特别大?

从 tokenizer 到故障恢复都写出来了,是"如何训一个前沿大模型"的实战手册,价值超过论文本身。

所以这一节是想说:Llama 3 是开源前沿基座的实战手册,普通人主要受益于用权重和读工程细节。


如果你想再深入

  1. 先读 §1 + §2 + 结论 —— 搞清楚他们想证明什么、最后证明到了什么。
  2. 读数据 pipeline + 预训练节 —— 工程含金量最高、最值得抄作业的部分。
  3. 读后训练(DPO + 拒绝采样迭代) —— 理解 SFT 之后怎么把模型调听话。
  4. 多模态部分对照 Flamingo / LLaVA 看 —— 当成"视觉适配器的工业实现"。
  5. 若只有 30 分钟 —— 读 §1、数据节、后训练循环图、评测表即可。

所以这一节是想说:先读引言和结论抓主线,再重点啃数据 pipeline 和后训练,多模态对照 Flamingo/LLaVA。


原文信息

@article{grattafiori2024llama3,
  title  = {The Llama 3 Herd of Models},
  author = {{Llama Team, AI @ Meta}},
  journal = {arXiv preprint arXiv:2407.21783},
  year   = {2024}
}

BibTeX 作者字段据公开信息填写(Llama 团队),完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_llama_3_herd_2026,
  title       = {(readable note) The Llama 3 Herd of Models},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/llama-3-herd/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?