Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 131

Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks

16 min read · 5753 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。

一句话讲什么(TL;DR)

一个相对小的看图模型:你跟它说"描述这张图""圈出所有的猫""图里红车在哪""把这段文字读出来",它都用同一个脑子处理,输出统一的一段文字。靠一个 5.4 亿标注 / 1.26 亿张图的超大数据集 FLD-5B 撑起来,让参数量不大的模型在检测、分割、caption、grounding 等多种任务上都有强劲的零样本(zero-shot)和微调能力。

所以这一节是想说:Florence-2 把"视觉任务接口"统一成"图 + 文字提示 → 文字输出",用数据的广度换掉模型的巨大,是一体化视觉基础模型的代表作。


这是个什么场景

你周末整理手机相册,可能会做几件事:把有猫的照片挑出来、给一张旅游照配一段文案、在合影里圈出"穿红衣服那个人"、把菜单照片里的字读出来。今天你得分别打开四个 app:宠物识别、AI 配文、人脸框选、OCR 工具——每个都要单独训练、单独调用,接口还都不一样。

旧的视觉模型就像这种专科 app 各做各的:一个只会检测物体(画框)、一个只会 caption(写图说)、一个只会分割(画像素轮廓)、一个只会 OCR(读字)。每个都得单独训、单独部署,输入输出格式互不兼容,工程上要拼一堆模块。

Florence-2 想做的,是把这些专科 app 合成一个万能助理:给它一张照片 + 一句"任务提示"(prompt),"圈出所有的猫"它画框、"描述这张图"它写文案、"图里红车在哪"它指给你看、"读一下这段字"它 OCR。不同提示,同一个脑子,输出都是一段文字。

更妙的是这个助理"个头不大"(参数比很多几十亿参数的大模型小得多),却因为见过的活儿足够多够杂,单项任务都能打过专科选手。

所以这一节是想说:Florence-2 面向的是"我不想为每种视觉任务各训一个模型"的场景,答案是用一个统一接口 + 一个超大多任务数据集吃下全部。


Florence-2 — 场景示意:这论文要解决的现实问题
Plate Nº IFlorence-2 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

在 Florence-2 之前,视觉领域主要有几条路,各有短板:

  • 专用模型路线:DETR(检测)、Mask R-CNN(分割)、BLIP(caption)各做各的。接口不统一,工程上要拼很多模块,且换任务就得换模型。
  • CLIP / ALIGN(图文对比学习):图文对齐拿到强 zero-shot 分类和检索能力,但只擅长"算图文匹配度",不能直接做检测框、像素分割这种密集预测(dense prediction)
  • Pix2Seq / UniTAB 等序列化统一范式:把检测/grounding 也写成"输出 token 序列",证明了可行,但任务覆盖面窄、训练数据规模有限
  • Flamingo / BLIP-2 / Kosmos(视觉接 LLM):擅长 VQA、caption 这类生成任务,但密集任务(精确框、像素 mask)不是它们主场,而且往往靠堆几十亿参数取胜。

密集预测(dense prediction):需要在图上给出精细空间输出的任务,比如每个物体的框、每个像素的类别(分割)。和"整图给一个标签/一句话"相对。

zero-shot(零样本):模型不在该任务上做额外训练,直接凭提示完成任务。

共同问题:要么接口不统一、要么不会密集预测、要么靠"大力出奇迹"堆参数。Florence-2 反其道行之——模型不必大,但任务接口要统一、训练数据要覆盖各种空间层次和语义粒度。

所以这一节是想说:前人缺一个"接口统一 + 任务全覆盖 + 数据够广"的方案,Florence-2 用统一序列接口和 FLD-5B 大数据集来补。


这篇论文的新想法

核心思路一句话:把所有视觉任务都翻译成"图像 + 文字提示 → 文字序列",连坐标框和分割轮廓也编码成文字来生成。

三个押注:

  1. 统一接口:用自然语言风格的 prompt(如 <CAPTION><OD> 表示 object detection、<REFERRING_EXPRESSION_SEGMENTATION>)告诉模型"做哪类任务",输出永远是 token 序列。没有任务专属的输出头(task-specific head)。
  2. 坐标也文字化:把连续坐标离散成一批 location token,检测框就是"4 个坐标 token + 类名",分割就是一串多边形顶点 token。这样"画框""画轮廓"都变成"写字"。
  3. 数据的广度换模型的大小:自建 FLD-5B——126M(1.26 亿)张图上的 5.4B(54 亿)条标注,覆盖 caption、检测、grounding、OCR、区域描述等多种粒度。用一套"自动标注 + 模型迭代精炼"的数据引擎生成。

核心赌注:当任务接口足够统一、训练数据足够全时,一个相对小的模型(base / large 两档)就能在很多任务上接近甚至超过专用大模型。

所以这一节是想说:Florence-2 的灵魂是"把视觉问题翻译成语言问题",配一个超大多粒度标注数据集,让统一小模型全能。


它分几步做的(方法)

整套方法可以拆成四步:统一格式、模型骨架、数据引擎、训练目标。方法的核心不在结构(结构很标准),而在"输入输出怎么打包"和"数据怎么造"。

1. 统一的输入输出格式(Unified Prompt-to-Sequence)

类比:把所有问题都翻译成同一种语言——不管你问"是什么""在哪""长什么样""写了啥字",回答统统用"一段文字"交差。

输入:图像 + 一个很短的任务提示 token(如 <CAPTION><OD>)。

处理:模型看到提示就知道该输出什么格式。所有任务共享同一个"序列输出口",不为每个任务单独设计输出层。

输出:一段 token 序列——caption 就是普通文字;检测是"坐标 token + 类名";分割是一串顶点 token。

prompt-to-sequence:用文字提示触发任务,所有输出统一成 token 序列的范式。

所以这一节是想说:统一格式让"一套权重做多任务"成为可能,提示词是任务的开关。


2. 坐标也能写成"文字"(Location Token)

类比:给整张图铺一张 1000×1000 的方格纸,任何位置都能用"第几格"来指。把这些格子编号做成特殊 token 加进词表,模型就能"说出"位置了。

输入:连续的像素坐标(归一化到 0~1)。

处理:把坐标离散成固定数量的 bin(如 1000 个),每个 bin 对应一个特殊 token <loc_i>,加进模型词表。于是:

  • 目标检测框 = 4 个 <loc> token(左上、右下角)+ 类名文字;
  • 指代表达理解(referring expression comprehension)= 先复述短语,再给框;
  • 分割轮廓 = 一串按顺序排列的顶点 <loc> token。

输出:坐标和轮廓像普通单词一样,被 encoder-decoder"续写"出来。

location token / <loc_i>:把连续坐标离散成有限个 bin,每个 bin 一个特殊 token,让"位置"也能被语言模型生成。这是把密集预测塞进序列模型的关键 trick。

所以这一节是想说:坐标文字化是 Florence-2 能用同一个序列口做检测/分割的技术核心。


3. 模型骨架:视觉编码器 + 序列到序列(DaViT + Encoder-Decoder)

类比:像三明治——底下视觉编码器把图嚼成 token,上面一个 encoder-decoder 把"图 token + 提示 token"一起读进去,再一个字一个字吐答案。

输入:图像 + 提示 token。

处理

  • 视觉端:用 DaViT(Dual Attention Vision Transformer,双注意力视觉 Transformer) 把图像编码成视觉 token。DaViT 同时做空间注意力和通道注意力,兼顾"哪里"和"什么特征"。
  • 多模态端:一个标准的 Transformer encoder-decoder(类似 T5 / BART 结构),把视觉 token 和提示 token 拼在一起编码,再自回归解码出文字序列。

输出:面向该任务的 token 序列(文字 / 坐标 / 顶点)。

结构本身没花活——关键不在结构,在训练目标和数据

所以这一节是想说:骨架是"DaViT 看图 + seq2seq 说话",刻意保持标准,把创新留给接口与数据。


4. FLD-5B 数据引擎与训练(Data Engine + Next-Token Prediction)

类比:组建一支专家流水线,给同一张图反复"抄作业",最后互相校对。

输入:1.26 亿张原始图像。

处理(数据引擎):用"自动标注 + 模型迭代精炼(iterative annotation and model refinement)"的循环——先用一批现成的专用模型给每张图打标(检测器画框、分割器画轮廓、caption 模型写图说、grounding 模型对齐短语和位置),再用模型和一致性检查去噪、合并、精炼,给每张图攒出三档粒度的标注:

  • 整图级(image-level):caption;
  • 区域级(region-level):框 + 短语;
  • 像素级(pixel-level):分割轮廓。

最终得到 FLD-5B:126M 图 + 5.4B 条综合视觉标注

处理(训练):所有任务共享同一个目标——next-token prediction(预测下一个 token)。不管是 caption 还是检测框,对模型来说都是"接着往下写"。数据按任务混合采样,prompt 决定该吐什么。下游可以零样本直接 prompt,也可以针对单任务再微调刷分。

输出:一个统一的视觉基础模型(base / large 两档规模),零样本和微调能力都强。

整体数据流(ASCII)

   图像 ─────────────► DaViT 视觉编码器 ──┐
                                          ├──► seq2seq Encoder-Decoder
   任务提示 <OD>/<CAPTION>/... ───────────┘            │
                                                       ▼
                              统一 token 序列输出:
                     "a cat on a sofa"            (caption)
                     <loc_x1><loc_y1><loc_x2><loc_y2> cat  (检测)
                     <loc>...<loc>(多边形顶点)        (分割)

数据引擎循环(ASCII)

  原始图 → [多个专用模型自动标注] → 初版标注
             ▲                          │
             │                          ▼
        用更强的模型     ←   [一致性过滤 / 合并 / 精炼]
        重新标注(迭代)          │
                                  ▼
                     FLD-5B(126M 图 / 5.4B 标注,三档粒度)

所以这一节是想说:Florence-2 的真护城河是 FLD-5B 数据引擎——用"自动标注 + 迭代精炼"低成本造出多粒度大标注,再用统一的 next-token 目标一锅端全部任务。


Florence-2 — 方法示意:核心 pipeline
Plate Nº IIFlorence-2 — 方法示意:核心 pipeline

关键数字(What works)

论文摘要给出的确定数字如下;具体各 benchmark 的分数需读原文表,本节只列摘要与公开信息可确认的。

数据集与模型规模

项目 数值
FLD-5B 图像数 126M(1.26 亿)
FLD-5B 标注数 5.4B(54 亿)条综合视觉标注
标注粒度 整图 / 区域 / 像素 三档
模型规模 base 与 large 两档(相对同类 generalist 更小)
视觉编码器 DaViT
多模态结构 Transformer encoder-decoder(seq2seq)
训练目标 统一 next-token prediction

能力覆盖(同一套权重)

任务类型 prompt 示例 输出形式
Caption(图说) <CAPTION> 自然语言
目标检测(OD) <OD> 坐标 token + 类名
视觉定位 / grounding 短语 框(loc token)
指代分割 <REFERRING_EXPRESSION_SEGMENTATION> 顶点 token
OCR / 文字识别 <OCR> 文字(+ 可选位置)

摘要级结论:Florence-2 展示了"前所未有的零样本和微调能力",作为一个相对小的视觉基础模型,在多种任务上是强有力的竞争者。具体各基准数字(COCO、RefCOCO、Flickr30k 等)原文表中给出,此处不臆造。

所以这一节是想说:核心可确认数字是 FLD-5B 的规模(126M 图 / 5.4B 标注)与"一套小模型覆盖 caption/检测/grounding/分割/OCR"这件事;单项 benchmark 分数请以原文表为准。


实验结果说明了什么

**结论 1:接口统一是可行的。**同一套权重 + 不同 prompt 就能在 caption、检测、grounding、分割、OCR 之间切换,证明"把视觉任务翻译成语言问题"这条路走得通,不需要为每个任务留专属输出头。

**结论 2:数据广 > 模型大。**Florence-2 用相对小的模型,靠 FLD-5B 的多粒度广覆盖,在多任务上接近或超过参数量大得多的 generalist 模型。这说明当前很多视觉任务的瓶颈不在模型容量,而在"有没有见过足够多、足够多样、足够细粒度的标注"。

**结论 3:自动数据引擎能规模化造标注。**5.4B 标注不可能全靠人工。用"多模型自动标注 + 迭代精炼 + 一致性过滤"的引擎,把标注成本压下来,是这类大一统模型能训起来的前提。

**结论 4:零样本能力来自多粒度覆盖。**因为训练时就见过整图/区域/像素三档标注,模型在没微调的情况下也能对新任务给出合理的结构化输出。

所以这一节是想说:Florence-2 验证了"统一接口 + 广数据 + 小模型"的组合,并给出了一个可复用的自动数据引擎范式。


你应该懂的几个新词

视觉基础模型(vision foundation model):在大规模数据上预训练、可迁移到多种下游视觉任务的通用模型。

generalist vs specialist:generalist(通用)一套权重做多任务;specialist(专用)一个模型只干一件事。Florence-2 是 generalist。

prompt-to-sequence:用文字提示触发任务、所有输出统一成 token 序列的范式。

location token / <loc_i>:把连续坐标离散成 bin、每个 bin 一个特殊 token,让坐标也能被生成。

DaViT(Dual Attention Vision Transformer):同时做空间和通道注意力的视觉骨干。

密集预测(dense prediction):需要精细空间输出的任务,如检测框、像素分割。

FLD-5B:Florence-2 自建的多粒度大标注数据集(126M 图 / 5.4B 标注),是它区别于其他 generalist 的核心资产。

指代表达分割(referring expression segmentation):给一句话"穿红衣服坐左边的人",分割出对应区域,是 grounding + 分割的合体任务。

所以这一节是想说:掌握"统一序列接口""location token""多粒度标注"这三点,就理解了 Florence-2 的全部要害。


它有什么搞不定的

  1. 偏 2D 图像级任务:设计聚焦静态单图上的检测/分割/caption/OCR,时序(视频)、3D、动作生成不在其范围,直接用于具身控制并不够。
  2. 坐标离散化的精度上限:location token 把坐标切成有限 bin(如 1000 档),对需要亚像素级精度的任务存在量化误差。
  3. 强依赖数据引擎质量:FLD-5B 由自动标注生成,源模型的偏差和错误会被继承进标注里,可能形成"自动标注的天花板"。
  4. 序列长度限制密集输出:分割轮廓写成一长串顶点 token,复杂形状(很多顶点、很多物体)会让序列过长,效率和精度受限。
  5. 未必是每个单项的 SOTA:作为 generalist,它在某些单项任务上可能仍不及针对该任务死磕的最强专用模型;它的价值在"全能 + 小 + 零样本",而非样样第一。
  6. 具体 benchmark 数字需读原文:本笔记基于摘要,各任务的精确分数以论文表为准。

所以这一节是想说:Florence-2 的边界是"2D 静态图 + 离散坐标 + 依赖自动标注质量",它是强通用底座,但不是万能,也不覆盖时序/3D/动作。


它和别的几篇是什么关系

家族关系(ASCII)

   CLIP / Florence(v1)(图文对比,偏检索)
              │ 转向生成 + 多任务统一
              ▼
        Florence-2(prompt→sequence,seq2seq)
      ┌───────┼─────────┬──────────────┐
   同期 generalist   grounding 专用    下游使用者
   Kosmos-2 /       GLIP /            机器人/具身:
   Unified-IO /     Grounding-DINO    需要框就 prompt 框
   OFA                                需要 caption 就 prompt
  • 前身:Florence v1(2021)是图文对比预训练、偏检索;Florence-2 转向生成式 + 多任务统一。
  • 同期 generalist:Kosmos-2、Unified-IO、OFA 都在把视觉任务序列化,Florence-2 的差异点是更全的任务覆盖 + 更大的多粒度标注数据集 FLD-5B
  • grounding 专用对照:GLIP、Grounding-DINO 专攻开放词表检测;Florence-2 把 detection 当多任务里的一项。
  • 对比 BLIP-2 / Flamingo:那些更偏"视觉接 LLM 做对话/VQA";Florence-2 偏"视觉任务统一接口",分工不同(详见 blip-2.mdflamingo.mdqwen-vl.md)。
  • 下游影响:很多具身 / 机器人工作把 Florence-2 当现成的"视觉万能秘书"——需要框就 prompt 框、需要 caption 就 prompt caption,和 SAM / DINOv2 一起成为下游搭积木的常用底座。

所以这一节是想说:Florence-2 = Florence v1 的生成化 + Pix2Seq 式序列接口 + FLD-5B 大数据,是"视觉任务统一接口"路线里最完整的一篇之一。


和本导读的关系

本篇对应 Ch09: 从 BLIP-2 到 LLaVA——视觉接语言

Ch09 讲"怎么把视觉接到语言模型上"。BLIP-2 / LLaVA 走的是"视觉特征 → LLM → 对话/VQA"的生成路线,强在自由问答。Florence-2 走的是另一条互补路线——"视觉任务统一接口 → 结构化文字输出",强在检测/分割/grounding 这类需要精确空间输出的任务。读 Ch09 时把 Florence-2 当作"generalist 视觉模型"这一分支的代表,它和 BLIP-2/LLaVA 一起构成了"VLM 能干什么"的完整版图,也是很多具身工作调用的感知前端。

所以这一节是想说:在 Ch09 里 Florence-2 代表"统一接口做密集视觉任务"的一支,与 BLIP-2/LLaVA 的对话式 VLM 互补。


思考题

Q1:Florence-2 把坐标离散成 1000 个 bin 用 location token 表示。这和 OpenVLA 把动作离散成 256 个 bin 是同一个 trick 吗?两者的取舍有何不同?

提示

本质同源——都是"把连续量离散成 token,塞进语言模型词表,让它能生成"。区别在精度需求与后果:Florence-2 的坐标 1000 档对 2D 检测框够用(图像本就离散成像素);OpenVLA 的动作 256 档在高精度装配上不够。且视觉坐标是"标注即真值",动作离散化的误差会通过控制回路累积。所以同一个 trick 在"感知输出"和"控制输出"上的容错度不同,这也是为什么后来 VLA(π0、OFT)转向连续动作,而视觉检测仍常用离散坐标 token。

Q2:FLD-5B 的标注是"用现成模型自动标出来的"。这会带来什么系统性风险?如何缓解?

提示

风险是"标注天花板"和"偏差继承":自动标注模型犯的错会被当成真值教给 Florence-2,且 Florence-2 很难超过标注源模型在该维度的能力。缓解手段:多个源模型交叉验证 + 一致性过滤(剔除互相矛盾的标注)+ 迭代精炼(用逐渐变强的模型重标)。但根本上,自动标注质量决定了上限,这也是为什么"数据引擎设计"本身是论文的核心贡献而非附属工程。

Q3:为什么 Florence-2 敢用"相对小"的模型,而不像 Flamingo/Kosmos 那样堆几十亿参数?它赌的是什么?

提示

它赌"当前多任务视觉的瓶颈在数据覆盖而非模型容量"。如果一个任务模型没做好,往往是没见过足够多样、足够细粒度的该类标注,而不是脑子不够大。FLD-5B 的多粒度广覆盖正是补这个短板。所以它用数据的广度换模型的大小。风险是:一旦任务复杂到需要更强的推理/组合能力,小模型的容量会成为真瓶颈——这也解释了它偏 2D 感知、不做复杂推理/时序。

Q4:把分割轮廓写成一长串顶点 token,有什么效率与精度上的隐患?

提示

复杂形状需要很多顶点,序列会很长——自回归解码是顺序的,长序列既慢又容易在后段累积错误;多个物体同时分割时序列更长。而且多边形近似本身对曲线边界有精度损失。相比之下,专用分割模型直接输出像素级 mask,对复杂形状更自然。这是"用统一序列接口"付出的代价:接口统一了,但对某些密集输出不是最高效的表示。

Q5:Florence-2 常被具身/机器人工作当作"感知前端"调用。它作为感知前端有什么优势,又有什么必须补的短板?

提示

优势:一个模型 + 换 prompt 就能拿到框、caption、grounding、OCR 等结构化输出,省去拼多个专用模型,且零样本即用。短板:它只懂 2D 静态图,不懂时序、不懂 3D 深度、不输出动作。所以具身系统通常把它当"看一眼给出结构化描述/位置"的模块,再接一个策略/控制器把这些信息转成动作——Florence-2 负责"看懂",不负责"动手"。

Q6:如果要把 Florence-2 扩展到视频/时序任务,最需要改哪几处?

提示

至少三处:(1) 视觉端要能吃多帧并建模帧间关系(时序注意力或帧堆叠);(2) 输出接口要新增时序 token(如轨迹、事件时间戳),类似给 location token 加一个"时间维";(3) 数据引擎要产出带时序标注的数据(动作、轨迹、事件),而现有 FLD-5B 是静态图标注。核心难点在第三点——时序多粒度标注的自动生成远比静态图难。


一些好奇心问答(FAQ)

Q:Florence-2 和 Florence(v1)是什么关系?

v1(2021)是偏检索的图文对比预训练模型;Florence-2 是重做的生成式多任务统一模型,思路差别很大,不是简单的版本升级。

Q:它开源吗?我能直接用吗?

Florence-2 由微软发布,模型在 Hugging Face 上可获取,社区广泛用作"视觉万能秘书"。具体许可以官方发布为准。

Q:base 和 large 差在哪?

主要是参数规模不同(large 更大更强)。两档都远小于同期一些几十亿参数的 generalist VLM,这是它"小模型"卖点的体现。

Q:它能做 VQA / 对话吗?

它的强项是结构化视觉任务(检测/分割/grounding/caption/OCR)。自由对话式 VQA 更是 BLIP-2 / LLaVA / Qwen-VL 那条线的主场,两者定位不同。

Q:为什么叫"统一表示(unified representation)"?

因为不同任务不再各有各的输出头和表示,而是共享同一个"图 + 提示 → 序列"的表示与接口。

所以这一节是想说:对多数人,Florence-2 的正确用法是"当一个零样本的结构化视觉输出工具调用",而不是拿它做对话。


如果你想再深入

  1. 对照读:BLIP-2 (Li et al. 2023) — 视觉接 LLM 的生成路线,和 Florence-2 的统一接口路线互补。见 blip-2.md
  2. 对照读:LLaVA (Liu et al. 2023) — 指令微调式 VLM,理解"对话式 VLM"和"统一接口视觉模型"的分工。见 llava.md
  3. 序列化前驱:Pix2Seq / UniTAB — 把检测写成序列的早期尝试,看 Florence-2 在此基础上扩了什么。
  4. grounding 专用对照:Grounding-DINO / GLIP — 专攻开放词表检测,对比 generalist 与 specialist。
  5. 下游搭档:SAM、DINOv2 — 常和 Florence-2 一起作为具身/视觉系统的底座。

读顺序建议:

CLIP → BLIP-2 / LLaVA(对话式 VLM)
              └─► Florence-2(你在这,统一接口视觉模型)
                        └─► 具身系统里当感知前端

所以这一节是想说:把 Florence-2 放在"generalist 视觉模型"这一支来读,对照 BLIP-2/LLaVA 的对话式路线,最能看清它的定位。


原文信息

@inproceedings{xiao2024florence2,
  title={Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks},
  author={Xiao, Bin and Wu, Haiping and Xu, Weijian and Dai, Xiyang and Hu, Houdong and Lu, Yumao and Zeng, Michael and Liu, Ce and Yuan, Lu},
  booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  year={2024}
}
  • arXiv:2311.06242
  • 机构:Microsoft
  • 一句话定位:统一 prompt→sequence 接口 + FLD-5B(126M 图 / 5.4B 标注),小模型全能视觉基础模型。

引用本笔记 / Cite this note
BibTeX
@online{eai_florence_2_2026,
  title       = {(readable note) Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/florence-2/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?