Multimodal Ecology
图、文、音、触、IMU——把更多通道塞进同一个嵌入空间。这一族不直接做机器人,但提供了关键基础设施:跨模态预训练、感知融合、Web-scale 图文数据。
先读这三篇。
ImageBind 用图像作锚点联通六模态 → OBELICS 把交错图文文档做成数据集 → AnyMAL 把任意模态注入 LLaMA。
-
1
ImageBind: One Embedding Space To Bind Them All
把图片当翻译官,六种感官(图、文、声、深度、热、动作)就能互相听懂彼此说话——而且不需要让它们两两见过面。
-
2
OBELICS
HuggingFace OBELICS 从 Common Crawl 抽出 1.41 亿 英文网页、3.53 亿 张图、1150 亿 text token,按 DOM 原生顺序 保留「段–图–段–图」交错结构;在此上训 IDEFICS-80B 后 4-shot VQAv2 63.
-
3
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
Meta AnyMAL 在 LLaMA-2-70B-chat 全程冻结 的前提下,为 图 / 视频 / 音 / IMU 各训一个 投影层(aligner),把模态信号映进 LLM 词嵌入空间 当「伪 token」;再用自标 60K MM-IT + 合成 150K 做指令微调。零样
2019 到 2025,15 篇怎么排开。
祖师爷
经典
前沿
Multimodal Ecology 全部 15 篇。
| era | year | title | venue |
|---|---|---|---|
| 前沿 | 2025 | VLAS: VLA Model With Speech Instructions | ICLR |
| 前沿 | 2024 | MLA: Multisensory Language-Action Model | arXiv |
| 祖师爷 | 2019 | Connecting Touch and Vision via Cross-Modal Prediction | CVPR |
| 祖师爷 | 2023 | ImageBind: One Embedding Space To Bind Them All | CVPR |
| 经典 | 2022 | X-VLM: Multi-Grained Vision Language Pre-Training | ICML |
| 经典 | 2023 | AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model | EACL |
| 经典 | 2023 | AudioPaLM | arXiv |
| 经典 | 2023 | FROMAGe: Grounding LLMs to Images | ICML |
| 经典 | 2023 | OBELICS | NeurIPS |
| 经典 | 2024 | OneLLM | CVPR |
| 前沿 | 2024 | Sparsh: Self-supervised Touch Representations | CoRL |
| 前沿 | 2024 | AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding | arXiv |
| 前沿 | 2025 | Tactile Beyond Pixels (Sparsh-X) | CoRL |
| 前沿 | 2025 | Tactile-VLA | CoRL |
| 前沿 | 2025 | TLA: Tactile-Language-Action | ICRA |