Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Topic VII · 多模态交互与数据生态

Multimodal Ecology

Multimodal Ecology — 多模态交互与数据生态
15papers
2founder
6classic
7frontier

图、文、音、触、IMU——把更多通道塞进同一个嵌入空间。这一族不直接做机器人,但提供了关键基础设施:跨模态预训练、感知融合、Web-scale 图文数据。


Primer · 入门 3 篇

先读这三篇

ImageBind 用图像作锚点联通六模态 → OBELICS 把交错图文文档做成数据集 → AnyMAL 把任意模态注入 LLaMA。

  1. 1
    ImageBind: One Embedding Space To Bind Them All 2023 · CVPR · ⭐⭐⭐

    把图片当翻译官,六种感官(图、文、声、深度、热、动作)就能互相听懂彼此说话——而且不需要让它们两两见过面。

  2. 2
    OBELICS 2023 · NeurIPS · ⭐⭐⭐

    HuggingFace OBELICS 从 Common Crawl 抽出 1.41 亿 英文网页、3.53 亿 张图、1150 亿 text token,按 DOM 原生顺序 保留「段–图–段–图」交错结构;在此上训 IDEFICS-80B 后 4-shot VQAv2 63.

  3. 3
    AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model 2023 · EACL · ⭐⭐⭐

    Meta AnyMAL 在 LLaMA-2-70B-chat 全程冻结 的前提下,为 图 / 视频 / 音 / IMU 各训一个 投影层(aligner),把模态信号映进 LLM 词嵌入空间 当「伪 token」;再用自标 60K MM-IT + 合成 150K 做指令微调。零样


Distribution · 年份分布

2019 到 2025,15 篇怎么排开。

祖师爷 经典 前沿
All papers · 按 era 排

Multimodal Ecology 全部 15 篇。

erayeartitlevenue
前沿 2025 VLAS: VLA Model With Speech Instructions ICLR
前沿 2024 MLA: Multisensory Language-Action Model arXiv
祖师爷 2019 Connecting Touch and Vision via Cross-Modal Prediction CVPR
祖师爷 2023 ImageBind: One Embedding Space To Bind Them All CVPR
经典 2022 X-VLM: Multi-Grained Vision Language Pre-Training ICML
经典 2023 AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model EACL
经典 2023 AudioPaLM arXiv
经典 2023 FROMAGe: Grounding LLMs to Images ICML
经典 2023 OBELICS NeurIPS
经典 2024 OneLLM CVPR
前沿 2024 Sparsh: Self-supervised Touch Representations CoRL
前沿 2024 AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding arXiv
前沿 2025 Tactile Beyond Pixels (Sparsh-X) CoRL
前沿 2025 Tactile-VLA CoRL
前沿 2025 TLA: Tactile-Language-Action ICRA