Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Colophon · 这站是怎么诞生的

About this reading station

Typewriter at a wooden desk — colophon illustration
202论文笔记
1,416,941总字数
497git commits
2011–2026年份跨度

这站是为想读懂顶会论文、但还在入门阶段的人做的。具身智能(Embodied AI)讲的是「怎么让机器人有身体地融入世界」——它要看见、要听见、要听懂指令、要决定下一步怎么做。听起来像科幻,但 2024-2025 已经在论文里跑通了一大半。

项目源于一个本科生科研任务:实验室给了 13 篇代表论文,覆盖 7 个主题。笔记用 AI 辅助整理成能读懂的长篇结构化版本——用基础类比解释新词,但不把结构门禁等同于逐页人工复核;关键数字和结论仍应回到来源核验。

原任务的七个主题是这样:

  • I. VLM Foundation — 视觉与语言对齐的基座模型
  • II. High-Level Planning — 让 LLM 输出"做得到"的指令
  • III. End-to-End VLA — 直接从图像 + 指令生成动作
  • IV. Multimodal Ecology — 语音、触觉、3D 等更多输入
  • V. Video World Model Policy — 用视频生成模型当机器人策略
  • VI. RF Perception & Mapping — 用毫米波雷达"看穿"墙和遮挡
  • VII. Auditory & Acoustic — 让设备在嘈杂环境中听清

Open data

站点元数据以 JSON 公开;许可按资产类别区分,Data API 不会把项目声明扩展到第三方论文或 figure。如果你想做二次分析、可视化或 LLM 训练数据:

Workflow

  1. lr pdf bundle paper.pdf — 把授权 PDF 转成带图 markdown
  2. notes/<slug>.md — 用统一模板整理长篇结构化笔记
  3. npm run provenance:generate — 生成或核对 156 条 canonical provenance 元数据与 hash
  4. node site/scripts/build.mjs — 期刊风 HTML 渲染
  5. GitHub Actions → GitHub Pages — 部署

Visual reference

视觉风格以 open-designatelier-zero(暖纸 + 珊瑚红 + 罗马数字章节 + 三族字体混排)和 warm-editorial(serif + 长读节奏)为起点;全站身份、导航、状态和项目证明层接入 Jason DS v2,并保留本站的期刊气质。

Stack

  • Pure HTML + CSS, no framework — 全站静态页面预渲染
  • Markdown → HTML via marked + gray-matter
  • Build script: site/scripts/build.mjs 编排入口 + scripts/lib/ 模块(Node,零框架)
  • 搜索: Pagefind 全文索引
  • 数学: KaTeX(自托管 vendor/)
  • 可视化: D3.js v7(force-directed graph,自托管 vendor/)
  • PWA: 自定义 service worker 离线缓存
  • 部署: GitHub Pages + Actions(每 push 自动 build → healthcheck → deploy)

Colophon

设计参照:open-designatelier-zero design system。

  • 字体:Inter Tight(正文 sans)/ Playfair Display(display italic)/ JetBrains Mono(mono)— 全部 Google Fonts
  • 颜色:暖纸 ivory #efe7d2 / 珊瑚红 #ed6f5c / 芥末黄 #e9b94a / 橄榄 #6e7448 / 墨色 #15140f
  • 图标记法:罗马数字章节(I-XI)/ Plate Nº 编号 / 章节末尾 ◼

AI 工具

这站建成借助了几个 AI 工具:

  • Claude Code:主要的代码生成 + 笔记重写工具
  • Codex CLI:404+ 张内嵌图片生成(场景图 + 方法图,全部 16:9 webp)
  • MinerU + pdftotext:PDF → markdown 解析
  • lr (LightRead):arXiv 检索 + PDF bundle 工具

AI 输出经过自动结构、链接、来源和构建门禁;这不代表 202 篇都已逐页人工复核。重要事实请以原论文为准,发现错误欢迎提交 issue。

dist 体积分布

107.0 MB

Images (webp/jpg)
99.3 MB
HTML pages
4.9 MB
JS / CSS
0.8 MB
Data (JSON/CSV/XML)
0.7 MB
Other
1.2 MB

License

稳定策略标识:EAI-LICENSE-MAP-1.0.0 / EAI-PROVENANCE-2.0.0

  • project-code: MIT
  • project-notes: CC-BY-4.0 — 引用并标注修改
  • project-generated-images: 仅另有证据证明项目可许可的图片声明 CC-BY-4.0;当前 v2 字段不会自动归类
  • third-party-paper-materials: NOASSERTION — 不是许可授予;论文、figure 与无独立权利证据的生成资产均默认归入此类

MIT license · rights notice · provenance policy

当前 canonical manifest 的 generated_assets 记录数为 306;记录与 hash 也不能单独证明可许可权利。

Contact / 反馈

有几种方式联系:

  • 笔记错误 / 想加论文 / 想改风格GitHub issue
  • 修正建议(你是原作者):同上 issue 或 PR;引用论文 slug 即可
  • 讨论 / 想法GitHub Discussions

这是个人项目,不保证回复速度。但每个 issue 都会读。

Cite this site

整站作为参考资料引用:

@online{embodied_ai_reading_station_2026,
  title       = {Embodied AI: Zero to One},
  author      = {Xun, Jason},
  year        = {2026},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/}},
  note        = {202 readable Chinese notes on embodied AI papers}
}

单篇引用请用论文页底部的 BibTeX 块。