About this reading station
这站是为想读懂顶会论文、但还在入门阶段的人做的。具身智能(Embodied AI)讲的是「怎么让机器人有身体地融入世界」——它要看见、要听见、要听懂指令、要决定下一步怎么做。听起来像科幻,但 2024-2025 已经在论文里跑通了一大半。
项目源于一个本科生科研任务:实验室给了 13 篇代表论文,覆盖 7 个主题。笔记用 AI 辅助整理成能读懂的长篇结构化版本——用基础类比解释新词,但不把结构门禁等同于逐页人工复核;关键数字和结论仍应回到来源核验。
原任务的七个主题是这样:
- I. VLM Foundation — 视觉与语言对齐的基座模型
- II. High-Level Planning — 让 LLM 输出"做得到"的指令
- III. End-to-End VLA — 直接从图像 + 指令生成动作
- IV. Multimodal Ecology — 语音、触觉、3D 等更多输入
- V. Video World Model Policy — 用视频生成模型当机器人策略
- VI. RF Perception & Mapping — 用毫米波雷达"看穿"墙和遮挡
- VII. Auditory & Acoustic — 让设备在嘈杂环境中听清
Open data
站点元数据以 JSON 公开;许可按资产类别区分,Data API 不会把项目声明扩展到第三方论文或 figure。如果你想做二次分析、可视化或 LLM 训练数据:
- /data/v2/index.json — v2 入口、兼容与治理发现
- /data/v2/provenance.json — canonical provenance(仅元数据与 hash)
- /data/index.json — manifest(计数 + endpoint URL)
- /data/papers.json — 202 篇全部元数据 + tldr
- /data/tags.json — tag 频次 + 共现矩阵
- /data/topics.json — 11 主题 + primer
Workflow
lr pdf bundle paper.pdf— 把授权 PDF 转成带图 markdownnotes/<slug>.md— 用统一模板整理长篇结构化笔记npm run provenance:generate— 生成或核对 156 条 canonical provenance 元数据与 hashnode site/scripts/build.mjs— 期刊风 HTML 渲染- GitHub Actions → GitHub Pages — 部署
Visual reference
视觉风格以 open-design 的 atelier-zero(暖纸 + 珊瑚红 + 罗马数字章节 + 三族字体混排)和 warm-editorial(serif + 长读节奏)为起点;全站身份、导航、状态和项目证明层接入 Jason DS v2,并保留本站的期刊气质。
Stack
- Pure HTML + CSS, no framework — 全站静态页面预渲染
- Markdown → HTML via
marked+gray-matter - Build script:
site/scripts/build.mjs编排入口 +scripts/lib/模块(Node,零框架) - 搜索: Pagefind 全文索引
- 数学: KaTeX(自托管 vendor/)
- 可视化: D3.js v7(force-directed graph,自托管 vendor/)
- PWA: 自定义 service worker 离线缓存
- 部署: GitHub Pages + Actions(每 push 自动 build → healthcheck → deploy)
Colophon
设计参照:open-design 的 atelier-zero design system。
- 字体:Inter Tight(正文 sans)/ Playfair Display(display italic)/ JetBrains Mono(mono)— 全部 Google Fonts
- 颜色:暖纸 ivory
#efe7d2/ 珊瑚红#ed6f5c/ 芥末黄#e9b94a/ 橄榄#6e7448/ 墨色#15140f - 图标记法:罗马数字章节(I-XI)/ Plate Nº 编号 / 章节末尾 ◼
AI 工具
这站建成借助了几个 AI 工具:
- Claude Code:主要的代码生成 + 笔记重写工具
- Codex CLI:404+ 张内嵌图片生成(场景图 + 方法图,全部 16:9 webp)
- MinerU + pdftotext:PDF → markdown 解析
- lr (LightRead):arXiv 检索 + PDF bundle 工具
AI 输出经过自动结构、链接、来源和构建门禁;这不代表 202 篇都已逐页人工复核。重要事实请以原论文为准,发现错误欢迎提交 issue。
dist 体积分布
总 107.0 MB。
License
稳定策略标识:EAI-LICENSE-MAP-1.0.0 / EAI-PROVENANCE-2.0.0。
project-code:MITproject-notes:CC-BY-4.0— 引用并标注修改project-generated-images: 仅另有证据证明项目可许可的图片声明CC-BY-4.0;当前 v2 字段不会自动归类third-party-paper-materials:NOASSERTION— 不是许可授予;论文、figure 与无独立权利证据的生成资产均默认归入此类
MIT license · rights notice · provenance policy
当前 canonical manifest 的 generated_assets 记录数为 306;记录与 hash 也不能单独证明可许可权利。
Contact / 反馈
有几种方式联系:
- 笔记错误 / 想加论文 / 想改风格:GitHub issue
- 修正建议(你是原作者):同上 issue 或 PR;引用论文 slug 即可
- 讨论 / 想法:GitHub Discussions
这是个人项目,不保证回复速度。但每个 issue 都会读。
Cite this site
整站作为参考资料引用:
@online{embodied_ai_reading_station_2026,
title = {Embodied AI: Zero to One},
author = {Xun, Jason},
year = {2026},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/}},
note = {202 readable Chinese notes on embodied AI papers}
}
单篇引用请用论文页底部的 BibTeX 块。