跳转到内容

14 类研究的零基础学习地图

这 14 类不是一门必须从第 1 章读到第 147 章的课程。它们更像一张技术城市地图:

  • 类别是城区;
  • 201 个项目是具体建筑;
  • README 是地铁图;
  • 最小实验是第一次下车步行;
  • 源码锚点是门牌号;
  • E0-E3 是“这条信息亲自验证到哪一步”的标记。

零基础读者每次只做一件事:

选一个问题
-> 读一个类别入口
-> 跑一个最小实验
-> 精读一个锚点项目
-> 做一个新场景迁移题

不要先安装 201 个项目,也不要把“文档看完”当成掌握。

任何系统先问:

它收到什么
-> 中间怎样变形
-> 最后产出什么

例如:

  • Agent Runtime:message → model/tool loop → events/result;
  • 文档解析:PDF → blocks/Markdown/JSON;
  • 视频 AI:video → timestamp evidence → answer/rubric;
  • Tutor:learner attempt → feedback/mastery evidence。

状态(state)是系统需要记住、以后还要继续使用的信息。

日常类比:快递单上的“已揽收、运输中、已签收”。如果只在聊天里说“已经运输”, 进程重启后就无法恢复。

身份(identity)回答“这是同一个什么”:

  • 同一个 run;
  • 同一个文档 block;
  • 同一个 learner attempt;
  • 同一个视频证据;
  • 同一个 canonical upstream。

没有稳定身份,重试、去重、恢复和比较都会混乱。

Gate 是可执行的通过条件,不是“看起来差不多”:

输入是否合法
状态是否允许
证据是否齐全
输出是否符合 schema
外部操作是否获授权
等级你真的做了什么可以怎样表述
E0只读项目自述“README 声称……”
E1检查固定源码“该提交中的代码表明……”
E2本机真实运行“命令运行得到……”
E3有 PR/Issue/部署/用户结果“外部流程显示……”

最大的学习误区,是把 E0/E1 说成 E2/E3。

路线 A:我完全不知道 Agent 怎样工作

Section titled “路线 A:我完全不知道 Agent 怎样工作”
中国独立开发者列表
-> Provider 切换
-> Coding Agent Runtime
-> Agent Skills
-> Trellis / Harness
-> LangGraph

你会依次理解:

  1. Markdown 也可以是数据;
  2. 配置、进程和流量是三种不同状态;
  3. Agent 本质是 model-tool loop;
  4. Skill 是可安装的自然语言软件资产;
  5. Harness 把自然语言流程变成状态、工件和 gate;
  6. Graph 把分支、并行、恢复和人工暂停显式化。

路线 B:我想理解生产级长期 Agent

Section titled “路线 B:我想理解生产级长期 Agent”

前置:先完成 Coding Agent Runtime 的最小 loop。

Coding Agent Runtime
-> LangGraph
-> LambChat
-> Hermes Agent
-> 系统提示词泄露与防御

重点不是“Agent 越多越好”,而是:

  • durable state;
  • idempotency;
  • tenant / credential / tool boundary;
  • lease、receipt、uncertain outcome;
  • prompt 公开后仍成立的权限控制。

路线 C:我想做 AI 研究或教学系统

Section titled “路线 C:我想做 AI 研究或教学系统”
MinerU / 文档解析
-> ResearchStudio
-> DeepTutor

你会依次理解:

  1. 来源文档怎样变成可引用结构;
  2. 研究 run 怎样由 artifact、provenance 和 gate 组成;
  3. 系统完成、当题正确、mastery 和 learning gain 为什么不是一件事。

前置:知道 token 和 Transformer 只需基础直觉,不要求先学训练数学。

MinerU / 文档解析
-> FastVLM
-> 多模态视频 AI

重点依次是:

  • 文本、顺序、结构和坐标证据;
  • 视觉 encoder、projector、LLM prefill 的成本位置;
  • 视频的时间轴、问题驱动回看和跨模态冲突。

路线 E:我只想提高证据与安全意识

Section titled “路线 E:我只想提高证据与安全意识”
中国独立开发者列表
-> ResearchStudio
-> 系统提示词泄露与防御

三步分别训练:

  • 公开仓状态与自动化结果不能混写;
  • artifact 存在与 gate 通过不能混写;
  • prompt 文本、secret 和授权边界不能混写。

每一行都是一个独立的 30 分钟起点。

类别先建立的直觉第一个实验30 分钟通过标准
中国独立开发者列表Markdown 可以同时是数据库和协作界面只读数据探针能解释条目、状态、重复和 Routine 失败是四类证据
Provider 切换配置源、运行投影和代理流量不是同一层验证实验能说明切换成功至少要验证哪些状态
Coding Agent RuntimeAgent 是可取消、可结算的 model-tool loop最小 loop能画出 message → model → tool → event → settle
Agent SkillsSkill 是内容、触发、权限和发布共同组成的软件资产生命周期实验能分开 Parse、Route、Act、Outcome
Trellis / HarnessHarness 把“记得做”变成状态和 gate最小 SDD/Harness能解释机器状态和上下文合同为什么要同时检查
LangGraph图是共享状态上的受控转移,不是画流程图StateGraph 实验能解释 reducer、checkpoint 和 exactly-once 的边界
LambChat生产平台比 Agent loop 多身份、队列、凭证和恢复最小平台能区分 run、event、operation 和 tenant identity
Hermes Agent长期 Agent 的关键是持续运行合同,不是长 prompt长期 Agent 实验能解释 lease、memory admission 和 skill rollback
ResearchStudio研究完成权属于通过 gate 的 artifactartifact-first 实验能区分 contract、environment、execution、scientific failure
DeepTutor“课程完成”不等于“学会”教学证据实验能区分 answer、mastery estimate 和 independent transfer
MinerUPDF 提取不是只有“字符多不多”一个指标同文档实验能分开 Text、Order、Structure、Provenance、Operations
FastVLM少 token 的位置决定真正省掉哪段成本端侧预算实验能区分 vision、projector、prefill、decoder pruning
多模态视频 AI检索负责定位,原始时间窗负责确认视频证据实验能处理缺步骤、乱序、ASR/视觉冲突和 frame provenance
系统提示词泄露Prompt 是岗位手册,不是保险箱和门禁离线防御实验能分开来源、secret、canary、tenant 和 approval

每个类别都用同一套五级标准,避免“看完了”这种模糊状态。

等级证据
M0 定位能用一句话说它解决什么问题,不与相邻类别混淆
M1 运行能运行最小实验,解释每行输出
M2 追踪能从入口沿 3-8 步主链找到源码锚点
M3 取舍能比较两种方案的收益、代价和不适用场景
M4 迁移面对新案例,能选择 gate、证据和失败分类

本材料提供到 M1-M3 的路径。M4 必须由你在新场景中的独立表现证明,不能由文档替你 宣布。

不看正文,先写:

  1. 输入是什么?
  2. 输出是什么?
  3. 最怕哪种失败?

只读类别 README 的结论和路线,不展开所有项目。

记录:

command
actual output
evidence level
what it does not prove

只追一条控制流,不同时打开多个仓。

把实验变量改一个:

  • 重复输入;
  • 中途崩溃;
  • 缺字段;
  • 跨 tenant;
  • 上游漂移;
  • 同值但不同 ownership。

先预测,再运行或查证。

每个类别可能有 1-27 个项目。选择顺序:

  1. 先选锚点项目:理解类别主链。
  2. 再选一个相反方案:理解 trade-off。
  3. 最后选业务相近项目:做迁移。

例如 FastVLM:

FastVLM
-> FastV(不同成本位置)
-> MiniCPM-V Apps(不同 runtime/产品边界)

不是把 21 个仓库从 A 到 Z 顺序读完。

实验失败时先分类:

类型例子下一步
Contractschema、字段、路径不符修输入或调用协议
Environment缺依赖、GPU、账号记录 blocker,做本地替代实验
Executiontimeout、crash、竞态收集日志、最小复现
Evidence文件存在但 hash/source/gate 不足补 provenance 或验证
Scientific/Product代码运行但效果不成立保留负结果,修改假设

不要用“多试几次”掩盖类别错误。

本轮研究范围由以下文件共同冻结:

运行:

Terminal window
cd src/content/docs/research/research-refresh-program
PYTHONDONTWRITEBYTECODE=1 \
python3 completion_audit.py --check-worktrees

它检查:

  • 14 个类别;
  • 209 个类别成员关系;
  • 202 张唯一项目卡;
  • 201 个 canonical upstream;
  • 204 个本地副本;
  • 160 个 research/repos clone;
  • 44 个旧 projects/ 正式副本;
  • 每类入口、实验、自测、答案检查和项目来源提及;
  • 14/14 覆盖矩阵;
  • 204/204 正式源码工作树。

这个审计证明“学习包结构和冻结范围闭合”,不证明 201 个上游在所有硬件、账号和 真实业务中都运行成功。每个类别的 E2/E3 边界仍以各自 README 为准。