大模型与 Agent 工程学习路线¶
这套文档想解决一个问题:
从“我会调用一个 LLM API”到“我能设计、部署和评测一个 Agent 系统”,中间到底要补哪些知识?
文档按工程视角组织,而不是按论文或工具列表堆放。先建立全局地图,再进入模型、API、训练部署、Agent 产品和系统架构。
一张全局路线图¶
总览
↓
数据、Tokenizer、预训练、后训练
↓
Reasoning Models、Transformer、推理架构
↓
API、RAG、模型路由、工具调用、Workflow、Agent
↓
训练、微调、量化、部署、硬件、参数、LLMOps
↓
Agent Runtime、Loop、Graph、Harness、Guardrails、Evaluation、Skills、MCP
↓
Context Engineering、Multi-Agent、大型 Agent 系统
先按你的目标选路线¶
| 目标 | 推荐入口 | 接下来读 |
|---|---|---|
| 不知道术语属于哪一层 | 核心概念索引 | 大模型与推理优化术语表 |
| 正在读推理优化文章,缩写太多 | 大模型与推理优化术语表 | LLM 推理与架构优化入门 |
| 想建立完整知识地图 | 从 LLM 出生到大型 Agent 系统 | LLM 生命周期 |
| 想理解模型怎么处理文本 | 数据、Tokenizer 与预训练数据工程入门 | Transformer 入门 |
| 想做 LLM 应用 | LLM API:从 HTTP 到 Transformer | LLM 应用架构 |
| 想看懂一次 Chat 请求的内部执行 | OpenAI-compatible Chat API 执行链路 | LLM 推理与架构优化入门 |
| 想做企业知识库或文档问答 | RAG 工程实践 | Agent 效果评测框架 |
| 想控制模型质量、延迟和成本 | 模型选择与路由 | 参数调优手册 |
| 想训练或微调模型 | 模型训练与部署学习路线 | LoRA 与 QLoRA 微调入门 |
| 想本地或线上部署模型 | 本地部署框架对比 | 模型量化与推理压缩入门 |
| 想把 LLM 应用上线运营 | LLM 应用生产化 | 模型选择与路由 |
| 想开发 Agent | Agent 开发入门 | Agent 模式与实现 |
| 想实现 Agent runtime | Agent 项目开发实战 | Harness Engineering |
| 想做可靠 Agent 产品 | Harness Engineering | Loop Engineering、Agent 安全与 Guardrails |
| 想把单 Agent 扩展成可治理的执行图 | Graph Engineering | Multi-Agent 协作、自进化与记忆系统 |
| 想接入外部工具和数据源 | MCP 工具协议 | Agent Skills 实现思路 |
| 想评测 Agent 效果 | Agent 效果评测框架 | 参数调优手册 |
| 想设计平台级系统 | 大型 Agent 系统架构设计 | Multi-Agent 协作、自进化与记忆系统 |
推荐阅读顺序¶
0. 先建立地图¶
这一组回答“这些词彼此是什么关系”。不要一开始就陷进某个框架或参数。
1. 模型原理¶
- 数据、Tokenizer 与预训练数据工程入门
- 后训练与对齐入门:SFT、DPO、RLHF、RFT
- Reasoning Models 与 Test-Time Compute 入门
- Transformer 入门
- LLM 推理与架构优化入门
- Hy3 Preview 推理优化案例:从算子到系统
这一组回答“模型为什么能生成、为什么慢、为什么贵、为什么有上下文长度限制”。
2. 应用与部署¶
- LLM API:从 HTTP 到 Transformer
- OpenAI-compatible Chat API 执行链路
- LLM 应用架构:Chatbot、RAG、工具调用、工作流与 Agent
- RAG 工程实践
- 模型选择与路由
- 模型训练与部署学习路线
- 原生 Python 训练循环入门
- LoRA 与 QLoRA 微调入门
- 本地部署框架对比
- 模型量化与推理压缩入门
- 模型部署硬件选型
- 参数调优手册
- LLM 应用生产化
这一组回答“怎么把模型接进业务、怎么训练一点自己的行为、怎么让它跑起来并调到可用”。
3. Agent 工程¶
- Agent 开发入门
- Agent 项目开发实战:上下文、工具、权限和沙箱
- Agent 模式与实现
- Harness Engineering:把模型变成可用 Agent 的工程
- Loop Engineering:Agent 循环、停止条件与恢复
- Graph Engineering:从单 Agent Loop 到可治理的执行图
- Agent 安全与 Guardrails:权限、注入攻击与运行时边界
- Agent Skills 实现思路
- MCP 工具协议
- Agent 效果评测框架
这一组回答“为什么同一个模型放进不同产品里效果差很多,以及 Agent 什么时候会失控、卡住或越权”。
4. 系统设计¶
这一组回答“模型每一轮应该看到什么,多个 Agent 如何协作,平台如何管理任务、状态、记忆、权限和评测”。
常见阅读路径¶
我只想快速做一个 LLM 应用¶
读:
暂时跳过训练、量化和 Multi-Agent。先把 API、上下文、状态、日志和评测闭环做清楚。
我想做 RAG 或企业知识库¶
读:
重点不是“接一个向量库”,而是数据清洗、chunk、召回、重排、引用、评测和失败归因。
我想微调开源模型¶
读:
先确认问题是不是需要微调。新知识通常优先用 RAG,稳定格式和行为才更适合 SFT / LoRA。
我想本地部署模型¶
读:
先分清本地实验、小型服务和生产服务。能跑起来不等于能稳定服务。
我想做 Codex / Claude Code 这类 Agent 产品¶
读:
- Agent 开发入门
- Agent 项目开发实战
- Harness Engineering
- Loop Engineering
- Graph Engineering
- Agent 安全与 Guardrails
- Agent Skills 实现思路
- MCP 工具协议
- 上下文工程入门
- 什么是上下文工程
- 开源 Agent 提示词目录
核心不是写一个更长的 system prompt,而是设计上下文、工具、权限、状态、恢复、评测和可观测性。
文档维护约定¶
- 首页只维护学习路线,不在这里展开所有概念细节。
- 概念定义优先放在 核心概念索引,专题文档只保留必要解释。
- 每篇专题尽量回答一个主问题,并在末尾给出“下一步”。
- 交叉引用用于承接上下游,不重复复制整段内容。