核心概念索引¶
这篇是查词和分流用的。
如果你在文档里看到一个词,一时不知道它属于哪一层,先来这里定位;如果你已经知道自己要解决的问题,可以直接跳到对应专题。
如果你正在读推理优化文章,遇到大量缩写、kernel、并行、量化和硬件术语,可以直接查 大模型与推理优化术语表。
怎么使用这篇索引¶
建议按三步看:
- 先看“总览”,确认这个概念属于数据、模型、推理、应用、Agent 还是系统层。
- 再查下面的表,读“一句话解释”,建立最小直觉。
- 最后点“继续读”,进入真正展开的专题。
不要把这里当成完整教程。索引只负责快速定位,细节放在专题文档里。
总览¶
数据层:Corpus / Cleaning / Dedup / PII / Tokenizer Training
模型层:Tokenizer / Transformer / Attention / MoE
训练层:Pretraining / SFT / DPO / RFT / LoRA
推理能力层:Reasoning Models / Test-Time Compute / Reasoning Tokens
推理层:KV Cache / Prefix Cache / Batching / Quantization
API 层:HTTP API / Chat Template / Sampling / Streaming / Tool Choice
应用层:Chatbot / RAG / Model Router / Tool Calling / Workflow / LLMOps
Agent 层:Runtime / Loop / Graph / State / Memory / Skill / Evaluator
系统层:Harness / Guardrails / Policy Engine / Sandbox / Orchestrator / Runtime / Trace / MCP / Multi-Agent
分层地图¶
| 层级 | 关心的问题 | 常见产物 | 优先阅读 |
|---|---|---|---|
| 数据层 | 模型从什么文本里学习 | corpus、清洗规则、去重管线、PII 过滤 | 数据、Tokenizer 与预训练数据工程入门 |
| 模型层 | 文本如何进入 Transformer 并生成 token | tokenizer、embedding、attention、logits | Transformer 入门 |
| 训练层 | 如何改变模型参数和行为 | pretraining、SFT、DPO、RFT、LoRA | 后训练与对齐入门 |
| 推理层 | 如何更快、更省地生成 | KV Cache、batching、量化、speculative decoding | LLM 推理与架构优化入门 |
| API 层 | 应用如何调用模型 | HTTP API、messages、tools、streaming、sampling | LLM API:从 HTTP 到 Transformer |
| 应用层 | 如何把模型接进业务流程 | chatbot、RAG、model router、tool calling、workflow | LLM 应用架构 |
| Agent 层 | 如何让模型围绕目标连续行动 | runtime、loop、state、memory、tools、evaluator、MCP | Agent 开发入门 |
| 系统层 | 如何做成可靠平台 | harness、policy engine、sandbox、orchestrator、trace、LLMOps、multi-agent | 大型 Agent 系统架构设计 |
更多推理优化和硬件相关缩写见:大模型与推理优化术语表。
先分清几组边界¶
模型能力 vs 产品能力¶
模型能力来自数据、训练、结构和推理预算;产品能力来自上下文、工具、权限、状态、评测和运行时。
所以同一个模型接进不同产品,效果会很不一样。要理解这个差异,读 Harness Engineering 和 上下文工程入门。
训练 vs 推理 vs 部署¶
训练改变权重,推理使用权重生成结果,部署把推理变成可调用服务。
如果你只是想让模型知道最新知识,通常先考虑 RAG;如果你要改变稳定格式、风格或工具行为,再考虑 SFT / LoRA。相关文档是 模型训练与部署学习路线。
RAG vs 微调 vs 上下文工程¶
RAG 是把外部资料检索进来,微调是改变模型参数,上下文工程是决定模型这一轮看到什么。
三者可以组合,但解决的问题不同:
| 问题 | 优先方案 |
|---|---|
| 需要引用最新或私有资料 | RAG |
| 需要稳定输出格式或任务风格 | SFT / LoRA |
| 需要按任务、权限、状态动态组织输入 | 上下文工程 |
Workflow vs Agent¶
Workflow 的下一步主要由程序决定;Agent 的下一步会让模型参与决策。
生产系统通常先做 workflow,再在需要开放探索、工具选择或复杂恢复的地方引入 Agent。相关文档是 LLM 应用架构 和 Loop Engineering。
模型与训练¶
| 概念 | 一句话解释 | 继续读 |
|---|---|---|
| Tokenizer | 把文本变成 token id | LLM 生命周期 |
| Token | 模型处理文本的最小片段 | Transformer 入门 |
| Corpus | 用于训练或评测的一组文本数据 | 数据、Tokenizer 与预训练数据工程入门 |
| Data Cleaning | 去掉乱码、模板、广告、低质量内容 | 数据、Tokenizer 与预训练数据工程入门 |
| Dedup | 删除重复或近似重复内容 | 数据、Tokenizer 与预训练数据工程入门 |
| PII Removal | 删除或脱敏个人身份信息 | 数据、Tokenizer 与预训练数据工程入门 |
| Data Mixture | 控制网页、代码、书籍、数学等数据比例 | 数据、Tokenizer 与预训练数据工程入门 |
| Tokenizer Training | 在代表性语料上训练 BPE / Unigram / WordPiece 词表 | 数据、Tokenizer 与预训练数据工程入门 |
| Packing | 把 token 序列拼成固定长度训练 block | 数据、Tokenizer 与预训练数据工程入门 |
| Embedding | 把 token id 变成向量 | Transformer 入门 |
| Transformer | 当前 LLM 的主流模型结构 | Transformer 入门 |
| Attention | 让 token 关注上下文中相关 token | Transformer 入门 |
| MHA | 多头注意力 | LLM 推理与架构优化入门 |
| MQA / GQA | 减少 K/V head,降低 KV Cache 成本 | LLM 推理与架构优化入门 |
| MoE | 多专家模型,每 token 激活部分专家 | LLM 推理与架构优化入门 |
| Pretraining | 用大量文本训练基础能力 | LLM 生命周期 |
| SFT | 用指令数据监督微调 | 后训练与对齐入门 |
| DPO / RLHF | 用偏好数据让回答更符合人类偏好 | 后训练与对齐入门 |
| RFT | 面向可验证任务做强化微调 | 后训练与对齐入门 |
| GRPO | 面向可验证任务的强化训练方法之一 | 后训练与对齐入门 |
| Reasoning Model | 推理阶段会投入额外计算来做复杂推理的模型 | Reasoning Models 与 Test-Time Compute 入门 |
| Test-Time Compute | 不改权重,在推理时多花计算换质量 | Reasoning Models 与 Test-Time Compute 入门 |
| Reasoning Effort / Thinking Budget | 控制模型这一轮内部推理预算 | Reasoning Models 与 Test-Time Compute 入门 |
| Reasoning Tokens | 模型用于内部推理、摘要或状态保持的 token | Reasoning Models 与 Test-Time Compute 入门 |
| LoRA | 只训练小型适配器 | LoRA 与 QLoRA 微调入门 |
| QLoRA | 量化底座模型后再做 LoRA | LoRA 与 QLoRA 微调入门 |
推理与部署¶
| 概念 | 一句话解释 | 继续读 |
|---|---|---|
| Prefill | 处理输入 prompt,并为后续生成建立 KV Cache | Chat API 执行链路 |
| Decode | 在单序列内逐 token 生成,并可跨序列组成 batch | Chat API 执行链路 |
| Logits | 模型对下一个 token 的分数 | Transformer 入门 |
| Sampling | 从 logits 中选择下一个 token | LLM API:从 HTTP 到 Transformer |
| KV Cache | 缓存历史 token 的 K/V,避免重复计算 | LLM 推理与架构优化入门 |
| Prefix Cache | 复用多个请求的相同前缀 | LLM 推理与架构优化入门 |
| FlashAttention | 更高效计算 attention | LLM 推理与架构优化入门 |
| PagedAttention | 更高效管理 KV Cache | LLM 推理与架构优化入门 |
| Continuous Batching | 动态合并请求提高吞吐 | LLM 推理与架构优化入门 |
| Operator Fusion | 把多个小算子合并,减少 kernel launch 和 HBM 往返 | Hy3 Preview 推理优化案例 |
| Sparse Attention | 只计算部分关键 attention,降低长上下文 prefill 成本 | Hy3 Preview 推理优化案例 |
| Multi-level KV Cache | 把 KV / Prefix Cache 分层放在 GPU、CPU 和外部存储 | Hy3 Preview 推理优化案例 |
| Max Model Length | 推理服务允许的最大上下文长度 | 参数调优手册 |
| Max Num Seqs | 推理调度中单轮最多处理的序列数 | 参数调优手册 |
| Max Num Batched Tokens | 推理调度中单轮最多处理的 token 数 | 参数调优手册 |
| Speculative Decoding | 小模型先猜,大模型验证 | 模型量化与推理压缩入门 |
| Quantization | 用更低精度保存或计算模型 | 模型量化与推理压缩入门 |
| GGUF | llama.cpp 常用模型格式 | 模型量化与推理压缩入门 |
| AWQ / GPTQ | 常见权重量化方法 | 模型量化与推理压缩入门 |
| Tensor Parallel | 把模型张量切到多张 GPU | 模型部署硬件选型 |
| Sequence Parallel | 沿序列维度切分计算,减少长 prefill 冗余 | Hy3 Preview 推理优化案例 |
| Pipeline Parallel | 把模型层切到多张 GPU | 模型部署硬件选型 |
| Expert Parallel | MoE 专家并行 | 模型部署硬件选型 |
API 与应用¶
| 概念 | 一句话解释 | 继续读 |
|---|---|---|
| HTTP API | 应用调用模型的网络接口 | LLM API:从 HTTP 到 Transformer |
| Responses API | 面向新式多模态和工具使用的响应接口 | LLM API:从 HTTP 到 Transformer |
| Chat Completions | 经典 messages 风格聊天接口 | Chat API 执行链路 |
| OpenAI-compatible | 接口形状尽量兼容 OpenAI,但底层实现可以不同 | Chat API 执行链路 |
| Chat Template | 把 messages、tools 和角色标记渲染成模型训练格式 | Chat API 执行链路 |
| Streaming / SSE | 模型生成时由返回层持续发送增量 | Chat API 执行链路 |
| Temperature | 控制采样随机性 | 参数调优手册 |
| Top-p | 控制候选 token 范围 | 参数调优手册 |
| Max Output Tokens | 控制最多生成多少 token | 参数调优手册 |
| Stop | 指定生成停止序列 | 参数调优手册 |
| Tool Choice | 控制模型是否以及如何调用工具 | 参数调优手册 |
| Structured Output | 用 schema 约束模型输出结构 | 参数调优手册 |
| RAG | 检索资料后再生成回答 | RAG 工程实践 |
| Embedding | 用向量表示文本语义 | RAG 工程实践 |
| Reranker | 对检索结果重排 | RAG 工程实践 |
| Model Router | 按任务、成本、延迟和风险选择模型 | 模型选择与路由 |
| Model Gateway | 统一模型供应商、模型别名、重试、fallback 和成本统计 | LLM 应用生产化 |
| LLMOps | LLM 应用的评测、发布、监控、成本和回滚体系 | LLM 应用生产化 |
| Tool Calling | 模型请求应用执行工具 | LLM 应用架构 |
| Workflow | 程序定义的确定性流程 | LLM 应用架构 |
Agent 与上下文¶
| 概念 | 一句话解释 | 继续读 |
|---|---|---|
| Agent | 围绕目标循环调用模型和工具的系统 | Agent 开发入门 |
| Agent Runtime | 管理上下文、工具、权限、沙箱、Skills 和 trace 的运行时 | Agent 项目开发实战 |
| Agent Loop | 思考、行动、观察、更新、继续或停止 | Loop Engineering |
| Graph Engineering | 用节点、边、状态和策略组织多个执行单元 | Graph Engineering |
| Graph Node | 一步可独立执行和观测的模型、Agent、函数、工具或人工任务 | Graph Engineering |
| Graph Edge | 根据当前状态决定下一个节点的固定或条件连接 | Graph Engineering |
| Checkpoint | 保存某次任务的图状态,以便中断后恢复 | Graph Engineering |
| Context Trimming | 在预算不足时裁剪低价值上下文 | Agent 项目开发实战 |
| Context Compression | 把长历史压缩成可恢复摘要 | Agent 项目开发实战 |
| Max Steps | 限制 Agent 最多行动轮数 | 参数调优手册 |
| Max Tool Calls | 限制 Agent 最多工具调用次数 | 参数调优手册 |
| State | 当前任务现场 | Agent 开发入门 |
| Memory | 跨任务保留的偏好、规则、经验 | Multi-Agent 协作、自进化与记忆系统 |
| Skill | 可发现、可按需加载、可复用的能力包 | Agent Skills 实现思路 |
| readFile / writeFile / editFile | Agent 读写和局部编辑文件的默认工具 | Agent 项目开发实战 |
| Bash / glob / grep | Agent 执行命令、找文件和搜索文本的默认工具 | Agent 项目开发实战 |
| MCP | Agent 连接外部工具、数据和资源的协议 | MCP 工具协议 |
| Context Engineering | 设计模型此刻应该看到什么 | 上下文工程入门 |
| Dynamic Prompt | 运行时根据状态注入的提示 | 什么是上下文工程 |
| Harness Engineering | 把模型包成可靠 Agent 产品的工程 | Harness Engineering |
| Guardrails | 输入、上下文、工具、运行时、输出和记忆的安全检查 | Agent 安全与 Guardrails |
| Prompt Injection | 不可信内容试图覆盖系统或用户意图 | Agent 安全与 Guardrails |
| Policy Engine | 对工具调用做权限、风险、预算和审批判断 | Agent 安全与 Guardrails |
| Sandbox | 在执行层限制文件、网络、命令和资源 | Agent 项目开发实战 |
| Human Approval | 高风险动作执行前让用户结构化确认 | Agent 安全与 Guardrails |
| Loop Engineering | Agent 循环、停止、恢复和预算控制 | Loop Engineering |
| Evaluator | 判断结果或过程是否合格 | Agent 效果评测框架 |
| Trace | Agent 执行过程记录 | Agent 效果评测框架 |
Multi-Agent 与大型系统¶
| 概念 | 一句话解释 | 继续读 |
|---|---|---|
| Router | 把请求分给合适 Agent 或流程 | Agent 模式与实现 |
| Handoff | 一个 Agent 把任务转交给另一个 Agent | Agent 模式与实现 |
| Supervisor | 管理多个 Worker Agent | Multi-Agent 协作、自进化与记忆系统 |
| Worker Agent | 执行特定任务的专家 Agent | Multi-Agent 协作、自进化与记忆系统 |
| Blackboard | 多 Agent 共享工作区 | Multi-Agent 协作、自进化与记忆系统 |
| A2A | Agent 和 Agent 之间通信协作 | Multi-Agent 协作、自进化与记忆系统 |
| Orchestrator | 调度任务、Agent、工具和状态机 | 大型 Agent 系统架构设计 |
| Tool Runtime | 执行工具并做权限和沙箱控制 | 大型 Agent 系统架构设计 |
| Memory Service | 平台化管理长期记忆 | 大型 Agent 系统架构设计 |
| Evolution Pipeline | 从 trace 到 eval 到灰度发布的改进流水线 | 大型 Agent 系统架构设计 |
常见混淆¶
| 容易混的词 | 区别 |
|---|---|
| Prompt Engineering vs Context Engineering | 前者偏写提示词,后者偏组织模型看到的完整信息 |
| RAG vs Fine-tuning | RAG 给模型外部资料,微调改变模型行为或参数 |
| Tool Calling vs Agent | 工具调用是一种动作能力,Agent 是带 loop 和状态的系统 |
| Workflow vs Agent | Workflow 控制流由程序定义,Agent 让模型参与下一步决策 |
| Loop vs Graph | Loop 控制一个执行单元如何持续行动,Graph 控制多个执行单元如何流转、隔离和恢复 |
| Graph vs Multi-Agent | Graph 强调控制结构,Multi-Agent 强调执行角色数量;Graph 的节点不一定是 Agent |
| Memory vs KV Cache | Memory 是产品保存的长期信息,KV Cache 是推理计算缓存 |
| MCP vs A2A | MCP 连接工具和数据,A2A 连接 Agent 和 Agent |
| MCP vs Tool Calling | Tool Calling 是模型请求动作的格式,MCP 是应用连接外部工具和数据源的协议 |
| Harness vs Loop | Harness 是 Agent 运行壳,Loop 是其中的行动循环 |
按问题查¶
| 你现在的问题 | 先读 |
|---|---|
| “为什么模型输出这么慢?” | LLM 推理与架构优化入门 |
| “一次 Chat API 请求在服务端怎么执行?” | OpenAI-compatible Chat API 执行链路 |
| “temperature、top_p、max_tokens 怎么调?” | 参数调优手册 |
| “我应该 RAG 还是微调?” | 模型训练与部署学习路线 |
| “RAG 为什么答不准?” | RAG 工程实践 |
| “不同模型应该怎么选?” | 模型选择与路由 |
| “LoRA、QLoRA 到底在训练什么?” | LoRA 与 QLoRA 微调入门 |
| “本地跑模型选 llama.cpp、vLLM 还是 SGLang?” | 本地部署框架对比 |
| “LLM 应用上线要补什么?” | LLM 应用生产化 |
| “Agent 为什么会停不下来?” | Loop Engineering |
| “什么时候应该从单 Agent Loop 升级到 Graph?” | Graph Engineering |
| “Agent runtime 怎么实现?” | Agent 项目开发实战 |
| “上下文裁剪和压缩怎么做?” | Agent 项目开发实战 |
| “Agent 默认工具怎么设计?” | Agent 项目开发实战 |
| “权限和沙箱怎么落地?” | Agent 项目开发实战 |
| “工具调用和 Agent 有什么区别?” | LLM 应用架构 |
| “MCP 和工具调用有什么区别?” | MCP 工具协议 |
| “怎么评测 Agent 不是只看最终回答?” | Agent 效果评测框架 |
| “prompt 注入怎么防?” | Agent 安全与 Guardrails |
| “上下文工程到底和 prompt 工程差在哪?” | 什么是上下文工程 |
下一步¶
回到主线: