跳转至

核心概念索引

这篇是查词和分流用的。

如果你在文档里看到一个词,一时不知道它属于哪一层,先来这里定位;如果你已经知道自己要解决的问题,可以直接跳到对应专题。

如果你正在读推理优化文章,遇到大量缩写、kernel、并行、量化和硬件术语,可以直接查 大模型与推理优化术语表

怎么使用这篇索引

建议按三步看:

  1. 先看“总览”,确认这个概念属于数据、模型、推理、应用、Agent 还是系统层。
  2. 再查下面的表,读“一句话解释”,建立最小直觉。
  3. 最后点“继续读”,进入真正展开的专题。

不要把这里当成完整教程。索引只负责快速定位,细节放在专题文档里。

总览

数据层:Corpus / Cleaning / Dedup / PII / Tokenizer Training
模型层:Tokenizer / Transformer / Attention / MoE
训练层:Pretraining / SFT / DPO / RFT / LoRA
推理能力层:Reasoning Models / Test-Time Compute / Reasoning Tokens
推理层:KV Cache / Prefix Cache / Batching / Quantization
API 层:HTTP API / Chat Template / Sampling / Streaming / Tool Choice
应用层:Chatbot / RAG / Model Router / Tool Calling / Workflow / LLMOps
Agent 层:Runtime / Loop / Graph / State / Memory / Skill / Evaluator
系统层:Harness / Guardrails / Policy Engine / Sandbox / Orchestrator / Runtime / Trace / MCP / Multi-Agent

分层地图

层级 关心的问题 常见产物 优先阅读
数据层 模型从什么文本里学习 corpus、清洗规则、去重管线、PII 过滤 数据、Tokenizer 与预训练数据工程入门
模型层 文本如何进入 Transformer 并生成 token tokenizer、embedding、attention、logits Transformer 入门
训练层 如何改变模型参数和行为 pretraining、SFT、DPO、RFT、LoRA 后训练与对齐入门
推理层 如何更快、更省地生成 KV Cache、batching、量化、speculative decoding LLM 推理与架构优化入门
API 层 应用如何调用模型 HTTP API、messages、tools、streaming、sampling LLM API:从 HTTP 到 Transformer
应用层 如何把模型接进业务流程 chatbot、RAG、model router、tool calling、workflow LLM 应用架构
Agent 层 如何让模型围绕目标连续行动 runtime、loop、state、memory、tools、evaluator、MCP Agent 开发入门
系统层 如何做成可靠平台 harness、policy engine、sandbox、orchestrator、trace、LLMOps、multi-agent 大型 Agent 系统架构设计

更多推理优化和硬件相关缩写见:大模型与推理优化术语表

先分清几组边界

模型能力 vs 产品能力

模型能力来自数据、训练、结构和推理预算;产品能力来自上下文、工具、权限、状态、评测和运行时。

所以同一个模型接进不同产品,效果会很不一样。要理解这个差异,读 Harness Engineering上下文工程入门

训练 vs 推理 vs 部署

训练改变权重,推理使用权重生成结果,部署把推理变成可调用服务。

如果你只是想让模型知道最新知识,通常先考虑 RAG;如果你要改变稳定格式、风格或工具行为,再考虑 SFT / LoRA。相关文档是 模型训练与部署学习路线

RAG vs 微调 vs 上下文工程

RAG 是把外部资料检索进来,微调是改变模型参数,上下文工程是决定模型这一轮看到什么。

三者可以组合,但解决的问题不同:

问题 优先方案
需要引用最新或私有资料 RAG
需要稳定输出格式或任务风格 SFT / LoRA
需要按任务、权限、状态动态组织输入 上下文工程

Workflow vs Agent

Workflow 的下一步主要由程序决定;Agent 的下一步会让模型参与决策。

生产系统通常先做 workflow,再在需要开放探索、工具选择或复杂恢复的地方引入 Agent。相关文档是 LLM 应用架构Loop Engineering

模型与训练

概念 一句话解释 继续读
Tokenizer 把文本变成 token id LLM 生命周期
Token 模型处理文本的最小片段 Transformer 入门
Corpus 用于训练或评测的一组文本数据 数据、Tokenizer 与预训练数据工程入门
Data Cleaning 去掉乱码、模板、广告、低质量内容 数据、Tokenizer 与预训练数据工程入门
Dedup 删除重复或近似重复内容 数据、Tokenizer 与预训练数据工程入门
PII Removal 删除或脱敏个人身份信息 数据、Tokenizer 与预训练数据工程入门
Data Mixture 控制网页、代码、书籍、数学等数据比例 数据、Tokenizer 与预训练数据工程入门
Tokenizer Training 在代表性语料上训练 BPE / Unigram / WordPiece 词表 数据、Tokenizer 与预训练数据工程入门
Packing 把 token 序列拼成固定长度训练 block 数据、Tokenizer 与预训练数据工程入门
Embedding 把 token id 变成向量 Transformer 入门
Transformer 当前 LLM 的主流模型结构 Transformer 入门
Attention 让 token 关注上下文中相关 token Transformer 入门
MHA 多头注意力 LLM 推理与架构优化入门
MQA / GQA 减少 K/V head,降低 KV Cache 成本 LLM 推理与架构优化入门
MoE 多专家模型,每 token 激活部分专家 LLM 推理与架构优化入门
Pretraining 用大量文本训练基础能力 LLM 生命周期
SFT 用指令数据监督微调 后训练与对齐入门
DPO / RLHF 用偏好数据让回答更符合人类偏好 后训练与对齐入门
RFT 面向可验证任务做强化微调 后训练与对齐入门
GRPO 面向可验证任务的强化训练方法之一 后训练与对齐入门
Reasoning Model 推理阶段会投入额外计算来做复杂推理的模型 Reasoning Models 与 Test-Time Compute 入门
Test-Time Compute 不改权重,在推理时多花计算换质量 Reasoning Models 与 Test-Time Compute 入门
Reasoning Effort / Thinking Budget 控制模型这一轮内部推理预算 Reasoning Models 与 Test-Time Compute 入门
Reasoning Tokens 模型用于内部推理、摘要或状态保持的 token Reasoning Models 与 Test-Time Compute 入门
LoRA 只训练小型适配器 LoRA 与 QLoRA 微调入门
QLoRA 量化底座模型后再做 LoRA LoRA 与 QLoRA 微调入门

推理与部署

概念 一句话解释 继续读
Prefill 处理输入 prompt,并为后续生成建立 KV Cache Chat API 执行链路
Decode 在单序列内逐 token 生成,并可跨序列组成 batch Chat API 执行链路
Logits 模型对下一个 token 的分数 Transformer 入门
Sampling 从 logits 中选择下一个 token LLM API:从 HTTP 到 Transformer
KV Cache 缓存历史 token 的 K/V,避免重复计算 LLM 推理与架构优化入门
Prefix Cache 复用多个请求的相同前缀 LLM 推理与架构优化入门
FlashAttention 更高效计算 attention LLM 推理与架构优化入门
PagedAttention 更高效管理 KV Cache LLM 推理与架构优化入门
Continuous Batching 动态合并请求提高吞吐 LLM 推理与架构优化入门
Operator Fusion 把多个小算子合并,减少 kernel launch 和 HBM 往返 Hy3 Preview 推理优化案例
Sparse Attention 只计算部分关键 attention,降低长上下文 prefill 成本 Hy3 Preview 推理优化案例
Multi-level KV Cache 把 KV / Prefix Cache 分层放在 GPU、CPU 和外部存储 Hy3 Preview 推理优化案例
Max Model Length 推理服务允许的最大上下文长度 参数调优手册
Max Num Seqs 推理调度中单轮最多处理的序列数 参数调优手册
Max Num Batched Tokens 推理调度中单轮最多处理的 token 数 参数调优手册
Speculative Decoding 小模型先猜,大模型验证 模型量化与推理压缩入门
Quantization 用更低精度保存或计算模型 模型量化与推理压缩入门
GGUF llama.cpp 常用模型格式 模型量化与推理压缩入门
AWQ / GPTQ 常见权重量化方法 模型量化与推理压缩入门
Tensor Parallel 把模型张量切到多张 GPU 模型部署硬件选型
Sequence Parallel 沿序列维度切分计算,减少长 prefill 冗余 Hy3 Preview 推理优化案例
Pipeline Parallel 把模型层切到多张 GPU 模型部署硬件选型
Expert Parallel MoE 专家并行 模型部署硬件选型

API 与应用

概念 一句话解释 继续读
HTTP API 应用调用模型的网络接口 LLM API:从 HTTP 到 Transformer
Responses API 面向新式多模态和工具使用的响应接口 LLM API:从 HTTP 到 Transformer
Chat Completions 经典 messages 风格聊天接口 Chat API 执行链路
OpenAI-compatible 接口形状尽量兼容 OpenAI,但底层实现可以不同 Chat API 执行链路
Chat Template 把 messages、tools 和角色标记渲染成模型训练格式 Chat API 执行链路
Streaming / SSE 模型生成时由返回层持续发送增量 Chat API 执行链路
Temperature 控制采样随机性 参数调优手册
Top-p 控制候选 token 范围 参数调优手册
Max Output Tokens 控制最多生成多少 token 参数调优手册
Stop 指定生成停止序列 参数调优手册
Tool Choice 控制模型是否以及如何调用工具 参数调优手册
Structured Output 用 schema 约束模型输出结构 参数调优手册
RAG 检索资料后再生成回答 RAG 工程实践
Embedding 用向量表示文本语义 RAG 工程实践
Reranker 对检索结果重排 RAG 工程实践
Model Router 按任务、成本、延迟和风险选择模型 模型选择与路由
Model Gateway 统一模型供应商、模型别名、重试、fallback 和成本统计 LLM 应用生产化
LLMOps LLM 应用的评测、发布、监控、成本和回滚体系 LLM 应用生产化
Tool Calling 模型请求应用执行工具 LLM 应用架构
Workflow 程序定义的确定性流程 LLM 应用架构

Agent 与上下文

概念 一句话解释 继续读
Agent 围绕目标循环调用模型和工具的系统 Agent 开发入门
Agent Runtime 管理上下文、工具、权限、沙箱、Skills 和 trace 的运行时 Agent 项目开发实战
Agent Loop 思考、行动、观察、更新、继续或停止 Loop Engineering
Graph Engineering 用节点、边、状态和策略组织多个执行单元 Graph Engineering
Graph Node 一步可独立执行和观测的模型、Agent、函数、工具或人工任务 Graph Engineering
Graph Edge 根据当前状态决定下一个节点的固定或条件连接 Graph Engineering
Checkpoint 保存某次任务的图状态,以便中断后恢复 Graph Engineering
Context Trimming 在预算不足时裁剪低价值上下文 Agent 项目开发实战
Context Compression 把长历史压缩成可恢复摘要 Agent 项目开发实战
Max Steps 限制 Agent 最多行动轮数 参数调优手册
Max Tool Calls 限制 Agent 最多工具调用次数 参数调优手册
State 当前任务现场 Agent 开发入门
Memory 跨任务保留的偏好、规则、经验 Multi-Agent 协作、自进化与记忆系统
Skill 可发现、可按需加载、可复用的能力包 Agent Skills 实现思路
readFile / writeFile / editFile Agent 读写和局部编辑文件的默认工具 Agent 项目开发实战
Bash / glob / grep Agent 执行命令、找文件和搜索文本的默认工具 Agent 项目开发实战
MCP Agent 连接外部工具、数据和资源的协议 MCP 工具协议
Context Engineering 设计模型此刻应该看到什么 上下文工程入门
Dynamic Prompt 运行时根据状态注入的提示 什么是上下文工程
Harness Engineering 把模型包成可靠 Agent 产品的工程 Harness Engineering
Guardrails 输入、上下文、工具、运行时、输出和记忆的安全检查 Agent 安全与 Guardrails
Prompt Injection 不可信内容试图覆盖系统或用户意图 Agent 安全与 Guardrails
Policy Engine 对工具调用做权限、风险、预算和审批判断 Agent 安全与 Guardrails
Sandbox 在执行层限制文件、网络、命令和资源 Agent 项目开发实战
Human Approval 高风险动作执行前让用户结构化确认 Agent 安全与 Guardrails
Loop Engineering Agent 循环、停止、恢复和预算控制 Loop Engineering
Evaluator 判断结果或过程是否合格 Agent 效果评测框架
Trace Agent 执行过程记录 Agent 效果评测框架

Multi-Agent 与大型系统

概念 一句话解释 继续读
Router 把请求分给合适 Agent 或流程 Agent 模式与实现
Handoff 一个 Agent 把任务转交给另一个 Agent Agent 模式与实现
Supervisor 管理多个 Worker Agent Multi-Agent 协作、自进化与记忆系统
Worker Agent 执行特定任务的专家 Agent Multi-Agent 协作、自进化与记忆系统
Blackboard 多 Agent 共享工作区 Multi-Agent 协作、自进化与记忆系统
A2A Agent 和 Agent 之间通信协作 Multi-Agent 协作、自进化与记忆系统
Orchestrator 调度任务、Agent、工具和状态机 大型 Agent 系统架构设计
Tool Runtime 执行工具并做权限和沙箱控制 大型 Agent 系统架构设计
Memory Service 平台化管理长期记忆 大型 Agent 系统架构设计
Evolution Pipeline 从 trace 到 eval 到灰度发布的改进流水线 大型 Agent 系统架构设计

常见混淆

容易混的词 区别
Prompt Engineering vs Context Engineering 前者偏写提示词,后者偏组织模型看到的完整信息
RAG vs Fine-tuning RAG 给模型外部资料,微调改变模型行为或参数
Tool Calling vs Agent 工具调用是一种动作能力,Agent 是带 loop 和状态的系统
Workflow vs Agent Workflow 控制流由程序定义,Agent 让模型参与下一步决策
Loop vs Graph Loop 控制一个执行单元如何持续行动,Graph 控制多个执行单元如何流转、隔离和恢复
Graph vs Multi-Agent Graph 强调控制结构,Multi-Agent 强调执行角色数量;Graph 的节点不一定是 Agent
Memory vs KV Cache Memory 是产品保存的长期信息,KV Cache 是推理计算缓存
MCP vs A2A MCP 连接工具和数据,A2A 连接 Agent 和 Agent
MCP vs Tool Calling Tool Calling 是模型请求动作的格式,MCP 是应用连接外部工具和数据源的协议
Harness vs Loop Harness 是 Agent 运行壳,Loop 是其中的行动循环

按问题查

你现在的问题 先读
“为什么模型输出这么慢?” LLM 推理与架构优化入门
“一次 Chat API 请求在服务端怎么执行?” OpenAI-compatible Chat API 执行链路
“temperature、top_p、max_tokens 怎么调?” 参数调优手册
“我应该 RAG 还是微调?” 模型训练与部署学习路线
“RAG 为什么答不准?” RAG 工程实践
“不同模型应该怎么选?” 模型选择与路由
“LoRA、QLoRA 到底在训练什么?” LoRA 与 QLoRA 微调入门
“本地跑模型选 llama.cpp、vLLM 还是 SGLang?” 本地部署框架对比
“LLM 应用上线要补什么?” LLM 应用生产化
“Agent 为什么会停不下来?” Loop Engineering
“什么时候应该从单 Agent Loop 升级到 Graph?” Graph Engineering
“Agent runtime 怎么实现?” Agent 项目开发实战
“上下文裁剪和压缩怎么做?” Agent 项目开发实战
“Agent 默认工具怎么设计?” Agent 项目开发实战
“权限和沙箱怎么落地?” Agent 项目开发实战
“工具调用和 Agent 有什么区别?” LLM 应用架构
“MCP 和工具调用有什么区别?” MCP 工具协议
“怎么评测 Agent 不是只看最终回答?” Agent 效果评测框架
“prompt 注入怎么防?” Agent 安全与 Guardrails
“上下文工程到底和 prompt 工程差在哪?” 什么是上下文工程

下一步

回到主线: