跳转至

决策记录

这里记录文档库的结构性决定,方便之后回看为什么这样组织。

2026-06-20

  • 使用 MkDocs 记录学习过程中的重要内容。
  • 保持文档内容干净,不预设具体主题方向。

2026-06-23

  • README 只保留项目说明、本地运行和维护原则,不再重复维护完整学习路线。
  • 站点首页作为唯一的主路线入口,负责按目标、阶段和常见问题分流。
  • MkDocs 导航按学习阶段分组:总览、模型原理、应用与部署、Agent 工程、系统设计。
  • 核心概念索引用于查词和分流,专题文档负责展开细节,避免每篇都重复解释同一组概念。
  • 专题文档保持“一个主问题”原则:先说适用场景,再讲核心概念、工程判断、常见误区和下一步。

2026-06-23 菜单标题整理

  • 左侧菜单使用短标题,正文页面保留完整标题。
  • 分组名称加序号,帮助读者按学习阶段从上到下阅读。
  • 菜单条目避免冒号、长副标题和重复的“入门 / 实现思路 / 学习路线”等后缀。
  • 英文术语只在必要时保留,例如 Agent、Harness、Loop、Prompt、Multi-Agent。

2026-06-23 第一批缺口补齐

  • 新增 RAG 工程实践,把分散在应用架构、参数调优和评测里的 RAG 内容收束成独立专题。
  • 新增 模型选择与路由,补上多模型选择、fallback、成本和延迟权衡。
  • 新增 LLM 应用生产化,补上上线后的网关、trace、eval、灰度、回滚和成本控制。
  • 新增 MCP 工具协议,补上 Agent 外部工具和数据源连接协议的独立说明。

2026-06-23 Agent Runtime 专题

  • 新增 Agent 项目开发实战,集中说明上下文裁剪、上下文压缩、Skills 接入、默认文件和命令工具、权限控制系统和沙箱系统。
  • 该专题放在 Agent 入门之后,作为从概念理解进入 runtime 实现的桥接文档。

2026-06-26 推理优化案例

  • 新增 Hy3 Preview 推理优化案例:从算子到系统,把腾讯混元 Hy3 Preview 推理优化文章整理成生产级推理系统案例。
  • 该专题放在“模型原理 / 推理架构”之后,承接 KV Cache、MoE、量化、并行和硬件选型等基础概念,强调长上下文模型在真实 SLO 下需要算子、通信、缓存、调度和压缩协同优化。

2026-06-26 推理术语表

  • 新增 大模型与推理优化术语表,长期维护大模型、推理优化、硬件 kernel、并行通信、缓存调度、量化稀疏和线上指标相关术语。
  • 该文档放在“总览”分组,和核心概念索引分工:概念索引用于分流,术语表用于解释专业缩写和工程含义。

2026-07-16 Chat API 执行链专题

  • 新增 OpenAI-compatible Chat API 执行链路,用单次本地请求串起 HTTP JSON、Chat Template、Tokenizer、Scheduler、Prefill、Decode、工具调用和 JSON / SSE 返回。
  • 现有 API 入门继续负责公开接口和参数的整体认知;新专题聚焦兼容服务内部可观察、可复现的执行过程,避免把 nano-vllm 等开源实现误写成 OpenAI 托管服务的内部实现。
  • 专题基于用户提供的博客文章重新组织,并使用 OpenAI、Transformers、vLLM 与 nano-vllm 的一手资料校正模型模板、批处理和 API / Engine 边界。

2026-07-29 Graph Engineering 专题

  • 新增 Graph Engineering:从单 Agent Loop 到可治理的执行图,集中回答什么时候应该从单 Agent Loop 升级为 Graph,以及节点、边、状态、策略、检查点和恢复如何落地。
  • 该专题放在 Loop 之后,作为单 Agent 运行控制与 Multi-Agent 系统设计之间的桥梁;现有 Agent 模式文档继续负责模式总览,避免重复展开。
  • 专题根据用户提供的微信公众号文章重新组织,并用 Anthropic、LangGraph 和 Google ADK 官方资料核对 workflow pattern、多 Agent 成本、状态持久化和工作流边界。