Learning paths

技术系列

发布日期记录写作时间,系列顺序还原技术演进。选择一条路径,从问题的起点连续读到当前实现。

Series 1

Attention 与长上下文

从 IO-aware 精确注意力出发,理解 KV 头共享、跨设备长序列计算与稀疏注意力。

6 篇文章
  1. 01

    FlashAttention:IO-aware 的精确注意力

    从在线 Softmax 到 GPU 分块流水线

  2. 02

    GQA 分组查询注意力:KV Cache 与模型质量的折中

    从多头注意力到缓存、带宽与并行切分

  3. 03

    FlashAttention-2:从 IO-aware 到更好的并行划分

    为什么同一个精确注意力算法,还能通过 Thread Block 与 Warp 重排再快一倍

  4. 04

    Ring Attention:把超长序列沿设备环流动

    从分块 Online Softmax 到 KV 通信与本地 Attention 计算重叠

  5. 05

    FlashAttention-3:用异步流水榨出 Hopper 的 Attention 性能

    从 TMA、WGMMA、Warp Specialization 到更准确的 FP8 Attention

  6. 06

    DeepSeek V3.2 稀疏注意力:Lightning Indexer 与 Top-k 选择

    从 MLA 全量访问到内容相关的细粒度稀疏化

Series 2

KV Cache 与内存系统

沿着缓存的生成、分配、复用、迁移和量化路径,理解 LLM Serving 的状态管理。

6 篇文章
  1. 01

    KV Cache:自回归推理为什么必须保存历史状态

    从重复计算、每 Token 显存到 MHA/GQA/MQA 与缓存生命周期

  2. 02

    PagedAttention 与 vLLM KV Cache 管理

    一条请求的分块、映射、共享与回收

  3. 03

    SGLang 与 RadixAttention:跨请求复用 KV Cache

    从最长前缀匹配到缓存感知调度

  4. 04

    Mooncake:让 KV Cache 跨 Prefill 与 Decode 流动

    从分离式推理、分布式缓存池到缓存感知调度与高速传输

  5. 05

    NIXL 与 KV Connector:把推理引擎和传输后端解耦

    从内存注册、元数据握手到异步 P/D KV Cache 交接

  6. 06

    NVFP4 KV Cache:Blackwell 上的 4-bit 缓存量化

    从 E2M1 与双层缩放到容量、内核和精度验证

Series 3

Serving 引擎与请求调度

从批次形成到 GPU 执行,拆解请求如何进入调度器、缓存管理器和模型运行时。

7 篇文章
  1. 01

    Continuous Batching:为什么 Batch 可以动态变化

    从请求粒度到 Iteration-Level Scheduling,理解生成式推理的批次重组

  2. 02

    Chunked Prefill:长 Prompt 为什么要切片执行

    从 Prefill/Decode 干扰到 Token Budget 与 Stall-Free Scheduling

  3. 03

    vLLM V1 EngineCore:引擎进程与执行核心的解耦

    沿一次请求理解 Client、Scheduler、KV Cache 与 GPU Worker

  4. 04

    异步连续批处理:CPU/GPU 重叠与正确同步

    沿着相邻两个 Engine Step 拆解调度流水线

  5. 05

    FairBatching:面向 LLM 推理的公平批次形成

    从延迟契约、进度余量到 Prefill Admission Budget

  6. 06

    vLLM Model Runner V2:GPU-native 与 async-first 的执行核心

    从稳定状态表到无 CPU 同步的 CUDA Stream

  7. 07

    大模型推理引擎对比:vLLM、SGLang 与 TensorRT-LLM

    从请求路径、工作负载到可复现选型

Series 4

推测解码

从无损接受与校正出发,追踪 EAGLE、量化自推测和动态验证的发展路径。

7 篇文章
  1. 01

    推测解码:从拒绝采样到工程实践

    用并行验证减少大模型的串行解码轮次

  2. 02

    EAGLE:为什么推测解码要预测 Feature

    从 Feature Uncertainty、Advanced Token 到树形草稿与无损验证

  3. 03

    推理模型的推测解码:Thinking Budget 与 EAGLE-3

    把生成工作量与执行效率分开优化

  4. 04

    SpecForge:把 EAGLE3 从训练样本交付到 SGLang

    理解特征对齐、Training-Time Test 与草稿模型的部署契约

  5. 05

    QuantSpec:分层量化 KV Cache 的自推测解码

    用同一份位平面同时服务 INT4 草稿与 INT8 验证

  6. 06

    MoE 与推测解码:计算、通信和接受率的联合优化

    从专家散射看清为什么验证更多 token 可能反而更慢

  7. 07

    DSpark:用置信度决定推测解码该验证多远

    从半自回归草稿、前缀存活概率到 SGLang Ragged Verification

Series 5

MoE 与分布式通信

围绕路由、专家计算、负载均衡与跨设备通信,分析稀疏模型的真实执行成本。

1 篇文章
  1. 01

    MoE 推理优化:路由、专家并行与通信

    沿着一个 token 的跨 GPU 旅程理解性能瓶颈

Series 6

分布式推理与云原生部署

理解 Prefill/Decode 解耦、KV 传输、缓存感知路由和 GPU 集群资源编排。

5 篇文章
  1. 01

    DistServe:为什么 Prefill 与 Decode 要分开配置

    从阶段干扰、每 GPU Goodput 到带宽感知 Placement

  2. 02

    NVIDIA Dynamo:把多套推理引擎组织成一个系统

    从请求路由、KV 状态到 P/D 扩缩容与 Kubernetes 编排

  3. 03

    llm-d:Kubernetes 原生分布式 LLM 推理栈

    沿一条请求理解智能路由、KV Cache 与 Prefill/Decode 解耦

  4. 04

    LLM 推理容量规划:从请求 Trace 推到 GPU 数量

    把 ISL、OSL、KV Cache、P/D Goodput 与扩容提前量放进同一张账

  5. 05

    分布式 LLM 推理故障恢复:一条流式请求怎样活下来

    从健康检测、请求迁移到 KV 状态、优雅下线与过载保护

Series 7

GPU Kernel、编译器与低精度

从执行图和 kernel 组合深入采样、量化与生产性能验证。

3 篇文章
  1. 01

    FlashInfer:面向 LLM Serving 的可组合 GPU Kernel 库

    从动态请求形状到 plan/run、JIT 与后端分派

  2. 02

    FlashInfer Sorting-Free Sampling:无需显式排序的 GPU 采样

    从目标分布到 Dual Pivot Rejection Sampling

  3. 03

    FlashInfer-Bench:AI 生成 GPU Kernel 的评测与上线边界

    从算子契约、真实 Workload 到运行时替换

Series 8

分布式训练与后训练

讨论状态分片、并行策略、checkpoint、训练存储以及强化学习训练流水线。

0 篇文章

这个系列正在准备中。

Series 9

模型服务能力与 Agent Infra

连接 Adapter、多模态编码、结构化生成、工具协议和可恢复的 Agent 工作流。

1 篇文章
  1. 01

    LangGraph + MCP:构建可恢复的 Agent 工作流

    状态机负责执行语义,协议负责外部能力边界