Learning paths
技术系列
发布日期记录写作时间,系列顺序还原技术演进。选择一条路径,从问题的起点连续读到当前实现。
Series 1
Attention 与长上下文
从 IO-aware 精确注意力出发,理解 KV 头共享、跨设备长序列计算与稀疏注意力。
-
01→
FlashAttention:IO-aware 的精确注意力
从在线 Softmax 到 GPU 分块流水线
-
02→
GQA 分组查询注意力:KV Cache 与模型质量的折中
从多头注意力到缓存、带宽与并行切分
-
03→
FlashAttention-2:从 IO-aware 到更好的并行划分
为什么同一个精确注意力算法,还能通过 Thread Block 与 Warp 重排再快一倍
-
04→
Ring Attention:把超长序列沿设备环流动
从分块 Online Softmax 到 KV 通信与本地 Attention 计算重叠
-
05→
FlashAttention-3:用异步流水榨出 Hopper 的 Attention 性能
从 TMA、WGMMA、Warp Specialization 到更准确的 FP8 Attention
-
06→
DeepSeek V3.2 稀疏注意力:Lightning Indexer 与 Top-k 选择
从 MLA 全量访问到内容相关的细粒度稀疏化
Series 2
KV Cache 与内存系统
沿着缓存的生成、分配、复用、迁移和量化路径,理解 LLM Serving 的状态管理。
-
01→
KV Cache:自回归推理为什么必须保存历史状态
从重复计算、每 Token 显存到 MHA/GQA/MQA 与缓存生命周期
-
02→
PagedAttention 与 vLLM KV Cache 管理
一条请求的分块、映射、共享与回收
-
03→
SGLang 与 RadixAttention:跨请求复用 KV Cache
从最长前缀匹配到缓存感知调度
-
04→
Mooncake:让 KV Cache 跨 Prefill 与 Decode 流动
从分离式推理、分布式缓存池到缓存感知调度与高速传输
-
05→
NIXL 与 KV Connector:把推理引擎和传输后端解耦
从内存注册、元数据握手到异步 P/D KV Cache 交接
-
06→
NVFP4 KV Cache:Blackwell 上的 4-bit 缓存量化
从 E2M1 与双层缩放到容量、内核和精度验证
Series 3
Serving 引擎与请求调度
从批次形成到 GPU 执行,拆解请求如何进入调度器、缓存管理器和模型运行时。
-
01→
Continuous Batching:为什么 Batch 可以动态变化
从请求粒度到 Iteration-Level Scheduling,理解生成式推理的批次重组
-
02→
Chunked Prefill:长 Prompt 为什么要切片执行
从 Prefill/Decode 干扰到 Token Budget 与 Stall-Free Scheduling
-
03→
vLLM V1 EngineCore:引擎进程与执行核心的解耦
沿一次请求理解 Client、Scheduler、KV Cache 与 GPU Worker
-
04→
异步连续批处理:CPU/GPU 重叠与正确同步
沿着相邻两个 Engine Step 拆解调度流水线
-
05→
FairBatching:面向 LLM 推理的公平批次形成
从延迟契约、进度余量到 Prefill Admission Budget
-
06→
vLLM Model Runner V2:GPU-native 与 async-first 的执行核心
从稳定状态表到无 CPU 同步的 CUDA Stream
-
07→
大模型推理引擎对比:vLLM、SGLang 与 TensorRT-LLM
从请求路径、工作负载到可复现选型
Series 4
推测解码
从无损接受与校正出发,追踪 EAGLE、量化自推测和动态验证的发展路径。
-
01→
推测解码:从拒绝采样到工程实践
用并行验证减少大模型的串行解码轮次
-
02→
EAGLE:为什么推测解码要预测 Feature
从 Feature Uncertainty、Advanced Token 到树形草稿与无损验证
-
03→
推理模型的推测解码:Thinking Budget 与 EAGLE-3
把生成工作量与执行效率分开优化
-
04→
SpecForge:把 EAGLE3 从训练样本交付到 SGLang
理解特征对齐、Training-Time Test 与草稿模型的部署契约
-
05→
QuantSpec:分层量化 KV Cache 的自推测解码
用同一份位平面同时服务 INT4 草稿与 INT8 验证
-
06→
MoE 与推测解码:计算、通信和接受率的联合优化
从专家散射看清为什么验证更多 token 可能反而更慢
-
07→
DSpark:用置信度决定推测解码该验证多远
从半自回归草稿、前缀存活概率到 SGLang Ragged Verification
Series 5
MoE 与分布式通信
围绕路由、专家计算、负载均衡与跨设备通信,分析稀疏模型的真实执行成本。
Series 6
分布式推理与云原生部署
理解 Prefill/Decode 解耦、KV 传输、缓存感知路由和 GPU 集群资源编排。
-
01→
DistServe:为什么 Prefill 与 Decode 要分开配置
从阶段干扰、每 GPU Goodput 到带宽感知 Placement
-
02→
NVIDIA Dynamo:把多套推理引擎组织成一个系统
从请求路由、KV 状态到 P/D 扩缩容与 Kubernetes 编排
-
03→
llm-d:Kubernetes 原生分布式 LLM 推理栈
沿一条请求理解智能路由、KV Cache 与 Prefill/Decode 解耦
-
04→
LLM 推理容量规划:从请求 Trace 推到 GPU 数量
把 ISL、OSL、KV Cache、P/D Goodput 与扩容提前量放进同一张账
-
05→
分布式 LLM 推理故障恢复:一条流式请求怎样活下来
从健康检测、请求迁移到 KV 状态、优雅下线与过载保护
Series 7
GPU Kernel、编译器与低精度
从执行图和 kernel 组合深入采样、量化与生产性能验证。
Series 8
分布式训练与后训练
讨论状态分片、并行策略、checkpoint、训练存储以及强化学习训练流水线。
这个系列正在准备中。
Series 9
模型服务能力与 Agent Infra
连接 Adapter、多模态编码、结构化生成、工具协议和可恢复的 Agent 工作流。