Knowledge map

技术主题

从推理引擎到 GPU Kernel,从算法原理到生产实践。

LLM推理

37 篇

模型推理引擎、执行路径与线上性能。

多模态 Serving:图片进入 LLM 之前发生了什么 Program-Aware Serving:Agent 等待工具时,GPU 状态该放在哪里 DFlash:Block Diffusion 怎样一次生成一整段 Draft 结构化生成:Grammar 怎样约束每一个 Token 长请求治理:Chunked Prefill 之后,KV Cache 怎样避免被长输出占满 Multi-LoRA Serving:一份 Base Model 怎样服务不同 Adapter RLHF/GRPO 系统数据流:一次训练迭代里四类模型怎样协作 W4A8:4-bit Weight 怎样喂给 8-bit Tensor Core AWQ:为什么 4-bit 权重量化要先观察 Activation SmoothQuant:把 Activation Outlier 迁移到 Weight FP8 推理:E4M3、E5M2、Scale 与 Tensor Core 到底怎样配合 torch.compile:LLM Serving 从 Python Forward 到融合 GPU Kernel CUDA Graph:把动态 LLM Serving 装进可重放的静态执行图 MoE 负载均衡:从 Router 偏置到 Expert 副本与 EPLB 分布式 LLM 推理故障恢复:一条流式请求怎样活下来 LLM 推理容量规划:从请求 Trace 推到 GPU 数量 DSpark:用置信度决定推测解码该验证多远 Mooncake:让 KV Cache 跨 Prefill 与 Decode 流动 DistServe:为什么 Prefill 与 Decode 要分开配置 KV Cache:自回归推理为什么必须保存历史状态 MLA:为什么一份 Latent 可以代替多头 KV Cache EAGLE:为什么推测解码要预测 Feature Chunked Prefill:长 Prompt 为什么要切片执行 Continuous Batching:为什么 Batch 可以动态变化 NVFP4 KV Cache:Blackwell 上的 4-bit 缓存量化 FlashInfer Sorting-Free Sampling:无需显式排序的 GPU 采样 vLLM V1 EngineCore:引擎进程与执行核心的解耦 DeepSeek V3.2 稀疏注意力:Lightning Indexer 与 Top-k 选择 FairBatching:面向 LLM 推理的公平批次形成 异步连续批处理:CPU/GPU 重叠与正确同步 推理模型的推测解码:Thinking Budget 与 EAGLE-3 MoE 推理优化:路由、专家并行与通信 FlashInfer:面向 LLM Serving 的可组合 GPU Kernel 库 SGLang 与 RadixAttention:跨请求复用 KV Cache 推测解码:从拒绝采样到工程实践 PagedAttention 与 vLLM KV Cache 管理 GQA 分组查询注意力:KV Cache 与模型质量的折中

KV Cache

16 篇

自回归状态的存储、复用、迁移与压缩。

推理调度

13 篇

批处理、排队、公平性与运行时执行。

分布式推理

11 篇

多实例、多节点与云原生推理系统。

分离式推理

4 篇

Prefill/Decode 解耦与 KV 数据面。

注意力机制

10 篇

Attention 架构、长上下文与执行优化。

推测解码

8 篇

Draft、验证、接受率与系统协同。

GPU优化

29 篇

Kernel、编译、执行图与硬件利用率。

Triton GEMM:从一个输出 Tile 到地址、边界与数据复用 混合精度训练:从 FP16/BF16 的数值边界到一次正确的参数更新 Roofline:从计算量、数据流量到可信的 GPU 性能判断 Activation Checkpointing:反向传播需要的张量,何时保存、何时重算 NCCL 内部机制:一次 AllReduce 如何变成拓扑图、Channel 与 GPU Kernel GPUDirect RDMA:网卡如何直接访问 GPU Memory DFlash:Block Diffusion 怎样一次生成一整段 Draft 结构化生成:Grammar 怎样约束每一个 Token GPU 互联拓扑:数据怎样从 HBM 走到另一张 GPU 与远端 NIC Zero-Bubble Pipeline Parallel:为什么 Weight Gradient 可以延后计算 Multi-LoRA Serving:一份 Base Model 怎样服务不同 Adapter Collective Communication:AllReduce、AllGather、ReduceScatter 与 All-to-All Sequence Parallel 与 Context Parallel:Token 维到底怎样切 Pipeline Parallel:Micro-batch 怎样流过 Transformer Stages Tensor Parallel:怎样把一个 Transformer Layer 切到多张 GPU W4A8:4-bit Weight 怎样喂给 8-bit Tensor Core AWQ:为什么 4-bit 权重量化要先观察 Activation SmoothQuant:把 Activation Outlier 迁移到 Weight FP8 推理:E4M3、E5M2、Scale 与 Tensor Core 到底怎样配合 torch.compile:LLM Serving 从 Python Forward 到融合 GPU Kernel CUDA Graph:把动态 LLM Serving 装进可重放的静态执行图 FlashAttention-3:用异步流水榨出 Hopper 的 Attention 性能 FlashAttention-2:从 IO-aware 到更好的并行划分 vLLM Model Runner V2:GPU-native 与 async-first 的执行核心 FlashInfer Sorting-Free Sampling:无需显式排序的 GPU 采样 FlashInfer-Bench:AI 生成 GPU Kernel 的评测与上线边界 异步连续批处理:CPU/GPU 重叠与正确同步 FlashInfer:面向 LLM Serving 的可组合 GPU Kernel 库 FlashAttention:IO-aware 的精确注意力

模型量化

6 篇

权重、Activation 与 KV Cache 的低精度路径。

MoE

7 篇

稀疏专家模型的路由、计算与部署。

专家并行

7 篇

Expert ownership、Token Dispatch 与负载均衡。

分布式训练

15 篇

状态分片与层内模型并行。

Kubernetes

4 篇

容器编排、资源调度与故障恢复。

vLLM

5 篇

vLLM 的缓存、调度与执行架构。

SGLang

4 篇

SGLang 的缓存、推测解码与运行时。

FlashInfer

3 篇

Serving GPU primitives、采样与评测。

FlashAttention

3 篇

IO-aware Attention Kernel 的持续演进。

EAGLE

3 篇

Feature-level speculative decoding 及其训练交付。

推荐系统

4 篇

召回、排序、特征与行为序列建模。

机器学习

6 篇

机器学习模型、算法与研究进展。

计算机视觉

2 篇

视觉算法与生成模型。

编程基础

3 篇

语言机制、数据结构与基础知识。

C/C++

2 篇

C/C++ 语言与底层编程。

工程实践

7 篇

工具、环境、工作流与经验记录。