Knowledge map

技术主题

从推理引擎到 GPU Kernel,从算法原理到生产实践。

LLM推理

30 篇

模型推理引擎、执行路径与线上性能。

W4A8:4-bit Weight 怎样喂给 8-bit Tensor Core AWQ:为什么 4-bit 权重量化要先观察 Activation SmoothQuant:把 Activation Outlier 迁移到 Weight FP8 推理:E4M3、E5M2、Scale 与 Tensor Core 到底怎样配合 torch.compile:LLM Serving 从 Python Forward 到融合 GPU Kernel CUDA Graph:把动态 LLM Serving 装进可重放的静态执行图 MoE 负载均衡:从 Router 偏置到 Expert 副本与 EPLB 分布式 LLM 推理故障恢复:一条流式请求怎样活下来 LLM 推理容量规划:从请求 Trace 推到 GPU 数量 Mooncake:让 KV Cache 跨 Prefill 与 Decode 流动 DistServe:为什么 Prefill 与 Decode 要分开配置 KV Cache:自回归推理为什么必须保存历史状态 MLA:为什么一份 Latent 可以代替多头 KV Cache DSpark:用置信度决定推测解码该验证多远 EAGLE:为什么推测解码要预测 Feature Chunked Prefill:长 Prompt 为什么要切片执行 Continuous Batching:为什么 Batch 可以动态变化 NVFP4 KV Cache:Blackwell 上的 4-bit 缓存量化 FlashInfer Sorting-Free Sampling:无需显式排序的 GPU 采样 vLLM V1 EngineCore:引擎进程与执行核心的解耦 DeepSeek V3.2 稀疏注意力:Lightning Indexer 与 Top-k 选择 FairBatching:面向 LLM 推理的公平批次形成 异步连续批处理:CPU/GPU 重叠与正确同步 推理模型的推测解码:Thinking Budget 与 EAGLE-3 MoE 推理优化:路由、专家并行与通信 FlashInfer:面向 LLM Serving 的可组合 GPU Kernel 库 SGLang 与 RadixAttention:跨请求复用 KV Cache 推测解码:从拒绝采样到工程实践 PagedAttention 与 vLLM KV Cache 管理 GQA 分组查询注意力:KV Cache 与模型质量的折中

KV Cache

12 篇

自回归状态的存储、复用、迁移与压缩。

推理调度

8 篇

批处理、排队、公平性与运行时执行。

分布式推理

9 篇

多实例、多节点与云原生推理系统。

分离式推理

3 篇

Prefill/Decode 解耦与 KV 数据面。

注意力机制

7 篇

Attention 架构、长上下文与执行优化。

推测解码

7 篇

Draft、验证、接受率与系统协同。

GPU优化

15 篇

Kernel、编译、执行图与硬件利用率。

模型量化

6 篇

权重、Activation 与 KV Cache 的低精度路径。

MoE

6 篇

稀疏专家模型的路由、计算与部署。

专家并行

6 篇

Expert ownership、Token Dispatch 与负载均衡。

分布式训练

3 篇

状态分片与层内模型并行。

Kubernetes

3 篇

容器编排、资源调度与故障恢复。

vLLM

5 篇

vLLM 的缓存、调度与执行架构。

SGLang

4 篇

SGLang 的缓存、推测解码与运行时。

FlashInfer

3 篇

Serving GPU primitives、采样与评测。

FlashAttention

3 篇

IO-aware Attention Kernel 的持续演进。

EAGLE

3 篇

Feature-level speculative decoding 及其训练交付。

推荐系统

4 篇

召回、排序、特征与行为序列建模。

机器学习

6 篇

机器学习模型、算法与研究进展。

计算机视觉

2 篇

视觉算法与生成模型。

编程基础

3 篇

语言机制、数据结构与基础知识。

C/C++

2 篇

C/C++ 语言与底层编程。

工程实践

3 篇

工具、环境、工作流与经验记录。