KV Cache:自回归推理为什么必须保存历史状态
从重复计算、每 Token 显存到 MHA/GQA/MQA 与缓存生命周期
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 62
Latest writing
从重复计算、每 Token 显存到 MHA/GQA/MQA 与缓存生命周期
从 TMA、WGMMA、Warp Specialization 到更准确的 FP8 Attention
从联合低秩压缩、矩阵吸收到 Decoupled RoPE 与 FlashMLA 执行模式
从分块 Online Softmax 到 KV 通信与本地 Attention 计算重叠
为什么同一个精确注意力算法,还能通过 Thread Block 与 Warp 重排再快一倍
从半自回归草稿、前缀存活概率到 SGLang Ragged Verification
从 Feature Uncertainty、Advanced Token 到树形草稿与无损验证
从 Prefill/Decode 干扰到 Token Budget 与 Stall-Free Scheduling
从请求粒度到 Iteration-Level Scheduling,理解生成式推理的批次重组
从 E2M1 与双层缩放到容量、内核和精度验证