P/D 弹性:扩容决定发出后,GPU 为什么还不能接请求
从 SLO 控制环、权重分发与编译缓存到 Worker Ready Gate,拆解分离式推理的容量生效时间
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 87
Latest writing
从 SLO 控制环、权重分发与编译缓存到 Worker Ready Gate,拆解分离式推理的容量生效时间
从低秩增量、异构批处理到 Adapter Cache,理解多租户推理的计算与隔离边界
从 Tensor 所有权和通信量出发,理解分布式训练中的数据重排
从 Policy Snapshot、Rollout 与 Reward,到 Advantage、参数更新和一致性边界
从 Sharded State Dict、两阶段提交到异步 I/O,构建真正可恢复的训练快照
从 LayerNorm Activation 分片到跨卡 Attention,厘清 SP、CP、Ring 与 All-to-All 的边界
从 GPipe、1F1B 到 Interleaving,理解流水气泡、Activation 生命周期与并行组合
从 Column/Row Parallel MLP 到 Attention、Sequence Parallel 与二维设备网格
逐项计算参数、梯度、Optimizer State、Activation 与 Collective 的生命周期
从 Progressive Quantization、寄存器解包到 QServe 的系统协同设计