llm-d:Kubernetes 原生分布式 LLM 推理栈
沿一条请求理解智能路由、KV Cache 与 Prefill/Decode 解耦
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 62
Latest writing
沿一条请求理解智能路由、KV Cache 与 Prefill/Decode 解耦
从专家散射看清为什么验证更多 token 可能反而更慢
理解特征对齐、Training-Time Test 与草稿模型的部署契约
从稳定状态表到无 CPU 同步的 CUDA Stream
从目标分布到 Dual Pivot Rejection Sampling
沿一次请求理解 Client、Scheduler、KV Cache 与 GPU Worker
从算子契约、真实 Workload 到运行时替换
用同一份位平面同时服务 INT4 草稿与 INT8 验证
从 MLA 全量访问到内容相关的细粒度稀疏化
从延迟契约、进度余量到 Prefill Admission Budget