vLLM V1 EngineCore:引擎进程与执行核心的解耦
沿一次请求理解 Client、Scheduler、KV Cache 与 GPU Worker
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 87
Latest writing
沿一次请求理解 Client、Scheduler、KV Cache 与 GPU Worker
从算子契约、真实 Workload 到运行时替换
用同一份位平面同时服务 INT4 草稿与 INT8 验证
从 MLA 全量访问到内容相关的细粒度稀疏化
从延迟契约、进度余量到 Prefill Admission Budget
沿着相邻两个 Engine Step 拆解调度流水线
把生成工作量与执行效率分开优化
状态机负责执行语义,协议负责外部能力边界
沿着一个 token 的跨 GPU 旅程理解性能瓶颈
从动态请求形状到 plan/run、JIT 与后端分派