Sequence Parallel 与 Context Parallel:Token 维到底怎样切
从 LayerNorm Activation 分片到跨卡 Attention,厘清 SP、CP、Ring 与 All-to-All 的边界
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 62
Latest writing
从 LayerNorm Activation 分片到跨卡 Attention,厘清 SP、CP、Ring 与 All-to-All 的边界
从 GPipe、1F1B 到 Interleaving,理解流水气泡、Activation 生命周期与并行组合
从 Column/Row Parallel MLP 到 Attention、Sequence Parallel 与二维设备网格
逐项计算参数、梯度、Optimizer State、Activation 与 Collective 的生命周期
从 Progressive Quantization、寄存器解包到 QServe 的系统协同设计
从显著通道、等价缩放到 W4A16 Kernel 与端到端 Serving 收益
从等价通道缩放到 W8A8 INT8 GEMM、Q/DQ 融合与 Serving 收益
分清权重存储、Activation 量化、GEMM、KV Cache 与通信的五条低精度路径
沿着 Dynamo、FX、Guards、Inductor 与 Graph Break 理解编译收益和冷启动
从 Kernel Launch 开销到 Batch Bucket、静态地址与 Piecewise Capture