Tensor Parallel:怎样把一个 Transformer Layer 切到多张 GPU
从 Column/Row Parallel MLP 到 Attention、Sequence Parallel 与二维设备网格
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 60
Latest writing
从 Column/Row Parallel MLP 到 Attention、Sequence Parallel 与二维设备网格
逐项计算参数、梯度、Optimizer State、Activation 与 Collective 的生命周期
从 Progressive Quantization、寄存器解包到 QServe 的系统协同设计
从显著通道、等价缩放到 W4A16 Kernel 与端到端 Serving 收益
从等价通道缩放到 W8A8 INT8 GEMM、Q/DQ 融合与 Serving 收益
分清权重存储、Activation 量化、GEMM、KV Cache 与通信的五条低精度路径
沿着 Dynamo、FX、Guards、Inductor 与 Graph Break 理解编译收益和冷启动
从 Kernel Launch 开销到 Batch Bucket、静态地址与 Piecewise Capture
从 Attention DP、跨节点 All-to-All 到 P/D 两套并行布局
理解变长通信、两级互联、低延迟路径、FP8 传输与计算重叠