RoPE:相对位置怎样进入 Attention,长上下文又改变了什么
从二维旋转与多频率相位,推导位置插值、基数调整以及 KV Cache 的一致性边界
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 80
Latest writing
从二维旋转与多频率相位,推导位置插值、基数调整以及 KV Cache 的一致性边界
推导算术强度与两类资源上限,再用 GEMM、缓存层级和串行阶段解释性能测量的边界
沿着梯度依赖推导分段重计算,理解显存收益、执行等价性与并行训练中的真实代价
沿着 NCCL 2.31.2 的真实执行路径,理解调优、传输与故障诊断
拆解 Media I/O、Processor、Encoder、Connector、Embedding Cache 与语言模型调度
从 PCIe BAR、内存注册与 rkey 到有序完成和可恢复数据面
从 Call 依赖、PLAS/ATLAS 调度到 KV Preserve、Swap 与 Recompute,理解 Agent 工作流的推理数据面
从 KV 状态、MoE Expert 权重到逐层 Activation 传输,理解 AF Disaggregation 的容量与通信边界
从目标隐藏状态、并行块预测到前缀验证,理解扩散式推测解码的收益边界
从 JSON Schema、Regex 与 CFG 到 Token Mask,理解 Constrained Decoding 的正确性与性能边界