WAR:Agent RL 的 Rollout 为什么需要两层负载感知
把同步训练的长尾、历史后缀草稿与 KV 局部性放在同一轮轨迹生成中,理解接受长度为何不等于加速
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 87
Latest writing
把同步训练的长尾、历史后缀草稿与 KV 局部性放在同一轮轨迹生成中,理解接受长度为何不等于加速
从 Choice、Score、Noul 到概率校准与执行边界,理解结构化决策模型解决了什么,又没有解决什么
沿 Direct-P 的概率编码和 Blackwell TMEM 生命周期,区分非因果前向、单次更新与长期训练的证据
从剩余 Attention 工作量出发,把请求路由、Context Parallel worker 重组与 Prefix Cache 可用性连成一条控制链
沿一段分块矩阵乘推导 program、stride 和 mask,再解释累加精度与调优为什么必须一起考虑
从 cu_seqlens 和段内可见性追踪位置、shifted labels 与有效 target 分母,区分布局优化和训练语义变化
区分计算与持久状态的精度,推导 loss scaling,并沿梯度累积、裁剪和跳步追踪训练目标
从二维旋转与多频率相位,推导位置插值、基数调整以及 KV Cache 的一致性边界
推导算术强度与两类资源上限,再用 GEMM、缓存层级和串行阶段解释性能测量的边界
沿着梯度依赖推导分段重计算,理解显存收益、执行等价性与并行训练中的真实代价