多模态 Serving:图片进入 LLM 之前发生了什么
拆解 Media I/O、Processor、Encoder、Connector、Embedding Cache 与语言模型调度
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 71
Latest writing
拆解 Media I/O、Processor、Encoder、Connector、Embedding Cache 与语言模型调度
从 Call 依赖、PLAS/ATLAS 调度到 KV Preserve、Swap 与 Recompute,理解 Agent 工作流的推理数据面
从 KV 状态、MoE Expert 权重到逐层 Activation 传输,理解 AF Disaggregation 的容量与通信边界
从目标隐藏状态、并行块预测到前缀验证,理解扩散式推测解码的收益边界
从 JSON Schema、Regex 与 CFG 到 Token Mask,理解 Constrained Decoding 的正确性与性能边界
从输入公平调度、动态 KV 准入到高水位保护,理解长尾请求的完整生命周期
从 SLO 控制环、权重分发与编译缓存到 Worker Ready Gate,拆解分离式推理的容量生效时间
从低秩增量、异构批处理到 Adapter Cache,理解多租户推理的计算与隔离边界
从 Sharded State Dict、两阶段提交到异步 I/O,构建真正可恢复的训练快照
从 LayerNorm Activation 分片到跨卡 Attention,厘清 SP、CP、Ring 与 All-to-All 的边界