LangGraph + MCP:构建可恢复的 Agent 工作流
状态机负责执行语义,协议负责外部能力边界
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 60
Latest writing
状态机负责执行语义,协议负责外部能力边界
沿着一个 token 的跨 GPU 旅程理解性能瓶颈
从动态请求形状到 plan/run、JIT 与后端分派
从最长前缀匹配到缓存感知调度
用并行验证减少大模型的串行解码轮次
从请求路径、工作负载到可复现选型
一条请求的分块、映射、共享与回收
从多头注意力到缓存、带宽与并行切分
从在线 Softmax 到 GPU 分块流水线
从时空潜变量到可控、长时和高效生成