NVFP4 KV Cache量化:Blackwell架构上的大模型推理内存革命
NVFP4 KV Cache量化:Blackwell架构上的大模型推理内存革命
AI Infra · Systems · Performance
关注大模型推理、GPU 性能优化与云原生基础设施。这里沉淀原理推导,也记录真实工程里的取舍。
$ focus --on
LLM inference systems
GPU kernel optimization
Cloud native infrastructure
$ posts --count 33
Latest writing
NVFP4 KV Cache量化:Blackwell架构上的大模型推理内存革命
llm-d深度解析:Kubernetes原生分布式LLM推理服务的新架构
MoE模型与推测解码的协同优化:2025年LLM推理加速的新前沿
SpecForge 深度解析:SGLang 团队开源的 EAGLE-3 推测解码训练框架
vLLM Model Runner V2 架构重构:GPU-native 与零同步设计解析
FlashInfer Sorting-Free Sampling:LLM推理采样性能突破的算法创新
vLLM V1 引擎架构重构:从单进程到多进程 EngineCore 的演进
FlashInfer-Bench:AI 自动生成 GPU Kernel 的生产级部署实践
QuantSpec: 自推测解码与分层量化KV Cache的长上下文推理加速方案
DeepSeek V3.2 稀疏注意力深度解析:从O(n²)到O(n)的长上下文革命