vLLM SYSTEMS NOTES
把每一次技术分享
整理成可检索的系统知识
从视频与课件出发,沿着模型架构、内存管理、调度策略和 Kernel 优化的因果链,沉淀面向 AI 系统工程师的中英文深度文章。
PagedAttentionContinuous BatchingKV CacheSpeculative DecodingMoE Serving
最新文章¶
-
ARCHITECTURE · MEMORY
Kimi K3 day-0支持背后的技术细节
从 KDA、LatentMoE 到 KV Cache、部分缓存命中与算子优化,理解 2.78T 模型背后的系统重构。
-
SPECULATIVE DECODING
DSpark 投机解码
从隐藏状态提取到 Markov Head、KVConnector 和跨节点传输,拆解投机解码的工程落地路径。
-
KV CACHE · DISTRIBUTED INFERENCE
解构 vLLM KV Connector
从 v0 到 v1 的调度解耦出发,拆解逐层传输、请求级异步、L2 预取,以及 LMCache 与 Mooncake 的零拷贝全局池化实践。
-
TRAINING SYSTEMS
长序列 MoE RL
以 32 张 H100 运行 128K 序列为案例,梳理显存解耦、通信重叠与并行配置收敛方法。
关于本站¶
文章由本仓库的技术博客流水线生成:先对视频进行带时间戳转写,再分析 PPT/PDF,建立证据与章节结构,最后经过写作、审校和双语排版。网页由 MkDocs Material 构建,并通过 GitHub Actions 自动发布。