跳转至

vLLM SYSTEMS NOTES

把每一次技术分享
整理成可检索的系统知识

从视频与课件出发,沿着模型架构、内存管理、调度策略和 Kernel 优化的因果链,沉淀面向 AI 系统工程师的中英文深度文章。

银发与黑橙发的两位 vLLM 看板娘一起阅读技术资料并讨论电脑内容
PagedAttentionContinuous BatchingKV CacheSpeculative DecodingMoE Serving

最新文章

  • ARCHITECTURE · MEMORY

    Kimi K3 day-0支持背后的技术细节


    从 KDA、LatentMoE 到 KV Cache、部分缓存命中与算子优化,理解 2.78T 模型背后的系统重构。

    阅读中文 · English

  • SPECULATIVE DECODING

    DSpark 投机解码


    从隐藏状态提取到 Markov Head、KVConnector 和跨节点传输,拆解投机解码的工程落地路径。

    阅读中文 · English

  • KV CACHE · DISTRIBUTED INFERENCE

    解构 vLLM KV Connector


    从 v0 到 v1 的调度解耦出发,拆解逐层传输、请求级异步、L2 预取,以及 LMCache 与 Mooncake 的零拷贝全局池化实践。

    阅读中文 · English

  • TRAINING SYSTEMS

    长序列 MoE RL


    以 32 张 H100 运行 128K 序列为案例,梳理显存解耦、通信重叠与并行配置收敛方法。

    阅读中文 · English

关于本站

文章由本仓库的技术博客流水线生成:先对视频进行带时间戳转写,再分析 PPT/PDF,建立证据与章节结构,最后经过写作、审校和双语排版。网页由 MkDocs Material 构建,并通过 GitHub Actions 自动发布。