跳转至

vLLM SYSTEMS NOTES

把每一次技术分享
整理成可检索的系统知识

从视频与课件出发,沿着模型架构、内存管理、调度策略和 Kernel 优化的因果链,沉淀面向 AI 系统工程师的中英文深度文章。

银发与黑橙发的两位 vLLM 看板娘一起阅读技术资料并讨论电脑内容
PagedAttentionContinuous BatchingKV CacheSpeculative DecodingMoE Serving

最新文章

  • MODEL INTEGRATION · TENSOR PARALLELISM

    从 Hugging Face 到 vLLM:一条可验证的模型接入链路


    从参考实现选择开始,系统拆解运行时接口、prefix 命名、张量并行、权重映射、模型注册、多模态扩展与分层测试。

    阅读中文 · English

  • MODEL ARCHITECTURE · SPARSE ATTENTION

    从压缩注意力到可执行推理:DeepSeek V4 如何落入 vLLM


    沿模型结构、异构缓存、内存布局与双流执行的因果链,拆解 CSA、HCA、SWA、Hybrid KV Cache Manager 与 C4A Decode 的系统实现。

    阅读中文 · English

  • REQUEST LIFECYCLE · SERVING ARCHITECTURE

    从 HTTP 到下一枚 Token:vLLM 请求如何穿过三个执行边界


    沿一次请求的真实因果链,拆解 API Server、Engine Core 与 GPU Worker 三个执行边界,以及调度、KV Cache、动态批处理和输出回传机制。

    阅读中文 · English

  • VIDEO GENERATION · INFERENCE ACCELERATION

    突破视频生成大模型的工程瓶颈:全链路推理加速与自动化实践


    从超分路线、窗口注意力多卡切分与长视频续写出发,拆解 vLLM-Omni 为 MiniMax H3 做的稀疏注意力、投影缓存、输出传输优化与自动化编排。

    阅读中文 · English

  • RL TRAINING · NUMERICAL CONSISTENCY

    大模型强化学习后训练:如何通过 RL-Kernel 彻底消除训推 LogP 偏差


    从浮点归约顺序出发,拆解 RL-Kernel 如何锁定五类关键算子的数值契约,并在 CUDA 与 ROCm 上实现 200 步 0 mismatch。

    阅读中文 · English

  • MODEL ROUTING · MIXTURE OF MODELS

    混合模型系统构建:开源语义路由器的架构演进与工程实践


    从两层网关的语义盲区出发,拆解 vLLM-SR 的信号驱动路由、多模型协作算法与 MoM 虚拟模型抽象。

    阅读中文 · English

  • MULTIMODAL RL · DIFFUSION TRAINING

    多模态强化学习工程解析:VeRL-Omni 架构与 MiniMax-H3 训练实录


    从文本 RL 与扩散 RL 的范式差异出发,拆解 VeRL-Omni 三引擎异步架构、DiffusionNFT、工程排雷与编码器并行切分。

    阅读中文 · English

  • AGENT SERVING · DISTRIBUTED CACHE

    把缓存变成服务边界:Kimi-K3 在 vLLM 上的生产推理设计


    从 Agent 负载的状态压力出发,拆解 Prefill/Decode 分离、Mooncake 分布式 KV、多模态四级缓存、KDA checkpoint、EAGLE3 与混合量化。

    阅读中文 · English

  • DIFFUSION SERVING · CONTINUOUS BATCHING

    vLLM-Omni Diffusion Continuous Batching 与 PiD


    从同步降噪循环的阻塞问题出发,拆解 step 粒度异步调度、动态组批、异构分辨率处理、DCB 性能边界与 PiD 高分辨率解码。

    阅读中文 · English

  • MOE SERVING · DISAGGREGATION

    大模型推理的内存与计算解耦:AFD 与 FastAFD


    从长上下文下 Attention 的显存压力与 MoE 的批次饥饿出发,拆解 AFD 角色重分配、双微批流水线、FastAFD GPU 优化与性能边界。

    阅读中文 · English

  • CONTEXT PARALLELISM · LONG CONTEXT

    vLLM PCP 与 DCP 上下文并行


    从 KVCache 分布式存储与长序列 Prefill 切分出发,拆解 DCP、PCP、Chunk Swap、AllGather Q/KV、TPA 与动态 CP 的工程权衡。

    阅读中文 · English

  • SERVING ARCHITECTURE · RUST

    vLLM Rust 前端架构演进


    从 ZMQ 前后端边界切入,拆解五层 Rust 前端、Stream-Native 数据流、解析器组合子,以及单进程高并发下的吞吐与延迟优势。

    阅读中文 · English

  • MULTIMODAL GENERATION · SERVING

    MiniMax-H3 与 vLLM-Omni 音视频联合生成


    从 118 GB 权重、58 758 token 长序列与 50 步去噪的三重压力出发,拆解共享 DiT 的打包序列、CPU 卸载与 DLO、Ulysses 与分块 VAE、跨步缓存与步级调度。

    阅读中文 · English

  • ARCHITECTURE · MEMORY

    Kimi K3 day-0支持背后的技术细节


    从 KDA、LatentMoE 到 KV Cache、部分缓存命中与算子优化,理解 2.78T 模型背后的系统重构。

    阅读中文 · English

  • SPECULATIVE DECODING

    DSpark 投机解码


    从隐藏状态提取到 Markov Head、KVConnector 和跨节点传输,拆解投机解码的工程落地路径。

    阅读中文 · English

  • KV CACHE · DISTRIBUTED INFERENCE

    解构 vLLM KV Connector


    从 v0 到 v1 的调度解耦出发,拆解逐层传输、请求级异步、L2 预取,以及 LMCache 与 Mooncake 的零拷贝全局池化实践。

    阅读中文 · English

  • TRAINING SYSTEMS

    长序列 MoE RL


    以 32 张 H100 运行 128K 序列为案例,梳理显存解耦、通信重叠与并行配置收敛方法。

    阅读中文 · English

  • RL · ROLLOUT ENGINE

    当 vLLM 遇见 slime


    从训练与推理的权重同步出发,拆解 slime 如何借助 vLLM 构建高吞吐的 RL rollout 链路。

    阅读中文 · English

  • MULTIMODAL RL · DIFFUSION

    VeRL-Omni 多模态强化学习


    以异步奖励、步进式连续批处理与 Rollout 校准三项优化为主线,解析扩散模型 RL 的系统级设计与 FlowGRPO 工程映射。

    阅读中文 · English

  • QUANTIZATION · INFERENCE

    vLLM 低比特量化实践:AutoRound


    从截断与舍入的误差博弈出发,拆解 SignSGD 块级联合优化、QDQ 伪量化、vLLM 集成与 CFG 并行加速。

    阅读中文 · English

  • ASCEND · INFERENCE OPTIMIZATION

    GLM-5 昇腾推理优化


    从 TTFT、TPOT 与显存约束出发,拆解 GLM-5 的并行策略、PD 分离、KV Cache 压缩、图模式与融合算子优化。

    阅读中文 · English

关于本站

文章由本仓库的技术博客流水线生成:先对视频进行带时间戳转写,再分析 PPT/PDF,建立证据与章节结构,最后经过写作、审校和双语排版。网页由 MkDocs Material 构建,并通过 GitHub Actions 自动发布。