vLLM SYSTEMS NOTES
把每一次技术分享
整理成可检索的系统知识
从视频与课件出发,沿着模型架构、内存管理、调度策略和 Kernel 优化的因果链,沉淀面向 AI 系统工程师的中英文深度文章。
最新文章¶
-
MODEL INTEGRATION · TENSOR PARALLELISM
从 Hugging Face 到 vLLM:一条可验证的模型接入链路
从参考实现选择开始,系统拆解运行时接口、
prefix命名、张量并行、权重映射、模型注册、多模态扩展与分层测试。 -
MODEL ARCHITECTURE · SPARSE ATTENTION
从压缩注意力到可执行推理:DeepSeek V4 如何落入 vLLM
沿模型结构、异构缓存、内存布局与双流执行的因果链,拆解 CSA、HCA、SWA、Hybrid KV Cache Manager 与 C4A Decode 的系统实现。
-
REQUEST LIFECYCLE · SERVING ARCHITECTURE
从 HTTP 到下一枚 Token:vLLM 请求如何穿过三个执行边界
沿一次请求的真实因果链,拆解 API Server、Engine Core 与 GPU Worker 三个执行边界,以及调度、KV Cache、动态批处理和输出回传机制。
-
VIDEO GENERATION · INFERENCE ACCELERATION
突破视频生成大模型的工程瓶颈:全链路推理加速与自动化实践
从超分路线、窗口注意力多卡切分与长视频续写出发,拆解 vLLM-Omni 为 MiniMax H3 做的稀疏注意力、投影缓存、输出传输优化与自动化编排。
-
RL TRAINING · NUMERICAL CONSISTENCY
大模型强化学习后训练:如何通过 RL-Kernel 彻底消除训推 LogP 偏差
从浮点归约顺序出发,拆解 RL-Kernel 如何锁定五类关键算子的数值契约,并在 CUDA 与 ROCm 上实现 200 步 0 mismatch。
-
MODEL ROUTING · MIXTURE OF MODELS
混合模型系统构建:开源语义路由器的架构演进与工程实践
从两层网关的语义盲区出发,拆解 vLLM-SR 的信号驱动路由、多模型协作算法与 MoM 虚拟模型抽象。
-
MULTIMODAL RL · DIFFUSION TRAINING
多模态强化学习工程解析:VeRL-Omni 架构与 MiniMax-H3 训练实录
从文本 RL 与扩散 RL 的范式差异出发,拆解 VeRL-Omni 三引擎异步架构、DiffusionNFT、工程排雷与编码器并行切分。
-
AGENT SERVING · DISTRIBUTED CACHE
把缓存变成服务边界:Kimi-K3 在 vLLM 上的生产推理设计
从 Agent 负载的状态压力出发,拆解 Prefill/Decode 分离、Mooncake 分布式 KV、多模态四级缓存、KDA checkpoint、EAGLE3 与混合量化。
-
DIFFUSION SERVING · CONTINUOUS BATCHING
vLLM-Omni Diffusion Continuous Batching 与 PiD
从同步降噪循环的阻塞问题出发,拆解 step 粒度异步调度、动态组批、异构分辨率处理、DCB 性能边界与 PiD 高分辨率解码。
-
MOE SERVING · DISAGGREGATION
大模型推理的内存与计算解耦:AFD 与 FastAFD
从长上下文下 Attention 的显存压力与 MoE 的批次饥饿出发,拆解 AFD 角色重分配、双微批流水线、FastAFD GPU 优化与性能边界。
-
CONTEXT PARALLELISM · LONG CONTEXT
vLLM PCP 与 DCP 上下文并行
从 KVCache 分布式存储与长序列 Prefill 切分出发,拆解 DCP、PCP、Chunk Swap、AllGather Q/KV、TPA 与动态 CP 的工程权衡。
-
SERVING ARCHITECTURE · RUST
vLLM Rust 前端架构演进
从 ZMQ 前后端边界切入,拆解五层 Rust 前端、Stream-Native 数据流、解析器组合子,以及单进程高并发下的吞吐与延迟优势。
-
MULTIMODAL GENERATION · SERVING
MiniMax-H3 与 vLLM-Omni 音视频联合生成
从 118 GB 权重、58 758 token 长序列与 50 步去噪的三重压力出发,拆解共享 DiT 的打包序列、CPU 卸载与 DLO、Ulysses 与分块 VAE、跨步缓存与步级调度。
-
ARCHITECTURE · MEMORY
Kimi K3 day-0支持背后的技术细节
从 KDA、LatentMoE 到 KV Cache、部分缓存命中与算子优化,理解 2.78T 模型背后的系统重构。
-
SPECULATIVE DECODING
DSpark 投机解码
从隐藏状态提取到 Markov Head、KVConnector 和跨节点传输,拆解投机解码的工程落地路径。
-
KV CACHE · DISTRIBUTED INFERENCE
解构 vLLM KV Connector
从 v0 到 v1 的调度解耦出发,拆解逐层传输、请求级异步、L2 预取,以及 LMCache 与 Mooncake 的零拷贝全局池化实践。
-
TRAINING SYSTEMS
长序列 MoE RL
以 32 张 H100 运行 128K 序列为案例,梳理显存解耦、通信重叠与并行配置收敛方法。
-
RL · ROLLOUT ENGINE
当 vLLM 遇见 slime
从训练与推理的权重同步出发,拆解 slime 如何借助 vLLM 构建高吞吐的 RL rollout 链路。
-
MULTIMODAL RL · DIFFUSION
VeRL-Omni 多模态强化学习
以异步奖励、步进式连续批处理与 Rollout 校准三项优化为主线,解析扩散模型 RL 的系统级设计与 FlowGRPO 工程映射。
-
QUANTIZATION · INFERENCE
vLLM 低比特量化实践:AutoRound
从截断与舍入的误差博弈出发,拆解 SignSGD 块级联合优化、QDQ 伪量化、vLLM 集成与 CFG 并行加速。
-
ASCEND · INFERENCE OPTIMIZATION
GLM-5 昇腾推理优化
从 TTFT、TPOT 与显存约束出发,拆解 GLM-5 的并行策略、PD 分离、KV Cache 压缩、图模式与融合算子优化。
关于本站¶
文章由本仓库的技术博客流水线生成:先对视频进行带时间戳转写,再分析 PPT/PDF,建立证据与章节结构,最后经过写作、审校和双语排版。网页由 MkDocs Material 构建,并通过 GitHub Actions 自动发布。