1

Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎

vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。

·24 min aiengineeringinfrastructure
2

Part 2 — vLLM Intro Part 2 — PagedAttention 與 KV Cache — 把作業系統的分頁搬進 GPU

vLLM 原始碼導讀系列第二篇:拆解 PagedAttention 的分頁機制與 kernel 記憶體佈局、Copy-on-Write 共享、自動前綴快取的 hash 鏈與 LRU 淘汰、KV cache 量化與多層卸載,以及一份能讓你算出併發上限的記憶體規劃手冊。

·26 min aiengineering
2

Part 2 — Hugging Face 實戰(二):用模型、跑 App、推送自己的模型

如何從兩百萬個 repo 中挑對模型、用四個抽象層載入它、用 Gradio 與 FastAPI + vLLM 把它變成服務,並把自己的模型完整推上 Hub。含量化、Spaces 部署與 Model Card 撰寫範例。

·26 min aiengineering
3

Part 3 — vLLM Intro Part 3 — 連續批次與排程器 — 決定誰在這一輪前進一格

vLLM 原始碼導讀系列第三篇:拆解連續批次的實作、V1 統一 token 預算排程器如何取代 V0 的雙軌制、Chunked Prefill 在 TTFT 與 ITL 之間的取捨、搶佔與重算機制、投機解碼的接受率數學,以及一份可直接套用的調參手冊。

·27 min aiengineeringarchitecture
4

Part 4 — vLLM Intro Part 4 — 分散式推論、量化與編譯優化 — 讓模型放得下也跑得快

vLLM 原始碼導讀系列第四篇:拆解 TP/PP/DP/EP 四種平行度的切法與通訊量、多機部署與 NCCL 排錯、量化方法與硬體支援矩陣、torch.compile 的 piecewise CUDA Graph 為什麼切在 attention 上,以及 attention backend 的選擇邏輯。

·27 min aiengineeringinfrastructure
5

Part 5 — vLLM Intro Part 5 — 生產部署與服務化 — 從 vllm serve 到一份可被驗收的 SLO

vLLM 原始碼導讀系列最終篇:拆解 OpenAI 相容 API 的完整面、Multi-LoRA 多租戶服務、結構化輸出的取樣層約束、Prometheus 指標全表與症狀診斷鏈、P/D 分離與 KV Connector 的實際配置,以及一套不會騙自己的 benchmark 方法。

·28 min aiengineeringinfrastructurearchitecture
5

Part 5 — Hugging Face 實戰(五):端到端實戰 — 打造一個完整的 RAG 客服系統

把前四篇串起來:用 bge-m3 + FAISS + reranker + 微調模型,從文件切分、混合檢索、引用生成、FastAPI 服務化到 Gradio 部署與線上評估,一套可直接執行的完整專案程式碼。

·30 min aiengineering
22

Part 22 — AI 工程從零開始|Phase 11 Part 1:LLM 推論工程 — 從實驗到每秒千次請求

深入解析 LLM 生產推論:vLLM PagedAttention、連續批次、投機解碼、量化(GPTQ/AWQ/INT4)、推論成本優化與 SLA 設計

·23 min aiengineering
47

Part 47 — FDE 面試準備指南(四十七):RKK 實戰——大模型與地端微型模型的智慧混合路由與冷啟動優化

深度拆解 Edge/On-Premise 小模型與雲端大模型的雙軌路由架構:基於 Token 概率熵值的早停路由(Early-Exit Confidence Routing)、vLLM logprobs API 整合、PII 強制本地路由、冷啟動優化策略,以及三個演進階段的完整系統設計

·26 min engineering