#Inference
3 posts tagged "inference"
1
Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎
vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。
16
Part 16 — FDE core topic - TTFT & Throughput Optimization:首字延遲與推理吞吐量的硬體級優化
深入解析 LLM 推理服務的兩大核心指標——首字時間(TTFT)與每秒 Token 吞吐量——以及 Quantization、Continuous Batching、PagedAttention、Speculative Decoding、Flash Attention 五大硬體級優化技術的原理與取捨。
22
Part 22 — AI 工程從零開始|Phase 11 Part 1:LLM 推論工程 — 從實驗到每秒千次請求
深入解析 LLM 生產推論:vLLM PagedAttention、連續批次、投機解碼、量化(GPTQ/AWQ/INT4)、推論成本優化與 SLA 設計