#Quantization
3 posts tagged "quantization"
4
Part 4 — vLLM Intro Part 4 — 分散式推論、量化與編譯優化 — 讓模型放得下也跑得快
vLLM 原始碼導讀系列第四篇:拆解 TP/PP/DP/EP 四種平行度的切法與通訊量、多機部署與 NCCL 排錯、量化方法與硬體支援矩陣、torch.compile 的 piecewise CUDA Graph 為什麼切在 attention 上,以及 attention backend 的選擇邏輯。
22
Part 22 — AI 工程從零開始|Phase 11 Part 1:LLM 推論工程 — 從實驗到每秒千次請求
深入解析 LLM 生產推論:vLLM PagedAttention、連續批次、投機解碼、量化(GPTQ/AWQ/INT4)、推論成本優化與 SLA 設計
ollama on mac - part 2 - 公開模型全覽與選型指南
從硬體、任務到量化,一套可落地的 Ollama 開源模型選型心智模型:看懂 Llama / Qwen / Gemma / Mistral / Phi / DeepSeek 家族,選對尺寸與量化,讓你的 Mac 跑出最佳性價比。