#GPU
6 posts tagged "gpu"
Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎
vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。
Part 2 — vLLM Intro Part 2 — PagedAttention 與 KV Cache — 把作業系統的分頁搬進 GPU
vLLM 原始碼導讀系列第二篇:拆解 PagedAttention 的分頁機制與 kernel 記憶體佈局、Copy-on-Write 共享、自動前綴快取的 hash 鏈與 LRU 淘汰、KV cache 量化與多層卸載,以及一份能讓你算出併發上限的記憶體規劃手冊。
Part 36 — AI 工程從零開始|Phase 17 Part 1:AI 推論服務架構 — 從單機到全球部署
深入解析 AI 推論服務工程:模型服務器選型(Triton/TorchServe/vLLM)、負載均衡、自動擴縮容、GPU 共享與多租戶隔離架構
industry-map - 半導體產業鏈 Part 6:IC 設計 — GPU / 加速器(中游)
深拆半導體 GPU / 加速器設計這一層:NVIDIA、AMD 與 CSP 自研 ASIC 的競爭格局、fabless 輕資產高毛利模式、CUDA 軟體護城河、瓶頸分數與定價權、利潤池、上下游依賴、風險與投資點子。這是全鏈價值捕獲最高、卻也最可能被工程繞過的咽喉。
Advanced Micro Devices (AMD) 2025 10-K 深度解析
用 10k-digest 方法對 AMD FY2025 年報做機構級深度拆解:五年財務軌跡、四大事業體、Xilinx 併購攤銷如何壓低 GAAP 獲利、$8.53 億一次性稅務利益、商譽佔資產 33%、MI308 中國出口管制、資本配置、風險矩陣與投資訊號。
NVIDIA (NVDA) 2026 10-K 深度解析
用 10k-digest 方法對 NVIDIA FY2026 年報做機構級深度拆解:五年財務軌跡、Compute & Networking 與 Graphics 事業體、資料中心營收爆炸、毛利率逆風、極端客戶集中、中國/H20 出口管制、$95.2B 採購承諾、循環融資疑雲、DuPont/ROIC、Rule of 40、情境分析、風險矩陣與投資訊號。