1

Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎

vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。

·24 min aiengineeringinfrastructure
2

Part 2 — vLLM Intro Part 2 — PagedAttention 與 KV Cache — 把作業系統的分頁搬進 GPU

vLLM 原始碼導讀系列第二篇:拆解 PagedAttention 的分頁機制與 kernel 記憶體佈局、Copy-on-Write 共享、自動前綴快取的 hash 鏈與 LRU 淘汰、KV cache 量化與多層卸載,以及一份能讓你算出併發上限的記憶體規劃手冊。

·26 min aiengineering
36

Part 36 — AI 工程從零開始|Phase 17 Part 1:AI 推論服務架構 — 從單機到全球部署

深入解析 AI 推論服務工程:模型服務器選型(Triton/TorchServe/vLLM)、負載均衡、自動擴縮容、GPU 共享與多租戶隔離架構

·23 min aiengineering

industry-map - 半導體產業鏈 Part 6:IC 設計 — GPU / 加速器(中游)

深拆半導體 GPU / 加速器設計這一層:NVIDIA、AMD 與 CSP 自研 ASIC 的競爭格局、fabless 輕資產高毛利模式、CUDA 軟體護城河、瓶頸分數與定價權、利潤池、上下游依賴、風險與投資點子。這是全鏈價值捕獲最高、卻也最可能被工程繞過的咽喉。

·16 min finance

Advanced Micro Devices (AMD) 2025 10-K 深度解析

用 10k-digest 方法對 AMD FY2025 年報做機構級深度拆解:五年財務軌跡、四大事業體、Xilinx 併購攤銷如何壓低 GAAP 獲利、$8.53 億一次性稅務利益、商譽佔資產 33%、MI308 中國出口管制、資本配置、風險矩陣與投資訊號。

·30 min finance

NVIDIA (NVDA) 2026 10-K 深度解析

用 10k-digest 方法對 NVIDIA FY2026 年報做機構級深度拆解:五年財務軌跡、Compute & Networking 與 Graphics 事業體、資料中心營收爆炸、毛利率逆風、極端客戶集中、中國/H20 出口管制、$95.2B 採購承諾、循環融資疑雲、DuPont/ROIC、Rule of 40、情境分析、風險矩陣與投資訊號。

·30 min finance