All Posts
The complete archive.
Every post on the blog, newest first.
Part 5 — Mem0 Intro Part 5 — 生產部署 — OSS 與 Platform 的分界線在哪裡
Mem0 原始碼導讀系列最終篇:拆解 OSS 與 Platform 的完整差異、Graph Memory/Temporal Reasoning/Memory Decay/Dream 四個專屬能力各自解決什麼問題與 OSS 的補法、v2→v3 破壞性變更遷移清單、怎麼用官方開源評測框架測自己的資料,以及一份生產檢查清單。
Part 4 — Mem0 Intro Part 4 — 儲存層與後端選型 — 三個 store、25 種向量庫與那個關鍵能力差異
Mem0 原始碼導讀系列第四篇:拆解向量庫/實體庫/SQL 三個儲存層的實際 schema、25 種向量庫裡哪 15 種真的支援 BM25、配置系統的組裝方式、LLM 與 embedder 的選型判準,以及自架 server 的部署與多租戶隔離。
Part 3 — Mem0 Intro Part 3 — 讀取路徑 — 語意、關鍵字與實體的三訊號融合
Mem0 原始碼導讀系列第三篇:逐行拆解 _search_vector_store() 的九個步驟、BM25 的 sigmoid 正規化與查詢長度自適應參數、實體加權的完整公式與那個反懲罰項、score_and_rank 的自適應分母,以及 explain=True 怎麼用來診斷召回問題。
Part 2 — Mem0 Intro Part 2 — 寫入路徑 — ADD-only 萃取管線與那次自我否定
Mem0 原始碼導讀系列第二篇:逐行拆解 _add_to_vector_store() 的八個階段、為什麼 v3 放棄了論文裡的 ADD/UPDATE/DELETE/NOOP 四動作模型、UUID 映射成整數的防幻覺技巧、md5 去重的邊界,以及一次 add() 到底花多少錢。
Part 1 — Mem0 Intro Part 1 — 全景架構 — 為什麼 Agent 需要一個記憶層而不是更長的上下文
Mem0 原始碼導讀系列第一篇:用一張全景圖說清楚這個 6.5 萬星的 AI Agent 記憶層由哪些子系統組成、寫入與讀取兩條路徑各自經過哪些階段、記憶的作用域模型怎麼設計,以及為什麼「把歷史全部塞進 context」在生產環境會失效。
Part 5 — vLLM Intro Part 5 — 生產部署與服務化 — 從 vllm serve 到一份可被驗收的 SLO
vLLM 原始碼導讀系列最終篇:拆解 OpenAI 相容 API 的完整面、Multi-LoRA 多租戶服務、結構化輸出的取樣層約束、Prometheus 指標全表與症狀診斷鏈、P/D 分離與 KV Connector 的實際配置,以及一套不會騙自己的 benchmark 方法。
Part 4 — vLLM Intro Part 4 — 分散式推論、量化與編譯優化 — 讓模型放得下也跑得快
vLLM 原始碼導讀系列第四篇:拆解 TP/PP/DP/EP 四種平行度的切法與通訊量、多機部署與 NCCL 排錯、量化方法與硬體支援矩陣、torch.compile 的 piecewise CUDA Graph 為什麼切在 attention 上,以及 attention backend 的選擇邏輯。
Part 3 — vLLM Intro Part 3 — 連續批次與排程器 — 決定誰在這一輪前進一格
vLLM 原始碼導讀系列第三篇:拆解連續批次的實作、V1 統一 token 預算排程器如何取代 V0 的雙軌制、Chunked Prefill 在 TTFT 與 ITL 之間的取捨、搶佔與重算機制、投機解碼的接受率數學,以及一份可直接套用的調參手冊。
Part 2 — vLLM Intro Part 2 — PagedAttention 與 KV Cache — 把作業系統的分頁搬進 GPU
vLLM 原始碼導讀系列第二篇:拆解 PagedAttention 的分頁機制與 kernel 記憶體佈局、Copy-on-Write 共享、自動前綴快取的 hash 鏈與 LRU 淘汰、KV cache 量化與多層卸載,以及一份能讓你算出併發上限的記憶體規劃手冊。
Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎
vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。
Part 5 — RAGFlow Intro Part 5 — 系統與程式碼結構 — 服務分層、Task Executor 與 Go 遷移
RAGFlow 原始碼導讀系列最終篇:拆解進程拓撲與水平擴充參數、四層服務分層、Redis Stream 任務系統的 13 種任務型別、Agent Canvas 與 ingestion Pipeline 兩套 DAG 引擎,以及正在進行中的 Python → Go 遷移。
Part 4 — RAGFlow Intro Part 4 — Decode 與檢索 — 混合搜尋、Rerank、GraphRAG/RAPTOR 與引用
RAGFlow 原始碼導讀系列第四篇:逐行拆解查詢編譯器如何把一句人話變成加權布林查詢、ES 與 Infinity 兩條融合路徑的差異、三層重排的權重公式、GraphRAG 與 RAPTOR 的成本與時機,以及不依賴 LLM 服從度的引用對齊演算法。
Part 3 — RAGFlow Intro Part 3 — Encode 與 Save — 向量化、索引 Schema 與雙引擎抽象
RAGFlow 原始碼導讀系列第三篇:拆解混合向量(0.1 檔名 + 0.9 內容)的設計理由、批次與截斷策略、以後綴驅動的動態 ES mapping、把 TF 壓成 min(freq,1) 的自訂相似度,以及支撐六種 doc engine 的儲存抽象層。
Part 2 — RAGFlow Intro Part 2 — 資料進場 — DeepDoc 解析、Chunking 策略與 14 種模板
RAGFlow 原始碼導讀系列第二篇:拆解 DeepDoc 的 OCR/版面辨識/表格結構辨識三層視覺管線、五條解析後端路線、14 種 chunk 模板各自的結構假設,以及 naive_merge 的切分契約與 chunk 加值管線的真實成本。
Part 1 — RAGFlow Intro Part 1 — 全景架構 — 從一份 PDF 到一句帶引用的答案
RAGFlow 原始碼導讀系列第一篇:用一張全景圖與兩條資料路徑,說清楚這個 9 萬星的開源 RAG 引擎由哪些子系統組成、一份 PDF 進來之後經過哪些階段、以及它在架構上做了哪些與眾不同的取捨。
Part 5 — Hugging Face 實戰(五):端到端實戰 — 打造一個完整的 RAG 客服系統
把前四篇串起來:用 bge-m3 + FAISS + reranker + 微調模型,從文件切分、混合檢索、引用生成、FastAPI 服務化到 Gradio 部署與線上評估,一套可直接執行的完整專案程式碼。
Part 4 — Hugging Face 實戰(四):後訓練 — 從 SFT 到 DPO、ORPO 與 GRPO
後訓練不只是再微調一次。完整解析 DPO / ORPO / KTO / SimPO / GRPO 與 PPO 的差異、偏好資料怎麼準備、TRL 的完整訓練程式碼,以及如何評估對齊效果與偵測 reward hacking。
Part 3 — Hugging Face 實戰(三):微調實戰 — Datasets、Trainer 與 LoRA/QLoRA
什麼時候才該微調?從資料準備、LoRA/QLoRA 原理、TRL SFTTrainer 完整訓練程式碼,到評估、合併、量化與部署的全流程。含超參數決策表與六種失敗模式診斷。
Part 2 — Hugging Face 實戰(二):用模型、跑 App、推送自己的模型
如何從兩百萬個 repo 中挑對模型、用四個抽象層載入它、用 Gradio 與 FastAPI + vLLM 把它變成服務,並把自己的模型完整推上 Hub。含量化、Spaces 部署與 Model Card 撰寫範例。
Part 1 — Hugging Face 實戰(一):它到底是什麼,以及如何開始
從零認識 Hugging Face:Hub、Transformers、Datasets、Spaces 五大支柱的關係,帳號與 Token 設定、CLI 安裝、快取機制,以及三行程式碼跑起第一個模型。含完整可執行範例。
Part 16 — AIO / GEO - Part 16 - 商業化:從一個客戶到二十個客戶
顧問生意在第 6 到第 10 個客戶之間會壞掉。本篇拆解交付 SOP、團隊配置、retainer 合約結構與詳細的單位經濟試算,並誠實處理兩個問題:GEO 服務往 SaaS 走的陷阱,以及什麼時候該停止擴張。
Part 15 — AIO / GEO - Part 15 - 商業化:工具地圖與該自建的部分
GEO 工具市場已經很擁擠,但九成的工具只做同一件事:給你 dashboard。本篇畫出完整工具地圖、比較商業與開源選項、給出自建 vs 買的分界線,並提醒一個 2026 年 9 月生效、會改變所有人前提的變動:Cloudflare 對新網域預設封鎖 AI 爬蟲。
Part 14 — AIO / GEO - Part 14 - 商業化:十個產業的 GEO 劇本
同一套方法在不同產業的效果差三倍以上。本篇給出十個產業的獨立劇本:主要查詢類型、可達天花板、優先動作、獨有風險與該用哪組 KPI。附一張跨產業對照表與「換產業時要重問的六個問題」。
Part 13 — AIO / GEO - Part 13 - 商業化:顧問方法論,從第一通電話到簽約
GEO 最有效的銷售動作是「當場跑診斷」。本篇給出 90 分鐘診斷工作坊的完整腳本、診斷報告模板、提案與定價錨定方式,以及最重要的一節:合約 KPI 該怎麼寫才不會自殺。附常見異議的回應與該拒絕的案子。
Part 12 — AIO / GEO - Part 12 - 商業化:什麼時候該做 GEO,什麼時候只需要 SEO
Google 官方說「這就是 SEO」——這句話對,也不對。本篇正面處理這個質疑,給出一套決策樹與四維評分表,並列出五種不該賣 GEO 的客戶。附預算配比建議與該怎麼跟客戶解釋這件事。