5

Part 5 — Mem0 Intro Part 5 — 生產部署 — OSS 與 Platform 的分界線在哪裡

Mem0 原始碼導讀系列最終篇:拆解 OSS 與 Platform 的完整差異、Graph Memory/Temporal Reasoning/Memory Decay/Dream 四個專屬能力各自解決什麼問題與 OSS 的補法、v2→v3 破壞性變更遷移清單、怎麼用官方開源評測框架測自己的資料,以及一份生產檢查清單。

·27 min aiengineeringinfrastructurearchitecture
4

Part 4 — Mem0 Intro Part 4 — 儲存層與後端選型 — 三個 store、25 種向量庫與那個關鍵能力差異

Mem0 原始碼導讀系列第四篇:拆解向量庫/實體庫/SQL 三個儲存層的實際 schema、25 種向量庫裡哪 15 種真的支援 BM25、配置系統的組裝方式、LLM 與 embedder 的選型判準,以及自架 server 的部署與多租戶隔離。

·26 min aiengineeringinfrastructure
3

Part 3 — Mem0 Intro Part 3 — 讀取路徑 — 語意、關鍵字與實體的三訊號融合

Mem0 原始碼導讀系列第三篇:逐行拆解 _search_vector_store() 的九個步驟、BM25 的 sigmoid 正規化與查詢長度自適應參數、實體加權的完整公式與那個反懲罰項、score_and_rank 的自適應分母,以及 explain=True 怎麼用來診斷召回問題。

·26 min aiengineering
2

Part 2 — Mem0 Intro Part 2 — 寫入路徑 — ADD-only 萃取管線與那次自我否定

Mem0 原始碼導讀系列第二篇:逐行拆解 _add_to_vector_store() 的八個階段、為什麼 v3 放棄了論文裡的 ADD/UPDATE/DELETE/NOOP 四動作模型、UUID 映射成整數的防幻覺技巧、md5 去重的邊界,以及一次 add() 到底花多少錢。

·26 min aiengineering
1

Part 1 — Mem0 Intro Part 1 — 全景架構 — 為什麼 Agent 需要一個記憶層而不是更長的上下文

Mem0 原始碼導讀系列第一篇:用一張全景圖說清楚這個 6.5 萬星的 AI Agent 記憶層由哪些子系統組成、寫入與讀取兩條路徑各自經過哪些階段、記憶的作用域模型怎麼設計,以及為什麼「把歷史全部塞進 context」在生產環境會失效。

·24 min aiengineeringarchitecture
5

Part 5 — vLLM Intro Part 5 — 生產部署與服務化 — 從 vllm serve 到一份可被驗收的 SLO

vLLM 原始碼導讀系列最終篇:拆解 OpenAI 相容 API 的完整面、Multi-LoRA 多租戶服務、結構化輸出的取樣層約束、Prometheus 指標全表與症狀診斷鏈、P/D 分離與 KV Connector 的實際配置,以及一套不會騙自己的 benchmark 方法。

·28 min aiengineeringinfrastructurearchitecture
4

Part 4 — vLLM Intro Part 4 — 分散式推論、量化與編譯優化 — 讓模型放得下也跑得快

vLLM 原始碼導讀系列第四篇:拆解 TP/PP/DP/EP 四種平行度的切法與通訊量、多機部署與 NCCL 排錯、量化方法與硬體支援矩陣、torch.compile 的 piecewise CUDA Graph 為什麼切在 attention 上,以及 attention backend 的選擇邏輯。

·27 min aiengineeringinfrastructure
3

Part 3 — vLLM Intro Part 3 — 連續批次與排程器 — 決定誰在這一輪前進一格

vLLM 原始碼導讀系列第三篇:拆解連續批次的實作、V1 統一 token 預算排程器如何取代 V0 的雙軌制、Chunked Prefill 在 TTFT 與 ITL 之間的取捨、搶佔與重算機制、投機解碼的接受率數學,以及一份可直接套用的調參手冊。

·27 min aiengineeringarchitecture
2

Part 2 — vLLM Intro Part 2 — PagedAttention 與 KV Cache — 把作業系統的分頁搬進 GPU

vLLM 原始碼導讀系列第二篇:拆解 PagedAttention 的分頁機制與 kernel 記憶體佈局、Copy-on-Write 共享、自動前綴快取的 hash 鏈與 LRU 淘汰、KV cache 量化與多層卸載,以及一份能讓你算出併發上限的記憶體規劃手冊。

·26 min aiengineering
1

Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎

vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。

·24 min aiengineeringinfrastructure
5

Part 5 — RAGFlow Intro Part 5 — 系統與程式碼結構 — 服務分層、Task Executor 與 Go 遷移

RAGFlow 原始碼導讀系列最終篇:拆解進程拓撲與水平擴充參數、四層服務分層、Redis Stream 任務系統的 13 種任務型別、Agent Canvas 與 ingestion Pipeline 兩套 DAG 引擎,以及正在進行中的 Python → Go 遷移。

·27 min aiengineeringarchitecture
4

Part 4 — RAGFlow Intro Part 4 — Decode 與檢索 — 混合搜尋、Rerank、GraphRAG/RAPTOR 與引用

RAGFlow 原始碼導讀系列第四篇:逐行拆解查詢編譯器如何把一句人話變成加權布林查詢、ES 與 Infinity 兩條融合路徑的差異、三層重排的權重公式、GraphRAG 與 RAPTOR 的成本與時機,以及不依賴 LLM 服從度的引用對齊演算法。

·28 min aiengineering
3

Part 3 — RAGFlow Intro Part 3 — Encode 與 Save — 向量化、索引 Schema 與雙引擎抽象

RAGFlow 原始碼導讀系列第三篇:拆解混合向量(0.1 檔名 + 0.9 內容)的設計理由、批次與截斷策略、以後綴驅動的動態 ES mapping、把 TF 壓成 min(freq,1) 的自訂相似度,以及支撐六種 doc engine 的儲存抽象層。

·25 min aiengineering
2

Part 2 — RAGFlow Intro Part 2 — 資料進場 — DeepDoc 解析、Chunking 策略與 14 種模板

RAGFlow 原始碼導讀系列第二篇:拆解 DeepDoc 的 OCR/版面辨識/表格結構辨識三層視覺管線、五條解析後端路線、14 種 chunk 模板各自的結構假設,以及 naive_merge 的切分契約與 chunk 加值管線的真實成本。

·26 min aiengineering
1

Part 1 — RAGFlow Intro Part 1 — 全景架構 — 從一份 PDF 到一句帶引用的答案

RAGFlow 原始碼導讀系列第一篇:用一張全景圖與兩條資料路徑,說清楚這個 9 萬星的開源 RAG 引擎由哪些子系統組成、一份 PDF 進來之後經過哪些階段、以及它在架構上做了哪些與眾不同的取捨。

·24 min aiengineering
5

Part 5 — Hugging Face 實戰(五):端到端實戰 — 打造一個完整的 RAG 客服系統

把前四篇串起來:用 bge-m3 + FAISS + reranker + 微調模型,從文件切分、混合檢索、引用生成、FastAPI 服務化到 Gradio 部署與線上評估,一套可直接執行的完整專案程式碼。

·30 min aiengineering
4

Part 4 — Hugging Face 實戰(四):後訓練 — 從 SFT 到 DPO、ORPO 與 GRPO

後訓練不只是再微調一次。完整解析 DPO / ORPO / KTO / SimPO / GRPO 與 PPO 的差異、偏好資料怎麼準備、TRL 的完整訓練程式碼,以及如何評估對齊效果與偵測 reward hacking。

·27 min aiengineering
3

Part 3 — Hugging Face 實戰(三):微調實戰 — Datasets、Trainer 與 LoRA/QLoRA

什麼時候才該微調?從資料準備、LoRA/QLoRA 原理、TRL SFTTrainer 完整訓練程式碼,到評估、合併、量化與部署的全流程。含超參數決策表與六種失敗模式診斷。

·28 min aiengineering
2

Part 2 — Hugging Face 實戰(二):用模型、跑 App、推送自己的模型

如何從兩百萬個 repo 中挑對模型、用四個抽象層載入它、用 Gradio 與 FastAPI + vLLM 把它變成服務,並把自己的模型完整推上 Hub。含量化、Spaces 部署與 Model Card 撰寫範例。

·26 min aiengineering
1

Part 1 — Hugging Face 實戰(一):它到底是什麼,以及如何開始

從零認識 Hugging Face:Hub、Transformers、Datasets、Spaces 五大支柱的關係,帳號與 Token 設定、CLI 安裝、快取機制,以及三行程式碼跑起第一個模型。含完整可執行範例。

·22 min aiengineering
15

Part 15 — AIO / GEO - Part 15 - 商業化:工具地圖與該自建的部分

GEO 工具市場已經很擁擠,但九成的工具只做同一件事:給你 dashboard。本篇畫出完整工具地圖、比較商業與開源選項、給出自建 vs 買的分界線,並提醒一個 2026 年 9 月生效、會改變所有人前提的變動:Cloudflare 對新網域預設封鎖 AI 爬蟲。

·20 min aiengineeringbusiness
5

Part 5 — QM 深度解析(五):Sandbox、Skills、Cron 與部署 — 讓 Agent 擁有一台持久的電腦

拆解 QM 的持久化能力:三種沙箱後端與能力損失偵測、Skills 的簽章與 git pack 匯入、Cron 的 leader lease 與收件人同意、三種記憶策略的抽取 prompt,以及部署目錄與私有 fork 兩種客製路線。

·29 min aiengineering
4

Part 4 — QM 深度解析(四):安全模型 — 三種 Posture、命令政策與誠實的威脅模型

拆解 QM 的分層防禦:三種 security posture 如何組合、命令政策的 scannableCommand 如何遞迴拆解八層 shell 混淆、ReDoS 防護的自製 regex 編譯器、內容篩檢分類器的分塊與重試,以及三個「刻意不給 Agent」的動作與 12 條誠實列出的已知限制。

·28 min aiengineering
3

Part 3 — QM 深度解析(三):Harness 抽象 — 一套核心驅動四種 Agent 引擎

拆解 QM 如何讓 Pi、OpenCode、Codex、Claude Code 四種完全不同的 Agent 引擎驅動同一個核心:Harness 契約的三軸能力宣告、60 欄位的 HarnessTurnInput 依賴注入、Entries 與 Tape 雙軌重放、context 壓縮的 throughSeq 錨點,以及 runtime 選擇的三層繼承。

·27 min aiengineering
2

Part 2 — QM 深度解析(二):Scope 與 Resolution — 一次對話如何解析出身分、權限與工作區

拆解 QM 多人隔離的核心:五種 ScopeId、workspace 分層掛載、soul 指令的不可覆寫疊層、audience floor 如何用「受眾交集」防止頻道洩漏、ACL grant 變成 shared/ handle,以及 session 租約與 tape 雙軌記錄。

·27 min aiengineering