#LLM
64 posts tagged "llm"
Part 1 — Mem0 Intro Part 1 — 全景架構 — 為什麼 Agent 需要一個記憶層而不是更長的上下文
Mem0 原始碼導讀系列第一篇:用一張全景圖說清楚這個 6.5 萬星的 AI Agent 記憶層由哪些子系統組成、寫入與讀取兩條路徑各自經過哪些階段、記憶的作用域模型怎麼設計,以及為什麼「把歷史全部塞進 context」在生產環境會失效。
Part 1 — vLLM Intro Part 1 — 全景架構 — 從一次 model.generate() 到一個推論引擎
vLLM 原始碼與架構導讀系列第一篇:用一張全景圖說清楚這個 9 萬星的 LLM 推論引擎由哪些子系統組成、一個請求進來之後經過哪些階段、GPU 記憶體到底被誰吃掉,以及 V1 重寫改變了什麼。
Part 1 — Hugging Face 實戰(一):它到底是什麼,以及如何開始
從零認識 Hugging Face:Hub、Transformers、Datasets、Spaces 五大支柱的關係,帳號與 Token 設定、CLI 安裝、快取機制,以及三行程式碼跑起第一個模型。含完整可執行範例。
Part 1 — OpenWorker 深度解析(一):架構全景 — 一個能交付成果的桌面 AI 同事
從零拆解 Andrew Ng 團隊的開源專案 OpenWorker:它為什麼強調「交付成果而非聊天」、三層本地優先架構如何組成、37000 行 Python 後端的目錄職責分工,以及一次任務從輸入到產出的完整生命週期。
Part 1 — AIO / GEO - Part 1 - 概念篇:當搜尋結果不再是十條藍色連結
AIO(AI Overview)與 GEO(Generative Engine Optimization)到底在優化什麼?本篇釐清 SEO / AEO / GEO / LLMO 的定義邊界,拆解生成式引擎產生答案的內部流程,並提出一套從 Ranking 思維轉向 Citation Share 思維的可見度指標與成熟度模型。
Part 1 — FDE core topic - Context Management:Token 預算管理與上下文修剪策略
深入解析 LLM 有限上下文視窗的管理策略,涵蓋 Token 預算分配、滑動視窗截斷、階層式摘要壓縮與工具輸出修剪,幫助你在面試中展現生產級 AI 系統設計能力。
Part 1 — FDE 面試準備指南(一):RAG 完全解析
以 Google AI 工程師兼面試官的視角,解析 FDE 面試中 RAG 最高頻考題,包含核心架構、Chunk 策略、幻覺改善、Hybrid Search 與實戰建議
Part 1 — AI Forward Deployed Engineer 必備技能指南(一):基礎核心概念與技術棧
深入解析 AI FDE 角色所需的核心技術基礎,包含 Python 生態系統、深度學習框架、大語言模型基礎與提示工程技術
Part 1 — CrewAI 完全指南(一):入門與核心概念——用多 Agent 協作解決複雜問題
從零開始學 CrewAI:什麼是多 Agent 協作框架、為什麼需要它、核心四大元件(Agent、Task、Crew、Tool)的詳細說明,以及你的第一個 CrewAI 應用程式。
Part 1 — RAG 完全指南(一):基礎概念與你的第一個 RAG 系統
從零開始理解 RAG(Retrieval-Augmented Generation):為什麼 LLM 需要外部知識、RAG 的核心架構是什麼,以及如何用 Python 實作一個最基本的 RAG pipeline。
Part 2 — Mem0 Intro Part 2 — 寫入路徑 — ADD-only 萃取管線與那次自我否定
Mem0 原始碼導讀系列第二篇:逐行拆解 _add_to_vector_store() 的八個階段、為什麼 v3 放棄了論文裡的 ADD/UPDATE/DELETE/NOOP 四動作模型、UUID 映射成整數的防幻覺技巧、md5 去重的邊界,以及一次 add() 到底花多少錢。
Part 2 — vLLM Intro Part 2 — PagedAttention 與 KV Cache — 把作業系統的分頁搬進 GPU
vLLM 原始碼導讀系列第二篇:拆解 PagedAttention 的分頁機制與 kernel 記憶體佈局、Copy-on-Write 共享、自動前綴快取的 hash 鏈與 LRU 淘汰、KV cache 量化與多層卸載,以及一份能讓你算出併發上限的記憶體規劃手冊。
Part 2 — Hugging Face 實戰(二):用模型、跑 App、推送自己的模型
如何從兩百萬個 repo 中挑對模型、用四個抽象層載入它、用 Gradio 與 FastAPI + vLLM 把它變成服務,並把自己的模型完整推上 Hub。含量化、Spaces 部署與 Model Card 撰寫範例。
Part 2 — OpenWorker 深度解析(二):TurnEngine — Agent 迴圈的完整解剖
逐行拆解 OpenWorker 的 1192 行 agent 迴圈:訊息的真實形狀、blocking provider 如何橋接到 async loop、工具呼叫的授權與併發分流、四種中斷狀態下的「不留孤兒 tool_call」不變式,以及 canonical history 與 outbound view 的分離設計。
Part 2 — 如何衡量 AI 的準確度(二):大型語言模型(LLM)的評估方法
LLM 的輸出沒有唯一標準答案,該怎麼客觀評估?本文介紹 BLEU、ROUGE、Perplexity、BERTScore 及 LLM-as-a-Judge 等方法,幫助你從多個維度評估語言模型的真實能力。
Part 3 — vLLM Intro Part 3 — 連續批次與排程器 — 決定誰在這一輪前進一格
vLLM 原始碼導讀系列第三篇:拆解連續批次的實作、V1 統一 token 預算排程器如何取代 V0 的雙軌制、Chunked Prefill 在 TTFT 與 ITL 之間的取捨、搶佔與重算機制、投機解碼的接受率數學,以及一份可直接套用的調參手冊。
Part 3 — Hugging Face 實戰(三):微調實戰 — Datasets、Trainer 與 LoRA/QLoRA
什麼時候才該微調?從資料準備、LoRA/QLoRA 原理、TRL SFTTrainer 完整訓練程式碼,到評估、合併、量化與部署的全流程。含超參數決策表與六種失敗模式診斷。
Part 3 — QM 深度解析(三):Harness 抽象 — 一套核心驅動四種 Agent 引擎
拆解 QM 如何讓 Pi、OpenCode、Codex、Claude Code 四種完全不同的 Agent 引擎驅動同一個核心:Harness 契約的三軸能力宣告、60 欄位的 HarnessTurnInput 依賴注入、Entries 與 Tape 雙軌重放、context 壓縮的 throughSeq 錨點,以及 runtime 選擇的三層繼承。
Part 3 — 如何衡量 AI 的準確度(三):RAG 系統的可靠性評估框架
RAG 系統的評估遠不只是看回答品質,還要驗證檢索忠誠度與事實接地性。本文介紹 Faithfulness、Relevance、Context Precision 等 RAG 專屬指標,以及如何使用 RAGAS 框架自動化評估流程。
Part 4 — Hugging Face 實戰(四):後訓練 — 從 SFT 到 DPO、ORPO 與 GRPO
後訓練不只是再微調一次。完整解析 DPO / ORPO / KTO / SimPO / GRPO 與 PPO 的差異、偏好資料怎麼準備、TRL 的完整訓練程式碼,以及如何評估對齊效果與偵測 reward hacking。
Part 4 — OpenWorker 深度解析(四):LLM 層 — Provider 抽象、能力降級與 Context 自動壓縮
拆解 OpenWorker 如何同時支援 OpenAI、Anthropic、Gemini、Bedrock、Vertex、Ollama 與多家轉售商:ProviderClient 契約為何刻意同步且無迴圈、能力矩陣如何驅動 vision/PDF 降級、TokenUsage 的快取拆分,以及 561 行 compaction.py 的完整壓縮演算法。
Part 4 — Knowledge Graph 知識圖譜(四):結合 LLM — GraphRAG 與多跳推理
為什麼純向量 RAG 在多跳問題上失敗?GraphRAG 如何用知識圖譜補足、降低 LLM 幻覺。含 LangChain + Neo4j 的可跑程式碼與 Text2Cypher 實作。
Part 5 — Hugging Face 實戰(五):端到端實戰 — 打造一個完整的 RAG 客服系統
把前四篇串起來:用 bge-m3 + FAISS + reranker + 微調模型,從文件切分、混合檢索、引用生成、FastAPI 服務化到 Gradio 部署與線上評估,一套可直接執行的完整專案程式碼。
Part 5 — Knowledge Graph 知識圖譜(五):實戰 — 用 LLM 自動建構知識圖譜並做問答
端到端實戰:用 LLM 把純文字文件自動抽成三元組、寫入 Neo4j、再接 GraphRAG 做問答。完整可跑的 Python 程式碼與架構演進建議。
Part 9 — FDE 面試準備指南(九):LLM 核心知識——Token、Prompt Engineering 與 Embedding
以 Google AI 工程師兼面試官的視角,整理 FDE 面試中最關鍵的 LLM 實用知識:Token 與 Context Window 的工程意涵、Prompt Engineering 五大技法,以及 Embedding 在語意搜尋中的原理與選型