#LLM
59 posts tagged "llm"
Part 1 — Hugging Face 實戰(一):它到底是什麼,以及如何開始
從零認識 Hugging Face:Hub、Transformers、Datasets、Spaces 五大支柱的關係,帳號與 Token 設定、CLI 安裝、快取機制,以及三行程式碼跑起第一個模型。含完整可執行範例。
Part 1 — OpenWorker 深度解析(一):架構全景 — 一個能交付成果的桌面 AI 同事
從零拆解 Andrew Ng 團隊的開源專案 OpenWorker:它為什麼強調「交付成果而非聊天」、三層本地優先架構如何組成、37000 行 Python 後端的目錄職責分工,以及一次任務從輸入到產出的完整生命週期。
Part 1 — AIO / GEO - Part 1 - 概念篇:當搜尋結果不再是十條藍色連結
AIO(AI Overview)與 GEO(Generative Engine Optimization)到底在優化什麼?本篇釐清 SEO / AEO / GEO / LLMO 的定義邊界,拆解生成式引擎產生答案的內部流程,並提出一套從 Ranking 思維轉向 Citation Share 思維的可見度指標與成熟度模型。
Part 1 — FDE core topic - Context Management:Token 預算管理與上下文修剪策略
深入解析 LLM 有限上下文視窗的管理策略,涵蓋 Token 預算分配、滑動視窗截斷、階層式摘要壓縮與工具輸出修剪,幫助你在面試中展現生產級 AI 系統設計能力。
Part 1 — FDE 面試準備指南(一):RAG 完全解析
以 Google AI 工程師兼面試官的視角,解析 FDE 面試中 RAG 最高頻考題,包含核心架構、Chunk 策略、幻覺改善、Hybrid Search 與實戰建議
Part 1 — AI Forward Deployed Engineer 必備技能指南(一):基礎核心概念與技術棧
深入解析 AI FDE 角色所需的核心技術基礎,包含 Python 生態系統、深度學習框架、大語言模型基礎與提示工程技術
Part 1 — CrewAI 完全指南(一):入門與核心概念——用多 Agent 協作解決複雜問題
從零開始學 CrewAI:什麼是多 Agent 協作框架、為什麼需要它、核心四大元件(Agent、Task、Crew、Tool)的詳細說明,以及你的第一個 CrewAI 應用程式。
Part 1 — RAG 完全指南(一):基礎概念與你的第一個 RAG 系統
從零開始理解 RAG(Retrieval-Augmented Generation):為什麼 LLM 需要外部知識、RAG 的核心架構是什麼,以及如何用 Python 實作一個最基本的 RAG pipeline。
Part 2 — Hugging Face 實戰(二):用模型、跑 App、推送自己的模型
如何從兩百萬個 repo 中挑對模型、用四個抽象層載入它、用 Gradio 與 FastAPI + vLLM 把它變成服務,並把自己的模型完整推上 Hub。含量化、Spaces 部署與 Model Card 撰寫範例。
Part 2 — OpenWorker 深度解析(二):TurnEngine — Agent 迴圈的完整解剖
逐行拆解 OpenWorker 的 1192 行 agent 迴圈:訊息的真實形狀、blocking provider 如何橋接到 async loop、工具呼叫的授權與併發分流、四種中斷狀態下的「不留孤兒 tool_call」不變式,以及 canonical history 與 outbound view 的分離設計。
Part 2 — 如何衡量 AI 的準確度(二):大型語言模型(LLM)的評估方法
LLM 的輸出沒有唯一標準答案,該怎麼客觀評估?本文介紹 BLEU、ROUGE、Perplexity、BERTScore 及 LLM-as-a-Judge 等方法,幫助你從多個維度評估語言模型的真實能力。
Part 3 — Hugging Face 實戰(三):微調實戰 — Datasets、Trainer 與 LoRA/QLoRA
什麼時候才該微調?從資料準備、LoRA/QLoRA 原理、TRL SFTTrainer 完整訓練程式碼,到評估、合併、量化與部署的全流程。含超參數決策表與六種失敗模式診斷。
Part 3 — QM 深度解析(三):Harness 抽象 — 一套核心驅動四種 Agent 引擎
拆解 QM 如何讓 Pi、OpenCode、Codex、Claude Code 四種完全不同的 Agent 引擎驅動同一個核心:Harness 契約的三軸能力宣告、60 欄位的 HarnessTurnInput 依賴注入、Entries 與 Tape 雙軌重放、context 壓縮的 throughSeq 錨點,以及 runtime 選擇的三層繼承。
Part 3 — 如何衡量 AI 的準確度(三):RAG 系統的可靠性評估框架
RAG 系統的評估遠不只是看回答品質,還要驗證檢索忠誠度與事實接地性。本文介紹 Faithfulness、Relevance、Context Precision 等 RAG 專屬指標,以及如何使用 RAGAS 框架自動化評估流程。
Part 4 — Hugging Face 實戰(四):後訓練 — 從 SFT 到 DPO、ORPO 與 GRPO
後訓練不只是再微調一次。完整解析 DPO / ORPO / KTO / SimPO / GRPO 與 PPO 的差異、偏好資料怎麼準備、TRL 的完整訓練程式碼,以及如何評估對齊效果與偵測 reward hacking。
Part 4 — OpenWorker 深度解析(四):LLM 層 — Provider 抽象、能力降級與 Context 自動壓縮
拆解 OpenWorker 如何同時支援 OpenAI、Anthropic、Gemini、Bedrock、Vertex、Ollama 與多家轉售商:ProviderClient 契約為何刻意同步且無迴圈、能力矩陣如何驅動 vision/PDF 降級、TokenUsage 的快取拆分,以及 561 行 compaction.py 的完整壓縮演算法。
Part 4 — Knowledge Graph 知識圖譜(四):結合 LLM — GraphRAG 與多跳推理
為什麼純向量 RAG 在多跳問題上失敗?GraphRAG 如何用知識圖譜補足、降低 LLM 幻覺。含 LangChain + Neo4j 的可跑程式碼與 Text2Cypher 實作。
Part 5 — Hugging Face 實戰(五):端到端實戰 — 打造一個完整的 RAG 客服系統
把前四篇串起來:用 bge-m3 + FAISS + reranker + 微調模型,從文件切分、混合檢索、引用生成、FastAPI 服務化到 Gradio 部署與線上評估,一套可直接執行的完整專案程式碼。
Part 5 — Knowledge Graph 知識圖譜(五):實戰 — 用 LLM 自動建構知識圖譜並做問答
端到端實戰:用 LLM 把純文字文件自動抽成三元組、寫入 Neo4j、再接 GraphRAG 做問答。完整可跑的 Python 程式碼與架構演進建議。
Part 9 — FDE 面試準備指南(九):LLM 核心知識——Token、Prompt Engineering 與 Embedding
以 Google AI 工程師兼面試官的視角,整理 FDE 面試中最關鍵的 LLM 實用知識:Token 與 Context Window 的工程意涵、Prompt Engineering 五大技法,以及 Embedding 在語意搜尋中的原理與選型
Part 10 — FDE 面試準備指南(十):RKK 實戰——AI Agent 的 Context Management
以系統設計視角拆解 AI Agent 的 Context Management:核心問題是什麼、有哪些策略、為什麼選這個、trade-off 怎麼算——含完整架構圖與面試答題框架
Part 12 — FDE 面試準備指南(十二):RKK 實戰——AI Agent 統計評估與品質量化
以系統設計視角拆解 AI Agent 的 Evaluation Pipeline:核心問題是什麼、RAG 評估三角怎麼設計、LLM-as-Judge 的取捨、以及怎麼讓 eval 成為持續整合的一環——含完整架構圖
Part 13 — FDE 面試準備指南(十三):RKK 實戰——Prompt Injection 攻防與 Agent 安全
以系統設計視角拆解 AI Agent 的安全架構:Prompt Injection 的兩類攻擊、為什麼 Agent 比純 LLM 危險 10 倍、五層防禦架構怎麼設計、OAuth 授權怎麼落地——含完整攻防架構圖
Part 18 — FDE 面試準備指南(十八):RKK 實戰——三層記憶體架構與 LLM 成本調優
以系統設計視角拆解企業級 Agent 的三層記憶體設計:Working Memory 成本控制、Semantic Long-term Memory 的異步壓縮流程、Profile Memory 的結構化提取——以及每個設計決策背後的成本與延遲 trade-off
Part 19 — AI 工程從零開始|Phase 10 Part 1:從頭構建 LLM — Tokenization 的工程藝術
深入解析 LLM Tokenization:BPE/WordPiece/SentencePiece 演算法、詞彙表大小的工程取捨、多語言 Token 效率與 Tiktoken 生產實作