41

Part 41 — FDE 面試準備指南(四十一):RKK 實戰——分散式 AI 系統的故障排查:結構化診斷框架與五種常見失效模式

以系統設計視角拆解分散式 AI 系統的故障排查:三個可觀測性成熟度階段、五步驟結構化診斷框架、症狀分類矩陣、完整決策樹圖、五種 AI 系統常見失效模式與特徵信號、SLO 與 Error Budget 設計,以及 Why X not Y 的關鍵可觀測性技術選型

·23 min aiengineering
48

Part 48 — FDE 面試指南 Part 48:高可靠性 Agent Graph 的多重工具 Fallback 與自我修復機制

深入解析如何在 LangGraph 中設計 Compiler-Validator Pattern,透過 Pydantic 強型別校驗、Critic Agent 反思重寫、Circuit Breaker 與 Human-in-the-loop,打造能自我修復的高可靠性供應鏈 Agent 架構。

·26 min engineering

Auto Agent System - Part 2 - Harness 引擎:多模型容錯、自我修正與 LLM 評審

深入 agent_auto_system 的心臟——Harness 引擎。從第一個 PR「解析被 markdown 包住的 JSON」開始,一路講到跨模型 fallback 重試(PR #3)、驗證失敗後的自我修正、獨立 LLM 評審打分,以及每次執行的 token/成本追蹤。這是把 LLM 這匹野馬套上挽具的完整工程。

·22 min aiengineering

Building Resilient Systems: Handling Failure at Scale

How we built systems that gracefully handle failures and maintain service availability even when components fail.

·10 min engineeringarchitecture