Auto Agent System - Part 2 - Harness 引擎:多模型容錯、自我修正與 LLM 評審

深入 agent_auto_system 的心臟——Harness 引擎。從第一個 PR「解析被 markdown 包住的 JSON」開始,一路講到跨模型 fallback 重試(PR #3)、驗證失敗後的自我修正、獨立 LLM 評審打分,以及每次執行的 token/成本追蹤。這是把 LLM 這匹野馬套上挽具的完整工程。

·22 min aiengineering

Anthropic Financial Services 入門 Part 2 — Agent、Skill、Command、Connector 是怎麼組成一個系統的

同一個目錄結構要同時餵給 Cowork 和 Claude Managed Agents API,Anthropic 是怎麼設計的?本篇拆解 financial-services 套件裡 Agent、Skill、Command、Connector、Managed-agent wrapper 五層的分工與依賴關係,以及為什麼所有東西都是純 markdown/JSON、沒有 build step。

·13 min aiengineering

Auto Agent System - Part 1 - 系統總覽:一個 CrewAI 多代理自動化平台如何運作

從 0 認識 agent_auto_system:一個用 CrewAI 打造、能透過 API 與網頁介面定義並執行 AI 自動化任務的平台。本篇拆解它的整體架構、11 種任務類型、最核心的 Harness 引擎層,以及一個請求從按下按鈕到拿到結果的完整資料流。

·20 min aiengineering

Anthropic Financial Services 入門 Part 1 — 怎麼安裝、怎麼用

Anthropic 官方開源的 financial-services 套件,把投資銀行、股票研究、私募股權、財富管理最常見的工作流程,包成 Claude 的 Agent 和 Skill。本篇講清楚怎麼在 Cowork 和 Claude Code 裡安裝它、怎麼選你需要的 Agent 或 Vertical Plugin,以及裝完之後第一次該怎麼用。

·12 min aiengineering

Langfuse 入門 Part 4 — 監控與 Prompt 管理:把實驗成果變成生產循環

系列最終篇。把前三篇的追蹤與評估收進日常營運:用監控儀表板盯緊成本、延遲、品質的趨勢與異常;用 Prompt 管理把 prompt 從程式碼裡抽出來做版本控制,讓你改 prompt 不必改程式、不必重新部署——並把整個 LLM 工程循環完整串起來。

·15 min aiengineering

Langfuse 入門 Part 3 — LLM 評估:Score、LLM-as-a-Judge、Dataset 與 Experiment

LLM 應用最難的問題:你怎麼知道它『答得好不好』?本篇拆解 Langfuse 的評估體系——用 Score 量化品質、用 LLM-as-a-Judge 自動評分、用人工標註校準、再用 Dataset + Experiment 在上線前做回歸測試,把『我覺得改好了』變成『數據證明改好了』。

·16 min aiengineering

Langfuse 入門 Part 2 — 三行程式碼開始追蹤:SDK 整合與 Tracing 實戰

概念懂了,該動手了。本篇示範用 Langfuse Python SDK 把應用接上可觀測性:@observe 裝飾器、get_client 與 context manager、OpenAI 一行替換整合、LangChain callback handler,以及如何用 Session、User、Metadata 讓 trace 真正可查可比。

·15 min aiengineering

Langfuse 入門 Part 1 — 為什麼 LLM 應用需要可觀測性?核心概念與資料模型

LLM 應用最可怕的地方,是它「壞掉時看起來跟正常時一模一樣」。本篇用最白話的方式講清楚:為什麼傳統監控救不了 LLM、Langfuse 是什麼、以及它的核心資料模型——Trace、Observation、Span、Generation、Session、Score——彼此怎麼組合成一張可觀測的全貌。

·14 min aiengineering

finance_data 是怎麼運作的:用 Cron + LLM 全自動生成股票研究報告

finance_data 是一個全自動的 AI 投資研究平台:每天靠 GitHub Actions cron 定時觸發,用 yfinance 抓市場數據、爬 Finviz/StockAnalysis/Roic.ai 補齊基本面,再餵給 Claude / OpenAI / Gemini 生成繁體中文研究報告,最後由 MkDocs 建置部署。本篇完整拆解這條 pipeline 的每一個環節。

·17 min aiengineering

ChatPDF RAG 優化(三):可觀測性與評估 —— Langfuse 追蹤、評估歷史、即時評分

沒有量測就沒有優化。本篇拆解 chatPDF 如何補上 RAG 的可觀測性最後一塊:opt-in 零開銷的 Langfuse 追蹤、執行緒安全的 singleton、評估歷史持久化、即時答案評分(faithfulness/relevance)、relevance gate,以及無外部依賴的 SVG 趨勢圖表。

·16 min aiengineering

ChatPDF RAG 優化(二):後端強化與進階 RAG —— 安全、資源邊界、多查詢擴展

RAG demo 能跑,不代表能上線。本篇拆解 chatPDF 如何補上 production 該有的防線:上傳的 PDF magic bytes 驗證與 OOM 防護、BM25 的 LRU 快取、多查詢擴展、檢索評分過濾、頁碼級引用、LLM gateway 重試退避——把 RAG pipeline 從「能跑」變成「能扛」。

·17 min aiengineering

ChatPDF RAG 優化(一):語意切塊與混合檢索 Semantic Chunking + Hybrid Retrieval

RAG 的成敗,八成決定在「切塊」與「檢索」這兩步。本篇拆解 chatPDF 如何從寫死的固定切塊,升級成 embedding 偵測語意轉折的 Semantic Chunking,以及如何把 dense 向量檢索與 BM25 關鍵字檢索融合成 Hybrid Retrieval——附完整 Python 實作與設計取捨。

·16 min aiengineering
5

Part 5 — Knowledge Graph 知識圖譜(五):實戰 — 用 LLM 自動建構知識圖譜並做問答

端到端實戰:用 LLM 把純文字文件自動抽成三元組、寫入 Neo4j、再接 GraphRAG 做問答。完整可跑的 Python 程式碼與架構演進建議。

·26 min aiengineering
4

Part 4 — Knowledge Graph 知識圖譜(四):結合 LLM — GraphRAG 與多跳推理

為什麼純向量 RAG 在多跳問題上失敗?GraphRAG 如何用知識圖譜補足、降低 LLM 幻覺。含 LangChain + Neo4j 的可跑程式碼與 Text2Cypher 實作。

·25 min aiengineering

Cloudflare AI 安全稽核系統(三):LLM Agent 的安全反模式——十個讓報告失去公信力的做法

從 Cloudflare security-audit-skill 的設計原則出發,系統化整理 LLM agent 做安全稽核時最常見的十個反模式,以及如何在 agent pipeline 設計中從根源消除這些問題

·22 min aiengineering
3

Part 3 — Knowledge Graph 知識圖譜(三):與關聯式 / 向量 / 文件資料庫的比較

知識圖譜 vs 關聯式資料庫 vs 向量資料庫 vs 文件資料庫:資料模型、查詢能力、效能與適用場景的深度比較,附決策表與混合架構建議。

·22 min aiengineering

Cloudflare AI 安全稽核系統(二):Agent 設計深潛——Hunt 策略、Sub-Agent Spawning、Adversarial Validation

深入拆解 security-audit-skill 的 Agent 設計:Hunt phase 怎麼派 agent、sub-agent 什麼時候 spawn、adversarial validation 為什麼是 multi-agent 系統的核心防線

·20 min aiengineering
2

Part 2 — Knowledge Graph 知識圖譜(二):從零建構 — NER、關係抽取與 Neo4j 實作

動手建知識圖譜:命名實體辨識(NER)、實體消歧、關係抽取的完整管線,並用 Python + spaCy + Neo4j + Cypher 把純文字變成可查詢的圖。

·23 min aiengineering

Cloudflare AI 安全稽核系統(一):六階段 Multi-Agent Pipeline 全解析

Cloudflare 開源了內部 AI 安全稽核系統 security-audit-skill——一個教科書級的六階段 Multi-Agent Pipeline:Recon→Hunt→Validate→Report→Structured Output→Verify,本篇拆解整個架構設計與核心設計決策

·18 min aiengineering
1

Part 1 — Knowledge Graph 知識圖譜(一):核心概念、三元組與語意網路

從零理解知識圖譜:實體、關係、三元組、本體(Ontology),以及 RDF/OWL/SPARQL 語意網路標準。用具體範例與程式碼建立直覺。

·20 min aiengineering
43

Part 43 — AI 工程從零開始|Phase 19 Part 3:Capstone — 多模態 AI 應用端對端實作與系列總結

端對端構建多模態 AI 應用:圖文理解、語音介面、文件分析三合一系統的架構設計、模態融合策略、延遲優化與系列學習路線總結

·28 min aiengineering
42

Part 42 — AI 工程從零開始|Phase 19 Part 2:Capstone — 生產級 AI Agent 產品端對端實作

端對端構建生產級 AI Agent 產品:從架構設計到上線,涵蓋 ReAct 迴圈、工具整合、記憶系統、Guardrails、可觀測性與商業指標追蹤

·28 min aiengineering
41

Part 41 — AI 工程從零開始|Phase 19 Part 1:Capstone — 企業級 RAG 知識庫系統端對端實作

端對端構建企業級 RAG 系統:從需求分析到生產部署,涵蓋文件解析管線、Hybrid Search、Re-ranking、LLM 評估框架與 30 天迭代路線圖

·28 min aiengineering
40

Part 40 — AI 工程從零開始|Phase 18 Part 2:AI 治理與倫理 — 工程師的責任邊界

深入解析 AI 治理工程:EU AI Act/NIST AI RMF 合規架構、偏見偵測與緩解技術、資料隱私工程(差分隱私/聯邦學習)與 AI 稽核框架

·23 min aiengineering
39

Part 39 — AI 工程從零開始|Phase 18 Part 1:AI 技術安全 — 讓模型行為符合人類意圖

深入解析 AI 技術安全工程:對齊問題的技術根源、紅隊測試方法論、越獄攻擊分類、毒化攻擊防禦、模型可解釋性與安全評估框架

·23 min aiengineering