Langfuse 入門 Part 3 — LLM 評估:Score、LLM-as-a-Judge、Dataset 與 Experiment

LLM 應用最難的問題:你怎麼知道它『答得好不好』?本篇拆解 Langfuse 的評估體系——用 Score 量化品質、用 LLM-as-a-Judge 自動評分、用人工標註校準、再用 Dataset + Experiment 在上線前做回歸測試,把『我覺得改好了』變成『數據證明改好了』。

·16 min

Langfuse 入門 Part 2 — 三行程式碼開始追蹤:SDK 整合與 Tracing 實戰

概念懂了,該動手了。本篇示範用 Langfuse Python SDK 把應用接上可觀測性:@observe 裝飾器、get_client 與 context manager、OpenAI 一行替換整合、LangChain callback handler,以及如何用 Session、User、Metadata 讓 trace 真正可查可比。

·15 min

Langfuse 入門 Part 1 — 為什麼 LLM 應用需要可觀測性?核心概念與資料模型

LLM 應用最可怕的地方,是它「壞掉時看起來跟正常時一模一樣」。本篇用最白話的方式講清楚:為什麼傳統監控救不了 LLM、Langfuse 是什麼、以及它的核心資料模型——Trace、Observation、Span、Generation、Session、Score——彼此怎麼組合成一張可觀測的全貌。

·14 min

finance_data 是怎麼運作的:用 Cron + LLM 全自動生成股票研究報告

finance_data 是一個全自動的 AI 投資研究平台:每天靠 GitHub Actions cron 定時觸發,用 yfinance 抓市場數據、爬 Finviz/StockAnalysis/Roic.ai 補齊基本面,再餵給 Claude / OpenAI / Gemini 生成繁體中文研究報告,最後由 MkDocs 建置部署。本篇完整拆解這條 pipeline 的每一個環節。

·17 min

ChatPDF RAG 優化(三):可觀測性與評估 —— Langfuse 追蹤、評估歷史、即時評分

沒有量測就沒有優化。本篇拆解 chatPDF 如何補上 RAG 的可觀測性最後一塊:opt-in 零開銷的 Langfuse 追蹤、執行緒安全的 singleton、評估歷史持久化、即時答案評分(faithfulness/relevance)、relevance gate,以及無外部依賴的 SVG 趨勢圖表。

·16 min

ChatPDF RAG 優化(二):後端強化與進階 RAG —— 安全、資源邊界、多查詢擴展

RAG demo 能跑,不代表能上線。本篇拆解 chatPDF 如何補上 production 該有的防線:上傳的 PDF magic bytes 驗證與 OOM 防護、BM25 的 LRU 快取、多查詢擴展、檢索評分過濾、頁碼級引用、LLM gateway 重試退避——把 RAG pipeline 從「能跑」變成「能扛」。

·17 min

ChatPDF RAG 優化(一):語意切塊與混合檢索 Semantic Chunking + Hybrid Retrieval

RAG 的成敗,八成決定在「切塊」與「檢索」這兩步。本篇拆解 chatPDF 如何從寫死的固定切塊,升級成 embedding 偵測語意轉折的 Semantic Chunking,以及如何把 dense 向量檢索與 BM25 關鍵字檢索融合成 Hybrid Retrieval——附完整 Python 實作與設計取捨。

·16 min

把站台從 3.1GB 砍到 503MB:finance_data 部署效能調校全紀錄

finance_data 是一個由 ~42 個每日分析任務自動產生報告的 MkDocs 站台,膨脹到搜尋索引 195MB、首頁 1MB、單次部署 752MB、CI 跑 15 分鐘。這篇拆解我們用六個改動把它降到搜尋索引 0.86MB、首頁 53KB、部署 387MB、CI 6.5 分鐘的完整過程與設計取捨。

·16 min

Cloudflare AI 安全稽核系統(三):LLM Agent 的安全反模式——十個讓報告失去公信力的做法

從 Cloudflare security-audit-skill 的設計原則出發,系統化整理 LLM agent 做安全稽核時最常見的十個反模式,以及如何在 agent pipeline 設計中從根源消除這些問題

·22 min

Cloudflare AI 安全稽核系統(二):Agent 設計深潛——Hunt 策略、Sub-Agent Spawning、Adversarial Validation

深入拆解 security-audit-skill 的 Agent 設計:Hunt phase 怎麼派 agent、sub-agent 什麼時候 spawn、adversarial validation 為什麼是 multi-agent 系統的核心防線

·20 min

Cloudflare AI 安全稽核系統(一):六階段 Multi-Agent Pipeline 全解析

Cloudflare 開源了內部 AI 安全稽核系統 security-audit-skill——一個教科書級的六階段 Multi-Agent Pipeline:Recon→Hunt→Validate→Report→Structured Output→Verify,本篇拆解整個架構設計與核心設計決策

·18 min

Stock Analysis - AVAV (AeroVironment) - 估值模型與投資裁決(下)

AeroVironment(NASDAQ: AVAV)三部曲完整選股分析(下):DCF 三情境機率加權、EV/Revenue 與本益比相對估值、可比國防股分析、足球場估值匯總、安全邊際、資本配置與股本稀釋,最終給出目標價區間與綜合投資裁決訊號——一檔崩跌 66% 後、財報在即的墜落天使,究竟貴還是便宜?

·23 min

Stock Analysis - AVAV (AeroVironment) - 技術面、籌碼面與市場情緒(中)

AeroVironment(NASDAQ: AVAV)三部曲完整選股分析(中):從 $417.86 崩跌 66% 後的下降趨勢、均線空頭排列、超賣反彈技術面,到內部人士交易、機構持股、12% 空頭興趣與軋空潛力、總體經濟與國防預算週期,全面拆解這檔「墜落天使」的籌碼與市場情緒。

·21 min

Stock Analysis - AVAV (AeroVironment) - 基本面與產業競爭力深度解析(上)

AeroVironment(NASDAQ: AVAV)三部曲完整選股分析(上):從無人機 / 巡飛彈(Switchblade)核心特許經營權、收購 BlueHalo 後的雙部門結構、損益表 / 資產負債表 / 現金流三表、Q3 FY2026 財報落空與 SCAR 訂單減記風險,到國防無人機產業五力與護城河,逐項拆解這家從 $417 腰斬至 $142 的國防無人機龍頭。

·22 min

Stock Analysis - PL (Planet Labs) - 估值模型與投資裁決(下)

Planet Labs(NYSE: PL)三部曲完整選股分析(下):DCF 三情境機率加權、P/S 與 EV/Revenue 相對估值、可比公司分析、足球場估值匯總、安全邊際、資本配置與股本稀釋,最終給出目標價區間與綜合投資裁決訊號。

·23 min

Stock Analysis - PL (Planet Labs) - 技術面、籌碼面與市場情緒(中)

Planet Labs(NYSE: PL)三部曲完整選股分析(中):從 $51.76 高點回落 45% 後的均線結構、支撐阻力、RSI / MACD / 布林通道,到內部人士交易、機構持股(含 Alphabet)、9% 空頭興趣、總體經濟與國防預算週期,全面拆解籌碼與市場情緒。

·21 min

Stock Analysis - PL (Planet Labs) - 基本面與產業競爭力深度解析(上)

Planet Labs(NYSE: PL)三部曲完整選股分析(上):從衛星對地觀測商業模式、損益表 / 資產負債表 / 現金流三表拆解、FY2026 首次調整後 EBITDA 轉正、Q1 FY2027 財報電話會議、到產業五力與競爭護城河,逐項拆解這家對地觀測龍頭的基本面。

·22 min

MiniMax M2.7 在 NVIDIA 平台上推動可擴展的智能工作流程,進一步強化複雜AI應用

MiniMax M2.7 版本不僅增強了其前一版本 MiniMax M2.5 的功能,還引入了多項創新特性,這些特性使得在 NVIDIA 平台上實現複雜 AI 應用的可擴展智能工作流程變得更加高效。本文將深入探討 MiniMax M2.7 的核心技術架構、實現細節及其在實際場景中的應用,並分析其性能優化和最佳實踐策略。

·25-30 min

Career-Ops 完全使用指南:AI 驅動的智能求職系統

深入講解 Career-Ops,一個由 AI 驅動的求職系統,幫助你在數百個工作機會中找到最適合的職位。涵蓋安裝、配置、使用技巧和策略,助力你高效求職。

·40 min

Harness 工程入門指南:AI 時代的基礎設施自動化

深入探討 Harness 在 AI 時代的角色,從基本概念、核心功能到實戰應用,幫助工程團隊建立高效的自動化部署流程,加速 AI 應用的上線速度。

·35 min

Hermes Agent 完全入門指南:自我改進的 AI 智能體

詳細介紹 Hermes Agent,一個具有自我學習和改進能力的 AI 系統。涵蓋核心功能、安裝步驟、配置方式和實際應用,幫助你快速上手這個強大的自主 AI 系統。

·35 min

LangGraph + AI 後端實戰:構建智能客服工單處理系統

詳細講解如何使用 LangGraph 和 AI 構建生產級的智能客服工單處理系統,涵蓋架構設計、Agent 定義、狀態管理、錯誤處理和實際案例,幫助你快速上線 AI 驅動的客服系統。

·45 min

LangGraph + LangChain 完全入門指南:從基礎到生產

全面介紹 LangChain 和 LangGraph 的核心概念、架構和實戰應用,涵蓋從簡單的 Chain 到複雜的多 Agent 工作流,幫助開發者快速掌握現代 AI 應用開發框架。

·50 min

LangGraph AI 後端創意應用:10 個生產級案例和未來方向

探索 LangGraph AI 後端在 10 個不同行業和場景的創意應用,從客服系統到內容創作、從數據分析到程式碼生成,展示 LangGraph 的真正潛力和未來發展方向。

·52 min

LangGraph AI 後端架構設計模式:從單體到分佈式

深入講解如何設計可擴展、高性能的 LangGraph AI 後端架構,涵蓋從單體應用到微服務的演進,包括 Agent 拓撲、數據流、錯誤恢復、分佈式協調等生產級設計模式。

·40 min