#RLHF
3 posts tagged "rlhf"
4
Part 4 — Hugging Face 實戰(四):後訓練 — 從 SFT 到 DPO、ORPO 與 GRPO
後訓練不只是再微調一次。完整解析 DPO / ORPO / KTO / SimPO / GRPO 與 PPO 的差異、偏好資料怎麼準備、TRL 的完整訓練程式碼,以及如何評估對齊效果與偵測 reward hacking。
18
Part 18 — AI 工程從零開始|Phase 9:強化學習基礎 — RLHF 與遊戲 AI 的根基
深入解析強化學習工程原理:MDP/Q-Learning/Policy Gradient/PPO/RLHF,理解 ChatGPT 背後的對齊訓練機制
開源 LLM Post-Training 全攻略:從 SFT 到 RLHF,手把手帶你訓練 Qwen
全面介紹開源 LLM 的 Post-Training 方法,包含 SFT、RLHF、DPO、ORPO、持續預訓練等技術,以 Qwen 為範例,深入分析各方法的優缺點、所需資源與適用場景,幫助你選擇最合適的訓練策略。