#TRL
2 posts tagged "trl"
3
Part 3 — Hugging Face 實戰(三):微調實戰 — Datasets、Trainer 與 LoRA/QLoRA
什麼時候才該微調?從資料準備、LoRA/QLoRA 原理、TRL SFTTrainer 完整訓練程式碼,到評估、合併、量化與部署的全流程。含超參數決策表與六種失敗模式診斷。
4
Part 4 — Hugging Face 實戰(四):後訓練 — 從 SFT 到 DPO、ORPO 與 GRPO
後訓練不只是再微調一次。完整解析 DPO / ORPO / KTO / SimPO / GRPO 與 PPO 的差異、偏好資料怎麼準備、TRL 的完整訓練程式碼,以及如何評估對齊效果與偵測 reward hacking。