(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化

所在平台: Udemy

课程主页: https://www.udemy.com/course/generative_ai_28/

课程评论:没有评论

第一个写评论        关注课程

课程简介

這門課程是「(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化」。它建立在第27部的基礎之上,深入教授如何使用 PyTorch 實作 PPO (Proximal Policy Optimization) 和 DPO (Direct Preference Optimization) 這兩種主流的 AI 對齊技術。 課程的重點在於: * **PPO 對齊技術**:詳細解釋 PPO 的組成,包括損失函數、剪裁、Advantage Function、Value Function、Entropy 獎勵,以及 Frozen Model 和 KL 懲罰的應用,以確保訓練穩定性並鼓勵模型探索。 * **DPO 對齊革命性方法**:講解 DPO 如何從配對比較中學習人類偏好,推導 DPO 損失函數,並探討 KL 散度約束和 Lagrange 乘子技術。 * **PyTorch 實戰**:透過 PyTorch 實際操作,學員將能獨立實現 PPO 和 DPO 的訓練流程,以及 SFT (Supervised Fine-Tuning),並計算 Log Probability、KL 散度、Entropy 等關鍵指標。 學習本課程的目標是提升 LLM 的使用者友善性和精確度,掌握類似 ChatGPT 的策略調整機制,並跟上 AI 領域的對齊技術趨勢。

课程评论(0条)

课程详情

(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化課程會在(Ken Cen出品)Generative AI第27部的基礎上,深入發掘 PPO 和 DPO 對修正 AI 行為背後的原理的 Pytorch 實際操作。為什麼要學習 PPO 和 DPO?隨著大模型快速發展,我們愈來愈關注一個核心問題:模型的回答是否符合人類偏好?是否「對齊」人類的價值與需求?本課程介紹的 PPO(Proximal Policy Optimization) 和 DPO(Direct Preference Optimization) 是目前最主流的兩種對齊技術。掌握這些技術,你將能:訓練出 對使用者更友善、更精確的 LLM學會如何實作如 ChatGPT背後的策略調整機制跟上大型 AI 公司對「對齊問題(Alignment)」的技術趨勢課程內容重點介紹 PPO 對齊技術精解PPO 損失函數組成與剪裁(Clipping)避免模型劇烈更新,提升穩定性。Advantage Function & Value Function評估「採取行動比預期好多少」,是強化學習的核心。Entropy(熵)獎勵:鼓勵探索、避免陷入局部最優熵越高 → 模型更願意嘗試新策略。Frozen Model & KL懲罰:防止「作弊」學壞固定參考模型,並限制與其差異,防止模型偏離人類偏好。DPO 對齊革命性新方法從獎勵模型到 Bradley-Terry 偏好模型從 pairwise 比較中學習人類偏好。DPO 損失函數推導與數學解析解理論 + 工程實作,讓你掌握真正原理。KL 散度約束與 Lagrange 乘子技術精準控制策略偏移與對齊速度。 PyTorch實戰:從理論到實作你將學會如何用 PyTorch 完整實現:PPO 訓練流程:包括策略梯度、值函數損失、熵項與總損失計算DPO 訓練流程:用偏好資料直接優化策略,無需建立獎勵模型SFT(Supervised Fine-Tuning)監督微調流程計算 Log Probability、KL 散度、Entropy 等關鍵指標

课程标签

0人关注该课程

主题相关的课程