|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/generative_ai_27/
课程评论:没有评论
肯·陳出品的《生成式AI第27部:強化學習模型RLHF與策略梯度優化》課程,旨在深入講解強化學習(RL)的核心概念與技術,特別側重於實現 RLHF(基於人類回饋的強化學習)系統。 課程重點包括: * **獎勵模型(Reward Model)的構建**:探討如何利用獎勵模型評估模型行為的好壞,與傳統監督式學習依賴標註資料不同。 * **軌跡(Trajectories)及其在RL中的作用**:解釋由狀態、動作、獎勵組成的序列(軌跡),是計算期望報酬、更新策略和訓練模型的基礎。 * **強化學習(RL)演算法與策略梯度優化**:介紹RL如何讓模型透過與環境互動學習「好策略」,並詳述策略梯度(Policy Gradient)如何直接優化模型輸出機率以獲得高獎勵。 * **Advantage Function, Q Function, 和 Value Function**:闡述Value function評估狀態的「長期價值」、Q function評估狀態下採取動作的價值,以及Advantage function用於比較動作相對於平均策略的優劣,是降低估計方差的關鍵。 * **Off-Policy Learning與Importance Sampling**:講解Off-policy learning如何利用非當前策略產生的軌跡來訓練模型,提升數據利用率,並介紹Importance Sampling作為數學工具,用以修正策略不一致性帶來的偏差。 本課程不僅教授實作RLHF系統的技巧,更旨在從根本上理解語言模型如何在實際應用中通過微調和優化來符合人類偏好。
在本課程中,我們將深入學習一系列強化學習(Reinforcement Learning, RL)中至關重要的核心概念與技術。理解以下主題的原因不僅是為了能夠實作一個完整的 RLHF(Reinforcement Learning with Human Feedback)系統,更是為了從根本上理解語言模型在實際應用中如何被微調與優化,以符合人類偏好。課程內容:如何構建 Reward Model(獎勵模型) 在傳統監督式學習中,我們依賴標註資料來告訴模型什麼是對的;但在 RLHF 中,我們使用獎勵模型來評估模型行為的好壞如何計算 Trajectories(軌跡)及其在 RL 中的作用 在 RL 中,模型與環境互動後會產生一連串狀態、動作、獎勵的序列,這稱為一條軌跡(trajectory) 這些軌跡是我們計算期望報酬、策略更新、模型訓練的依據什麼是強化學習(RL)演算法 & 策略梯度優化 強化學習讓模型可以透過與環境互動逐步學習「好的策略」 策略梯度(Policy Gradient)是一種重要方法,能夠直接對模型輸出機率進行優化,使其更可能產生高獎勵的行為什麼是 Advantage Function、Q Function 和 Value Function Value function 評估某個狀態的「長期價值」。 Q function 評估某個狀態下,採取某個動作的價值 Advantage function 則比較某動作相對於平均策略的好壞,是降低估計方差的關鍵什麼是 Off-Policy Learning & Importance Sampling Off-policy learning 讓我們可以使用「非當前策略」產生的軌跡來訓練模型,提高數據利用率 Importance sampling 則是數學工具,讓我們能夠糾正這種策略不一致所產生的偏差