|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/generative_ai_24/
课程评论:没有评论
课程名称:(Ken Cen 出品)Generative AI 第24部 使用 PyTorch 编写 Stable Diffusion 上部 课程概述: 本课程全方位解析 Stable Diffusion 及其背后的扩散模型(Diffusion Models),从理论到实践,帮助学员掌握从基础概念、数学原理到完整架构与编码实现的整套流程,并具备在实际项目中进行微调与推论的能力。 课程内容亮点: * **Stable Diffusion 概述**:介绍 Stable Diffusion 作为基于潜在扩散模型的深度学习文本生成图像框架。 * **生成模型与概率分布**:讲解生成模型如何学习数据概率分布,以高斯分布和变分推理为例。 * **扩散模型的正向与逆向过程**:详细阐述扩散模型如何逐步加噪及如何移除噪声还原数据,重点介绍马尔可夫链建模。 * **DDPM 论文数学原理**:深入解读 Denoising Diffusion Probabilistic Models 的数学原理,包括变分下界(ELBO)和重构误差项推导。 * **模型训练方法实作**:演示如何设置噪声日程、选择优化器与 loss 函数,并通过 PyTorch 实例展示完整训练流程。 * **采样生成新数据**:展示从随机噪声到最终影像的迭代采样算法,以及影响速度与质量的关键参数。 * **控制去噪过程**:介绍如何通过无分类器引导(classifier-free guidance)或自定义时间嵌入(time embeddings)来调节生成内容。 * **无分类器引导 (Classifier-Free Guidance)**:理解 "guidance scale" 如何在不依赖外部分类器的情况下提升生成质量,并提供代码示例。 * **CLIP 模型**:讲解 CLIP 模型如何通过对比学习将文本与图像映射到同一向量空间,学习通用视觉语义表示。 * **潜在扩散模型与 VAE**:介绍 VAE 如何将高维图像压缩至低维潜在空间,再利用扩散模型在潜在空间中进行操作。 * **Stable Diffusion 架构**:全面剖析 CLIP 文本编码器、VAE 编码器/解码器、U-Net 去噪网络以及整合管线。 * **编码器与解码器实现**:实作 VAE 编码器将图像映射到潜在表示,并演示如何用 U-Net 和注意力机制还原高分辨率影像。
本課程從理論到實作,全方位解析 Stable Diffusion 及其背後的擴散模型(Diffusion Models),幫助學員掌握從基礎概念、數學原理到完整架構與編碼實現的整套流程,並具備在實際專案中進行微調與推論的能力。Stable Diffusion 概述Stable Diffusion 是一款基於潛在擴散模型(Latent Diffusion Model)的深度學習文字生成影像框架,顛覆了 DALL·E 等專有模型的使用方式,開放源碼且可在常規 GPU 上運行 Wikipedia。生成模型與概率分布介紹生成模型(Generative Models)如何學習複雜數據的概率分布,並以高斯分佈與變分推理作為實例說明 Wikipedia。擴散模型的正向與逆向過程正向(forward)過程為逐步加入噪聲至數據;逆向(reverse)過程則學習將噪聲還原成數據的轉換,核心在於有限步數的馬可夫鏈建模 AI Summer。DDPM 論文的數學原理深入解讀 Jonathan Ho 等人提出的 Denoising Diffusion Probabilistic Models,包含變分下界(ELBO)分解與重構誤差項的推導 Wikipedia。模型訓練方法實作如何設置噪聲日程(βₜ schedule)、選擇優化器與 loss 函數,並透過 PyTorch 範例演示完整訓練流程 Medium。採樣生成新數據展示從隨機純噪聲到最終影像的迭代採樣(sampling)演算法,以及影響速度與品質的關鍵參數 Hugging Face。控制去噪過程演示如何透過無分類器引導(classifier-free guidance)或自定義時間嵌入(time embeddings)調節生成內容的細節與風格 Hugging Face。無分類器引導 (Classifier-Free Guidance)理解 "guidance scale" 如何在不依賴外部分類器的情況下提升生成品質,並提供範例程式碼示範。CLIP 模型CLIP(Contrastive Language-Image Pretraining)通過對比學習將文本與圖像映射到同一向量空間,借助 4 億對圖文數據學習通用視覺語義表示 Wikipedia。潛在擴散模型與 VAE講解 VAE(Variational Autoencoder)如何將高維圖像壓縮到低維潛在空間,再利用擴散模型在潛在空間中進行逐步噪聲與去噪 Wikipedia。Stable Diffusion 架構全面剖析架構:CLIP 文本編碼器、VAE 編碼器/解碼器、U-Net 去噪網絡,以及整合管線 超堆疊。編碼器實現實作 VAE 編碼器將圖像映射到潛在表示的細節,包括卷積層設計與參數初始化。解碼器實現演示如何根據潛在向量利用 U-Net 架構及注意力機制(self-attention)逐步還原高解析度影像。