|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/llms-buyuk-dil-modelleri-egitimi-uzmanlg-grpo-sft-dpo/
课程评论:没有评论
Coursera 课程“LLM (大语言模型) 微调专业技能:GRPO, SFT, DPO” 课程概述: 本课程将带您步入大语言模型 (LLM) 的世界,并从中学习端到端的基础和高级优化方法。课程将从 SFT (Supervised Fine-Tuning) 方法开始,通过实际示例,您将学习如何正确准备数据,以及如何使用 tokenizer 和 data collator 创建自定义数据集。在 SFT 过程中,您将学习如何使用 LoRA (Low-Rank Adaptation) 和量化方法使大型模型更轻便、更高效,并逐步了解如何在您的项目中应用这些技术。 在打牢 SFT 的基础之后,课程将进入 DPO (Direct Preference Optimization) 部分。DPO 允许您将用户反馈用户反馈直接映射到模型中,从而获得以用户为中心的结果。您将学习需要以何种格式准备数据、在应用此方法时如何设计奖励机制,以及如何在 Hugging Face 等流行平台上分享经过训练的模型。此外,您还将更深入地理解 DPO 过程中的 data collator 逻辑,并学习为不同场景准备和转换数据集的实践方法。 课程最重要的部分是日益流行且能产生强大结果的 GRPO (Group Relative Policy Optimization) 技术。通过 GRPO,您将学习如何优化模型行为,不仅是单个用户,还可以是社区成员或不同用户群体之间的。这使得大语言模型能够为不同受众或不同目的提供服务,变得更加系统化和有效。在本课程中,您将学习 GRPO 的基本原理,然后通过在真实数据集上进行实践示例来巩固这项技术。 在整个培训过程中,我们将结合 LoRA、量化、SFT、DPO,特别是 GRPO 等关键主题,并通过项目导向的应用程序来支持它们。总而言之,完成本课程后,您将能够自信地管理从端到端数据准备到模型微调和基于组的策略优化等所有阶段。现在,在您的项目中开发注重性能和用户满意度、现代且具有竞争力的 LLM 解决方案将变得更加容易!
Bu kursta, Büyük Dil Modelleri (LLM) dünyasına adım atarak hem temel hem de ileri düzey optimizasyon yöntemlerini uçtan uca öğreneceksiniz. Eğitime SFT (Supervised Fine-Tuning) yaklaşımıyla başlayıp, veriyi doğru biçimde hazırlamayı, tokenizer ve data collator kullanarak özelleştirilmiş veri setleri oluşturmayı pratik örnekler eşliğinde göreceksiniz. SFT sürecinde LoRA (Low-Rank Adaptation) ve quantization yöntemleriyle büyük modelleri daha hafif ve daha verimli hale getirmenin püf noktalarını öğrenecek, projelerinizde nasıl kullanabileceğinizi adım adım keşfedeceksiniz.SFT temellerini sağlamlaştırdıktan sonra, DPO (Direct Preference Optimization) bölümüne geçeceğiz. DPO, kullanıcı geri bildirimlerini modele doğrudan yansıtarak kullanıcı odaklı sonuçlar elde etme imkânı sunar. Veriyi hangi formatta hazırlamamız gerektiğini, bu yöntemi uygularken nasıl bir ödül mekanizması kurgulayabileceğimizi ve Hugging Facegibi popüler platformlarda eğitilen modelleri nasıl paylaşabileceğinizi göreceksiniz. Ayrıca DPO süreçlerinde data collator mantığını daha derinlemesine anlayarak, farklı senaryolar için veri seti hazırlama ve dönüştürme pratiklerini öğreneceksiniz.Kursun en önemli aşaması, giderek popülerleşen ve güçlü sonuçlar üreten GRPO (Group Relative Policy Optimization) tekniğidir. GRPO ile sadece bireysel değil, topluluk içi veya farklı kullanıcı grupları arasında da model davranışını optimize etmenin yöntemlerini öğreneceksiniz. Bu sayede büyük dil modellerinin farklı kitlelere veya farklı amaçlara hizmet etmesini sağlamak daha sistematik ve etkili hale geliyor. Kursta GRPO'nun temel prensiplerini öğrenecek, ardından gerçek veri setleri üzerinde uygulamalı örnekler yaparak tekniği pekiştireceksiniz.Eğitim boyunca, LoRA, quantization, SFT, DPO ve özellikle GRPO gibi kilit başlıkları bir arada işleyerek, her birini proje odaklı uygulamalarla destekleyeceğiz. Sonuç olarak, bu kursu tamamladığınızda, uçtan uca veri hazırlamadan model ince ayarına ve grup bazlı politika optimizasyonuna kadar tüm aşamaları güvenle yönetebileceksiniz. Kendi projelerinizde hem performans hem de kullanıcı memnuniyeti odaklı, modern ve rekabetçi LLM çözümleri geliştirmek artık çok daha kolay olacak!