(Ken Cen出品)Generative AI第18部 如何訓練DeepSeek大語言模型

所在平台: Udemy

课程主页: https://www.udemy.com/course/generative_ai_18/

课程评论:没有评论

第一个写评论        关注课程

课程简介

**課程名稱:**(Ken Cen出品)Generative AI第18部 如何訓練DeepSeek大語言模型 **課程概述:** 本課程由Ken Cen出品,旨在教授學員如何利用Python代碼,以低成本訓練強大的DeepSeek大語言模型。課程將深入剖析DeepSeek-R1的技術原理與性能優勢,該模型是中國AI企業DeepSeek開源的一項顛覆性突破,性能媲美OpenAI的頂級推理模型,但成本僅為其四十分之一,已引起全球科技巨頭和政界的廣泛關注。學員將從理論到實踐,親手操作,掌握成為下一代AI開發者的關鍵技能。 **課程內容詳情:** * **DeepSeek模型家族介紹:** 深入了解DeepSeek的發展歷程及其各個版本的技術特點,包括DeepSeek V1, V2, V3, R1-Zero, 以及核心的DeepSeek R1。 * **神經網絡基礎:** 全面解析神經網絡的組成與基本原理,包括前饋神經網絡的架構(輸入層、隱藏層、輸出層、Softmax、Logits、激活函數)及其在Python中的訓練方法(tensor, epoch)。 * **Transformer架構詳解:** 深入理解Transformer的核心機制,包括Attention機制、多頭自注意力(MHA)、分組查詢注意力(GQA)和多查詢注意力(MQA),以及位置嵌入(Positional Embedding)。 * **先進架構與技術:** 探索多頭注意力(MLA)、旋轉位置嵌入(RoPE)以及混合專家架構(MoE)等前沿技術。 * **Python實踐:** * 用Python編寫MLA的各層及整體結構。 * 學習如何將RotaryEmbedding集成到MLA中。 * 指導如何使用Python編寫混合專家架構。 * 詳細講解如何實現並編寫DeepSeek模型。 * 指導如何實現Transformer的Encoder和Decoder部分。 **學習目標:** 學員將能夠: * 理解DeepSeek大語言模型的技術優勢和應用前景。 * 掌握神經網絡和Transformer的底層原理。 * 熟練使用Python進行深度學習模型的開發與訓練。 * 具備獨立訓練和優化類似DeepSeek的大型語言模型的能力。 * 為成為下一代AI開發者打下堅實基礎。

课程评论(0条)

课程详情

掌握AI未來:用Python代碼拆解DeepSeek-R1,開啓低成本大模型訓練之旅-從理論到實踐,手把手教你成為下一代AI開發者 DeepSeek-R1:一場全球AI競賽的顛覆性突破2025年初,中國AI企業DeepSeek憑借開源模型DeepSeek-R1震撼全球,其性能與OpenAI的頂級推理模型o1旗鼓相當,但成本僅為後者的1/40!這一突破不僅讓亞馬遜、微軟等科技巨頭爭相接入,更引發美國政界與科技界的雙重震動課程包括內容:DeepSeek的發展與技術特點(DeepSeek V1, DeepSeek V2, DeepSeek V3, DeepSeek R1-Zero, DeepSeek R1, )神經網絡Neural Networks的組成和原理前饋神經網絡的原理&數據加載(輸入層,隱藏層, Softmax,Logits,激活函數,輸出層)如何用Python訓練前饋神經網絡(tensor, epoch)什麼是Transformer & Attention & MHA & GQA & MQA(Transformer, Attention, Positional Embedding)什麼是MLA & RoPE & MoE用Python編寫MLA的各層和結構如何添加RotaryEmbedding到MLA如何用Python編寫混合專家架構如何實現訓練和編寫DeepSeekModel如何實現 Transformer(Encoder, Decoder)

课程标签

0人关注该课程

主题相关的课程