(Ken Cen出品)Generative AI第26部 Mistral 語言模型的架構秘密

所在平台: Udemy

课程主页: https://www.udemy.com/course/generative_ai_26/

课程评论:没有评论

第一个写评论        关注课程

课程简介

課程名稱:(Ken Cen出品)Generative AI第26部 Mistral 語言模型的架構秘密 課程概述:本課程是Generative AI系列的延續,專注於Mistral大語言模型與原始Transformer模型之間的結構差異,深入講解大語言模型架構技術的原理。課程涉及的關鍵技術包括: 1. **滑動窗口注意力(Sliding Window Attention)**:通過限制注意力計算在固定大小的窗口內來減少計算量。 2. **滾動緩衝區緩存(Rolling Buffer Cache)**:在推理過程中用於保存中間計算結果的緩存技術。 3. **稀疏混合專家模型(Sparse Mixture of Experts, MoE)**:利用多個專家子網絡進行並行處理,以提升模型的容量和效率。 4. **KV緩存(Key-Value Cache)**:在注意力機制中儲存Key和Value的緩存,從而加速推理。 5. **前饋網絡(Feedforward Networks,Experts)**:在MoE中,負責處理不同輸入的多個獨立前饋子網絡。 6. **模型分片(Model Sharding)**:將模型參數分散到多個設備上以減少單一設備的負擔。 通過這些技術,學員將能夠深入理解大語言模型的運作原理及其架構設計的創新點。

课程评论(0条)

课程详情

本課程延續Generative AI 第 18~25 部,繼續講解大語言模型架構技術的原理,圍繞Mistral 大語言模型與原始 Transformer 之間的架構差異展開。其中包括如下技術:Sliding Window Attention - 滑動窗口注意力:限制注意力計算在固定大小窗口內,減少計算量Rolling Buffer Cache - 滾動緩衝區緩存:一種用於推理時保存中間計算結果的緩存技術Sparse Mixture of Experts (MoE) - 稀疏混合專家模型:利用多個專家子網絡並行處理,提升模型容量與效率KV 緩存 - Key-Value Cache:儲存注意力機制中Key和Value的緩存,加速推理Feedforward Networks (Experts) - 前饋網絡(專家):MoE中多個獨立的前饋子網絡,負責不同輸入的處理Model Sharding - 模型分片:將模型參數分散到多個設備上以減少單設備負擔

课程标签

0人关注该课程

主题相关的课程