|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/ittensive-python-machine-learning-unsupervised/
课程评论:没有评论
课程名称:Python 无监督机器学习:完整课程 课程概述: 该课程旨在深入探讨无监督学习的方法,使用 Python 进行机器学习。课程将分为七个部分,涵盖从数据处理到模型构建的各个阶段,重点包括:数据降维、聚类及异常检测等主题。 第一部分:介绍数据处理的各个阶段,包括任务定义和机器学习模型的应用,旨在减少预测误差。同时将讨论机器学习模型的基本原理、基本指标以及简单模型(如线性回归、决策树和随机森林)的构建。 第二部分:实践数据清理和预处理(ETL),应用线性回归进行数据外推,并使用正则化技术来提取关键因素,并通过降低维度的信息标准创建简单模型的堆叠组合。 第三部分:探讨矩阵方法,包括主成分分析(PCA)、奇异值分解(SVD)和独立成分分析(ICA),并通过矩阵方法深入了解无监督学习问题的解决方案。 第四部分:研究非线性方法,如多维尺度分析(MDS)、t-SNE、UMAP 和 LargeVis,并利用稳定的降维模型预测俄罗斯的预期寿命,基于重要的宏观经济指标。 第五部分:学习基本的聚类模型,如 K-means 和 FOREL,并实践其应用,理解聚合聚类的原理,并在实际中使用马哈拉诺比斯距离和高斯混合模型(GMM)。 第六部分:深入了解高级聚类模型,包括 DBSCAN、HDBSCAN 和 OPTICS 的区别,学习自组织映射(SOM)及谱聚类的实现,并构建多种聚类模型的组合。 最后:学习异常检测及 pAUC 度量,使用 Smirnov-Grubbs 测试进行实践,进行椭圆体近似,比较 LOF 和 ABOD 模型,并训练使用 COPOD 模型及 iForest 隔离森林,最终完成 2020 年黑客松的项目解决方案。 该课程适合希望掌握无监督学习技术和应用的学习者,通过实践案例来提升解决实际问题的能力。
Внимание: для доступа к курсам ITtensive на Udemy напишите, пожалуйста, на support@ittensive.com с названием курса или группы курсов, которые хотите пройти.Мы разберем 2 задачи с хакатонов 2020 года:1. По выделению факторов, в наибольшей степени влияющих на продолжительность жизни в России, с точки зрения фундаментальных и прикладных подходов к понижению размерности данных. В заключении построим ансамбль моделей для предсказания продолжительности жизни, базируясь на выделенных факторах.2. По прогнозу срока экспозиции объявлений с хакатона Яндекс.Недвижимости - решим ее с помощью методов кластеризации и поиска аномалий.Курс разбит на 7 частей. В первой части мы последовательно пройдем все этапы работы с данными: от видов задач и их постановки до работы с моделями машинного обучения для минимизации предсказательной ошибки. Дополнительно рассмотрим фундаментальные основы построения моделей машинного обучения, базовые метрики и наиболее простые модели - линейную регрессии, решающие деревья и случайный лес. А также ансамбли машинного обучения.Во второй части на практике разберем:Очистку и предобработку данных - ETLЛинейную регрессию для экстраполяции данныхЛинейную регрессию с регуляризацией для выделения факторовИнформационные критерии понижения размерностиВ заключении создадим ансамбль стекинга из простых моделей понижения размерности.Третья часть посвящена матричным методам:Метод главных компонент (PCA)Сингулярное разложение (SVD)Анализ независимых компонент (ICA)Положительно-определенные матрицы (NMF)Уточним решение задачи обучения без учителя через матричные методы.В четвертой части рассмотрим нелинейные подходы:Многомерное шкалирование (MDS).t-SNEUMAPLargeVisСтабилизируем ансамбль понижения размерности и используем его для предсказания продолжительности жизни в России, основываясь на наиболее важных макроэкономических показателях.Пятая часть посвящена базовым моделям кластеризации:Изучите внешние и внутренние метрики кластеризации.Разберете модели К-средних и FOREL и потренируетесь в их применении.Рассмотрите принципы работы агломеративной кластеризации и используете ее на практике.Узнаете про расстояние Махаланобиса и работу GMM.В качестве задания соберем простую модель кластеризации исходных данных.В шестой части перейдем к продвинутой кластеризации:Погрузитесь в различия моделей DBSCAN, HDBSCAN и OPTICS.Разберете особенности модели распространения близости.Посмотрите на расширяющийся нейронный газ.Запустите и обучите самоорганизующиеся карты Кохонена (SOM).Столкнетесь с матрицей Кирхгофа и спектральной кластеризацией.И соберем ансамбль из несколько моделей кластеризации.В завершении:Изучите поиск аномалий и метрику pAUC.Используете тест Смирнова-Граббса на практике.Потренируетесь в эллипсоидальной аппроксимации.Разберете разницу между LOF и ABOD.Обучите и используете модель COPOD.Вырастите как iForest, как и расширенный лес изоляции.В финале соберем свое решение задачи Хакатона 2020 года.