|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/machine-learning-competicoes-kaggle-curso-2/
课程评论:没有评论
课程名称:Kaggle 竞赛机器学习 - 课程 2 课程概述:Kaggle平台上的数据科学竞赛为检验初级课程所学技能及学习解决实际问题所需新技能提供了极佳的机会。然而,从教育环境到Kaggle所模拟的市场挑战之间的过渡往往相当困难,因为数据性质和所提出问题的复杂性超出基本课程的范围。因此,本课程旨在弥补数据科学家培训中的这一空白,详细展示如何应对这些挑战,包括数据探索与处理、解决方案选择、模型构建、训练和验证的各个阶段。理解这一过程是竞争者开发改进并逐步攀升至排行榜顶端的第一步。 在本课程中,我们将重点关注两种主要的无监督机器学习任务:聚类与关联分析。在聚类部分,我们将使用FIFA足球2019的数据库,根据每位球员的技术特征、身高和体重将其聚类为技术档案。我们将利用k均值算法和sklearn库,探讨这些档案与球员原始位置之间的关系。 在关联分析部分,我们将探索Instacart市场购物篮分析的大型数据集,该数据集包含超过300万笔超市交易,涉及不同部门的多种产品。我们将基于两类数据集(购买习惯和产品联动)生成关联规则:购买习惯(天和时间、订单间隔)及哪些产品倾向于一起出售。我们将使用两种方法:一是使用apyori库生成规则,二是从零开始实现apriori算法! 我们将逐行使用Python语言和Google Colab开发所有代码,以确保您理解参与这些竞赛所需的所有分析!
As competições de Ciência de Dados como aquelas postadas na plataforma Kaggle são uma ótima maneira de testar as habilidades adquiridas em cursos iniciais, e ainda aprender novas habilidades necessárias para resolver problemas reais. Entretanto, fazer essa transição entre um ambiente educacional e aquele que encontramos no Kaggle, que imita os desafios que devemos encontrar no mercado de trabalho, tende a ser um degrau muito grande, pois a natureza dos dados e dos problemas propostos aumenta de complexidade num nível que os cursos básicos não contemplam. Pensando nisso, este curso tem o objetivo de preencher essa lacuna na formação dos cientistas de dados, mostrando detalhadamente como abordar os desafios, passando pelas fases de exploração e tratamento de dados, escolha de abordagem de solução, construção de um modelo, treinamento e validação. O entendimento desse processo é o primeiro passo para que os competidores possam desenvolver melhorias e começar sua escalada rumo ao topo dos rankings.Neste curso focaremos em duas das principais tarefas da aprendizagem de máquina não supervisionada: agrupamento e associaçãoCom relação ao agrupamento, vamos trabalhar com uma base de dados do jogo FIFA Soccer 2019 e usar as características técnicas de cada jogador, juntamente com a altura e peso para agrupá-los em um perfil técnico. Investigaremos as relações entre estes perfis e as posições originais dos jogadores utilizando o algoritmo k-means e a biblioteca sklearnNo que se refere a associação, vamos explorar o extenso conjunto de dados Instacart Market Basket Analysis com mais de 3 milhões de transações de supermercado, compreendendo uma enorme variedade de produtos de diferentes departamentos. Faremos a geração de regras de associação com base em duas coleções de dados: hábitos de compra (dia e hora, intervalo entre pedidos) e associação de produtos (quais produtos tendem a ser vendidos juntos). Usaremos duas abordagens: na primeira vamos usar a biblioteca apyori para geração das regras, enquanto que na segunda faremos a implementação do zero do algoritmo apriori!Vamos desenvolver todos os códigos utilizando a linguagem Python linha por linha com o Google Colab, de forma que você entenda todas as análises necessárias para participar dessas competições!