Machine Learning para Competições Kaggle - Especial COVID-19

所在平台: Udemy

课程主页: https://www.udemy.com/course/machine-learning-competicoes-kaggle-covid-19-coronavirus/

课程评论:没有评论

第一个写评论        关注课程

课程简介

课程名称:Kaggle竞赛机器学习 - COVID-19特刊 课程概述:本课程旨在帮助数据科学家填补教育与现实世界Kaggle竞赛之间的差距,特别是在COVID-19相关的数据科学挑战中。该课程结合了科学研究和数据分析,利用来自不同组织(如美国疾病控制与预防中心、Allen Institute for AI等)的公共数据集,帮助解决全球疫情带来的复杂问题。 随着新冠病毒的传播及其对健康和经济的严重影响,多个机构联合开发了一个包含超过30,000篇关于COVID-19、SARS-CoV-2及冠状病毒的文章的数据库,旨在为研究人员和医疗专业人士提供必要的信息。课程中,我们将根据该数据库的挑战,在真实的背景下使用机器学习技术进行数据处理和模型构建。 课程内容分为三个主要部分: 1. **信息检索与文本挖掘**:我们将利用科学文章数据库,实施文本挖掘和自然语言处理技术,使用NLTK、spaCy和其他库进行数据准备与可视化,包括频次统计和词云图绘制。另外,我们还将开发基于TF-IDF的文本搜索系统。 2. **COVID-19死亡人数预测**:利用Kaggle中的相关数据集,通过回归算法预测每日死亡人数,实现对疫情发展趋势的分析。 3. **基于胸部X光片的COVID-19患者诊断**:通过使用TensorFlow 2.0的深度学习技术,应用卷积神经网络和迁移学习,对患者图像进行分类,以辅助医疗诊断。 课程将使用Python编程语言,在Google Colab平台上逐步实现以上分析,确保学员能够掌握所有必要的技能,以便参与相关竞赛并推动自己的研究。

课程评论(0条)

课程详情

De acordo com o CDC (Centers for Disease Control and Prevention), o novo coronavírus de 2019 é um vírus identificado como a causa de um surto de doença respiratória detectado pela primeira vez em Wuhan, na China. Desde o início, muitos dos pacientes do surto em Wuhan teriam algum vínculo com um grande mercado de frutos do mar e animais silvestres. Um número crescente de pacientes supostamente não teve exposição ao mercado de animais, indicando a ocorrência de disseminação de pessoa para pessoa. O vírus já se espalhou para praticamente todos os países do mundo, causando muitas mortes e sérios problemas na economia. Devido a isso, a Casa Branca dos Estados Unidos junto com pesquisadores e líderes do Allen Institute for AI, Chan Zuckerberg Initiative (CZI), Georgetown University's Center for Security and Emerging Technology (CSET), Microsoft, e o National Library of Medicine (NLM) at the National Institutes of Health lançaram uma base de dados com artigos publicados sobre o COVI-19, SARS-CoV-2 e vírus do grupo dos coronavírus. A base de dados possui mais de 30.000 artigos científicos sobre essas doenças, sendo que o objetivo principal é ajudar pesquisadores e profissionais da saúde obterem informações relevantes sobre esses assuntos. Leia alguns trechos do chamado (call to action) da Casa Branca: "A Casa Branca se une a essas instituições ao emitir um apelo à ação dos especialistas em inteligência artificial da nação para desenvolver novas técnicas de mineração de texto e dados que podem ajudar a comunidade científica a responder perguntas científicas de alta prioridade relacionadas ao COVID-19", "Precisamos nos unir como empresas, governos e cientistas e trabalhar para trazer nossas melhores tecnologias para a biomedicina, epidemiologia, IA e outras ciências. O recurso e desafio da literatura COVID-19 estimulará esforços que podem acelerar o caminho para soluções em COVID-19", "Uma das aplicações mais imediatas e impactantes da IA é a capacidade de ajudar cientistas, acadêmicos e tecnólogos a encontrar as informações corretas em um mar de artigos científicos para impulsionar a pesquisa mais rapidamente", "É difícil para as pessoas revisarem manualmente mais de 20.000 artigos e sintetizarem suas descobertas. Avanços recentes em tecnologia podem ser úteis aqui".Como essa base de dados foi postada como um desafio no Kaggle, é uma ótima oportunidade para testar as habilidades adquiridas em cursos iniciais, e ainda aprender novas habilidades necessárias para resolver problemas reais. Entretanto, fazer essa transição entre um ambiente educacional e aquele que encontramos no Kaggle, que imita os desafios que devemos encontrar no mercado de trabalho, tende a ser um degrau muito grande, pois a natureza dos dados e dos problemas propostos aumenta de complexidade num nível que os cursos básicos não contemplam. Pensando nisso, este curso tem o objetivo de preencher essa lacuna na formação dos cientistas de dados, mostrando detalhadamente como abordar os desafios, passando pelas fases de exploração e tratamento de dados, escolha de abordagem de solução, construção de um modelo, treinamento e validação. O entendimento desse processo é o primeiro passo para que os competidores possam desenvolver melhorias e começar sua escalada rumo ao topo dos rankings.Além da base de dados descrita acima, neste curso também focaremos em mais duas bases de dados relacionadas ao COVID-19. Com isso, o curso está dividido em três partes:Recuperação de informações de bases de dados de artigos: vamos usar a base de dados dos artigos científicos e aplicar várias técnicas de mineração de textos e processamento de linguagem natural, utilizando bibliotecas como NLTK (Natural Language Toolkit, spaCy, WordCloud e fuzzywuzzy. Focaremos na etapa de preparação e visualização dos textos, como por exemplo: contagem de termos frequentes, nuvem de palavras e aplicação de algoritmos para agrupamento, como o k-means! Implementaremos também sistemas de busca em textos que levam em consideração palavras-chave e similaridade entre documentos utilizando TF-IDF (Term Frequency - Inverse Document Frequency)Previsões de mortes por COVID-19: utilizaremos outra base de dados do Kaggle para prever as mortes diárias, utilizando algoritmos de regressãoDiagnóstico de pacientes com COVID-19 por meio do Raio-X do tórax: vamos utilizar modernas técnicas de Deep Learning com o TensorFlow 2.0, ou seja, redes neurais convolucionais e transferência de aprendizagem (transfer learning) para classificar imagens de pacientes doentes e saudáveis!Os códigos serão desenvolvidos utilizando a linguagem Python linha por linha e com o Google Colab, de forma que você entenda todas as análises necessárias para participar dessas competições!

课程标签

0人关注该课程

主题相关的课程