|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/engenheiro-de-dados/
课程评论:没有评论
**课程名称:** 数据工程:精通大数据! **课程概述:** 本课程(最新更新于2022年9月)将带您全面掌握数据工程的核心技能,利用云端工具,只需一台联网的电脑即可开始学习。数据工程师是当今增长最快、需求量最大的职业之一,薪资待遇优厚,并拥有众多在跨国公司或海外工作的机会。 本课程是进入或深化数据领域最全面且易于理解的课程。您将学习到数据工程师的职责:构建、维护和提供企业所需的数据。面对日益复杂的数据环境,数据工程师需要掌握多种数据结构和技术。 **学习内容包括:** * **概念与基础:** 了解数据工程的根本原理。 * **分布式数据存储:** 掌握分布式存储系统的概念。 * **关系模型与SQL语言:** 深入学习关系型数据库的操作,SQL作为现今最重要的数据库模型之一,广泛应用于财务、薪资、库存等各个领域。 * **维度模型:** 学习用于构建数据仓库以支持决策制定的维度模型。 * **现代数据仓库与数据湖:** 了解现代数据仓库的列式存储和分区优化,以及数据湖的概念。 * **NoSQL数据库:** 探索面向文档和键值存储的NoSQL数据库(如MongoDB和Redis),用于处理半结构化数据。 * **Hadoop生态系统入门:** 了解这个在处理海量数据方面处于领先地位的生态系统。 * **Spark:** 学习Spark,这是数据工程和数据科学领域最重要的工具之一,能够高效处理大数据。 * **Python数据工程:** 掌握Python作为数据领域最重要命令式语言的应用。 * **流式数据应用(实时与近实时):** 学习如何处理连续产生并需要持续处理的流式数据。 * **ETL与数据爬虫:** 掌握数据提取、转换和加载(ETL)以及数据爬取等日常数据工程任务。 * **通过CLI管理服务:** 学习使用命令行界面管理各种服务。 **课程将涉及的工具:** Postgresql, S3, EC2, Redshift, Mongodb, Redis, Databricks, RDS, Kinesis, Glue, Athena。 **实践项目:** 课程最后将包含两个大型实践项目: 1. **构建数据湖** 2. **构建数据提取和转换(ETL)管道** **课程资源:** 课程提供所有学习材料,包括幻灯片和脚本,供您下载。
Totalmente atualizado em Setembro de 2022! Faça o utilizando ferramentas na nuvem, tudo o que você precisa é de um computador com acesso a internet!A Engenharia de Dados é uma das profissões que mais cresce no mundo, com alta demanda de profissionais e consequentemente salários cada vez maiores, além de muitas oportunidades para trabalhar para empresas estrangeiras ou mesmo para uma carreira no exterior!Este é mais completo e acessível curso para você entrar ou se especializar no mundo dos Dados!O Engenheiro de Dados é o profissional que constrói, mantém e disponibiliza dados em empresas. Com ambientes cada vez mais complexos, este profissional deve conhecer diversas estruturas e tecnologias de dados. Neste curso, você vai ter um panorama geral sobre as principais modelos e tecnologias de dados que encontramos no mundo da ciência de dados.Entre outras coisas, você vai estudar:Conceitos e FundamentosArmazenamentos de dados distribuidos Modelo Relacional e Linguagem SQL: Operação. Modelos relacionais estão em toda parte, são sistemas contabeis, folhas de pagamento, estoque, finanças etc. Embora este seja um modelo mais antigo de dados, é sem dúvida ainda o mais importante!Modelo Dimensional: Tomada de Decisão. Modelos dimensionais são utilizados para construir armazéns de dados, que nada mais são "depósitos" de informação utilizada para apoiar a tomada de decisão.Data Warehouse Moderno e Data Lake: Os armazens de dados modernos são estruturados em colunas e otimizados através de partiçõesNoSQL: Orientado a Documento e Chave Valor: Dados semi-estruturados com MongoDB e Redis. NoSQL é uma familia de bancos de dados para modelos diferenciados, para armazenar informações que não tem as restrições encontradas em sistemas de transações.Introdução do Ecossistema Hadoop: Este ecossistema que foi o pioneiro no processamento de grandes volumes de dadosSpark: O Spark é uma das mais importantes ferramentas de Engenharia e Ciência de Dados, capaz de processar grandes volumes de dados com alta performance.Engenharia de Dados com Python: O Python se tornou a mais importante linguagem imperativa no mundo dos dados.Aplicações em Streaming: Real Time e Near Real Time: Dados em streaming são aqueles que são produzidos e forma contínua, e que precisam ser processados de forma contínua. ETL e Data Crawlers: Extrair, transformar e entregar dados é uma tarefa de rotina na engenharia de dadosGerenciamento de serviços pela CLIAlgumas das ferramentas que serão utilizadas e estudadas durante o curso:PostgresqlS3EC2RedshiftMongodbRedisDatabricksRDSKinesisGlueAthenaVocê também terá dois grandes projetos práticos para desenvolver ao final do curso:Construção de um Data LakeConstrução de um Pipeline de Extração e Transformação de DadosO curso ainda traz todo material, como slides e scripts, disponíveis para você baixar.