|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/master-querys-sql-pipelines-em-pyspark/
课程评论:没有评论
[课程名称]:Master Querys SQL + Pipelines em Pyspark [课程概述]: 本课程旨在帮助学员掌握数据领域两大关键技术:SQL和PySpark(Python+Spark)。课程首先从SQL入手,教授数据库查询的基础知识和核心技能,以简化日常数据处理工作。SQL是企业中最受欢迎和广泛使用的数据处理语言,尤其适用于数据操作。本课程适合有志于成为系统开发人员、数据库分析师、SQL分析师、DBA、商业智能分析师等数据相关职业的学员。学员将通过实践操作,理解和运用Oracle数据库的SQL查询和数据操作命令,并能直接查看结果。 随后,课程将深入PySpark。PySpark是Apache Spark的Python API,是处理大规模分布式数据和机器学习的分析处理引擎。PySpark具有诸多优势,包括: * **分布式内存处理**:高效且分布式的特点。 * **广泛的数据源支持**:可处理Hadoop (HDFS)、AWS S3等多种文件系统。 * **丰富的库**:内置机器学习和图计算库。 * **高性能**:相比其他数据系统,PySpark应用执行速度可提升100倍。 课程将通过在Apache Spark环境中执行Python脚本来展示PySpark的威力,Spark会将处理任务分发到集群中的节点(NÓS)进行执行和数据转换。 课程将涵盖以下PySpark模块: * PySpark RDD * PySpark DataFrame and SQL * PySpark Streaming 立即加入,开启您的数据技能提升之旅!
Este treinamento engloba duas grandes linguagens que vem revolucionando a área de dados e trazendo um interesse muito grande pelas empresas, que é a formação de profissionais que dominem tanto SQL quanto PySPARK ( Python+SPARK).Começamos o curso trabalhando com SQL, para você ter a base, ter o conhecimento principal da construção de consultas em banco de dados, facilitando e muito seu dia a dia.O Curso SQL na Prática para Oracle - Simples, Fácil e Rápido foi desenvolvido pensando em você que quer apreender os principais comando de Consulta e Manipulação de Dados com a Linguagem SQL. O SQL é simplesmente a linguagem de banco de dados mais solicitada e utilizada no mercado e pelas maiores organizações do mundo quando falamos de manipulação de dados em banco de dados.Esse conteúdo também foi preparado para você que quer trabalhar como Desenvolvedor de Sistemas, Analista de Banco de dados, Analista SQL, DBA, Business Intelligence e outros afins ligados a Banco de Dados.Neste treinamento você terá a oportunidade de ver na prática e também de praticar os comandos SQL explicados, visualizando os resultados da obtenção dos dados no banco de dados Oracle.Depois mergulharemos no Pyspark, trabalhando com uma série de scripts em python dentro do SPARK, algo que a maioria das empresas hoje necessita que seus colaboradores aprendam.Vamos entender que o PySpark é uma API Python para Apache SPARK que é denominado como o mecanismo de processamento analítico para aplicações de processamento de dados distribuídos em larga escala e aprendizado de máquina, ou seja, para grandes volumes de dados.O uso da biblioteca Pyspark possui diversas vantagens:• É um mecanismo de processamento distribuído, na memória, que permite o processamento de dados de forma eficiente e de características distribuída.• Com o uso do PySpark, é possível o processamento de dados em Hadoop (HDFS), AWS S3 e outros sistemas de arquivos.• Possui bibliotecas de aprendizado de máquina e gráficos.• Geralmente as aplicações criadas e executadas no PySpark são 100x mais rápidas que outras em sistemas de dados conhecidos.Toda a execução dos scripts é realizada dentro do Apache Spark, que distribui o processamento dentro de um ambiente de cluster que são interligados aos NÓS que realizam a execução e transformação dos dados.Vamos trabalhar com os seguintes módulos do PySpark:• PySpark RDD• PySpark DataFrame and SQL• PySpark StreamingEntão o que você está esperando, venha e comece hoje mesmo.