PySpark e APACHE HOP: processamento e pipelines de dados

所在平台: Udemy

课程主页: https://www.udemy.com/course/pyspark-e-apache-hop-processamento-e-pipelines-de-dados/

课程评论:没有评论

第一个写评论        关注课程

课程简介

**课程总结:PySpark 与 Apache Hop 数据处理与管道** 本课程结合了两大市场主流工具:Apache Hop 和 PySpark,专注于数据处理与集成任务。 **Apache Hop 部分:** * **可视化数据处理:** 学习使用 Apache Hop,一款强大的、100% 可视化的数据调整、处理、准备和文件生成工具。您无需编写代码,即可轻松快速地构建数据管道(Pipelines)和工作流(Workflows)。 * **丰富的组件:** Apache Hop 拥有超过 400 种插件或组件,能够处理几乎所有数据操作任务,包括: * 数据库准备 * 创建新字段 * 删除字段 * 创建计算字段 * 数据清洗与卫生处理等。 * **链式管道:** 课程将涵盖链式管道的构建,提供高度的实践性。 **PySpark 部分:** * **分布式处理:** 掌握 PySpark 的应用,了解如何创建集群、准备 Spark 环境。Spark 是分布式处理的基石,而 PySpark 则是 Spark 与 Python 的结合。 * **执行与转换:** 所有脚本将在 Apache Spark 环境中执行,Spark 会将处理任务分发到集群中的各个节点(NÓS)进行数据执行和转换。 * **核心模块:** 课程将重点学习以下 PySpark 模块: * PySpark RDD * PySpark DataFrame and SQL * PySpark Streaming **课程价值:** 本课程将帮助您利用 Apache Hop 的可视化能力高效地进行数据准备,并借助 PySpark 实现强大的分布式数据处理,全面提升您的数据处理与集成技能。

课程评论(0条)

课程详情

Unimos duas das principais ferramentas de mercado para realização das tarefas de tratamento e integração de dados, estamos falando do APACHE HOP e do uso do PySpark. Iniciaremos nosso treinamento com a incrível ferramenta de ajuste, tratamento, preparação e geração de arquivos de dados que é o APACHE HOP. Aprenderemos a manipular o dado com um produto 100% visual, onde você não precisa estar gerando código, você irá construir os famosos pipelines e workflows, tudo fácil e rápido de fazer. Teremos a construção de pipelines em cadeia, tudo muito prático e disponível. O APACHE HOP conta com + 400 plugin ou componentes para fazer praticamente tudo (preparação de base de dados, criação de novos campos, eliminação de campos, criação de campos calculados, limpeza ou higienização de bases, dentre outras atividades).Já com o uso do PySpark, você entenderá como criar um cluster, como preparar o SPARK que é o uso de processamento distribuído para a geração de seus scripts em python, a união do SPARK com o python gerou o PySpark.Toda a execução dos scripts são realizados dentro do Apache Spark, que distribui o processamento dentro de um ambiente de cluster que são interligados aos NÓS que realizam a execução e transformação dos dados.Vamos trabalhar com os seguintes módulos do PySpark:• PySpark RDD• PySpark DataFrame and SQL• PySpark StreamingEntão não deixe de realizar nosso treinamento e venha estudar conosco.

课程标签

0人关注该课程

主题相关的课程