|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/manipulacao-de-dados-em-grande-escala-com-pyspark/
课程评论:没有评论
Coursera 课程摘要:使用 PySpark 进行大规模数据处理 本课程旨在赋能学员使用 Python 和强大的 PySpark 库来处理海量数据。课程从 Python 编程基础讲起,逐步深入到更复杂的概念。 **课程内容面向不同角色:** * **数据分析师:** 学习从数据源查询、进行必要的数据转换,最终将数据准备成适合分析和可视化的理想格式。 * **数据科学家:** 掌握利用 Spark 的处理能力进行数据清洗,并为使用机器学习库构建预测模型奠定基础。 * **数据工程师:** 深入理解数据源和目标数据的各种格式,将原始数据转换为更适合分析的格式,同时获得优化查询性能和选择最佳处理策略的技巧。 通过本课程,学员将能够高效地管理和处理不断增长的数据量,提升数据工作的效率和能力。
Todas as empresas coletam e armazenam dados para diferentes finalidades. À medida que a empresa cresce, torna-se vital armazenar e processar esses dados de forma adequada e em grandes volumes. Com isso em mente, criei este curso com o objetivo de capacitar os alunos a manipular dados utilizando Python, uma linguagem amplamente reconhecida e a mais utilizada para esse propósito, juntamente com a poderosa biblioteca PySpark.Vamos começar com os fundamentos da programação em Python e, em seguida, avançar para conteúdos mais complexos.Para Analistas de Dados: Você aprenderá todo o processo, desde a consulta nas fontes de dados, passando pelas transformações necessárias, até a preparação dos dados no formato ideal para análise e visualização.Para Cientistas de Dados: O conteúdo deste curso será inestimável para a limpeza de dados, aproveitando a capacidade de processamento do Spark, além de possibilitar o uso de bibliotecas de Machine Learning na construção de modelos preditivos.Para Engenheiros de Dados: Assim como eu, você utilizará este curso para compreender os diferentes formatos de origem e destino dos dados e realizar transformações de dados brutos em formatos mais adequados, facilitando o trabalho dos analistas de dados. Além disso, você receberá diversas dicas para melhorar o desempenho das consultas e escolher a melhor estratégia de processamento.