Spark y Python con PySpark en AWS para Big Data

所在平台: Udemy

课程主页: https://www.udemy.com/course/spark-python-pyspark/

课程评论:没有评论

第一个写评论        关注课程

课程简介

这个Coursera课程《Spark y Python con PySpark en AWS para Big Data》是Datademia数据工程训练营的一部分。课程旨在教授学员如何利用Spark和Python(PySpark)在AWS(Amazon Web Services)上进行大数据处理。 **主要内容包括:** * **大数据与并行计算入门:** 讲解大数据的概念、并行计算原理以及Apache Spark。 * **AWS环境配置:** 指导学员创建AWS账户,使用EC2创建虚拟机,并配置Spark和Jupyter Notebook环境。 * **Spark核心概念与技术:** * **RDDs (Resilient Distributed Datasets):** 学习Spark的弹性分布式数据集,这是Spark的基础抽象。 * **Spark SQL与DataFrames:** 掌握使用Spark SQL进行结构化数据处理,特别是DataFrames的操作。 * **Spark MLlib (基础):** 学习Spark机器学习库的基本语法,包括实现线性回归等机器学习算法。 **目标学员:** * 任何希望入门大数据领域,并学习使用Spark和Python进行数据处理的初学者。 **课程特点:** * **实践性强:** 课程注重实践操作,从零开始教授Spark的使用。 * **AWS集成:** 所有操作将在AWS云平台上进行。 * **理论与实践结合:** 每一步都将先讲解理论,再通过实际案例进行演练。 讲师Sebastian拥有多年在科技公司从事大数据工作的经验,从数据提取、处理到模型开发都有深入实践。课程鼓励学员观看介绍视频和免费课程,并提供平台内的私信交流渠道。

课程评论(0条)

课程详情

* Este curso es parte del Data Engineering Bootcamp de Datademia. Visita nuestra web para más información.Hola y bienvenidos a este curso de Spark y Python con PySpark.En este curso aprenderás lo que es la computación paralela utilizando Spark y Python con PySpark en un Jupyter notebook que corre en AWS (Amazon Web Services).Spark es un framework de programación para datos distribuidos y es de los más utilizados para el Big Data hoy en día. En este curso aprenderás a trabajar con Spark y sus RDDs, con Spark SQL y sus DataFrames y aprenderás la sintaxis básica de Spark ML, para algoritmos de aprendizaje automático o Machine Learning.Este curso está diseñado para cualquier persona que quiera empezar a meterse en el mundo del big data con Spark y Python.Es un curso totalmente práctico y dinámico en el que empezarás desde cero con Spark.Empezaremos con una introducción al big data, a la computación paralela y a Apache Spark.Luego os llevaremos paso a paso para crear una cuenta de AWS, crear una máquina virtual utilizando el sistema de computación EC2 y configurar todo lo necesario para poder utilizar Spark y Jupyter Notebooks en AWS.En las primeras partes del curso trabajaremos con Spark y su formato RDD (Resilient Distributed Datasets o Datos Distribuidos Resilientes). Luego trabajaremos con Spark SQL y sus DataFrames y acabaremos aprendiendo a implementar un algoritmos de regresión lineal en Spark ML.Como ves hay mucho temario. Iremos paso a paso explicando primero la teoría y después haciendo casos prácticos.Mi nombre es Sebastian y he trabajado durante muchos años en diferentes empresas tecnológicas con el Big Data en Barcelona. He trabajado siempre con datos, desde la extracción y manipulación de datos hasta la creación de dashboards y programación de modelos de aprendizaje automático.Te invito a que veas la presentación completa del curso y las lecciones gratuitas.Cualquier duda que tengas me puedes contactar por mensaje privado dentro de la plataforma.Te espero en el curso, un saludo y muchas gracias.

课程标签

0人关注该课程

主题相关的课程