|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/programacion-con-apache-spark/
课程评论:没有评论
课程名称:使用Apache Spark处理大数据(西班牙语) 课程概述:该课程旨在教学生如何使用Apache Spark进行编程,这是处理大规模数据的高效且受欢迎的解决方案。Apache Spark在内存处理中比Apache Hadoop快100倍,而在磁盘处理上也快10倍。为了实现这种性能,Spark采用基于有向无环图(DAGs)任务的先进执行引擎,允许进行无环数据流和内存计算。Spark易于使用,支持Python、Scala、Java或R等多种编程语言,并提供超过80个高层操作符,便于开发可扩展的并行程序。学员将学习如何使用Python、Scala或R的交互式解释器,或借助Apache Zeppelin等工具进行操作。 Spark可以在单一PC上、搭载Hadoop YARN或Apache Mesos的集群中、或使用Amazon Elastic MapReduce和Microsoft HDInsight等云解决方案运行,并能访问HDFS、Cassandra、HBase、Hive、Tachyon及任何可由Hadoop访问的数据来源。课程将从Spark编程的基础元素——弹性分布式数据集(RDD)开始,讲解如何创建、转换和操作它们以处理文件。接下来将探讨提升和优化Spark代码的高级内容,最后深入了解Spark的高级解决方案,包括Spark SQL、Spark Streaming、用于机器学习的Spark ML以及图处理的GraphX。这些解决方案可以在同一应用程序中结合使用,以实现学习目标。
A través de este curso los alumnos aprenderán a programar con Apache Spark, la solución más eficiente y popular para procesar enormes cantidades de datos en clusters de cientos de máquinas. Spark es hasta 100 veces más rápido que Apache Hadoop si el procesamiento se hace en memoria y 10 veces más rápido si se hace en disco. Para conseguir este rendimiento, Spark incorpora un motor de ejecución avanzado basado en Grafos Dirigidos Acíclicos (DAGs) de tareas que permite el flujo de datos acíclico u la computación en memoria. Spark es fácil de usar, y permite utilizar diferentes lenguajes de programación, en concreto Python, Scala, Java o R. Ofrece más de 80 operadores de alto nivel que facilitan la creación de programas paralelos escalables a cientos o miles de máquinas. Y es posible utilizarlo de forma interactiva mediante los interpretes de Python, Scala o R, o utilizando herramientas como Apache Zeppelin, como veremos en este curso. Spark se puede ejecutar en un PC simple, en un cluster con Hadoop YARN o Apache Mesos, o en la nube, con soluciones como Amazon Elastic MapReduce o Microsoft HDInsight. Y puede acceder a datos almacenados el HDFS, Cassandra, HBase, Hive, Tachyon y cualquier fuente de datos accesible por Hadoop. Empezaremos viendo los elementos básicos de la programación Spark: los RDDs o Resilient Distributed DataSets. Veremos como crearlos, transformarlos y operar con ellos para procesar nuestros archivos.Continuaremos viendo aspectos avanzados para mejorar y optimizar nuestros códigos Spark y finalizaremos adentrándonos en el conjunto de soluciones de alto nivel de Spark: Spark SQL, Spark Streaming, Spark ML para problemas de Machine Learning, y GraphX para procesamiento de grafos. Todas estas soluciones pueden combinarse en la misma aplicación para alcanzar nuestros objetivos.