Big Data: adquisición y almacenamiento de datos

所在平台: Coursera

课程主页: https://www.coursera.org/learn/adquisicion-almacenamiento-de-datos

课程评论:没有评论

第一个写评论        关注课程

课程简介

课程名称:大数据:数据获取与存储 课程概述:如果您对大数据的工具和应用有更深入的了解兴趣,那么本课程将非常适合您。在本课程中,您将学习理解大数据相关术语、基本概念和重要工具的基本原理,以解决数据分析的问题,特别关注实际问题和应用。课程目标是提供系统视角,以帮助您理解在处理大量数据时所面临的主要挑战。 课程内容包括对社区中常用工具如Hadoop、Spark和Hive的介绍,您需要通过使用这些工具来解决不同的数据分析挑战。课程结束后,您将掌握大数据工具生态系统的知识,包括在工业和科学问题中的使用实例。此外,您将获得关于如何将分析转化为数据收集、监控、存储、分析和结果报告的一系列资源,并学会根据工具的使用需求选择最合适的数据分析工具。 该课程面向计算机、工程或数学相关专业的大学生,以及其他具备编程知识并希望学习如何使用开源工具进行数据分析的学生。完成练习需要在个人电脑上安装虚拟机。 课程大纲: 1. 引言 2. 虚拟机 - 介绍如何下载并安装Cloudera虚拟机,需要满足硬件要求。 3. 模块1 - Apache Hadoop生态系统简介 - 介绍Apache Hadoop的基本概念及其在大数据分析中的应用。 4. 模块2 - SQL和NoSQL技术。一致性、可靠性和可扩展性 - 讲解NoSQL与关系数据库的区别,及CAP定理在分布式系统中的重要性。 5. 模块3 - 数据获取 - 介绍在将数据导入NoSQL系统时的挑战及Hadoop生态系统中重要工具的简介。 6. 模块4 - 工业数据分析工具 - 讨论大规模数据的工业分析,并介绍针对工业特定需求的第二代工具和系统。 通过本课程,您将获得解决大数据分析问题的知识与技能,为未来的学习和职业发展奠定基础。

课程大纲

Name:INTRODUCCIÓN

Description:

Name:LA MÁQUINA VIRTUAL

Description:A lo largo de estos cursos vamos a trabajar con un conjunto de herramientas contenidas en la máquina virtual Cloudera. En este apartado te explicamos cómo descargar e instalar dicha máquina virtual en tu ordenador.

La MV-Cloudera requiere disponer de un equipo con las siguientes características: (1) máquina de 64 bits, (2) mínimo 6G de memoria (recomendable 8G), y (3) 20G disponibles en disco.

Ten en cuenta que bajar e instalar la máquina virtual te llevará tiempo dado el tamaño y complejidad de la misma

Name:MÓDULO 1 - Introducción al ecosistema Apache Hadoop

Description:En este módulo se van a introducir los conceptos básicos sobre el uso de Apache Hadoop y su utilización para plantear análisis de grandes conjuntos de datos. Se van a presentar las herramientas principales y la arquitectura del sistema.

Visualiza los vídeos, contesta el cuestionario tantas veces como quieras, realiza el ejercicio práctico sobre Hadoop y HDFS, y accede a los foros para discutir los temas que te parezcan más interesantes.

Name:MÓDULO 2 - Tecnologías SQL y NoSQL. Consistencia, fiabilidad y escalabilidad

Description:En este módulo se introducen conceptos básicos sobre la naturaleza de los datos a tratar y de qué forma los sistemas NoSQL se diferencian de las bases de datos relacionales. Se presenta el teorema CAP y se muestra su importancia en el contexto de los sistemas distribuidos. Finalmente, se muestran una serie de sistemas junto con su uso en la industria actual.

Visualiza los vídeos, contesta el cuestionario tantas veces como quieras, y accede a los foros para discutir los temas que te parezcan más interesantes.

Name:MÓDULO 3 - Adquisición de datos

Description:En este módulo se presentan los desafíos que hay que resolver a la hora de incorporar datos a los sistemas NoSQL y una breve introducción a las herramientas asociadas al ecosistema Hadoop más importantes.

Visualiza los vídeos, contesta el cuestionario tantas veces como quieras, realiza el ejercicio práctico sobre Apache Scoop, y accede a los foros para discutir los temas que te parezcan más interesantes.

Name:MÓDULO 4 - Herramientas para el análisis de datos industrial

Description:En este módulo se presenta el análisis industrial de grandes volúmenes de datos y se introducen una serie de herramientas y sistemas de segunda generación dedicados a resolver necesidades específicas de la industria.

Visualiza los vídeos, contesta el cuestionario tantas veces como quieras, realiza los ejercicios prácticos sobre Apache Hive y Sparck, y accede a los foros para discutir los temas que te parezcan más interesantes.

课程评论(0条)

课程详情

¿Estás interesado en tener un conocimiento más detallado sobre las herramientas y aplicaciones Big Data? En este curso aprenderás los principios para comprender la terminología, conceptos básicos y herramientas más importantes para resolver problemas de análisis de datos enfocándonos en los problemas y las aplicaciones. El objetivo es proporcionar una visión de sistema para entender los retos más importantes que nos encontramos cuando trabajamos en entornos con grandes volúmenes de datos. En el curso se plantea una introducción a diversas herramientas utilizadas de forma común en la comunidad como Hadoop, Spark o Hive y tendrás que resolver diferentes retos de análisis de datos mediante su uso. Al terminar el curso habrás adquirido conocimientos sobre el ecosistema de herramientas Big Data incluyendo ejemplos de uso con problemas industriales y científicos. Tendrás una serie de recursos sobre cómo un análisis a realizar se traduce en una serie de operaciones de recolección de datos, monitorización, almacenamiento, análisis y creación de informes sobre los resultados obtenidos. También adquirirás un criterio para elegir cuál es la herramienta más adecuada para resolver un cierto problema de análisis de datos a partir de los requerimientos de uso de las herramientas. El curso está orientado tanto a estudiantes universitarios de primeros cursos de estudios universitarios relacionados con la informática, la ingeniería o las matemáticas, como a otros estudiantes con conocimientos de programación, interesados en aprender cómo utilizar de análisis de datos con herramientas de código abierto. Para realizar los ejercicios es necesario utilizar una máquina virtual que deberá ser instalada en tu ordenador.

课程标签

0人关注该课程

主题相关的课程