Big Data: procesamiento y análisis

所在平台: Coursera

课程主页: https://www.coursera.org/learn/big-data-procesamiento-analisis

课程评论:没有评论

第一个写评论        关注课程

课程简介

课程总结:大数据:处理与分析 本课程旨在介绍大数据处理与分析的基本方法和技术,并不深入探讨机器学习或统计方法,而是提供这些技术的主要特征,以便学生能够对数据分析的选项有一个整体的认识,从而探索、验证线索并提取结论。课程适合希望接触大数据处理和分析的学生和专业人士,尤其是那些已有一定数据分析基础或希望在大数据环境中提升分析能力的学习者。 课程采用虚拟机进行实际操作,利用Jupyter作为开发模型与技术的桥梁,运用PySpark进行数据分析。课程内容分为四个模块,虽然模块之间相对独立,但建议按顺序学习。 模块1主要介绍数据分析中的常见问题和技术,并引入相关的案例研究和工作工具,重点在于数据的探索和预处理,包括查询、管理任务、数值总结和图形。 模块2聚焦于基础建模技术,特别是线性回归和逻辑回归,涵盖模型的校准、验证和简化过程。 模块3专注于回归和分类树模型,包括随机森林,并探讨不确定性和过拟合等一般性问题。 模块4介绍神经网络分类技术以及基本的不监督技术,特别是通过主成分分析进行维度减少及自动分类,此外还要求学生完成一项实践作业以巩固所学内容。 课程结合视频讲解、小测验和论坛讨论,鼓励学生积极参与和交流,帮助他们更好地理解和掌握大数据分析的核心技能。

课程大纲

Name:INTRODUCCIÓN

Description:

Name:LA MÁQUINA VIRTUAL

Description:ATENCIÓN: Si ya te instalaste la máquina virtual en el curso anterior de la Especialización no es necesario que vuelvas a hacerlo. En caso contrario, sigue leyendo.

Los ejercicios y sesiones prácticas pretenden mostrar un caso práctico de procesamiento y análisis de datos en el contexto de Big Data. En este sentido, será necesario trabajar con una máquina virtual que ya trae configuradas e instaladas una serie de componentes habituales al manejar Big Data. En este apartado te explicamos cómo descargar e instalar la máquina virtual Cloudera en tu ordenador. La MV-Cloudera requiere disponer de un equipo con las siguientes características: (1) máquina de 64 bits, (2) mínimo 6G de memoria (recomendable 8G), y (3) 20G disponibles en disco.

Ten en cuenta que bajar e instalar la máquina virtual te llevará tiempo dado el tamaño y complejidad de la misma

Name:MATERIAL DE PRÁCTICAS Y FICHEROS DE TRABAJO

Description:Para poder seguir la parte aplicada del curso, responder a los cuestionarios y trabajar con las herramientas que te explicamos, necesitarás acceder a una serie de ficheros de código, así como las bases de datos de trabajo, que hemos recopilado y comprimido. Verás que algunos vídeos llevan un código entre paréntesis que coincide con el nombre de alguno de estos ficheros. Esto significa que en el vídeo correspondiente se trabaja con dicho fichero.

A continuación te explicamos como incorporarlos en la máquina virtual.

Name:MÓDULO 1 - Análisis Exploratorio de Datos

Description:Durante la primera semana del curso se introducen el curso y las herramientas que se emplearán. Además también se presentan las tareas relacionadas con el Análisis Exploratorio de Datos. Cada pocos temas tratados en los vídeos encontrarás un pequeño custionario de 5 preguntas.

Visualiza los vídeos, contesta los cuestionarios tantas veces como quieras, y accede a los foros para discutir los temas que te parezcan más interesantes.

Name:MÓDULO 2 - MODELOS DE REGRESIÓN

Description:En el módulo 2 del curso se introducen conceptos de modelización generales (calibración y validación) y en particular los modelos de regresión lineal y regresión logística. Desde la perspectiva de Big Data, se incluyen aspectos relacionados con la regularización de los modelos para su simplificación.

Como en el módulo anterior, visualiza los vídeos, contesta los cuestionarios tantas veces como quieras, y accede a los foros para discutir los temas que te parezcan más interesantes.

Name:MÓDULO 3 - ÁRBOLES DE REGRESIÓN Y CLASIFICACIÓN

Description:En el módulo 3 del curso se introduce la família de modelos basada en árboles (clasificación, regresión, bosques) y aspectos generales sobre la incertidumbre y el sobreajuste. Después de cada tema, o de unos pocos temas, encontrarás un cuestionario para comprobar tu nivel de comprensión de los mismos.

Visualiza los vídeos, contesta los cuestionarios tantas veces como quieras, y accede a los foros para discutir los temas que te parezcan más interesantes.

Name:MÓDULO 4 - REDES NEURONALES Y TÉCNICAS NO SUPERVISADAS

Description:En el módulo 4 del curso se introduce la família de modelos basada en redes neuronales así como se introducen las técnicas básicas no supervisadas, tanto de clasificación automática como de reducción de la dimensionalidad. En este módulo, además de los cuestionarios convencionales, tendrás que realizar un trabajo práctico en el que trabajarás las técnicas aprendidas hasta el momento.

Visualiza los vídeos, contesta los cuestionarios tantas veces como quieras, realiza el ejercicios práctico, y accede a los foros para discutir los temas que te parezcan más interesantes.

课程评论(0条)

课程详情

El presente curso tiene como objetivo presentar los métodos y técnicas básicos para el procesamiento y análisis de datos en el contexto de Big Data. No prentende ser un curso exhaustivo sobre Machine Learning ni sobre métodos Estadísticos, simplemente se pretenden mostrar las características principales de estas técnicas para que el alumno pueda tener una visión general de las opciones que ofrece el análisis de datos para poder explorar, confirmar indicios y en definitiva, extraer conclusiones. El curso está dirigido a estudiantes y profesionales que deseen aproximarse al procesamiento y análisis de datos en Big Data. Aunque no es un requisito indispensable tener experiencia en análisis de datos o en entornos Big Data, el curso puede resultar especialmente interesante a estudiantes con ciertos conocimientos de análisis de datos que deseen introducirse en el entorno Big Data, por otro lado, también resultará interesante a aquellos estudiantes con cierta experiencia en entornos Big Data que deseen adquirir una mayor visión analítica. En este sentido el curso pretende ofrecer recursos realistas en el contexto Big Data y por este motivo se trabajará des de una máquina virtual con la aplicación Jupyter como enlace para desarrollar los modelos y técnicas con PySpark. El curso está dividido en 4 módulos más o menos independientes aunque se recomienda realizarlos de forma secuencial. En el Módulo 1 se presentan los diferentes problemas y técnicas más habitules para analizar datos desde una perspectiva general. También se introduce el caso de estudio y las herramientas de trabajo que se emplearán. El resto de módulo está dedicado a la tarea de Exploración y Pre-Proceso de los datos, incluyendo consultas, tareas de gestión, resúmenes numéricos y gráficos. Los siguientes módulos se focalizan en las técnicas de análisis. El Módulo 2 se centra en técnicas de modelización básicas, en particular regresión y regresión logística. Además de repasar las etapas de calibración del modelo, también se incluyen las etapas de validación y simplificación. El módulo 3 está plenamente dedicado a la técnica de Árboles de Regresión y Clasificación. También se incluyen los bosques aleatorios. El módulo final contiene la técnica de Redes Neuronales para clasificación y también una introducción a las técnicas No Supervisadas, en particular, reducción de dimensión a través del análisis de componentes principales y la clasificación automática a través del análisis de clústers.

课程标签

0人关注该课程

主题相关的课程