|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/analisis-exploratorio-de-datos-con-python-y-r/
课程评论:没有评论
**课程名称:** 使用Python和R进行探索性数据分析 **课程概述:** 本课程旨在教授学员如何进行探索性数据分析(EDA),这是一个通过统计方法和可视化手段来理解和探索数据集的过程。EDA有助于识别数据的特征,如异常值、分布形态、趋势等,从而为后续的数据建模和预测奠定基础,是开启数据科学职业生涯的重要一步。 **课程内容摘要:** * **第一部分:数据与统计介绍** * 日常生活中的数据与统计应用。 * 理解数据的重要性与可信度。 * 课程简介及学习路径。 * **第二部分:统计学与EDA入门** * 统计学基本概念。 * 什么是探索性数据分析(EDA)。 * 描述性统计与推断性统计的区别。 * 课程将使用的软件介绍及其选择原因。 * **第三部分:Python和R环境设置与基础** * Python和R的下载与安装(Mac和Windows系统)。 * 软件界面的介绍与功能探索。 * Python和R中的主要数据结构及其处理方法。 * **第四部分:EDA实践:数据导入与预处理** * 使用Pandas, Numpy, dplyr, tidyr, ggplot等核心库进行EDA。 * 导入Excel、CSV和Stata文件。 * 数据转换、分组、过滤等预处理技术。 * **第五部分:数据可视化:常用图表** * 使用Python和R的绘图库生成各种图表。 * 学习条形图、饼图、以及更高级的图表类型。 * 通过可视化直观展示数据信息。 * **第六部分:描述性统计:集中趋势度量** * 学习描述性统计中的核心概念:集中趋势度量。 * 理解均值、中位数、众数和百分位数(包括四分位数、五分位数等)。 * 通过直方图和箱线图进行图形化展示。
El análisis exploratorio de datos (EDA, por sus siglas en inglés, Exploratory Data Analysis) es el proceso o tratamiento estadístico al cual se someten los datos de una muestra con la que se busca representar a una población. Incluye la elaboración de gráficos y estadísticos que permiten explorar la distribución de los datos, identificando características como: valores atípicos o outliers, saltos o discontinuidades, concentraciones de valores, forma de la distribución, etc. Esto permite conocer la naturaleza de los datos, entender su distribución y explorarlos mediante análisis estadístico, para posteriormente realizar el mejor modelo posible que permita sacar conclusiones sobre dichos datos. Este curso puede ser tenido en cuenta como un paso inicial para arrancar tu carrera como científico de datos (Data Scientist). Sección 1: Día a día vivimos rodeados de datos y estadísticas: cuando abrimos el periódico, cuando hacemos una transacción financiera, cuando vemos el noticiero, entre otros. Tenemos que asegurarnos de entender qué hay detrás de esos datos para asegurarnos de si debemos confiar o no en ellos. Además, podemos aprender a generarlos. Esta sección contiene la introdicción del curso y los pasos a seguir para completarlo satisfactoriamente.Sección 2: Esta parte del curso es una introducción a qué es la estadística, qué es el análisis exploratorio de datos y cuáles son las principales diferencias entre la estadística descriptiva y la inferencial. Además, veremos cuáles son los programas que se utilizarán durante el curso y cuál es la razón de que sean estos y no otros. Hasta acá, las dos primeras secciones del curso son cortas y concisas. En adelante, las siguientes son mucho más largas y contienen más material. Sección 3: En esta sección vamos a ver cómo se descargar los programas que soportan los lenguajes de programación Python y R, y vamos a ver cómo instalarlos en los dispositivos con sistema operativo Mac y Windows para poder usarlos de la mejor manera posible. Además, estudiaremos sus interfaces, para entender cómo funcionan y qué características tienen. Finalmente, veremos cuáles son las principales estructuras de datos en esos dos lenguajes de programación y cómo deben ser manejadas para no obtener errores en los resultados al manejar bases de datos y/o al crear nuevas variables.Sección 4: Una vez hemos instalado los principales programas que nos permite ejecutar Python y R, y habiendo explorado los principales tipos y estructuras de datos en estos dos lenguajes, esta sección nos introduce al Análisis Exploratorio de Datos (EDA, por sus siglas en inglés), a través de un conjunto de funciones iniciales que traen consigo las principales librerías descargadas e instaladas en la sección final del tema anterior: Pandas, Numpy y Matplotlib, en el caso de Python y; dplyr, tidyr y ggplot en R. Aprenderemos a importar bases de datos de Excel y otro tipo de archivos con extensión csv, siglas que responden a Comma Separated Values (en inglés) o valores separados por comas, así como archivos del programa estadístico Stata. A las variables contenidas en las bases abiertas les aplicaremos algunas transformaciones, agrupaciones, filtros y otras técnicas para su respectivo manejo y exploración. ¡Vamos con toda!Sección 5: Adicional a las librerías utilizadas para hacer transformaciones y manejos directamente a la base de datos, Python y R también tienen paquetes especializados para la generación de gráficos a partir de datos contenidos en datasets o a partir de datos que se le pueden indicar dentro del mismo código al gráfico deseado. En este caso, estaremos viendo algunos de los gráficos más utilizados en el análisis de datos, por lo básicos, pero efectivos que son a la hora de mostrar de una forma más agradable la información contenida en la base de datos: gráfico de barras, gráficos de porcentajes como el pie o torta, y otros gráficos un poco más avanzados.Sección 6: Ya ha conocido los dos programas y lenguajes de programación usados principalmente en la ciencia de datos, así como sus principales librerías, paquetes y funciones. Además, ha trabajado algunos de los manejos que se les pueden dar a los datos a través de Python y R, como filtros, agrupaciones, unión o pegado. Ahora, vamos a ver uno de los conceptos y mediciones primordiales de la estadística descriptiva: las medidas de tendencia central. Veremos acá la media, la mediana, la moda y los percentiles (cuartiles, quintiles, entre otros), así como los histogramas y boxplot para verlos gráficamente.