Big Data Analytics con Python e Spark 2.4: il Corso Completo

所在平台: Udemy

课程主页: https://www.udemy.com/course/big-data-analytics-con-python-e-spark/

课程评论:没有评论

第一个写评论        关注课程

课程简介

CSDN 上的“大数据分析 Python Spark 2.4:完整课程”课程涵盖了利用 Python 和 Spark 2.4 进行大数据分析的全面方法。 **课程概述:** 本课程旨在教授学员如何使用当今最流行的编程语言 Python 以及强大的分布式计算框架 Spark 2.4 来处理和分析大数据。课程强调了在当今数据驱动的世界中掌握大数据分析技能的重要性,并将其比作“新石油”,能够为个人带来就业保障和竞争优势。 **核心内容:** 1. **大数据入门:** 介绍大数据的概念、来源及其应用价值。 2. **大数据技术概览:** 深入讲解 Apache Hadoop、Hadoop MapReduce 和 Spark,分析它们的异同、优缺点。 3. **Spark 安装与配置:** * 使用 VirtualBox 和 Ubuntu 在本地计算机上安装 Spark。 * 利用 Amazon Web Services (AWS) EC2 创建和配置远程 Spark 节点。 4. **Spark 集群构建:** * **AWS EMR (Elastic MapReduce):** 学习使用 AWS 托管的服务创建 Spark 集群。 * **DataBricks:** 了解并使用由 Spark 创始人联合创立的数据分析平台。 5. **Spark 核心数据结构 RDD (Resilient Distributed Dataset):** * 理解 RDD 的理论基础。 * 通过实践练习掌握 RDD 的 API 操作。 6. **实际案例分析 1:** 使用 RDD 分析包含 2250 万条亚马逊产品评论的数据集。 7. **Spark DataFrame:** * 介绍 Spark 中更高级的数据结构 DataFrame。 * 学习 DataFrame 的实际应用,包括创建 SQL 表。 * 执行 SQL 查询来分析数据。 8. **实际案例分析 2:** 使用 DataFrame 分析包含 2800 万条电影评论的数据集。 9. **时间序列分析:** 学习处理时间序列数据,并分析了 Apple 公司自 1980 年以来的股票数据。 10. **机器学习入门:** * 理解机器学习的概念和应用。 * 学习两种基础模型:线性回归(用于回归)和逻辑回归(用于分类)。 11. **Spark MLlib:** * 介绍 Spark 的机器学习库 MLlib。 * 学习使用 MLlib 的 DataFrame API 来解决实际的回归和分类问题,例如: * 根据房屋特征估算房价。 * 区分良性与恶性乳腺肿瘤。 12. **应用案例:情感分析:** * 利用机器学习和 MLlib 技术,使用超过 5GB 的 Yelp 评论数据集构建情感分析模型。 * 学习使用 AWS EMR 集群训练大型数据集,并掌握将数据从 S3 导入 HDFS 的 `s3-dist-cp` 工具。 13. **Spark Streaming:** * 介绍 Spark 的实时数据处理扩展 Spark Streaming。 * 学习实时分析和处理数据流。 14. **实际项目:Twitter 数据分析:** * 使用 Spark Streaming 和 Twitter API,实时监控特定主题的推文。 * 利用收集到的数据创建交互式图表,展示热门标签。 **课程价值:** 本课程为学员提供了在当今大数据时代取得成功的关键技能。通过对 Spark 和 Python 的深入学习,学员将能够有效地处理、分析和利用海量数据,从而获得职业发展和商业上的显著优势。

课程评论(0条)

课程详情

Impara a utilizzare le Ultime Tecnologie per l'Analisi dei Big Data con il linguaggio di Programmazione più popolare al mondo - Spark e Python!Siamo entrati nell'era dei Big Data, oggi i dati sono il nuovo petrolio e sapere come elaborarli e analizzarli vuol dire avere un posto di lavoro garantito in un futuro molto prossimo e un vantaggio competitivo enorme rispetto ai rivali in affari.In questo corso impareremo a lavorare con i Big Data utilizzando Spark, il framework per il calcolo distribuito più popolare al mondo, usato in produzione da giganti come Amazon, Microsoft, Oracle, Verizon e Cisco.Cosa faremo durante il corso ?Nella prima sezione del corso introdurre l'argomento Big Data, vedendo cosa sono, da dover arrivano e come possono essere sfruttati.Vedremo quali sono le principali tecnologie utilizzate per i Big Data: Apache Hadoop, Hadoop MapReduce e Spark, chiarendone le differenze, i punti deboli e i punti di forza.Nella seconda sezione vedremo come installare e configurare Spark su una macchina locale, prima usando VirtualBox per creare una macchina simulata sulla quale installare Ubuntu, poi creando una macchina remota sfruttando gli Amazon Web Service, nello specifico AWS EC2.Nella terza sezione impareremo a creare un cluster di macchine con Spark e lo faremo in due modi differenti:Usando AWS EMR (Elastic MapReduce) Usando DataBricks, piattaforma per l'analisi dei Big Data co-fondata dallo stesso creatore di Spark.Nella quarta sezione studieremo la principale struttura dati di Spark: il Resilient Distributed Dataset (RDD), introducendo la teoria del suo funzionamento per poi eseguire qualche esercizio pratico per studiarne le API.Nella quinta sezione ci sporcheremo le mani con il primo laboratorio in cui analizzeremo un dataset contenente 22.5 milioni di recensioni di prodotti su Amazon.Nella sesta sezione introdurremo una struttura dati a più alto livello che Spark mette a disposizione dalle sue versioni più recenti: il DataFrame, parleremo brevemente della suo funzionamento per poi vedere come può essere utilizzato nella pratica. Vedremo anche come creare una tabella SQL partendo da un DataFrame per poi interrogarla con query di selezione.Nella settima sezione svolgeremo un secondo laboratorio, usando un DataFrame per analizzare ben 28 milioni di recensioni di film.Nell'ottava sezione parleremo di serie storiche (time series) e analizzeremo le azioni di Apple dal 1980 ad oggi.Nella nona sezione parleremo di Machine Learning, scoprendo come funziona e a cosa serve e studiando i due modelli di base rispettivamente per modelli di Regressione e Classificazione:La Regressione LineareLa Regressione LogisticaAl termine di questa sezione introdurremo il modulo MLlib (Machine Learning Library) di Spark, il quale ci permette di costruire modelli di Machine Learning distribuiti.Nelle sezioni dieci e undici vedremo come utilizzare il modulo MLlib con le sue API per il Dataframe, per risolvere semplici problemi di regressione e classificazione, come:Stimare il valore di abitazioni partendo dalle loro caratteristicheRiconoscere un tumore al seno maligno da un'agobiopsiaNella sezione dodici utilizzeremo le conoscenze acquisite sul Machine Learning e MLlib per costruire un modello di Sentiment Analysis utilizzando il dataset di Yelp, il quale contiene oltre 5 GB di recensioni di locali e attività commerciali. Per addestrare il modello di Machine Learning sull'intero dataset così grande utilizzeremo un cluster AWS EMR, imparando a configurare un cluster e a importare grandi quantità di dati nel Hadoop File System (HDFS) da un bucket S3 utilizzando l'utility s3-dist-cp.Nella nona sezione introdurremo uno delle estensioni più hot di Spark: Spark Streaming, che ci permette di analizzare ed elaborare flussi di dati in tempo reale!Nella decima sezione svolgeremo un progetto usando Spark Streaming e le API di Twitter: monitoreremo tutti i tweets pubblicati in tempo reale, relativi ad un determinato argomento selezionato da noi, e creeremo un grafico interattivo con gli hashtags più popolari!Perché seguire questo corso ?I Big Data sono il futuro, sapere come sfruttarli sarà un vantaggio enorme, sia per un professionista che per un imprenditore, non perdere questa occasione!

课程标签

0人关注该课程

主题相关的课程