|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/spark-pyspark/
课程评论:没有评论
《Spark与PySpark》课程概述 本课程旨在教授如何使用Spark处理海量数据(大数据),涵盖数据清洗和构建机器学习模型等环节。Spark的强大之处在于,它能将开发者的指令分布式地发送到多个“工作节点”上执行,这些节点并行处理数据并返回结果。整个过程在后台自动完成,让开发者能专注于编写代码。 课程特点: * **易于上手**:Spark的操作并不复杂,核心任务包括数据加载(通常来自文本文件)、数据过滤、添加/删除列、基于现有数据生成新列、处理缺失值、去除无关值以及合并多表数据。课程将详细介绍完成这些操作所需的具体命令。 * **PySpark重点**:Spark支持Python、SQL、Scala和R等多种编程语言。本课程专注于Spark的Python API——PySpark。因此,具备Python基础知识是学习本课程的必要条件。 * **循序渐进的学习路径**:课程从介绍Spark的运行环境入手,然后逐步深入各个数据处理领域,每节课都会增加新的函数和技巧。 * **丰富的学习资源**:每节课都提供视频讲解、练习题及GitHub上的参考解决方案。课程最后还有机会完成一个小项目。此外,课程还包含一份PDF手册,内有课程笔记和练习题。 * **行业应用广泛**:掌握Spark对于数据科学、机器学习和人工智能领域至关重要,这些领域都离不开数据处理。Spark在Databricks、Synapse和Microsoft Fabric等多种产品中有广泛应用。随着数据量的持续增长,理解和准备数据变得越来越重要。 **讲师**:Rafał **立即加入本课程,学习强大的数据处理和分析工具Spark,开启你的大数据分析之旅!**
Spark to narzędzie, którego możemy użyć do przetwarzania ogromnych ilości danych - Big Data - i to zarówno na etapie ich oczyszczania, ale też później podczas budowania modeli uczenia maszynowego. Ta moc Sparka bierze się z tego, że jedno niewinne polecenie jest w tle rozsyłane przez Sparka do wielu maszyn zwanych workerami, które te dane przetwarzają i odsyłają gotowe wyniki, ale… bez obaw - wszystko dzieje się w tle, a developer po prostu skupia się na tym co lubi najbardziej, czyli pisaniu działającego kodu. I o pisaniu takiego kodu jest ten kurs.Jakkolwiek by to brzmiało - Spark nie jest trudny. Dane trzeba wczytać, tyle tylko że wczytujemy je najczęściej z luźnych plików. Trzeba je odfiltrować, dodać kolumnę, usunąć kolumnę, w oparciu o istniejące dane wyznaczyć nowe. Znaleźć braki i je czymś uzupełnić, a wyeliminować wartości niepotrzebne. Czasami dane są rozrzucone między wiele tabel. W takim przypadku trzeba je ze sobą połączyć. Do każdej z tych operacji mamy odpowiednie polecenie i na tym kursie możesz je poznać.Spark to platforma, która pozwala na pisanie swoich programów w Pythonie, SQL, Scali czy języku R. W tym kursie zajmujemy się pythonową wersją API Sparka, zwaną PySpark. Dlatego znajomość podstaw pracy z Pythonem jest tutaj niezbędna.Na kursie zaczynamy od kilku propozycji środowiska w jakim można pracować ze Sparkiem. Następnie przyglądamy się poszczególnym obszarom pracy z danymi i z lekcji na lekcję powiększamy zbiór znanych funkcji. Do każdej lekcji dostajesz do dyspozycji materiał video zadania wraz z propozycjami rozwiązania tych zadań na GitHub. Na zakończenie kursu możesz podjąć się zbudowania małego projektu. Do kursu jest też dołączony podręcznik PDF z krótką notatką z lekcji i treścią zadań.Warto znać Sparka, bo w Data Science, Machine Learning czy AI, od danych się nie ucieknie. Spark pracuje w wielu innych produktach, jak np. Databricks, Synapse czy Microsoft Fabric. A tych danych jest coraz to więcej i ktoś musi je zrozumieć i przygotować.Dlatego zapraszam na kurs „Spark i PySpark. Obejrzyj lekcje próbne, dodaj kurs do koszyka i poznaj potężne narzędzie do obróbki i analizy danych - Spark - Twój klucz do analizy Big Data.Twój trener, Rafał