データサイエンスのための前処理入門PythonとSparkで学ぶビッグデータエンジニアリング(PySpark) 速習講座

所在平台: Udemy

课程主页: https://www.udemy.com/course/python-spark-pyspark/

课程评论:没有评论

第一个写评论        关注课程

课程简介

**课程名称:** 数据科学入门:使用Python和Spark学习大数据工程(PySpark)速成课程 **课程概述:** 本课程由现役数据工程师授课,专注于数据工程领域。在进行人工智能和机器学习项目时,数据准备和管理通常是最耗时的工作,即所谓的“数据工程”。目前,数据工程(包括数据科学中的预处理)占用了超过80%的时间。 本课程将重点介绍如何使用 Apache Spark 进行数据工程。Spark 已成为分布式处理的事实标准,广泛应用于大数据处理。通过熟悉的 CSV 格式,您将学习如何结合 Python 使用 PySpark。 **课程特点:** * **侧重数据工程:** 本课程偏重数据工程实践,不涉及复杂的科学或数学知识。 * **面向数据工程师:** 课程专为“数据工程师”这一数据领域的三大职业之一而设计。 * **适合人群:** 适合日常使用 Python,并希望掌握数据操作以进入人工智能或大数据领域的工程师。 **学习内容:** * **Apache Spark:** 学习作为大数据处理和分布式处理引擎的 Spark。 * **PySpark:** 通过 CSV 数据格式,学习使用 Python 驱动 Spark。 * **数据准备和管理:** 掌握数据工程的核心技能,解决数据科学项目中耗时的数据准备问题。 **补充资源:** 课程提供 GitHub 仓库,其中包含源代码和详细解释。讲师将在视频讲解中,在 GitHub 资料的基础上进行补充说明。

课程评论(0条)

课程详情

現役のデータエンジニアがレクチャーします!AIや機械学習を行う際に最も時間のかかる作業は、データの準備とそれらの管理です。これらの作業のことをデータエンジニアリングと呼びます。実に80%以上の時間をデータエンジニアリング(データサイエンスのための前処理など)に割いてるのが現状です。本コースではApache Sparkを使ったデータエンジニアリングについて学びます。ポイント:本コースでは分散処理のデファクトとなりつつあるSparkについて学びます。Apache Sparkはビッグデータ処理で多く使われている分散処理エンジンです。今回はPythonと組み合わせたPySparkを、馴染みのあるCSVフォーマットを通して学びます。特徴:データエンジニアリングよりの講座です。難しいいサイエンスや数学は出てきませんが、データの3職種のうちの一つである「データエンジニア」のためのコースです。普段Pythonを使っている方やこれからAIやビッグデータの分野にエンジニアとして参画してデータを自在に操りたいという方にはぴったりですソースコードや解説は以下のGitHubリポジトリにあります。動画内ではGitHubの資料に加え補足をしながら解説を進めています。

课程标签

0人关注该课程

主题相关的课程