|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/python-spark-streaming/
课程评论:没有评论
**课程名称:** 数据科学中的流式数据预处理入门:使用Python和Spark开启大数据流式处理之旅 **课程概述:** 本课程由经验丰富的数据工程师授课,旨在教授学员如何进行大数据流式数据的预处理和管理。在人工智能和机器学习领域,数据准备和管理通常占据80%以上的时间,这被统称为数据工程。 本课程将重点讲解如何使用**Apache Spark**进行流式数据的工程化处理。Spark是当前大数据处理领域广泛使用的分布式处理引擎。课程将结合**Python**,通过**PySpark**教授流式处理的实践应用。 **核心内容包括:** * 流式处理的基础知识 * Avro数据格式 * Web应用程序中的用户追踪与流式数据的完整处理流程 **课程特点:** * **侧重数据工程:** 本课程更偏向数据工程领域,无需深厚的科学或数学背景。 * **面向数据工程师:** 专为希望成为数据工程师的学员设计,特别是那些熟悉Python并希望在大数据和AI领域灵活运用数据的工程师。 * **面向流式处理学习者:** 适合希望学习流式处理,以及消息队列和流式概念的人群。 **附加资源:** 课程提供了GitHub代码库,其中包含源代码和详细解释。授课视频将在GitHub资料的基础上进行补充讲解。
現役のデータエンジニアがレクチャーします!AIや機械学習を行う際に最も時間のかかる作業は、データの準備とそれらの管理です。これらの作業のことをデータエンジニアリングと呼びます。実に80%以上の時間をデータエンジニアリング(データサイエンスのための前処理や仕組み構築)に割いてるのが現状です。本コースではApache Sparkを使ったストリーミングのデータエンジニアリングについて学びます。ポイント:本コースでは分散処理のデファクトとなりつつあるSparkについて学びます。Apache Sparkはビッグデータ処理で多く使われている分散処理エンジンです。今回はPythonと組み合わせたPySparkを使ったストリーミング処理の講座です。ストリーミング処理の基本から、Avroフォーマット、Webアプリケーションにおけるユーザのトラッキングとストリーミングの一連の流れをこのコース一つで学ぶことが可能です。特徴:データエンジニアリングよりの講座です。難しいいサイエンスや数学は出てきませんが、データの3職種のうちの一つである「データエンジニア」のためのコースです。普段Pythonを使っている方やこれからAIやビッグデータの分野にエンジニアとして参画してデータを自在に操りたいという方にはぴったりですストリーミング処理を勉強してみたい方(メッセージキュー、ストリーミングについて学びたい方)ソースコードや解説は以下のGitHubリポジトリにあります。動画内ではGitHubの資料に加え補足をしながら解説を進めています。