|
所在平台: Coursera |
课程主页: https://www.coursera.org/learn/batch-data-pipelines-gcp-jp
课程评论:没有评论
课程名称:在GCP上构建批量数据管道(日本语版) 课程概述:本课程探讨了数据管道的不同分类方式,包括抽取-加载(EL)、抽取-加载-转换(ELT)和抽取-转换-加载(ETL)。课程将介绍在何种情况下使用这些方式处理批量数据,并重点阐述在Google Cloud Platform上采用的数据转换技术,如BigQuery、Cloud Dataproc中的Spark执行、Cloud Data Fusion中的管道图,以及通过Cloud Dataflow实现的无服务器数据处理。学员将通过Qwiklabs实践,亲自构建Google Cloud Platform上的数据管道组件。 课程大纲: 1. **入门**:介绍课程内容及议程。 2. **批量数据管道构建的概述**:探讨数据读取的多种方法及EL、ELT、ETL的使用时机。 3. **在Dataproc上执行Spark**:展示如何在Dataproc上运行Hadoop,利用Cloud Storage,并优化Dataproc作业。 4. **使用Dataflow进行无服务器数据处理**:讲解如何使用Dataflow构建数据处理管道。 5. **使用Cloud Data Fusion和Cloud Composer管理数据管道**:探讨如何利用Cloud Data Fusion和Cloud Composer管理数据管道。 6. **课程总结**:对课程内容进行总结。 本课程旨在帮助学员掌握在Google Cloud Platform上构建和管理高效的批量数据管道技能。
Name:はじめに
Description:このモジュールでは、コースおよびアジェンダについて紹介します
Name:バッチデータ パイプラインの構築の概要
Description:このモジュールでは、データ読み込みに関するさまざまな方法を確認します。EL、ELT、ETL について、また何をどのタイミングで使用するか
Name:Dataproc での Spark の実行
Description:このモジュールでは、Dataproc での Hadoop の実行、Cloud Storage の活用、Dataproc ジョブの最適化の方法を示します。
Name:Dataflow を使用したサーバーレスのデータ処理
Description:このモジュールでは、Dataflow を使用してデータ処理パイプラインを構築する方法について説明します。
Name:Cloud Data Fusion と Cloud Composer を使用したデータ パイプラインの管理
Description:このモジュールでは、Cloud Data Fusion と Cloud Composer を使用したデータ パイプラインの管理方法について説明します。
Name:コースのまとめ
Description:コースのまとめ
データ パイプラインは通常、Extract-Load(抽出、読み込み)、Extract-Load-Transform(抽出、読み込み、変換)、Extract-Transform-Load(抽出、変換、読み込み)のいずれかの方式に分類されます。このコースでは、どの方式をどのような場合にバッチデータに対して使用すべきかを説明します。また、Google Cloud Platform 上のデータ変換技術(BigQuery など)、Cloud Dataproc での Spark の実行、Cloud Data Fusion でのパイプライン グラフ、Cloud Dataflow によるサーバーレスのデータ処理についても取り上げます。Qwiklabs を使用して、Google Cloud Platform でデータ パイプライン コンポーネントを実際に構築できます。