【PythonとSparkで始めるデータマネジメント入門】 ビッグデータレイクのための統合メタデータ管理入門

所在平台: Udemy

课程主页: https://www.udemy.com/course/datamanagement-spark-metadata/

课程评论:没有评论

第一个写评论        关注课程

课程简介

## PythonとSparkで始めるデータマネジメント入門:ビッグデータレイクのための統合メタデータ管理入門 本コースは、データエンジニアリング、特にAIや機械学習プロジェクトにおいて不可欠なメタデータ管理に焦点を当てた実践的な入門講座です。データサイエンスプロジェクトの80%以上を占めると言われるデータ準備と管理に、PythonとSparkを用いて効率的に取り組む方法を学びます。 **コースの概要:** * **データエンジニアリングの重要性:** データ準備と管理(データエンジニアリング)がAI・機械学習プロジェクトの生産性を左右することを強調します。 * **メタデータ管理の必要性:** データレイクやデータウェアハウスにデータを保存するだけでなく、データの所在、状態、意味、アクセス権限、アクセス頻度といったメタデータを適切に管理することの重要性を解説します。 * **3種類のメタデータ:** 以下の3種類のメタデータについて、PySparkを用いた算出方法とMySQLへの保存、そしてその活用方法までを実践的に学びます。 * **ビジネスメタデータ:** テーブル定義や説明など、データ利用に必要な情報。 * **テクニカルメタデータ:** データプロファイリングを通じて、データ特性を把握する方法。 * **オペレーショナルメタデータ:** Sparkのアクセスログ解析から、データの5W1H(いつ、どこで、誰が、何を、なぜ、どのように)を抽出する方法。 * **実践的なアプローチ:** 一つのテーブルを基に、PySparkを使用してこれらのメタデータを抽出し、MySQLに保存するプロセスを学習します。 **学習対象者:** * 普段Pythonを使用しており、AIやビッグデータの分野でデータエンジニアとして活躍したい方。 * データ分析の付加価値を高めたい方。 * 「データサイエンスのための前処理入門 PythonとSparkで学ぶビッグデータエンジニアリング(PySpark) 速習講座」を受講済みで、より深くメタデータ管理を学びたい方。 **コースの特徴:** * データエンジニアリングに特化しており、高度な数式や数学の知識は不要です。 * GitHubリポジトリで提供されるソースコードと解説に加え、動画での補足説明があります。 本コースを受講することで、データ活用の生産性を飛躍的に向上させるためのメタデータ管理スキルを習得できます。

课程评论(0条)

课程详情

現役のデータエンジニアがレクチャーします!AIや機械学習を行う際に最も時間のかかる作業は、データの準備とそれらの管理です。これらの作業のことをデータエンジニアリングと呼びます。実に80%以上の時間をデータエンジニアリング(データサイエンスのための前処理やメタデータ管理)に割いてるのが現状です。本コースではSparkを使ったデータエンジニアリングにおけるメタデータ管理について学びます。メタデータを管理しなければデータ組織の生産性低下は免れません。本コースを受講してデータを管理するという新たな方向へと舵を切りましょう。メタデータ管理とは、データ活用の生産性を高めるためのデータの設計書です。データはゴミ箱に捨てるようにただ「データレイク」や「データウェアハウス」に保存しておけばいいだけではなく、データがどこにあるのか?データはどのような状態なのか?データの意味合いはどのような意味なのか?データは誰にアクセスされているのか?データは何回アクセスされているのか?といったいわゆるメタデータをしっかりと管理することにあります。本コースは3種のメタデータ(下記ポイント参照)について、入門として一つのテーブルをもとにPySparkを用いて算出しMysql保存していく実践講座です。また保存するだけでなく、保存したメタデータの活用方法についても言及しています。ポイント:PySparkを使いながら以下の取得や算出を行います。ビジネスメタデータ:テーブル定義や、テーブルの説明など、データ利用をするのに必要なメタデータ管理を勉強します。テクニカルメタデータ:データプロファイリングを通した、データを検索せずともデータの特性をわかるようにするための方法を学びますオペレーショナルメタデータ:Sparkのアクセスログの解析を行い、データに関する5w1hを引き出します。いづれの情報もPysparkなどを使いながら算出していきます。「データサイエンスのための前処理入門PythonとSparkで学ぶビッグデータエンジニアリング(PySpark) 速習講座」を受講していると内容の理解がよりスムーズかと思います。特徴:データエンジニアリングよりの講座です。難しいいサイエンスや数学は出てきませんが、データの3職種のうちの一つである「データエンジニア」のためのコースです。普段Pythonを使っている方やこれからAIやビッグデータの分野にエンジニアとして参画してデータを自在に操りたいという方にはぴったりですメタデータを管理して、データ分析という行為にさらに付加価値を加えたい方ソースコードや解説は以下のGitHubリポジトリにあります。動画内ではGitHubの資料に加え補足をしながら解説を進めています。

课程标签

0人关注该课程

主题相关的课程