|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/pyspark-ml/
课程评论:没有评论
## PySparkによる大規模データ処理手法と機械学習 コース概要 本コースは、Apache SparkのPythonライブラリであるPySparkを用いて、大規模データ処理と機械学習の基礎を実践的に学ぶコースです。 **コースのポイント:** * **未経験者歓迎:** 分散処理やSparkの基本から丁寧に解説するため、初心者でも安心して受講できます。 * **実践中心:** Apache Spark 3.2バージョンを使用し、Spark DataFrame, Spark SQL (一部), Spark MLlibを用いた実装を行います。 * **環境構築:** Dockerを用いて、受講者のPC環境に依存せず簡単に学習環境を構築できます。Docker環境が難しい場合は、Google Colaboratoryも利用可能です。 * **キャリアアップ:** 多くの大企業で活用されているSpark技術を習得し、今後のキャリアに活かすことを目指します。 **学習内容:** * 大規模データ処理手法 * HadoopとSparkの概要 * 機械学習の基本 * Dockerによる環境構築 * Pandasの復習 * Spark DataFrameによるデータ処理 * Spark SQL * Spark MLlibによる機械学習 **その他:** * コースリリース時からのPySparkバージョン変更により、一部コードが動作しない可能性があります。 * 購入後30日以内はキャンセル可能です。 PythonとSparkを共に学び、大規模データ時代のスキルを身につけましょう。
本コースでは、大規模データを高速分散処理するためのフレームワーク"Apache Spark"を人気のプログラミング言語Pythonで実践します。最近はビッグデータと呼ばれる大規模データを扱うケースがとても多くなってきており、そのようなデータを高速に処理するためには分散処理が必要になります。分散処理??Spark??と思う人も多いかと思いますが、このコースでは分散処理とは何か、Sparkとは何かといった導入から、実際にPython(PySpark)で実装するまでを全て行いますので、未経験の方でも学ぶことができます。皆さんのよく知る大企業でもSparkの技術はたくさん使われているので、この機会にSparkをPythonで扱う"PySpark"の扱い方を学び、これからのキャリアに活かしていただければと思います。本コースの実践パートでは、Spark3.2のバージョンでプログラミングを行います。実践内容はSpark DataFrame, Spark SQL(少し), Spark MLlibです。実行環境にはDockerを用います。Docker Hubを用いると自身のPCの環境を変えることなく、簡単に環境構築ができるのでオススメです。※ Docker環境をうまく作成できなかった方はGoogle Colaboratoryを使って実施してみてください。"!pip install pyspark"でインストールし、使うことができます。※ コースリリース時からPySparkのバージョンが変わっているために一部動かないコードがありますので、そちらご了承ください。本コースの内容大規模データの処理手法HadoopとはSparkとは機械学習の基本Dockerによる環境構築Pandasの復習Spark DataFrameによるデータ処理Spark SQLSpark MLlibによる機械学習本コースは購入から30日はキャンセルが可能なので、購入したけれど思っていた内容と違うという方はキャンセルしてください。それでは一緒にPython, Sparkを学んでいきましょう!