|
所在平台: Coursera |
课程主页: https://www.coursera.org/learn/developing-pipelines-on-dataflow-es
课程评论:没有评论
课程名称:无服务器数据处理与Dataflow:用西班牙语开发管道 概述:在这门关于Dataflow的系列课程的第二部分中,我们将深入探讨使用Beam SDK开发管道的过程。我们将首先复习Apache Beam的基本概念。接着,我们将讨论使用窗口、时间戳和触发器进行流数据处理。然后,我们将回顾管道中的源和接收器选项、结构化数据的表示方案,以及如何利用状态和计时器API进行状态转换。接下来,我们将介绍一些最佳实践,以帮助最大化管道的性能。课程结束时,我们将介绍如何使用SQL和Dataframes在Beam中表达业务逻辑,以及如何通过Beam笔记本以递归方式开发管道。 课程大纲: 1. **第一部分:源和接收器** - 描述:在本模块中,您将学习Google Cloud Dataflow中源和接收器的特性。模块中包含了文本输入/输出、文件输入/输出、BigQuery输入/输出、PubSub输入/输出、KafKa输入/输出、BigTable输入/输出、Avro输入/输出以及可分割的DoFn示例,同时也提供了与每种输入/输出相关的一些有用功能。 2. **第二部分:最佳实践** - 描述:在本模块中,我们将探讨最佳实践,并回顾一些常见模式,从而最大化您的Dataflow管道的性能。 3. **第三部分:总结** - 描述:在本模块中,将提供课程的总结内容。 此课程是对热爱数据处理和希望学习如何有效使用Dataflow和Beam进行流数据处理的开发者的理想选择。
Part: 1
Title:Fuentes y receptores
Description:En este módulo, aprenderá acerca de las características de las fuentes y los receptores en Google Cloud Dataflow. En el módulo hay algunos ejemplos de E/S de Text, E/S de File, E/S de BigQuery, E/S de PubSub, E/S de KafKa, E/S de BigTable, E/S de Avro y DoFn divisible. En el módulo también se indican algunas funciones útiles asociadas a cada E/S.
Part: 2
Title: Prácticas Recomendadas
Description:En este módulo, analizaremos las prácticas recomendadas y revisaremos patrones comunes que maximizan el rendimiento de sus canalizaciones de Dataflow.
Part: 3
Title:Resumen
Description:En este módulo, se ofrece un resumen del curso.
En esta segunda parte de la serie de cursos sobre Dataflow, analizaremos en profundidad el desarrollo de canalizaciones con el SDK de Beam. Comenzaremos con un repaso de los conceptos de Apache Beam. A continuación, analizaremos el procesamiento de datos de transmisión con ventanas, marcas de agua y activadores. Luego, revisaremos las opciones de fuentes y receptores en sus canalizaciones, los esquemas para expresar datos estructurados y cómo realizar transformaciones con estado mediante las API de State y de Timer. Después, revisaremos las prácticas recomendadas que ayudan a maximizar el rendimiento de las canalizaciones. Al final del curso, presentaremos SQL y Dataframes para representar su lógica empresarial en Beam y cómo desarrollar canalizaciones de forma iterativa con notebooks de Beam.