|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/pache-iceberg-e-spark/
课程评论:没有评论
课程名称:使用Apache Iceberg和Spark的数据工程 课程概述:欢迎来到使用Apache Iceberg和Spark的数据工程课程!本课程为希望掌握现代数据湖管理的专业人士提供了一种实用且全面的方法。该课程可在任何计算机上在线学习,无需复杂的基础设施,让您能够在云端进行学习和实践。所有支持材料均可下载,您将获得实用示例、脚本和额外文档,帮助您跟随课程内容并深入理解。 学习内容: - 使用时间旅行功能查询表的历史版本,适用于审计和历史分析。 - 创建和管理数据分区,优化查询性能,并确保数据存储和处理的高效性。 - 探索目录和元数据,获取有关架构、快照、历史记录和数据清单的详细信息。 - 数据压缩,提高数据湖的性能和管理,同时学习如何定义保留周期,以控制存储的大小和成本。 - 在不丢失数据或历史记录的情况下,演化表的架构。 - 持续插入和更新数据,使用合并(upsert)操作或将现有的Parquet文件纳入数据湖。 - 执行回滚操作,以恢复表的先前状态。 通过本课程,您将能够实施一个强大而高效的数据架构,充分利用Apache Iceberg和Spark在大数据环境中的潜力。欢迎参加!
Bem vindo a Engenharia de Dados com Apache Iceberg e Spark! Este curso oferece uma abordagem prática e completa para profissionais que desejam dominar a gestão de dados em Data Lakes modernos. Desenvolvido para ser executado de qualquer computador, este curso é realizado na nuvem, permitindo que você aprenda e pratique sem a necessidade de uma infraestrutura avançada. Com todo o material de apoio disponível para download, você terá acesso a exemplos práticos, scripts e documentação adicional, facilitando o acompanhamento das aulas e o aprofundamento no conteúdo.O que você vai aprender:Consultar versões anteriores de suas tabelas com o recurso Time Travel, essencial para auditorias e análises históricas. Também será capaz de criar e gerenciar partições de dados, otimizando a performance das consultas e garantindo que o armazenamento e o processamento de dados sejam eficientes. Explorar o catálogo e os metadados, possibilitando que você consulte informações detalhadas sobre schemas, snapshots, históricos e manifestos de seus dados.Compactação de dados, melhorando a performance e a gestão do Data Lake, além de ensinar como definir períodos de retenção para controlar o tamanho e o custo de armazenamento. A evolução do schema de tabelas sem perder dados ou históricos é outra característica fundamental que você vai aprender.Você vai aprender a inserir e atualizar dados continuamente com operações de merge (upsert) ou incorporar arquivos Parquet existentes ao seu Data Lake Realizar operações de rollback para restaurar estados anteriores de uma tabela. Com este curso, você estará preparado para implementar uma arquitetura de dados robusta e eficiente, aproveitando o potencial do Apache Iceberg e do Spark em ambientes de Big Data.Seja muito bem vindo!