Databricks Delta Lake: alta qualidade sobre seus dados

所在平台: Udemy

课程主页: https://www.udemy.com/course/databricks-delta-lake-alta-qualidade-sobre-seus-dados/

课程评论:没有评论

第一个写评论        关注课程

课程简介

课程名称:Databricks Delta Lake:提高数据质量 课程概述:这是数据工程领域的主要培训之一,针对那些希望利用Databricks工具对其数据进行更多控制、精炼和丰富的专业人士。我们将探讨建造Data Lakehouse的市场上主要功能,该功能正在革新云计算世界。课程特别适合希望从事Spark和高性能工作的人员,学习如何使用Databricks Delta Lake。 Databricks Delta Lake是一个开源项目,允许在Databricks的Data Lake上构建名为Lakehouse的架构。Delta Lake提供批处理和流式处理,此外还提供对数据的事务控制,具备以下特性: 1. **易用性**:其时间数据管理功能简化了数据管道,便利审计,允许在数据录入或删除出现故障时进行恢复,以及复现实验。 2. **审计**:在传统数据系统与大数据技术之间工作的组织需要审计数据,以确保合规性和便于调试,Delta Lake使这一过程变得更加简单。 3. **回滚**:在执行数据管道时,可能会写入不适当的数据(需要精炼和调整),当没有Delta Lake的本机时间旅行功能时,工程师往往需要设计复杂的管道。 4. **复现实验**:数据分析师或数据科学家为创建最佳实践而产生多个数据副本,导致存储成本增加。Delta Lake允许你使用存储的任何数据版本,数据会在DBFS中被记录和历史化。 Databricks Delta Lake代表了与SPARK处理引擎结合的现代云平台,能够本地控制所有数据事务。立即开始您的培训,提升数据处理能力!

课程评论(0条)

课程详情

Este é um dos principais treinamentos da área de engenharia de dados, que traz um conceito novo para estes profissionais que buscam mais controle, refinamento e enriquecimento de suas bases utilizando o ferramental do Databricks, estamos falando de uma das principais funcionalidades do mercado na construção de Data Lakehouse, que está revolucionado o mundo cloud, para quem deseja trabalhar com Spark e alta performance, vamos aprender a trabalhar com o Databricks Delta Lake.O Databricks Delta Lake é um projeto de código aberto que permite construir uma arquitetura chamada Lakehouse sobre o Data Lake no Databricks. O Delta Lake fornece processamento em batch, streaming em lote, além de controle de transações sobre os dados, como um banco de dados com as seguintes características:FACILIDADE: gerenciamento de dados temporais que simplifica seu pipeline de dados, facilitando a auditoria, a reversão de dados em caso de gravações ou exclusões de falhas acidentais e a reprodução de experimentos.AUDITORIA: organizações que trabalham com sistemas de dados tradicionais para tecnologias de Big Data sempre tem necessidade de auditar os dados, fundamental tanto em termos de conformidade de dados quanto de depuração simples para entender como os dados mudaram ao longo do tempo, isso o Delta Lake faz de forma nativa.REVERSÕES: os pipelines de dados ao serem executados, podem escrever dados não adequados (precisando de refinamento, ajustes), atualizações e exclusões, pode-se tornar muito complicado, e os engenheiros de dados normalmente têm que projetar um pipeline complexo, quando não contam com um recurso nativo do Delta Lake o Delta Time Travel.REPRODUZIR EXPERIMENTOS: analistas ou cientistas de dados projetam práticas recomendadas criando várias cópias dos dados, levando a um aumento dos custos de armazenamento. Tudo isso para simular a história dos dados, no Delta Lake você utiliza qualquer versão dos dados, pois eles ficam gravados e são historizados dentro do DBFS.O Databricks Delta Lake é o que de mais moderno em plataforma para cloud que utilizam o SPARK como seu motor de processamento e que permitem controlar todas as transações sobre seus dados de forma nativa.Então venha e comece hoje mesmo seu treinamento!

课程标签

0人关注该课程

主题相关的课程