O que é um Data Lake? Definição. ArchiArquitetura e Melhores Práticas

⚡ Resumo Inteligente

A arquitetura Data Lake armazena dados estruturados, semiestruturados e não estruturados em formato nativo, sob um design plano. Cada elemento recebe um identificador único e tags de metadados, permitindo a análise sem um esquema corporativo predefinido.

  • 🗄️ Definição Essencial: Um repositório que armazena todos os tipos de dados em formato bruto, sem limite fixo para o tamanho da conta ou do arquivo.
  • ???? Estrutura de Níveis: Ingestão, armazenamento, destilação, processamento, insights e operações unificadas formam os seis níveis arquitetônicos.
  • 🔑 Componentes chave: Ingestão, armazenamento, governança, segurança, qualidade, descoberta, auditoria, linhagem e exploração devem funcionar em conjunto.
  • 📈 Caminho de Maturidade: Quatro etapas levam uma organização da ingestão bruta à governança empresarial completa dentro do lago.
  • ⚖️ Contraste de Armazém: Os data lakes aplicam esquemas na leitura para cientistas de dados, enquanto os data warehouses aplicam esquemas na gravação para relatórios de negócios.
  • ⚠️ Risco primário: O fraco controle de acesso e a ausência de supervisão transformam um lago sem governança em um pântano de dados inutilizável.

O que é um Data Lake? Archiarquitetura

O que é Data Lake?

Um Data Lake é um repositório de armazenamento que pode armazenar uma grande quantidade de dados estruturados, semiestruturados e não estruturados. É um local para armazenar todos os tipos de dados em seu formato nativo, sem limites fixos de tamanho de conta ou arquivo. Oferece alta quantidade de dados para aumentar o desempenho analítico e integração nativa.

Data Lake é como um grande contêiner muito semelhante a lagos e rios reais. Assim como em um lago, você recebe vários afluentes, um data lake possui dados estruturados, dados não estruturados, máquina a máquina, registros fluindo em tempo real.

lago data
lago data

Como mostra a ilustração acima, vários fluxos separados alimentam um único conjunto de dados armazenados. O Data Lake democratiza os dados e é uma maneira econômica de armazenar todos os dados de uma organização para processamento posterior. O analista de pesquisa pode se concentrar em encontrar padrões significativos nos dados, e não nos dados em si.

Ao contrário de uma hierarquia Armazém de dados onde os dados são armazenados em arquivos e pastas, o Data Lake tem uma arquitetura plana. Cada elemento de dados em um Data Lake recebe um identificador exclusivo e é marcado com um conjunto de informações de metadados.

Por que DataLake?

O principal objetivo da construção de um data lake é oferecer uma visão não refinada dos dados aos cientistas de dados.

Os motivos para usar o Data Lake são:

  • Com o surgimento de mecanismos de armazenamento como Hadoop armazenar informações díspares tornou-se fácil. Não há necessidade de modelar dados em um esquema empresarial com um Data Lake.
  • Com o aumento do volume de dados, da qualidade dos dados e dos metadados, a qualidade das análises também aumenta.
  • Data Lake oferece agilidade aos negócios
  • Machine Learning e a Inteligência Artificial pode ser usada para fazer previsões lucrativas.
  • Oferece uma vantagem competitiva para a organização implementadora.
  • Não há estrutura de silo de dados. O Data Lake oferece uma visão de 360 ​​graus dos clientes e torna a análise mais robusta.

lago data Archiarquitetura

lago data Archiarquitetura
lago data Archiarquitetura

A figura mostra a arquitetura de um Business Data Lake. Os níveis mais baixos representam dados que estão principalmente em repouso, enquanto os níveis mais altos mostram dados transacionais em tempo real. Esses dados fluem pelo sistema com pouca ou nenhuma latência. A seguir estão as camadas importantes no Data Lake Architextura:

  1. Nível de ingestão: as camadas do lado esquerdo representam as fontes de dados. Os dados podem ser carregados no data lake em lotes ou em tempo real
  2. Nível de insights: As camadas à direita representam o lado da pesquisa onde os insights do sistema são usados. SQL, consultas NoSQL ou mesmo Excel podem ser usadas para análise de dados.
  3. HDFS é uma solução econômica para dados estruturados e não estruturados. É uma zona de destino para todos os dados que estão inativos no sistema.
  4. Nível de destilação Extrai dados da camada de armazenamento e os converte em dados estruturados para facilitar a análise.
  5. Camada de processamento execute algoritmos analíticos e consultas de usuários em lotes interativos e variados em tempo real para gerar dados estruturados para análise mais fácil.
  6. Camada de operações unificadas rege o gerenciamento e monitoramento do sistema. Inclui auditoria e gerenciamento de proficiência, gerenciamento de dados, Gestão de fluxo de trabalho.

Lago de dados chave Concepts

A seguir estão os principais conceitos do Data Lake que é preciso entender para entender completamente o Data Lake Archiarquitetura

Ingestão de Dados

A ingestão de dados permite que os conectores obtenham dados de diferentes fontes de dados e carreguem no Data Lake.

A ingestão de dados suporta:

  • Todos os tipos de dados estruturados, semiestruturados e não estruturados.
  • Múltiplas ingestões, como lote, tempo real e carregamento único.
  • Muitos tipos de fontes de dados, como bancos de dados, servidores Web, e-mails, IoTe FTP.

Armazenamento de dados

O armazenamento de dados deve ser escalável, oferecer armazenamento econômico e permitir acesso rápido à exploração de dados. Deve suportar vários formatos de dados.

Governança de dados

A governança de dados é um processo de gerenciamento de disponibilidade, usabilidade, segurança e integridade dos dados usados ​​em uma organização.

Total

A segurança precisa ser implementada em todas as camadas do Data Lake. Tudo começa com armazenamento, desenterramento e consumo. A necessidade básica é impedir o acesso de usuários não autorizados. Deve suportar diferentes ferramentas para acessar dados com GUI e painéis fáceis de navegar.

Autenticação, contabilidade, autorização e proteção de dados são alguns recursos importantes da segurança do data lake.

Qualidade de dados

A qualidade dos dados é um componente essencial da arquitetura de Data Lake. Os dados são usados ​​para gerar valor comercial. Exemplo:tracExtrair informações de dados de baixa qualidade levará a informações de baixa qualidade.

Descoberta de dados

A descoberta de dados é outro estágio importante antes de começar a preparar dados ou análises. Nesta etapa, a técnica de tagging é utilizada para expressar a compreensão dos dados, organizando e interpretando os dados ingeridos no Data lake.

Auditoria de dados

Duas tarefas principais de auditoria de dados são: tracalterações do rei no conjunto de dados principal.

  1. Tracking alterações em elementos importantes do conjunto de dados
  2. Captura como/quando/e quem muda esses elementos.

A auditoria de dados ajuda a avaliar o risco e a conformidade.

Linhagem de Dados

Este componente lida com as origens dos dados. Ele trata principalmente de para onde os dados se movem ao longo do tempo e o que acontece com eles. Facilita a correção de erros em um processo de análise de dados, da origem ao destino.

Exploração de Dados

É o estágio inicial da análise de dados. Ajuda a identificar o conjunto de dados correto, é vital antes de iniciar a exploração de dados.

Todos os componentes fornecidos precisam trabalhar juntos para desempenhar um papel importante na construção do Data Lake, evoluir e explorar facilmente o ambiente.

Plataformas populares de Data Lake

As camadas descritas acima geralmente são montadas a partir de serviços de nuvem gerenciados, em vez de serem construídas do zero. As plataformas abaixo abrangem as camadas de armazenamento e catalogação com as quais a maioria das implementações começa.

  • Amazon S3 com formação de lago AWS: Armazenamento de objetos combinado com um serviço que registra as fontes, define permissões e cria o catálogo de dados. Veja o Tutorial da AWS para o ecossistema em geral.
  • Azure Armazenamento de Data Lake Gen2: Adiciona um namespace hierárquico acima do Blob Storage, o que proporciona segurança em nível de diretório e acesso mais rápido às análises.
  • Google Cloud Armazenamento com BigLake: Combina armazenamento de objetos com uma camada de consulta que lê diretamente formatos de tabela abertos.
  • Apache Hadoop com HDFS: A opção original de instalação local ainda é utilizada quando os dados precisam permanecer dentro de um centro de dados privado.
  • Databricks e Snowflake: Plataformas que sobrepõem formatos de tabela, como Delta Lake e Apache Iceberg sobre armazenamento de objetos para adicionar transações e versionamento.

A seleção normalmente segue o provedor de nuvem que a organização já utiliza, visto que a ingestão e ferramentas de inteligência de negócios integrar-se da maneira mais econômica possível dentro de um único ecossistema.

Estágios de maturidade do Data Lake

A definição dos estágios de maturidade do Data Lake difere de livro para outro. Embora o ponto crucial permaneça o mesmo. Após a maturidade, a definição do estágio é do ponto de vista leigo.

Estágio 1: Processar e ingerir dados em escala

Esta primeira etapa da Maturidade de Dados envolve melhorar a capacidade de transformar e analisar dados. Aqui, os empresários precisam encontrar as ferramentas de acordo com suas habilidades para obter mais dados e construir aplicativos analíticos.

Etapa 2: Construindo o músculo analítico

Esta é uma segunda etapa que envolve melhorar a capacidade de transformar e analisar dados. Nesta fase, as empresas utilizam a ferramenta mais adequada ao seu conjunto de competências. Eles começam a adquirir mais dados e a construir aplicativos. Aqui, os recursos do data warehouse corporativo e do data lake são usados ​​juntos.

Estágio 3: EDW e Data Lake trabalham em uníssono

Esta etapa envolve colocar dados e análises nas mãos do maior número de pessoas possível. Nesta fase, o data lake e o data warehouse corporativo passam a funcionar em união. Ambos desempenhando seu papel na análise

Estágio 4: Capacidade empresarial no lago

Neste estágio de maturidade do data lake, os recursos empresariais são adicionados ao Data Lake. Adoção de governança da informação, capacidades de gerenciamento do ciclo de vida da informação e gerenciamento de metadados. No entanto, muito poucas organizações conseguem atingir este nível de maturidade, mas este número aumentará no futuro.

Melhores práticas para implementação de Data Lake

  • Archicomponentes estruturais, sua interação e produtos identificados devem suportar tipos de dados nativos
  • O design do Data Lake deve ser orientado pelo que está disponível e não pelo que é necessário. O esquema e o requisito de dados não são definidos até serem consultados
  • O design deve ser orientado por componentes descartáveis ​​integrados à API de serviço.
  • A descoberta, ingestão, armazenamento, administração, qualidade, transformação e visualização de dados devem ser gerenciados de forma independente.
  • A arquitetura do Data Lake deve ser adaptada a um setor específico. Deve garantir que as capacidades necessárias para esse domínio sejam uma parte inerente do projeto
  • A integração mais rápida de fontes de dados recém-descobertas é importante
  • O Data Lake ajuda na gestão personalizada para extract valor máximo
  • O Data Lake deve apoiar técnicas e métodos existentes de gerenciamento de dados corporativos

Desafios de construir um data lake:

  • No Data Lake, o volume de dados é maior, então o processo deve depender mais da administração programática
  • É difícil lidar com dados esparsos, incompletos e voláteis
  • Um escopo mais amplo de conjunto de dados e fonte precisa de maior governança e suporte de dados

⚠️ Aviso: Um lago sem metadados catalogados e regras de acesso aplicadas se transforma em um pântano de dados. Os dados estão presentes, mas ninguém consegue encontrá-los, confiar neles ou provar quem os modificou. Portanto, a governança é um requisito desde o lançamento, não uma fase posterior.

Diferença entre data lakes e data warehouse

A comparação a seguir resume a posição de cada loja. Uma análise mais detalhada está disponível no [link para a página de detalhes]. data lake versus data warehouse comparação.

Parâmetros Técnicos Lagos de dados Armazém de dados
Dados Os data lakes armazenam tudo. Data Warehouse concentra-se apenas em Processos de Negócios.
Tratamento Os dados são principalmente não processados Dados altamente processados.
Tipo de dados Pode ser não estruturado, semiestruturado e estruturado. Está principalmente em forma e estrutura tabular.
Tarefa Compartilhe a administração de dados Otimizado para recuperação de dados
Agilidade Altamente ágil, configure e reconfigure conforme necessário. Comparado ao Data lake, é menos ágil e possui configuração fixa.
Utilizadores Data Lake é usado principalmente por cientistas de dados Profissionais de negócios usam amplamente o data warehouse
Armazenamento Projeto de data lakes para armazenamento de baixo custo. Armazenamento caro que oferece tempos de resposta rápidos é usado
Total Oferece menor controle. Permite melhor controle dos dados.
Substituição de EDW Data lake pode ser fonte para EDW Complementar ao EDW (não substituto)
Esquema Esquema na leitura (sem esquemas predefinidos) Esquema na gravação (esquemas predefinidos)
Processamento de dados Ajuda na ingestão rápida de novos dados. Demorado para apresentar novo conteúdo.
Granularidade de dados Dados com baixo nível de detalhe ou granularidade. Dados em nível de detalhe resumido ou agregado.
Ferramentas Pode usar código aberto/ferramentas como Hadoop/Map Reduce Principalmente ferramentas comerciais.

O que é um Data Lakehouse?

A comparação acima pressupõe dois sistemas separados. Um Data Lakehouse os funde em um só, razão pela qual o termo aparece na maioria das discussões atuais sobre arquitetura.

Um servidor à beira do lago armazena arquivos brutos em armazenamento de objetos de baixo custo e, em seguida, adiciona uma camada de metadados transacionais por meio de formatos de tabela abertos, como... Delta Lake, Apache Iceberg ou Apache Hudi. Essa camada fornece as garantias que um data warehouse oferece enquanto os arquivos subjacentes permanecem abertos.

Capacidade lago data Casa do Lago de Dados
Transações Não suportado Transações ACID em tabelas
Manipulação de esquemas Esquema em modo somente leitura Aplicação e evolução de esquemas
Usuários principais Cientistas de dados Analistas e cientistas de dados juntos
Velocidade de relatório Lento sem um armazém separado Consultas diretas com indexação e cache.

Para equipes que já operam um lago controlado, a adoção de um formato de tabela geralmente representa uma atualização incremental, e não uma reconstrução completa.

Benefícios e riscos do uso do Data Lake

Aqui estão alguns dos principais benefícios do uso de um Data Lake:

  • Auxilia totalmente na implementação em produção e em análises avançadas.
  • Oferece escalabilidade econômica e flexibilidade
  • Oferece valor a partir de tipos de dados ilimitados
  • Reduz o custo de propriedade a longo prazo
  • Permite armazenamento econômico de arquivos
  • Rapidamente adaptável a mudanças
  • A principal vantagem do data lake é a centralização de diferentes fontes de conteúdo
  • Os usuários, de vários departamentos, podem estar espalhados pelo mundo e podem ter acesso flexível para os dados

Risco de usar Data Lake:

  • Depois de algum tempo, o Data Lake pode perder relevância e impulso
  • Há um risco maior envolvido ao projetar o Data Lake
  • Dados não estruturados podem levar ao caos descontrolado, dados inutilizáveis, ferramentas díspares e complexas e fraca colaboração em toda a empresa.
  • Também aumenta os custos de armazenamento e computação
  • Não há como obter insights de outras pessoas que trabalharam com os dados porque não há um relato da linhagem das descobertas de analistas anteriores
  • O maior risco dos data lakes é a segurança e o controle de acesso. Às vezes, os dados podem ser colocados em um lago sem qualquer supervisão, pois alguns dos dados podem ter privacidade e necessidade regulatória

Perguntas Frequentes

Ingestão de arquivos sem tags de metadados, propriedade ou regras de retenção. Consequentemente, os usuários não conseguem determinar qual conjunto de dados é o atual ou confiável, o que leva ao acúmulo de duplicatas que ninguém consulta.

Formatos colunares como Parquet e ORC são bem compactados e permitem que as consultas leiam apenas as colunas necessárias. JSON e CSV permanecem úteis na área de destino original antes da conversão.

O treinamento de modelos requer grandes volumes de exemplos brutos e variados, que é exatamente o que um data lake preserva. As equipes leem diretamente do armazenamento de objetos, em vez de exportar de um data warehouse.

Sim. Os serviços de IA analisam os arquivos recebidos, inferem esquemas, sugerem tags de metadados e sinalizam colunas que parecem conter dados pessoais. Os responsáveis ​​humanos ainda aprovam as classificações antes que as políticas sejam aplicadas.

Aplique regras de ciclo de vida de armazenamento que movam arquivos inativos para camadas de arquivamento, compactem arquivos pequenos em arquivos maiores e particionem os dados para que as consultas realizem menos varreduras. Normalmente, o processamento, e não o armazenamento, é o principal fator que consome todos os dados.

Resuma esta postagem com: