Hva er Data Lake? Det er ArchiTecture: Data Lake Tutorial

Hva er Data Lake?

En Data Lake er et lagringssted som kan lagre store mengder strukturerte, semistrukturerte og ustrukturerte data. Det er et sted รฅ lagre alle typer data i sitt opprinnelige format uten faste grenser for kontostรธrrelse eller fil. Den tilbyr hรธy datamengde for รฅ รธke analytisk ytelse og integrering.

Data Lake er som en stor container som er veldig lik ekte innsjรธ og elver. Akkurat som i en innsjรธ har du flere sideelver som kommer inn, en datainnsjรธ har strukturerte data, ustrukturerte data, maskin til maskin, logger som strรธmmer gjennom i sanntid.

Data Lake
Data Lake

Data Lake demokratiserer data og er en kostnadseffektiv mรฅte รฅ lagre alle data fra en organisasjon for senere behandling. Forskningsanalytiker kan fokusere pรฅ รฅ finne meningsmรธnstre i data og ikke data i seg selv.

I motsetning til en hierarkisk Datavarehus der data er lagret i filer og mappe, har Data lake en flat arkitektur. Hvert dataelement i en Data Lake er gitt en unik identifikator og merket med et sett med metadatainformasjon.

Hvorfor Data Lake?

Hovedmรฅlet med รฅ bygge en datainnsjรธ er รฅ tilby et uraffinert syn pรฅ data til dataforskere.

Grunner til รฅ bruke Data Lake er:

  • Med utbruddet av lagringsmotorer som Hadoop lagring av ulik informasjon har blitt enkelt. Det er ikke nรธdvendig รฅ modellere data til et virksomhetsomfattende skjema med en Data Lake.
  • Med รธkningen i datavolum, datakvalitet og metadata รธker ogsรฅ kvaliteten pรฅ analyser.
  • Data Lake tilbyr forretningsmessig smidighet
  • Maskinlรฆring og kunstig intelligens kan brukes til รฅ lage lรธnnsomme spรฅdommer.
  • Det gir et konkurransefortrinn til den implementerende organisasjonen.
  • Det er ingen datasilostruktur. Data Lake gir 360 graders visning av kunder og gjรธr analysen mer robust.

Data Lake Architecture

Data Lake Architecture
Data Lake Architecture

Figuren viser arkitekturen til en Business Data Lake. De nedre nivรฅene representerer data som stort sett er i ro, mens de รธvre nivรฅene viser transaksjonsdata i sanntid. Disse dataene flyter gjennom systemet med ingen eller liten ventetid. Fรธlgende er viktige nivรฅer i Data Lake Archilรฆre:

  1. Svelgingsnivรฅ: Lagene pรฅ venstre side viser datakildene. Dataene kan lastes inn i datasjรธen i grupper eller i sanntid
  2. Innsiktsnivรฅ: Lagene til hรธyre representerer forskningssiden der innsikt fra systemet brukes. SQL, NoSQL-spรธrringer eller til og med excel kan brukes til dataanalyse.
  3. HDFS er en kostnadseffektiv lรธsning for bรฅde strukturerte og ustrukturerte data. Det er en landingssone for alle data som er i ro i systemet.
  4. Destillasjonsnivรฅ tar data fra lagringsdekket og konverterer det til strukturerte data for enklere analyse.
  5. Behandlingsnivรฅ kjรธre analytiske algoritmer og brukerforespรธrsler med varierende sanntid, interaktiv, batch for รฅ generere strukturerte data for enklere analyse.
  6. Samlet driftsnivรฅ styrer systemadministrasjon og overvรฅking. Det inkluderer revisjon og kompetansestyring, dataadministrasjon, arbeidsflytstyring.

Key Data Lake Concepts

Fรธlgende er Key Data Lake-konsepter som man mรฅ forstรฅ for รฅ forstรฅ Data Lake fullstendig Architecture

nรธkkel Concepts fra Data Lake
nรธkkel Concepts fra Data Lake

Svelging av data

Datainntak lar koblinger hente data fra en annen datakilde og laste inn i datasjรธen.

Datainntak stรธtter:

  • Alle typer strukturerte, semi-strukturerte og ustrukturerte data.
  • Flere inntak som batch, sanntid, engangsbelastning.
  • Mange typer datakilder som databaser, webservere, e-poster, IoT, og FTP.

Datalagring

Datalagring skal vรฆre skalerbar, tilby kostnadseffektiv lagring og gi rask tilgang til datautforskning. Den skal stรธtte ulike dataformater.

Datastyring

Datastyring er en prosess for รฅ administrere tilgjengelighet, brukervennlighet, sikkerhet og integritet til data som brukes i en organisasjon.

Trygghet

Sikkerhet mรฅ implementeres i hvert lag av datainnsjรธen. Det starter med lagring, utgraving og forbruk. Det grunnleggende behovet er รฅ stoppe tilgangen for uautoriserte brukere. Den skal stรธtte forskjellige verktรธy for รฅ fรฅ tilgang til data med GUI og Dashboards som er enkle รฅ navigere.

Autentisering, regnskap, autorisasjon og databeskyttelse er noen viktige funksjoner ved datainnsjรธsikkerhet.

Datakvalitet

Datakvalitet er en viktig del av Data Lake-arkitekturen. Data brukes til รฅ oppnรฅ forretningsverdi. F.eks.tracร… fรฅ innsikt fra data av dรฅrlig kvalitet vil fรธre til innsikt av dรฅrlig kvalitet.

Dataoppdagelse

Data Discovery er et annet viktig stadium fรธr du kan begynne รฅ forberede data eller analyser. I dette stadiet brukes taggingsteknikk for รฅ uttrykke dataforstรฅelsen, ved รฅ organisere og tolke dataene som tas inn i datasjรธen.

Datarevisjon

To viktige datarevisjonsoppgaver er tracking endringer i nรธkkeldatasettet.

  1. Tracking endringer i viktige datasettelementer
  2. Fanger hvordan/nรฅr/ og hvem som endrer til disse elementene.

Datarevisjon hjelper til med รฅ evaluere risiko og samsvar.

Datalinje

Denne komponenten omhandler datas opprinnelse. Den handler hovedsakelig om hvor den beveger seg over tid og hva som skjer med den. Det letter feilrettinger i en dataanalyseprosess fra opprinnelse til destinasjon.

Dataforskning

Det er startfasen av dataanalyse. Det hjelper รฅ identifisere riktig datasett er avgjรธrende fรธr du starter datautforskning.

Alle gitte komponenter mรฅ fungere sammen for รฅ spille en viktig rolle i at Data Lake-bygging enkelt kan utvikle seg og utforske miljรธet.

Modenhetsstadier av Data Lake

Definisjonen av Data Lake-modenhetsstadier er forskjellig fra lรฆrebok til annen. Selv om kjernen forblir den samme. Etter modenhet er scenedefinisjonen fra et lekmannssynspunkt.

Modenhetsstadier av Data Lake
Modenhetsstadier av Data Lake

Trinn 1: Hรฅndtere og innta data i stor skala

Denne fรธrste fasen av datamodenhet innebรฆrer รฅ forbedre evnen til รฅ transformere og analysere data. Her mรฅ bedriftseiere finne verktรธyene i henhold til deres ferdigheter for รฅ skaffe mer data og bygge analytiske applikasjoner.

Trinn 2: Bygge den analytiske muskelen

Dette er et andre trinn som innebรฆrer รฅ forbedre evnen til รฅ transformere og analysere data. I denne fasen bruker bedrifter det verktรธyet som passer best for deres ferdigheter. De begynner รฅ skaffe mer data og bygge applikasjoner. Her brukes funksjonene til bedriftens datavarehus og datainnsjรธ sammen.

Trinn 3: EDW og Data Lake jobber unisont

Dette trinnet innebรฆrer รฅ fรฅ data og analyser i hendene pรฅ sรฅ mange mennesker som mulig. Pรฅ dette stadiet begynner datainnsjรธen og bedriftens datavarehus รฅ jobbe i en fagforening. Begge spiller sin rolle i analysene

Trinn 4: Bedriftsevne i innsjรธen

I dette modenhetsstadiet av datasjรธen legges bedriftsfunksjoner til datasjรธen. Adopsjon av informasjonsstyring, administrasjonsevner for informasjonslivssyklus og metadataadministrasjon. Imidlertid kan svรฆrt fรฅ organisasjoner nรฅ dette modenhetsnivรฅet, men dette antallet vil รธke i fremtiden.

Beste praksis for Data Lake-implementering

  • Architektoniske komponenter, deres interaksjon og identifiserte produkter bรธr stรธtte innfรธdte datatyper
  • Design av Data Lake bรธr vรฆre drevet av det som er tilgjengelig i stedet for det som kreves. Skjema- og datakravet er ikke definert fรธr det spรธrres
  • Design bรธr styres av engangskomponenter integrert med service API.
  • Dataoppdagelse, inntak, lagring, administrasjon, kvalitet, transformasjon og visualisering bรธr administreres uavhengig.
  • Data Lake-arkitekturen bรธr skreddersys til en spesifikk bransje. Det bรธr sikre at nรธdvendige egenskaper for dette domenet er en iboende del av designet
  • Raskere ombordstigning av nyoppdagede datakilder er viktig
  • Data Lake hjelper med tilpasset administrasjon for รฅtract maksimal verdi
  • Data Lake bรธr stรธtte eksisterende bedriftsdatabehandlingsteknikker og -metoder

Utfordringer med รฅ bygge en datainnsjรธ:

  • I Data Lake er datavolumet hรธyere, sรฅ prosessen mรฅ vรฆre mer avhengig av programmatisk administrasjon
  • Det er vanskelig รฅ hรฅndtere sparsomme, ufullstendige, flyktige data
  • Stรธrre spekter av datasett og kilde trenger stรธrre datastyring og stรธtte

Forskjellen mellom datainnsjรธer og datavarehus

Parametre Datasjรธer Datavarehus
Data Datainnsjรธer lagrer alt. Data Warehouse fokuserer kun pรฅ forretningsprosesser.
i prosess Data er hovedsakelig ubehandlet Hรธyt behandlet data.
Type data Det kan vรฆre ustrukturert, semistrukturert og strukturert. Det er stort sett i tabellform og struktur.
Oppgave Del dataforvaltning Optimalisert for datainnhenting
Agility Svรฆrt smidig, konfigurer og rekonfigurer etter behov. Sammenlignet med Data Lake er den mindre smidig og har fast konfigurasjon.
brukere Data Lake brukes mest av Data Scientist Forretningsfolk bruker datavarehus mye
Oppbevaring Datainnsjรธ-design for rimelig lagring. Det brukes dyr lagring som gir raske responstider
Trygghet Gir mindre kontroll. Gir bedre kontroll over dataene.
Erstatning av EDW Datainnsjรธ kan vรฆre kilde for EDW Komplementรฆr til EDW (ikke erstatning)
Skjema Skjema ved lesing (ingen forhรฅndsdefinerte skjemaer) Skjema ved skriving (forhรฅndsdefinerte skjemaer)
Databehandling Hjelper for rask inntak av nye data. Tidkrevende รฅ introdusere nytt innhold.
Datagranularitet Data pรฅ et lavt detaljnivรฅ eller granularitet. Data pรฅ oppsummerings- eller aggregert detaljnivรฅ.
verktรธy Kan bruke รฅpen kildekode/verktรธy som Hadoop/ Map Reduce For det meste kommersielle verktรธy.

Fordeler og risikoer ved bruk av Data Lake

Her er noen store fordeler ved รฅ bruke en Data Lake:

  • Hjelper fullt ut med produktionisering og avansert analyse
  • Tilbyr kostnadseffektiv skalerbarhet og fleksibilitet
  • Tilbyr verdi fra ubegrensede datatyper
  • Reduserer langsiktige eierkostnader
  • Tillater รธkonomisk lagring av filer
  • Kan raskt tilpasses endringer
  • Den stรธrste fordelen med datainnsjรธ er sentralisering av ulike innholdskilder
  • Brukere, fra ulike avdelinger, kan vรฆre spredt over hele kloden kan ha fleksibel tilgang til dataene

Risiko ved bruk av Data Lake:

  • Etter en tid kan Data Lake miste relevans og momentum
  • Det er stรธrre risiko involvert nรฅr du designer Data Lake
  • Ustrukturerte data kan fรธre til ukontrollert kao, ubrukelige data, uensartede og komplekse verktรธy, bedriftsdekkende samarbeid, enhetlig, konsistent og felles
  • Det รธker ogsรฅ lagrings- og beregningskostnadene
  • Det er ingen mรฅte รฅ fรฅ innsikt fra andre som har jobbet med dataene fordi det ikke er noen redegjรธrelse for linjen av funn fra tidligere analytikere
  • Den stรธrste risikoen ved datainnsjรธer er sikkerhet og tilgangskontroll. Noen ganger kan data plasseres i en innsjรธ uten tilsyn, siden noen av dataene kan ha personvern og regulatoriske behov

Sammendrag

  • En Data Lake er et lagringssted som kan lagre store mengder strukturerte, semistrukturerte og ustrukturerte data.
  • Hovedmรฅlet med รฅ bygge en datainnsjรธ er รฅ tilby et uraffinert syn pรฅ data til dataforskere.
  • Unified operations tier, Processing tier, Destillation tier og HDFS er viktige lag i Data Lake Architecture
  • Datainntak, datalagring, datakvalitet, datarevisjon, datautforskning, dataoppdagelse er noen viktige komponenter i Data Lake Architecture
  • Design av Data Lake bรธr vรฆre drevet av det som er tilgjengelig i stedet for det som kreves.
  • Data Lake reduserer langsiktige eierkostnader og tillater รธkonomisk lagring av filer
  • Den stรธrste risikoen ved datainnsjรธer er sikkerhet og tilgangskontroll. Noen ganger kan data plasseres i en innsjรธ uten tilsyn, siden noen av dataene kan ha personvern og regulatoriske behov.

Oppsummer dette innlegget med: