Wat is een data lake? Definitie. Archistructuur & beste praktijken

โšก Slimme samenvatting

De Data Lake-architectuur slaat gestructureerde, semi-gestructureerde en ongestructureerde data op in een native formaat met een plat ontwerp. Elk element krijgt een unieke identificatiecode en metadatatags, waardoor analyse mogelijk is zonder een vooraf gedefinieerd bedrijfsschema.

  • ๏ธ Kerndefinitie: Een opslagplaats voor alle gegevenstypen in onbewerkte vorm, zonder vaste limiet voor accountgrootte of bestandsgrootte.
  • ???? ๏ธ Niveaustructuur: Inname, opslag, distillatie, verwerking, inzichten en uniforme bedrijfsvoering vormen de zes architectuurlagen.
  • ๐Ÿ”‘ Belangrijke onderdelen: Inname, opslag, beheer, beveiliging, kwaliteit, ontdekking, controle, herkomstregistratie en onderzoek moeten op elkaar afgestemd zijn.
  • ๐Ÿ“ˆ Volwassenwordingstraject: Vier fasen brengen een organisatie van ruwe data-inname naar volledig bedrijfsbestuur binnen het 'lake'-model.
  • โ€‹ Vergelijking van magazijnen: Lakes passen schema's toe bij het lezen voor datawetenschappers, warehouses passen schema's toe bij het schrijven voor bedrijfsrapportage.
  • โš ๏ธ Primair risico: Zwakke toegangscontrole en gebrek aan toezicht veranderen een ongecontroleerd meer in een onbruikbaar datamoeras.

Wat is een datameer Architectuur

Wat is Data Lake?

Een Data Lake is een opslagplaats waarin grote hoeveelheden gestructureerde, semi-gestructureerde en ongestructureerde gegevens kunnen worden opgeslagen. Het is een plek waar u elk type gegevens in het oorspronkelijke formaat kunt opslaan, zonder vaste limieten op de accountgrootte of het bestand. Het biedt een grote hoeveelheid gegevens om de analytische prestaties en de native integratie te verbeteren.

Data Lake is als een grote container die erg lijkt op een echt meer en rivieren. Net zoals in een meer meerdere zijrivieren binnenkomen, heeft een data lake gestructureerde data, ongestructureerde data, machine-naar-machine, logs die in realtime doorstromen.

Datameer
Datameer

Zoals de bovenstaande illustratie laat zien, komen veel afzonderlijke datastromen samen in รฉรฉn grote, opgeslagen dataset. Het data lake democratiseert data en is een kosteneffectieve manier om alle data van een organisatie op te slaan voor latere verwerking. Onderzoeksanalisten kunnen zich richten op het vinden van betekenisvolle patronen in de data, in plaats van op de data zelf.

In tegenstelling tot een hiรซrarchische Datawarehouse waar data wordt opgeslagen in Files en Folder, heeft Data Lake een platte architectuur. Elk data-element in een Data Lake krijgt een unieke identifier en is getagd met een set metadata-informatie.

Waarom DataLake?

Het belangrijkste doel van het bouwen van een datameer is om datawetenschappers een ongeraffineerd beeld van data te bieden.

Redenen om Data Lake te gebruiken zijn:

  • Met het begin van opslagmotoren zoals Hadoop het opslaan van ongelijksoortige informatie is eenvoudig geworden. Met een Data Lake is het niet nodig om gegevens in een ondernemingsbreed schema te modelleren.
  • Met de toename van het datavolume, de datakwaliteit en de metadata neemt ook de kwaliteit van de analyses toe.
  • Data Lake biedt zakelijke flexibiliteit
  • Machine leren en kunstmatige intelligentie kan worden gebruikt om winstgevende voorspellingen te doen.
  • Het biedt een concurrentievoordeel voor de uitvoerende organisatie.
  • Er is geen datasilostructuur. Data Lake geeft een 360 graden beeld van klanten en maakt analyses robuuster.

Datameer Architectuur

Datameer Architectuur
Datameer Architectuur

De afbeelding toont de architectuur van een Business Data Lake. De lagere niveaus vertegenwoordigen data die voornamelijk in rust is, terwijl de hogere niveaus realtime transactionele data tonen. Deze data stroomt door het systeem met weinig of geen latentie. Hieronder volgen belangrijke lagen in Data Lake Archistructuur:

  1. Innameniveau: De lagen aan de linkerkant geven de gegevensbronnen weer. De gegevens kunnen in batches of in realtime in het datameer worden geladen
  2. Inzichtenlaag: De lagen aan de rechterkant vertegenwoordigen de onderzoekskant waar inzichten uit het systeem worden gebruikt. SQL, NoSQL-query's of zelfs Excel kunnen worden gebruikt voor gegevensanalyse.
  3. HDFS is een kosteneffectieve oplossing voor zowel gestructureerde als ongestructureerde data. Het is een landingszone voor alle gegevens die zich in het systeem bevinden.
  4. Distillatielaag Haalt gegevens uit de opslaglaag en zet deze om in gestructureerde gegevens voor eenvoudigere analyse.
  5. Verwerkingslaag Voer analytische algoritmen en gebruikersquery's uit met variรซrende realtime, interactieve en batch-gebaseerde gegevens om gestructureerde gegevens te genereren voor eenvoudigere analyse.
  6. Uniforme operationele laag regelt het systeembeheer en de monitoring. Het omvat auditing en vaardigheidsbeheer, gegevensbeheer, workflowbeheer.

Sleuteldatameer Concepts

Hieronder staan โ€‹โ€‹de belangrijkste Data Lake-concepten die u moet begrijpen om Data Lake volledig te begrijpen Architectuur

Gegevensopname

Met Data Ingestion kunnen connectoren gegevens uit verschillende gegevensbronnen ophalen en in het Data Lake laden.

Gegevensopname ondersteunt:

  • Alle soorten gestructureerde, semi-gestructureerde en ongestructureerde gegevens.
  • Meerdere opnames zoals batch, realtime, eenmalige belasting.
  • Veel soorten gegevensbronnen zoals databases, webservers, e-mails, IoTen FTP.

Data opslag

Gegevensopslag moet schaalbaar zijn, kosteneffectieve opslag bieden en snelle toegang tot gegevensverkenning mogelijk maken. Het moet verschillende gegevensformaten ondersteunen.

Gegevensbeheer

Data governance is een proces voor het beheren van de beschikbaarheid, bruikbaarheid, veiligheid en integriteit van gegevens die in een organisatie worden gebruikt.

Security

Beveiliging moet in elke laag van het datameer worden geรฏmplementeerd. Het begint met opslag, opgraving en consumptie. De basisbehoefte is om de toegang voor ongeautoriseerde gebruikers te stoppen. Het moet verschillende tools ondersteunen om toegang te krijgen tot gegevens met een eenvoudig te navigeren GUI en dashboards.

Authenticatie, boekhouding, autorisatie en gegevensbescherming zijn enkele belangrijke kenmerken van data lake-beveiliging.

Datakwaliteit

Datakwaliteit is een essentieel onderdeel van de Data Lake-architectuur. Data wordt gebruikt om concrete bedrijfswaarde te genereren.tracHet vergaren van inzichten uit data van slechte kwaliteit zal leiden tot inzichten van slechte kwaliteit.

Gegevensdetectie

Data Discovery is een andere belangrijke fase voordat u kunt beginnen met het voorbereiden van gegevens of analyses. In deze fase wordt de tagging-techniek gebruikt om het begrip van de gegevens tot uitdrukking te brengen, door de gegevens die in het Data Lake worden opgenomen, te organiseren en te interpreteren.

Gegevenscontrole

Twee belangrijke taken bij data-auditing zijn: trackoning wijzigt de belangrijkste dataset.

  1. Tracking wijzigingen aan belangrijke datasetelementen
  2. Legt vast hoe/wanneer/ en wie deze elementen verandert.

Gegevensaudit helpt bij het evalueren van risico's en compliance.

Gegevensafstamming

Deze component behandelt de oorsprong van data. Het gaat voornamelijk over de route die data in de loop van de tijd aflegt en wat ermee gebeurt. Het vereenvoudigt foutcorrecties in een data-analyseproces, van oorsprong tot bestemming.

Gegevensverkenning

Het is de beginfase van data-analyse. Het helpt om de juiste dataset te identificeren, wat essentieel is voordat u met Data Exploration begint.

Alle gegeven componenten moeten samenwerken om een โ€‹โ€‹belangrijke rol te spelen bij het bouwen van datameren, zodat ze gemakkelijk kunnen evolueren en de omgeving kunnen verkennen.

Populaire Data Lake-platformen

De hierboven beschreven lagen worden doorgaans samengesteld uit beheerde cloudservices in plaats van volledig vanaf nul te worden opgebouwd. De onderstaande platforms omvatten de opslag- en catalogiseringslagen waarmee de meeste implementaties beginnen.

  • Amazon S3 met AWS Lake Formation: Objectopslag in combinatie met een service die bronnen registreert, machtigingen instelt en de datacatalogus opbouwt. Zie de AWS-zelfstudie voor het bredere ecosysteem.
  • Azure Data Lake Storage Gen2: Voegt een hiรซrarchische naamruimte toe bovenop Blob Storage, wat zorgt voor beveiliging op mapniveau en snellere toegang tot analyses.
  • Google Cloud Opslag bij BigLake: Combineert objectopslag met een querylaag die direct open tabelformaten leest.
  • Apache Hadoop met HDFS: De oorspronkelijke on-premises optie, die nog steeds wordt gebruikt wanneer gegevens binnen een privรฉdatacenter moeten blijven.
  • Databricks en Snowflake: Platformen die tabelformaten over elkaar heen leggen, zoals Delta Lake en Apache Iceberg bovenop objectopslag om transacties en versiebeheer toe te voegen.

De selectie volgt normaal gesproken de cloudprovider die een organisatie al gebruikt, aangezien de gegevensinvoer en -verwerking tools voor bedrijfsinformatie Integreer het op de meest voordelige manier binnen รฉรฉn ecosysteem.

Volwassenheidsfasen van Data Lake

De definitie van Data Lake Maturity-fasen verschilt van leerboek tot leerboek. Hoewel de kern hetzelfde blijft. Na de volwassenheid is de definitie van de fase vanuit een lekenperspectief.

Fase 1: Gegevens op schaal verwerken en verwerken

Deze eerste fase van Data Maturity omvat het verbeteren van het vermogen om data te transformeren en te analyseren. Hier moeten bedrijfseigenaren de tools vinden die passen bij hun vaardigheden om meer gegevens te verkrijgen en analytische applicaties te bouwen.

Fase 2: Het opbouwen van de analytische spier

Dit is een tweede fase waarin het vermogen om gegevens te transformeren en te analyseren wordt verbeterd. In deze fase gebruiken bedrijven de tool die het meest geschikt is voor hun vaardigheden. Ze beginnen meer data te verzamelen en applicaties te bouwen. Hier worden de mogelijkheden van het enterprise datawarehouse en data lake samen gebruikt.

Fase 3: EDW en Data Lake werken samen

Deze stap houdt in dat gegevens en analyses in handen van zoveel mogelijk mensen komen. In deze fase gaan het datameer en het bedrijfsdatawarehouse in รฉรฉn geheel werken. Beiden spelen hun rol in de analyse

Fase 4: Enterprise-capaciteiten in het meer

In deze volwassenheidsfase van het datameer worden bedrijfsmogelijkheden aan het Data Lake toegevoegd. Toepassing van informatiebeheer, mogelijkheden voor informatielevenscyclusbeheer en metadatabeheer. Er zijn echter maar heel weinig organisaties die dit volwassenheidsniveau kunnen bereiken, maar dit aantal zal in de toekomst toenemen.

Best practices voor de implementatie van Data Lake

  • Archistructurele componenten, hun interactie en geรฏdentificeerde producten moeten native datatypen ondersteunen
  • Het ontwerp van Data Lake moet worden gestuurd door wat beschikbaar is in plaats van wat nodig is. De schema- en gegevensvereiste worden pas gedefinieerd nadat er een query op is uitgevoerd
  • Het ontwerp moet worden geleid door wegwerpbare componenten die zijn geรฏntegreerd met de service-API.
  • Het ontdekken, opnemen, opslaan, beheren, kwaliteit, transformeren en visualiseren van gegevens moeten onafhankelijk worden beheerd.
  • De Data Lake-architectuur moet worden afgestemd op een specifieke branche. Het moet ervoor zorgen dat de mogelijkheden die nodig zijn voor dat domein een inherent onderdeel zijn van het ontwerp.
  • Een snellere on-boarding van nieuw ontdekte databronnen is belangrijk
  • Data Lake helpt bij het beheren van projecten op maat.tract maximale waarde
  • Het Data Lake moet bestaande technieken en methoden voor bedrijfsgegevensbeheer ondersteunen

Uitdagingen bij het bouwen van een datameer:

  • In Data Lake is het datavolume groter, dus het proces moet meer afhankelijk zijn van programmatisch beheer
  • Het is moeilijk om met schaarse, onvolledige en vluchtige gegevens om te gaan
  • Een bredere reikwijdte van dataset en bron vereist groter databeheer en ondersteuning

โš ๏ธ Waarschuwing: Een datameer zonder gecatalogiseerde metadata en afgedwongen toegangsregels verandert in een datamoeras. Er zijn wel gegevens aanwezig, maar niemand kan ze vinden, erop vertrouwen of bewijzen wie ze heeft gewijzigd. Governance is daarom een โ€‹โ€‹vereiste vanaf de lancering, niet iets voor een latere fase.

Verschil tussen datameren en datawarehouse

De volgende vergelijking geeft een overzicht van de positie van elke winkel. Een gedetailleerdere analyse is beschikbaar in de datalake versus datawarehouse vergelijking.

Kenmerken Datameren Datawarehouse
Data Datameren slaan alles op. Data Warehouse richt zich alleen op bedrijfsprocessen.
verwerkingsoplossingen Gegevens zijn grotendeels onbewerkt Sterk verwerkte gegevens.
Type gegevens Het kan ongestructureerd, semi-gestructureerd en gestructureerd zijn. Het is meestal in tabelvorm en structuur.
Taak Deel databeheer Geoptimaliseerd voor het ophalen van gegevens
Behendigheid Zeer flexibel, configureer en herconfigureer indien nodig. In vergelijking met Data Lake is het minder wendbaar en heeft het een vaste configuratie.
Gebruikers Data Lake wordt vooral gebruikt door Data Scientist Zakelijke professionals maken op grote schaal gebruik van datawarehouse
Opslag Datameren ontwerpen voor goedkope opslag. Er wordt gebruik gemaakt van dure opslag die snelle responstijden oplevert
Security Biedt minder controle. Maakt een betere controle over de gegevens mogelijk.
Vervanging van EDW Data Lake kan een bron zijn voor EDW Aanvullend op EDW (geen vervanging)
Schema Schema bij het lezen (geen vooraf gedefinieerde schema's) Schema bij schrijven (vooraf gedefinieerde schema's)
data Processing Helpt bij snelle opname van nieuwe gegevens. Tijdrovend om nieuwe inhoud te introduceren.
Gegevens granulariteit Gegevens met een laag detailniveau of granulariteit. Gegevens op het samenvattende of geaggregeerde detailniveau.
Tools Kan open source/tools zoals Hadoop/ Map Reduce gebruiken Meestal commerciรซle tools.

Wat is een Data Lakehouse?

De bovenstaande vergelijking gaat uit van twee afzonderlijke systemen. Een Data Lakehouse voegt deze samen tot รฉรฉn systeem, vandaar dat de term in de meeste hedendaagse architectuurdiscussies voorkomt.

Een lakehouse bewaart onbewerkte bestanden in goedkope objectopslag en voegt vervolgens een transactionele metadatalaag toe via open tabelformaten zoals Delta Lake, Apache Iceberg of Apache Hudi. Die laag biedt de garanties die een datawarehouse biedt zolang de onderliggende bestanden open blijven.

Bekwaamheid Datameer Gegevens Lakehouse
Transacties Niet ondersteund ACID-transacties op tabellen
Schemaverwerking Schema alleen-lezen Schema-handhaving en -evolutie
Hoofdgebruikers Data wetenschappers Analisten en datawetenschappers samen
Rapportagesnelheid Traag zonder een apart magazijn Directe zoekopdrachten met indexering en caching

Voor teams die al een gereguleerde lake beheren, is het invoeren van een tabelformaat meestal een stapsgewijze verbetering in plaats van een complete herziening.

Voordelen en risico's van het gebruik van Data Lake

Hier zijn enkele belangrijke voordelen bij het gebruik van een Data Lake:

  • Biedt volledige ondersteuning bij het in productie nemen en geavanceerde analyses.
  • Biedt kosteneffectieve schaalbaarheid en flexibiliteit
  • Biedt waarde uit onbeperkte datatypen
  • Verlaagt de eigendomskosten op de lange termijn
  • Maakt economische opslag van bestanden mogelijk
  • Snel aanpasbaar aan veranderingen
  • Het belangrijkste voordeel van data lake is de centralisatie van verschillende inhoudsbronnen
  • Gebruikers, afkomstig uit diverse afdelingen, kunnen verspreid over de hele wereld terecht kunnen flexibele toegang naar de gegevens

Risico van het gebruik van Data Lake:

  • Na verloop van tijd kan Data Lake aan relevantie en momentum verliezen
  • Er zijn grotere risico's verbonden aan het ontwerpen van Data Lake
  • Ongestructureerde data kan leiden tot ongecontroleerde chaos, onbruikbare data, uiteenlopende en complexe tools en zwakke samenwerking binnen de hele organisatie.
  • Het verhoogt ook de opslag- en computerkosten
  • Er is geen manier om inzichten te krijgen van anderen die met de gegevens hebben gewerkt, omdat er geen verslag is van de bevindingen van eerdere analisten
  • Het grootste risico van datameren is beveiliging en toegangscontrole. Soms kunnen gegevens zonder enig toezicht in een meer worden geplaatst, omdat sommige gegevens mogelijk privacy- en regelgevingsvereisten hebben

Veelgestelde vragen

Het importeren van bestanden zonder metadata-tags, eigendomsrechten of bewaarregels. Gebruikers kunnen dan niet zien welke dataset actueel of betrouwbaar is, waardoor de data lake volloopt met duplicaten die niemand raadpleegt.

Kolomgeoriรซnteerde formaten zoals Parquet en ORC comprimeren goed, waardoor query's alleen de benodigde kolommen lezen. JSON en CSV blijven bruikbaar in de ruwe invoerzone vรณรณr de conversie.

Voor modeltraining zijn grote hoeveelheden ruwe, gevarieerde voorbeelden nodig, en dat is precies wat een 'meer' bewaart. Teams lezen rechtstreeks uit de objectopslag in plaats van te exporteren vanuit een datawarehouse.

Ja. AI-diensten scannen binnenkomende bestanden, leiden schema's af, suggereren metadatatags en markeren kolommen die op persoonsgegevens lijken. Menselijke beheerders keuren de classificaties nog steeds goed voordat het beleid wordt toegepast.

Pas regels voor de opslaglevenscyclus toe die inactieve bestanden naar archieflagen verplaatsen, kleine bestanden comprimeren tot grotere bestanden en gegevens partitioneren zodat query's minder vaak hoeven te scannen. Rekenkosten, niet opslagkosten, zijn meestal de grootste kostenpost.

Vat dit bericht samen met: