Mis on andmejärv? Definitsioon Archistruktuur ja parimad tavad

⚡ Nutikas kokkuvõte

Data Lake'i arhitektuur salvestab struktureeritud, poolstruktureeritud ja struktureerimata andmeid natiivses vormingus ühetaolise kujunduse all. Iga element saab unikaalse identifikaatori ja metaandmete sildid, mis võimaldab analüüsi ilma eelnevalt määratletud ettevõtte skeemita.

  • 🗄️ Põhidefinitsioon: Hoidla, mis hoiab igat tüüpi andmeid töötlemata kujul, ilma konto või faili suuruse piiranguta.
  • 🏗️ Taseme struktuur: Kuus arhitektuuritasandit moodustavad sissevõtmine, säilitamine, destilleerimine, töötlemine, analüüsid ja ühtsed toimingud.
  • 🔑 Põhikomponendid: Andmete allaneelamine, salvestamine, haldamine, turvalisus, kvaliteet, avastamine, auditeerimine, päritolu ja uurimine peavad koos töötama.
  • 📈 Küpsuse tee: Neli etappi viivad organisatsiooni toorandmete sisestamisest täieliku ettevõtte juhtimiseni järve sees.
  • 🇧🇷 Lao kontrast: Järved rakendavad andmeteadlaste jaoks lugemisel skeemi, laod rakendavad äriaruandluse jaoks kirjutamisel skeemi.
  • ⚠️ Peamine risk: Nõrk ligipääsukontroll ja puuduv järelevalve muudavad kontrollimata järve kasutamiskõlbmatuks andmesooks.

Mis on andmejärv Architektuur

Mis on Data Lake?

Data Lake on salvestushoidla, mis suudab salvestada suurel hulgal struktureeritud, poolstruktureeritud ja struktureerimata andmeid. See on koht, kus saab salvestada igat tüüpi andmeid nende algvormingus, ilma konto suuruse või faili piiranguteta. See pakub suurt andmemahtu, et suurendada analüütilist jõudlust ja natiivset integratsiooni.

Data Lake on nagu suur konteiner, mis on väga sarnane tõelise järve ja jõgedega. Nii nagu järves, kus on mitu lisajõge, on andmejärves struktureeritud andmed, struktureerimata andmed, masinatevahelised andmed, reaalajas voolavad logid.

andmejärv
andmejärv

Nagu ülaltoodud illustratsioon näitab, toidavad paljud eraldi vood ühte salvestatud andmekogumit. Andmejärv demokratiseerib andmeid ja on kulutõhus viis organisatsiooni kõigi andmete salvestamiseks hilisemaks töötlemiseks. Uurimisanalüütik saab keskenduda tähendusmustrite leidmisele andmetes, mitte andmetes endis.

Erinevalt hierarhilisest Andmeladu kus andmeid salvestatakse failidesse ja kaustadesse, on Data Lake'il tasane arhitektuur. Igale Data Lake'i andmeelemendile antakse kordumatu identifikaator ja märgitakse metaandmete kogum.

Miks Data Lake?

Andmejärve ehitamise peamine eesmärk on pakkuda andmeteadlastele täpsustamata vaadet andmetele.

Data Lake'i kasutamise põhjused on järgmised:

  • Mis algusega ladustamise mootorid nagu hadoop erineva teabe salvestamine on muutunud lihtsaks. Andmeid ei ole vaja Data Lake'i abil kogu ettevõtet hõlmavaks skeemiks modelleerida.
  • Andmemahu, andmete kvaliteedi ja metaandmete kasvuga tõuseb ka analüüside kvaliteet.
  • Data Lake pakub ärilist Agilityt
  • Masinõpe ja tehisintellekti saab kasutada tulusate prognooside tegemiseks.
  • See pakub rakendavale organisatsioonile konkurentsieelise.
  • Andmesilo struktuur puudub. Data Lake annab klientidele 360-kraadise ülevaate ja muudab analüüsi töökindlamaks.

andmejärv Architektuur

andmejärv Architektuur
andmejärv Architektuur

Joonisel on kujutatud Business Data Lake'i arhitektuur. Alumised tasemed esindavad andmeid, mis on enamasti puhkeolekus, samas kui ülemised tasemed näitavad reaalajas tehinguandmeid. Need andmed liiguvad läbi süsteemi ilma või vähese latentsusega. Järgmised on Data Lake'i olulised tasemed ArchiStruktuur:

  1. Allaneelamise tase: vasakpoolsed tasemed kujutavad andmeallikaid. Andmeid saab laadida andmejärve partiidena või reaalajas
  2. Statistika tase: Parempoolsed tasemed esindavad uurimistöö poolt, kus kasutatakse süsteemi teadmisi. SQL, andmete analüüsimiseks saab kasutada NoSQL-i päringuid või isegi Exceli.
  3. HDFS on kulutõhus lahendus nii struktureeritud kui ka struktureerimata andmete jaoks. See on kõigi süsteemis olevate andmete maandumistsoon.
  4. Destilleerimise tasand võtab salvestustasandilt andmeid ja teisendab need struktureeritud andmeteks hõlpsamaks analüüsimiseks.
  5. Töötlemise tasand käivitage analüütilisi algoritme ja kasutajate päringuid erineva reaalajas, interaktiivsete partiidega, et luua struktureeritud andmeid lihtsamaks analüüsiks.
  6. Ühtne operatsioonide tasand reguleerib süsteemi haldamist ja jälgimist. See hõlmab auditeerimist ja oskuste haldamist, andmehaldust, töövoo juhtimine.

Key Data Lake Concepts

Järgnevalt on toodud Data Lake'i võtmekontseptsioonid, mida tuleb Data Lake'i täielikuks mõistmiseks mõista Architektuur

Andmete sissevõtmine

Andmete sisestamine võimaldab konnektoritel saada andmeid erinevatest andmeallikatest ja laadida need Data Lake'i.

Andmete sisestamine toetab:

  • Igat tüüpi struktureeritud, poolstruktureeritud ja struktureerimata andmed.
  • Mitu allaneelamist, näiteks partii, reaalajas, ühekordne laadimine.
  • Mitut tüüpi andmeallikad, nagu andmebaasid, veebiserverid, e-kirjad, IoTja FTP.

Data Storage

Andmesalvestus peaks olema skaleeritav, pakkuma kulutõhusat salvestusruumi ja võimaldama kiiret juurdepääsu andmete uurimisele. See peaks toetama erinevaid andmevorminguid.

Andmete haldamine

Andmehaldus on protsess, mille käigus hallatakse organisatsioonis kasutatavate andmete kättesaadavust, kasutatavust, turvalisust ja terviklikkust.

TURVALISUS

Turvalisust tuleb rakendada Data Lake'i igas kihis. See algab ladustamisest, kaevandamisest ja tarbimisest. Põhivajadus on peatada volitamata kasutajate juurdepääs. See peaks toetama erinevaid tööriistu andmetele juurdepääsuks hõlpsasti navigeeritava GUI ja armatuurlauaga.

Autentimine, raamatupidamine, autoriseerimine ja andmekaitse on mõned Data Lake'i turvalisuse olulised funktsioonid.

Andmekvaliteet

Andmete kvaliteet on Data Lake'i arhitektuuri oluline komponent. Andmeid kasutatakse äriväärtuse täpseks loomiseks. NäitekstracHalva kvaliteediga andmetest arusaamade ammutamine viib halva kvaliteediga teadmisteni.

Andmete avastamine

Andmete avastamine on veel üks oluline etapp enne andmete ettevalmistamise või analüüsi alustamist. Selles etapis kasutatakse andmete mõistmise väljendamiseks sildistamistehnikat, korraldades ja tõlgendades Andmejärves neelatud andmeid.

Andmete auditeerimine

Kaks peamist andmete auditeerimise ülesannet on trackuningas muudab võtmeandmestikku.

  1. Tracking oluliste andmestiku elementide muudatused
  2. Jäädvustab, kuidas/ millal/ ja kes neid elemente muudab.

Andmete auditeerimine aitab hinnata riske ja vastavust.

Andmeliinid

See komponent tegeleb andmete päritoluga. See tegeleb peamiselt sellega, kuhu need aja jooksul liiguvad ja mis nendega juhtub. See hõlbustab vigade parandamist andmeanalüüsi protsessis päritolust sihtkohta.

Andmete uurimine

See on andmete analüüsi algusetapp. See aitab tuvastada õige andmestiku, mis on oluline enne andmete uurimise alustamist.

Kõik antud komponendid peavad töötama koos, et mängida olulist rolli Data Lake'i ehitamisel, mida saab hõlpsasti arendada ja keskkonda uurida.

Populaarsed andmejärve platvormid

Ülalkirjeldatud astmed pannakse tavaliselt kokku hallatavatest pilveteenustest, mitte ei ehitata nullist. Allpool olevad platvormid hõlmavad salvestus- ja kataloogimiskihte, millega enamik rakendusi algab.

  • Amazon S3 koos AWS järve moodustumisega: Objektisalvestus koos teenusega, mis registreerib allikaid, määrab õigused ja loob andmekataloogi. Vaata AWS-i õpetus laiema ökosüsteemi jaoks.
  • Azure Andmejärve salvestusruum Gen2: Lisab Blob Storage'i peale hierarhilise nimeruumi, mis annab kataloogitaseme turvalisuse ja kiirema juurdepääsu analüütikale.
  • Google Cloud Salvestusruum BigLake'iga: Kombineerib objektisalvestuse päringukihiga, mis loeb otse avatud tabeli vorminguid.
  • Apache Hadoop HDFS-iga: Algne kohapealne variant, mida kasutatakse endiselt juhul, kui andmed peavad jääma privaatsesse andmekeskusesse.
  • Andmetellised ja lumehelves: Platvormid, mis kihistavad tabelivorminguid, näiteks Delta Lake ja Apache Iceberg objektisalvestuse kaudu tehingute ja versioonimise lisamiseks.

Valik järgib tavaliselt pilveteenuse pakkujat, mida organisatsioon juba kasutab, kuna allaneelamine ja äriteabe tööriistad kõige odavamalt integreerida ühte ökosüsteemi.

Data Lake'i küpsusastmed

Andmejärve küpsusastmete määratlus on õpikuti erinev. Kuigi tuum jääb samaks. Pärast küpsust on lavamääratlus võhiku vaatenurgast.

1. etapp: käsitlege ja neelake andmeid mastaabis

See andmete küpsuse esimene etapp hõlmab andmete teisendamise ja analüüsimise võime parandamist. Siin peavad ettevõtete omanikud leidma vastavalt oma oskustele tööriistad, et hankida rohkem andmeid ja luua analüütilisi rakendusi.

2. etapp: analüütilise lihase ehitamine

See on teine ​​etapp, mis hõlmab andmete teisendamise ja analüüsimise võime parandamist. Selles etapis kasutavad ettevõtted tööriista, mis on nende oskuste jaoks kõige sobivam. Nad hakkavad hankima rohkem andmeid ja looma rakendusi. Siin kasutatakse koos ettevõtte andmelao ja andmejärve võimalusi.

3. etapp: EDW ja Data Lake töötavad koos

See samm hõlmab andmete ja analüütika saamist võimalikult paljude inimeste kätte. Selles etapis hakkavad andmejärv ja ettevõtte andmeladu liidus tööle. Mõlemad mängivad oma osa analüütikas

4. etapp: Ettevõtlusvõime järves

Andmejärve selles küpsusastmes lisatakse andmejärvele ettevõtte võimalused. Teabe haldamise, teabe elutsükli haldamise võimaluste ja metaandmete haldamise kasutuselevõtt. Selle küpsusastmeni jõuavad aga väga vähesed organisatsioonid, kuid see arv kasvab tulevikus.

Data Lake'i juurutamise parimad tavad

  • Archistruktuurikomponendid, nende koostoime ja tuvastatud tooted peaksid toetama natiivseid andmetüüpe
  • Data Lake'i kujundamisel tuleks lähtuda sellest, mis on saadaval, mitte selle, mida nõutakse. Skeemi ja andmenõuet ei määratleta enne, kui selle kohta päringuid tehakse
  • Disain peaks juhinduma teenuse API-ga integreeritud ühekordsetest komponentidest.
  • Andmete leidmist, sissevõtmist, salvestamist, haldust, kvaliteeti, teisendamist ja visualiseerimist tuleks hallata iseseisvalt.
  • Data Lake'i arhitektuur peaks olema kohandatud konkreetsele tööstusele. See peaks tagama, et selle domeeni jaoks vajalikud võimalused on disaini lahutamatu osa
  • Oluline on äsja avastatud andmeallikate kiirem kasutuselevõtt
  • Andmejärv aitab kohandatud haldust nttract maksimaalne väärtus
  • Data Lake peaks toetama olemasolevaid ettevõtte andmehaldustehnikaid ja -meetodeid

Andmejärve ehitamise väljakutsed:

  • Data Lake'is on andmemaht suurem, seega peab protsess rohkem sõltuma programmilisest haldusest
  • Hõredate, mittetäielike ja muutlike andmetega on raske toime tulla
  • Andmestiku ja allika laiem ulatus vajab suuremat andmehaldust ja tuge

⚠️ Hoiatus: Kataloogitud metaandmete ja jõustatud juurdepääsureegliteta järvest saab andmemugul. Andmed on olemas, kuid keegi ei suuda neid leida, usaldada ega tõestada, kes neid muutis. Seega on haldamine käivitamise nõue, mitte hilisem etapp.

Andmejärvede ja andmelao erinevus

Järgnev võrdlus võtab kokku, kuhu iga pood sobib. Põhjalikum jaotus on saadaval jaotises andmejärv vs andmeladu võrdlus.

parameetrid Andmete järved Andmeladu
kuupäev Andmejärved salvestavad kõike. Data Warehouse keskendub ainult äriprotsessidele.
Töötlemine Andmed on peamiselt töötlemata Kõrgelt töödeldud andmed.
Andmete tüüp See võib olla struktureerimata, poolstruktureeritud ja struktureeritud. See on enamasti tabeli kujul ja struktuuris.
Ülesanne Jagage andmete haldamist Optimeeritud andmete otsimiseks
Väledus Väga vilgas, konfigureerige ja konfigureerige vastavalt vajadusele. Võrreldes Data Lake'iga on see vähem vilgas ja fikseeritud konfiguratsiooniga.
kasutajad Data Lake’i kasutab enamasti Data Scientist Ettevõtlusspetsialistid kasutavad andmeladu laialdaselt
Säilitamine Andmejärvede disain odavaks salvestamiseks. Kasutatakse kiiret reageerimisaega andvat kallist salvestusruumi
TURVALISUS Pakub väiksemat kontrolli. Võimaldab andmeid paremini kontrollida.
EDW asendamine Data Lake võib olla EDW allikas EDW täiendav (mitte asendus)
Skeem Lugemise skeem (eelmääratletud skeemid puuduvad) Skeem kirjutamisel (eelmääratletud skeemid)
Andmetöötlus Aitab uute andmete kiireks sissevõtmiseks. Uue sisu tutvustamine võtab aega.
Andmete detailsus Madala detailsuse või detailsuse andmed. Andmed kokkuvõtlikul või koondatud detailsustasemel.
TÖÖRIISTAD Saab kasutada avatud lähtekoodiga tööriistu, nagu Hadoop/Map Reduce Enamasti kaubanduslikud tööriistad.

Mis on andmelava?

Ülaltoodud võrdlus eeldab kahte eraldi süsteemi. Andmelaohoone ühendab need üheks, mistõttu see termin esineb enamikus praegustes arhitektuurialastes aruteludes.

Lakehouse hoiab toorfaile odavas objektisalvestusruumis ja lisab seejärel tehingute metaandmete kihi avatud tabelivormingute kaudu, näiteks Delta Lake, Apache Iceberg või Apache Hudi. See kiht pakub garantiisid, mida andmeladu pakub, samal ajal kui alusfailid jäävad avatuks.

Võime andmejärv Data Lakehouse
Tehingud Ei toetata ACID-tehingud tabelites
Skeemide käsitlemine Skeem on kirjutuskaitstud Skeemi jõustamine ja areng
Peamised kasutajad Andmeteadlased Analüütikud ja andmeteadlased koos
Aruandluskiirus Aeglane ilma eraldi laohooneta Otsepäringud indekseerimise ja vahemällu salvestamisega

Meeskondade jaoks, kes juba haldavad hallatavat järve, on tabelivormingu kasutuselevõtt tavaliselt järkjärguline uuendus, mitte ümberehitus.

Data Lake'i kasutamise eelised ja riskid

Siin on mõned Data Lake'i kasutamise peamised eelised:

  • Aitab täielikult kaasa tootmise suurendamisele ja täiustatud analüütikale
  • Pakub kulutõhusat mastaapsust ja paindlikkust
  • Pakub väärtust piiramatul hulgal andmetüüpidel
  • Vähendab pikaajalisi omamiskulusid
  • Võimaldab faile säästlikult salvestada
  • Kohandub kiiresti muutustega
  • Data Lake'i peamine eelis on tsentraliseerimine erinevatest sisuallikatest
  • Erinevatest osakondadest pärit kasutajad võivad olla üle maailma laiali paindlik juurdepääs andmetele

Data Lake'i kasutamise oht:

  • Mõne aja pärast võib Data Lake kaotada olulisuse ja hoo
  • Data Lake'i kavandamisega kaasneb suurem risk
  • Struktureerimata andmed võivad põhjustada kontrollimatut kaost, kasutuskõlbmatuid andmeid, erinevaid ja keerulisi tööriistu ning nõrka ettevõtteülest koostööd.
  • See suurendab ka salvestusruumi ja arvutab kulusid
  • Teistelt, kes on andmetega töötanud, ei ole võimalik saada teavet, kuna puudub ülevaade varasemate analüütikute leidude päritolust.
  • Andmejärvede suurim risk on turvalisus ja juurdepääsu kontroll. Mõnikord saab andmeid paigutada järve ilma igasuguse järelevalveta, kuna osa andmetest võib olla eraelu puutumatuse ja regulatiivse vajadusega.

KKK

Failide sisestamine ilma metaandmesiltide, omandiõiguse või säilitusreegliteta. Kasutajad ei saa seejärel öelda, milline andmestik on ajakohane või usaldusväärne, seega täitub järv duplikaatidega, mida keegi päringuid ei esita.

Veergvormingud, näiteks Parquet ja ORC, tihendavad päringuid hästi ja lasevad neil lugeda ainult vajalikke veerge. JSON ja CSV jäävad enne teisendamist kasulikuks ka toores sihttsoonis.

Mudelikoolitus vajab suures mahus töötlemata ja mitmekesiseid näiteid, mida järv säilitabki. Meeskonnad loevad otse objektide salvestusruumist, selle asemel et neid laost eksportida.

Jah. Tehisintellekti teenused skannivad sissetulevaid faile, järeldavad skeeme, pakuvad metaandmesilte ja märgistavad veerge, mis näevad välja nagu isikuandmed. Inimestest haldurid kiidavad klassifikatsioonid enne poliitikate jõustamist siiski heaks.

Rakenda salvestusruumi elutsükli reegleid, mis liigutavad külmad failid arhiivikihtidele, tihenda väikesed failid suuremateks ja jaotavad andmeid nii, et päringud skanniksid vähem. Tavaliselt domineerib arvel arvutusvõimsus, mitte salvestusruum.

Võta see postitus kokku järgmiselt: