Mis on andmejärv? Definitsioon Archistruktuur ja parimad tavad
⚡ Nutikas kokkuvõte
Data Lake'i arhitektuur salvestab struktureeritud, poolstruktureeritud ja struktureerimata andmeid natiivses vormingus ühetaolise kujunduse all. Iga element saab unikaalse identifikaatori ja metaandmete sildid, mis võimaldab analüüsi ilma eelnevalt määratletud ettevõtte skeemita.

Mis on Data Lake?
Data Lake on salvestushoidla, mis suudab salvestada suurel hulgal struktureeritud, poolstruktureeritud ja struktureerimata andmeid. See on koht, kus saab salvestada igat tüüpi andmeid nende algvormingus, ilma konto suuruse või faili piiranguteta. See pakub suurt andmemahtu, et suurendada analüütilist jõudlust ja natiivset integratsiooni.
Data Lake on nagu suur konteiner, mis on väga sarnane tõelise järve ja jõgedega. Nii nagu järves, kus on mitu lisajõge, on andmejärves struktureeritud andmed, struktureerimata andmed, masinatevahelised andmed, reaalajas voolavad logid.

Nagu ülaltoodud illustratsioon näitab, toidavad paljud eraldi vood ühte salvestatud andmekogumit. Andmejärv demokratiseerib andmeid ja on kulutõhus viis organisatsiooni kõigi andmete salvestamiseks hilisemaks töötlemiseks. Uurimisanalüütik saab keskenduda tähendusmustrite leidmisele andmetes, mitte andmetes endis.
Erinevalt hierarhilisest Andmeladu kus andmeid salvestatakse failidesse ja kaustadesse, on Data Lake'il tasane arhitektuur. Igale Data Lake'i andmeelemendile antakse kordumatu identifikaator ja märgitakse metaandmete kogum.
Miks Data Lake?
Andmejärve ehitamise peamine eesmärk on pakkuda andmeteadlastele täpsustamata vaadet andmetele.
Data Lake'i kasutamise põhjused on järgmised:
- Mis algusega ladustamise mootorid nagu hadoop erineva teabe salvestamine on muutunud lihtsaks. Andmeid ei ole vaja Data Lake'i abil kogu ettevõtet hõlmavaks skeemiks modelleerida.
- Andmemahu, andmete kvaliteedi ja metaandmete kasvuga tõuseb ka analüüside kvaliteet.
- Data Lake pakub ärilist Agilityt
- Masinõpe ja tehisintellekti saab kasutada tulusate prognooside tegemiseks.
- See pakub rakendavale organisatsioonile konkurentsieelise.
- Andmesilo struktuur puudub. Data Lake annab klientidele 360-kraadise ülevaate ja muudab analüüsi töökindlamaks.
andmejärv Architektuur
Joonisel on kujutatud Business Data Lake'i arhitektuur. Alumised tasemed esindavad andmeid, mis on enamasti puhkeolekus, samas kui ülemised tasemed näitavad reaalajas tehinguandmeid. Need andmed liiguvad läbi süsteemi ilma või vähese latentsusega. Järgmised on Data Lake'i olulised tasemed ArchiStruktuur:
- Allaneelamise tase: vasakpoolsed tasemed kujutavad andmeallikaid. Andmeid saab laadida andmejärve partiidena või reaalajas
- Statistika tase: Parempoolsed tasemed esindavad uurimistöö poolt, kus kasutatakse süsteemi teadmisi. SQL, andmete analüüsimiseks saab kasutada NoSQL-i päringuid või isegi Exceli.
- HDFS on kulutõhus lahendus nii struktureeritud kui ka struktureerimata andmete jaoks. See on kõigi süsteemis olevate andmete maandumistsoon.
- Destilleerimise tasand võtab salvestustasandilt andmeid ja teisendab need struktureeritud andmeteks hõlpsamaks analüüsimiseks.
- Töötlemise tasand käivitage analüütilisi algoritme ja kasutajate päringuid erineva reaalajas, interaktiivsete partiidega, et luua struktureeritud andmeid lihtsamaks analüüsiks.
- Ühtne operatsioonide tasand reguleerib süsteemi haldamist ja jälgimist. See hõlmab auditeerimist ja oskuste haldamist, andmehaldust, töövoo juhtimine.
Key Data Lake Concepts
Järgnevalt on toodud Data Lake'i võtmekontseptsioonid, mida tuleb Data Lake'i täielikuks mõistmiseks mõista Architektuur
Andmete sissevõtmine
Andmete sisestamine võimaldab konnektoritel saada andmeid erinevatest andmeallikatest ja laadida need Data Lake'i.
Andmete sisestamine toetab:
- Igat tüüpi struktureeritud, poolstruktureeritud ja struktureerimata andmed.
- Mitu allaneelamist, näiteks partii, reaalajas, ühekordne laadimine.
- Mitut tüüpi andmeallikad, nagu andmebaasid, veebiserverid, e-kirjad, IoTja FTP.
Data Storage
Andmesalvestus peaks olema skaleeritav, pakkuma kulutõhusat salvestusruumi ja võimaldama kiiret juurdepääsu andmete uurimisele. See peaks toetama erinevaid andmevorminguid.
Andmete haldamine
Andmehaldus on protsess, mille käigus hallatakse organisatsioonis kasutatavate andmete kättesaadavust, kasutatavust, turvalisust ja terviklikkust.
TURVALISUS
Turvalisust tuleb rakendada Data Lake'i igas kihis. See algab ladustamisest, kaevandamisest ja tarbimisest. Põhivajadus on peatada volitamata kasutajate juurdepääs. See peaks toetama erinevaid tööriistu andmetele juurdepääsuks hõlpsasti navigeeritava GUI ja armatuurlauaga.
Autentimine, raamatupidamine, autoriseerimine ja andmekaitse on mõned Data Lake'i turvalisuse olulised funktsioonid.
Andmekvaliteet
Andmete kvaliteet on Data Lake'i arhitektuuri oluline komponent. Andmeid kasutatakse äriväärtuse täpseks loomiseks. NäitekstracHalva kvaliteediga andmetest arusaamade ammutamine viib halva kvaliteediga teadmisteni.
Andmete avastamine
Andmete avastamine on veel üks oluline etapp enne andmete ettevalmistamise või analüüsi alustamist. Selles etapis kasutatakse andmete mõistmise väljendamiseks sildistamistehnikat, korraldades ja tõlgendades Andmejärves neelatud andmeid.
Andmete auditeerimine
Kaks peamist andmete auditeerimise ülesannet on trackuningas muudab võtmeandmestikku.
- Tracking oluliste andmestiku elementide muudatused
- Jäädvustab, kuidas/ millal/ ja kes neid elemente muudab.
Andmete auditeerimine aitab hinnata riske ja vastavust.
Andmeliinid
See komponent tegeleb andmete päritoluga. See tegeleb peamiselt sellega, kuhu need aja jooksul liiguvad ja mis nendega juhtub. See hõlbustab vigade parandamist andmeanalüüsi protsessis päritolust sihtkohta.
Andmete uurimine
See on andmete analüüsi algusetapp. See aitab tuvastada õige andmestiku, mis on oluline enne andmete uurimise alustamist.
Kõik antud komponendid peavad töötama koos, et mängida olulist rolli Data Lake'i ehitamisel, mida saab hõlpsasti arendada ja keskkonda uurida.
Populaarsed andmejärve platvormid
Ülalkirjeldatud astmed pannakse tavaliselt kokku hallatavatest pilveteenustest, mitte ei ehitata nullist. Allpool olevad platvormid hõlmavad salvestus- ja kataloogimiskihte, millega enamik rakendusi algab.
- Amazon S3 koos AWS järve moodustumisega: Objektisalvestus koos teenusega, mis registreerib allikaid, määrab õigused ja loob andmekataloogi. Vaata AWS-i õpetus laiema ökosüsteemi jaoks.
- Azure Andmejärve salvestusruum Gen2: Lisab Blob Storage'i peale hierarhilise nimeruumi, mis annab kataloogitaseme turvalisuse ja kiirema juurdepääsu analüütikale.
- Google Cloud Salvestusruum BigLake'iga: Kombineerib objektisalvestuse päringukihiga, mis loeb otse avatud tabeli vorminguid.
- Apache Hadoop HDFS-iga: Algne kohapealne variant, mida kasutatakse endiselt juhul, kui andmed peavad jääma privaatsesse andmekeskusesse.
- Andmetellised ja lumehelves: Platvormid, mis kihistavad tabelivorminguid, näiteks Delta Lake ja Apache Iceberg objektisalvestuse kaudu tehingute ja versioonimise lisamiseks.
Valik järgib tavaliselt pilveteenuse pakkujat, mida organisatsioon juba kasutab, kuna allaneelamine ja äriteabe tööriistad kõige odavamalt integreerida ühte ökosüsteemi.
Data Lake'i küpsusastmed
Andmejärve küpsusastmete määratlus on õpikuti erinev. Kuigi tuum jääb samaks. Pärast küpsust on lavamääratlus võhiku vaatenurgast.
1. etapp: käsitlege ja neelake andmeid mastaabis
See andmete küpsuse esimene etapp hõlmab andmete teisendamise ja analüüsimise võime parandamist. Siin peavad ettevõtete omanikud leidma vastavalt oma oskustele tööriistad, et hankida rohkem andmeid ja luua analüütilisi rakendusi.
2. etapp: analüütilise lihase ehitamine
See on teine etapp, mis hõlmab andmete teisendamise ja analüüsimise võime parandamist. Selles etapis kasutavad ettevõtted tööriista, mis on nende oskuste jaoks kõige sobivam. Nad hakkavad hankima rohkem andmeid ja looma rakendusi. Siin kasutatakse koos ettevõtte andmelao ja andmejärve võimalusi.
3. etapp: EDW ja Data Lake töötavad koos
See samm hõlmab andmete ja analüütika saamist võimalikult paljude inimeste kätte. Selles etapis hakkavad andmejärv ja ettevõtte andmeladu liidus tööle. Mõlemad mängivad oma osa analüütikas
4. etapp: Ettevõtlusvõime järves
Andmejärve selles küpsusastmes lisatakse andmejärvele ettevõtte võimalused. Teabe haldamise, teabe elutsükli haldamise võimaluste ja metaandmete haldamise kasutuselevõtt. Selle küpsusastmeni jõuavad aga väga vähesed organisatsioonid, kuid see arv kasvab tulevikus.
Data Lake'i juurutamise parimad tavad
- Archistruktuurikomponendid, nende koostoime ja tuvastatud tooted peaksid toetama natiivseid andmetüüpe
- Data Lake'i kujundamisel tuleks lähtuda sellest, mis on saadaval, mitte selle, mida nõutakse. Skeemi ja andmenõuet ei määratleta enne, kui selle kohta päringuid tehakse
- Disain peaks juhinduma teenuse API-ga integreeritud ühekordsetest komponentidest.
- Andmete leidmist, sissevõtmist, salvestamist, haldust, kvaliteeti, teisendamist ja visualiseerimist tuleks hallata iseseisvalt.
- Data Lake'i arhitektuur peaks olema kohandatud konkreetsele tööstusele. See peaks tagama, et selle domeeni jaoks vajalikud võimalused on disaini lahutamatu osa
- Oluline on äsja avastatud andmeallikate kiirem kasutuselevõtt
- Andmejärv aitab kohandatud haldust nttract maksimaalne väärtus
- Data Lake peaks toetama olemasolevaid ettevõtte andmehaldustehnikaid ja -meetodeid
Andmejärve ehitamise väljakutsed:
- Data Lake'is on andmemaht suurem, seega peab protsess rohkem sõltuma programmilisest haldusest
- Hõredate, mittetäielike ja muutlike andmetega on raske toime tulla
- Andmestiku ja allika laiem ulatus vajab suuremat andmehaldust ja tuge
⚠️ Hoiatus: Kataloogitud metaandmete ja jõustatud juurdepääsureegliteta järvest saab andmemugul. Andmed on olemas, kuid keegi ei suuda neid leida, usaldada ega tõestada, kes neid muutis. Seega on haldamine käivitamise nõue, mitte hilisem etapp.
Andmejärvede ja andmelao erinevus
Järgnev võrdlus võtab kokku, kuhu iga pood sobib. Põhjalikum jaotus on saadaval jaotises andmejärv vs andmeladu võrdlus.
| parameetrid | Andmete järved | Andmeladu |
|---|---|---|
| kuupäev | Andmejärved salvestavad kõike. | Data Warehouse keskendub ainult äriprotsessidele. |
| Töötlemine | Andmed on peamiselt töötlemata | Kõrgelt töödeldud andmed. |
| Andmete tüüp | See võib olla struktureerimata, poolstruktureeritud ja struktureeritud. | See on enamasti tabeli kujul ja struktuuris. |
| Ülesanne | Jagage andmete haldamist | Optimeeritud andmete otsimiseks |
| Väledus | Väga vilgas, konfigureerige ja konfigureerige vastavalt vajadusele. | Võrreldes Data Lake'iga on see vähem vilgas ja fikseeritud konfiguratsiooniga. |
| kasutajad | Data Lake’i kasutab enamasti Data Scientist | Ettevõtlusspetsialistid kasutavad andmeladu laialdaselt |
| Säilitamine | Andmejärvede disain odavaks salvestamiseks. | Kasutatakse kiiret reageerimisaega andvat kallist salvestusruumi |
| TURVALISUS | Pakub väiksemat kontrolli. | Võimaldab andmeid paremini kontrollida. |
| EDW asendamine | Data Lake võib olla EDW allikas | EDW täiendav (mitte asendus) |
| Skeem | Lugemise skeem (eelmääratletud skeemid puuduvad) | Skeem kirjutamisel (eelmääratletud skeemid) |
| Andmetöötlus | Aitab uute andmete kiireks sissevõtmiseks. | Uue sisu tutvustamine võtab aega. |
| Andmete detailsus | Madala detailsuse või detailsuse andmed. | Andmed kokkuvõtlikul või koondatud detailsustasemel. |
| TÖÖRIISTAD | Saab kasutada avatud lähtekoodiga tööriistu, nagu Hadoop/Map Reduce | Enamasti kaubanduslikud tööriistad. |
Mis on andmelava?
Ülaltoodud võrdlus eeldab kahte eraldi süsteemi. Andmelaohoone ühendab need üheks, mistõttu see termin esineb enamikus praegustes arhitektuurialastes aruteludes.
Lakehouse hoiab toorfaile odavas objektisalvestusruumis ja lisab seejärel tehingute metaandmete kihi avatud tabelivormingute kaudu, näiteks Delta Lake, Apache Iceberg või Apache Hudi. See kiht pakub garantiisid, mida andmeladu pakub, samal ajal kui alusfailid jäävad avatuks.
| Võime | andmejärv | Data Lakehouse |
|---|---|---|
| Tehingud | Ei toetata | ACID-tehingud tabelites |
| Skeemide käsitlemine | Skeem on kirjutuskaitstud | Skeemi jõustamine ja areng |
| Peamised kasutajad | Andmeteadlased | Analüütikud ja andmeteadlased koos |
| Aruandluskiirus | Aeglane ilma eraldi laohooneta | Otsepäringud indekseerimise ja vahemällu salvestamisega |
Meeskondade jaoks, kes juba haldavad hallatavat järve, on tabelivormingu kasutuselevõtt tavaliselt järkjärguline uuendus, mitte ümberehitus.
Data Lake'i kasutamise eelised ja riskid
Siin on mõned Data Lake'i kasutamise peamised eelised:
- Aitab täielikult kaasa tootmise suurendamisele ja täiustatud analüütikale
- Pakub kulutõhusat mastaapsust ja paindlikkust
- Pakub väärtust piiramatul hulgal andmetüüpidel
- Vähendab pikaajalisi omamiskulusid
- Võimaldab faile säästlikult salvestada
- Kohandub kiiresti muutustega
- Data Lake'i peamine eelis on tsentraliseerimine erinevatest sisuallikatest
- Erinevatest osakondadest pärit kasutajad võivad olla üle maailma laiali paindlik juurdepääs andmetele
Data Lake'i kasutamise oht:
- Mõne aja pärast võib Data Lake kaotada olulisuse ja hoo
- Data Lake'i kavandamisega kaasneb suurem risk
- Struktureerimata andmed võivad põhjustada kontrollimatut kaost, kasutuskõlbmatuid andmeid, erinevaid ja keerulisi tööriistu ning nõrka ettevõtteülest koostööd.
- See suurendab ka salvestusruumi ja arvutab kulusid
- Teistelt, kes on andmetega töötanud, ei ole võimalik saada teavet, kuna puudub ülevaade varasemate analüütikute leidude päritolust.
- Andmejärvede suurim risk on turvalisus ja juurdepääsu kontroll. Mõnikord saab andmeid paigutada järve ilma igasuguse järelevalveta, kuna osa andmetest võib olla eraelu puutumatuse ja regulatiivse vajadusega.
