Τι είναι μια Λίμνη Δεδομένων; Ορισμός, Architecture & καλυτερα Practices
⚡ Έξυπνη Σύνοψη
Η αρχιτεκτονική Data Lake αποθηκεύει δομημένα, ημιδομημένα και μη δομημένα δεδομένα σε εγγενή μορφή με επίπεδη σχεδίαση. Κάθε στοιχείο λαμβάνει ένα μοναδικό αναγνωριστικό και ετικέτες μεταδεδομένων, επιτρέποντας την ανάλυση χωρίς προκαθορισμένο εταιρικό σχήμα.

Τι είναι το Data Lake;
Η Λίμνη Δεδομένων είναι μια αποθήκη αποθήκευσης που μπορεί να αποθηκεύσει μεγάλη ποσότητα δομημένων, ημιδομημένων και μη δομημένων δεδομένων. Είναι ένα μέρος για την αποθήκευση κάθε τύπου δεδομένων στην εγγενή του μορφή χωρίς σταθερά όρια στο μέγεθος του λογαριασμού ή στο αρχείο. Προσφέρει υψηλή ποσότητα δεδομένων για την αύξηση της αναλυτικής απόδοσης και της εγγενούς ενοποίησης.
Η Λίμνη Δεδομένων είναι σαν ένα μεγάλο δοχείο που μοιάζει πολύ με πραγματική λίμνη και ποτάμια. Ακριβώς όπως σε μια λίμνη που εισέρχονται πολλοί παραπόταμοι, μια λίμνη δεδομένων έχει δομημένα δεδομένα, μη δομημένα δεδομένα, από μηχανή σε μηχανή, κούτσουρα που ρέουν σε πραγματικό χρόνο.

Όπως δείχνει το παραπάνω παράδειγμα, πολλές ξεχωριστές ροές τροφοδοτούν ένα ενιαίο σύνολο αποθηκευμένων δεδομένων. Η Λίμνη Δεδομένων εκδημοκρατικοποιεί τα δεδομένα και αποτελεί έναν οικονομικά αποδοτικό τρόπο αποθήκευσης όλων των δεδομένων ενός οργανισμού για μεταγενέστερη επεξεργασία. Ο Αναλυτής Έρευνας μπορεί να επικεντρωθεί στην εύρεση μοτίβων νοήματος στα δεδομένα και όχι στα ίδια τα δεδομένα.
Σε αντίθεση με έναν ιεραρχικό Αποθήκη δεδομένων όπου τα δεδομένα αποθηκεύονται σε Files and Folder, το Data Lake έχει επίπεδη αρχιτεκτονική. Σε κάθε στοιχείο δεδομένων σε μια Λίμνη Δεδομένων δίνεται ένα μοναδικό αναγνωριστικό και επισημαίνεται με ένα σύνολο πληροφοριών μεταδεδομένων.
Γιατί Data Lake;
Ο κύριος στόχος της οικοδόμησης μιας λίμνης δεδομένων είναι να προσφέρει μια μη βελτιωμένη άποψη των δεδομένων στους επιστήμονες δεδομένων.
Οι λόγοι για τη χρήση του Data Lake είναι:
- Με την έναρξη των μηχανών αποθήκευσης όπως Hadoop Η αποθήκευση ανόμοιων πληροφοριών έχει γίνει εύκολη. Δεν χρειάζεται να μοντελοποιήσετε δεδομένα σε ένα σχήμα σε επίπεδο επιχείρησης με Data Lake.
- Με την αύξηση του όγκου δεδομένων, της ποιότητας των δεδομένων και των μεταδεδομένων, αυξάνεται και η ποιότητα των αναλύσεων.
- Η Data Lake προσφέρει επιχειρηματική ευελιξία
- Μηχανική μάθηση και η Τεχνητή Νοημοσύνη μπορεί να χρησιμοποιηθεί για να γίνουν κερδοφόρες προβλέψεις.
- Προσφέρει ανταγωνιστικό πλεονέκτημα στον οργανισμό υλοποίησης.
- Δεν υπάρχει δομή σιλό δεδομένων. Το Data Lake παρέχει στους πελάτες προβολή 360 μοιρών και κάνει την ανάλυση πιο ισχυρή.
Λίμνη δεδομένων Archiδομή
Το σχήμα δείχνει την αρχιτεκτονική μιας λίμνης επιχειρηματικών δεδομένων. Τα χαμηλότερα επίπεδα αντιπροσωπεύουν δεδομένα που είναι ως επί το πλείστον σε κατάσταση ηρεμίας, ενώ τα ανώτερα επίπεδα δείχνουν δεδομένα συναλλαγών σε πραγματικό χρόνο. Αυτά τα δεδομένα ρέουν μέσω του συστήματος χωρίς ή με μικρή καθυστέρηση. Ακολουθούν σημαντικές βαθμίδες στο Data Lake Archiδομή:
- Επίπεδο κατάποσης: Τα επίπεδα στην αριστερή πλευρά απεικονίζουν τις πηγές δεδομένων. Τα δεδομένα θα μπορούσαν να φορτωθούν στη λίμνη δεδομένων σε παρτίδες ή σε πραγματικό χρόνο
- Επίπεδο πληροφοριών: Τα επίπεδα στα δεξιά αντιπροσωπεύουν την ερευνητική πλευρά όπου χρησιμοποιούνται πληροφορίες από το σύστημα. SQL, ερωτήματα NoSQL ή ακόμα και excel θα μπορούσαν να χρησιμοποιηθούν για ανάλυση δεδομένων.
- ΚΑΕ είναι μια οικονομικά αποδοτική λύση τόσο για δομημένα όσο και για μη δομημένα δεδομένα. Είναι μια ζώνη προσγείωσης για όλα τα δεδομένα που βρίσκονται σε ηρεμία στο σύστημα.
- Βαθμίδα απόσταξης Λαμβάνει δεδομένα από το επίπεδο αποθήκευσης και τα μετατρέπει σε δομημένα δεδομένα για ευκολότερη ανάλυση.
- Επίπεδο επεξεργασίας εκτελέστε αναλυτικούς αλγόριθμους και ερωτήματα χρηστών με ποικίλο πραγματικό χρόνο, διαδραστικά, ομαδικά για τη δημιουργία δομημένων δεδομένων για ευκολότερη ανάλυση.
- Ενιαίο επίπεδο λειτουργιών διέπει τη διαχείριση και την παρακολούθηση του συστήματος. Περιλαμβάνει έλεγχο και διαχείριση επάρκειας, διαχείριση δεδομένων, διαχείριση ροής εργασίας.
Key Data Lake Concepts
Ακολουθούν βασικές έννοιες της Λίμνης Δεδομένων που πρέπει να κατανοήσει κάποιος για να κατανοήσει πλήρως τη Λίμνη Δεδομένων Archiδομή
Κατάποση δεδομένων
Η απορρόφηση δεδομένων επιτρέπει στους συνδέσμους να λαμβάνουν δεδομένα από διαφορετικές πηγές δεδομένων και να φορτώνουν στη λίμνη Δεδομένων.
Η απορρόφηση δεδομένων υποστηρίζει:
- Όλοι οι τύποι δομημένων, ημιδομημένων και μη δομημένων δεδομένων.
- Πολλαπλές απολήψεις όπως Μαζική, Πραγματικός Χρόνος, Εφάπαξ φόρτωση.
- Πολλοί τύποι πηγών δεδομένων όπως βάσεις δεδομένων, διακομιστές ιστού, μηνύματα ηλεκτρονικού ταχυδρομείου, IoTκαι FTP.
Αποθήκευσης δεδομένων
Η αποθήκευση δεδομένων πρέπει να είναι επεκτάσιμη, να προσφέρει οικονομικά αποδοτική αποθήκευση και να επιτρέπει γρήγορη πρόσβαση στην εξερεύνηση δεδομένων. Θα πρέπει να υποστηρίζει διάφορες μορφές δεδομένων.
Διακυβέρνηση δεδομένων
Η διακυβέρνηση δεδομένων είναι μια διαδικασία διαχείρισης της διαθεσιμότητας, της χρηστικότητας, της ασφάλειας και της ακεραιότητας των δεδομένων που χρησιμοποιούνται σε έναν οργανισμό.
Ασφάλεια
Η ασφάλεια πρέπει να εφαρμόζεται σε κάθε στρώμα της λίμνης Δεδομένων. Ξεκινά με την αποθήκευση, την αποκάλυψη και την κατανάλωση. Η βασική ανάγκη είναι να σταματήσει η πρόσβαση για μη εξουσιοδοτημένους χρήστες. Θα πρέπει να υποστηρίζει διαφορετικά εργαλεία για πρόσβαση σε δεδομένα με εύκολη πλοήγηση GUI και πίνακες εργαλείων.
Ο έλεγχος ταυτότητας, η λογιστική, η εξουσιοδότηση και η προστασία δεδομένων είναι μερικά σημαντικά χαρακτηριστικά της ασφάλειας της λίμνης δεδομένων.
Ποιότητα δεδομένων
Η ποιότητα των δεδομένων είναι ένα ουσιαστικό στοιχείο της αρχιτεκτονικής της Data Lake. Τα δεδομένα χρησιμοποιούνται για την εκτίμηση της επιχειρηματικής αξίας. Π.χ.tracΗ εξαγωγή πληροφοριών από δεδομένα κακής ποιότητας θα οδηγήσει σε πληροφορίες κακής ποιότητας.
Ανακάλυψη δεδομένων
Η Ανακάλυψη Δεδομένων είναι ένα άλλο σημαντικό στάδιο πριν ξεκινήσετε την προετοιμασία δεδομένων ή την ανάλυση. Σε αυτό το στάδιο, η τεχνική επισήμανσης χρησιμοποιείται για να εκφράσει την κατανόηση των δεδομένων, οργανώνοντας και ερμηνεύοντας τα δεδομένα που λαμβάνονται στη λίμνη Δεδομένων.
Έλεγχος Δεδομένων
Δύο κύριες εργασίες ελέγχου δεδομένων είναι tracΟ βασιλιάς αλλάζει στο βασικό σύνολο δεδομένων.
- Tracking αλλαγές σε σημαντικά στοιχεία του συνόλου δεδομένων
- Καταγράφει πώς/ πότε/ και ποιος αλλάζει σε αυτά τα στοιχεία.
Ο έλεγχος δεδομένων βοηθά στην αξιολόγηση του κινδύνου και της συμμόρφωσης.
Γενεαλογία Δεδομένων
Αυτό το στοιχείο ασχολείται με την προέλευση των δεδομένων. Ασχολείται κυρίως με το πού μετακινούνται με την πάροδο του χρόνου και τι τους συμβαίνει. Διευκολύνει τις διορθώσεις σφαλμάτων σε μια διαδικασία ανάλυσης δεδομένων από την προέλευση έως τον προορισμό.
Εξερεύνηση δεδομένων
Είναι το αρχικό στάδιο της ανάλυσης δεδομένων. Βοηθά να προσδιοριστεί το σωστό σύνολο δεδομένων είναι ζωτικής σημασίας πριν από την έναρξη της Εξερεύνησης Δεδομένων.
Όλα τα δεδομένα πρέπει να συνεργαστούν για να διαδραματίσουν σημαντικό ρόλο στην εύκολη εξέλιξη και εξερεύνηση του περιβάλλοντος της Data Lake.
Δημοφιλείς πλατφόρμες Data Lake
Τα επίπεδα που περιγράφονται παραπάνω συνήθως συναρμολογούνται από διαχειριζόμενες υπηρεσίες cloud και όχι κατασκευάζονται από την αρχή. Οι παρακάτω πλατφόρμες καλύπτουν τα επίπεδα αποθήκευσης και καταλογογράφησης με τα οποία ξεκινούν οι περισσότερες υλοποιήσεις.
- Amazon S3 με σχηματισμό λιμνών AWS: Αποθήκευση αντικειμένων σε συνδυασμό με μια υπηρεσία που καταχωρεί πηγές, ορίζει δικαιώματα και δημιουργεί τον κατάλογο δεδομένων. Δείτε το Εκπαιδευτικό σεμινάριο AWS για το ευρύτερο οικοσύστημα.
- Azure Data Lake Storage Gen2: Προσθέτει έναν ιεραρχικό χώρο ονομάτων πάνω από το Blob Storage, ο οποίος παρέχει ασφάλεια σε επίπεδο καταλόγου και ταχύτερη πρόσβαση σε αναλυτικά στοιχεία.
- Google Cloud Αποθήκευση με το BigLake: Συνδυάζει την αποθήκευση αντικειμένων με ένα επίπεδο ερωτήματος που διαβάζει απευθείας τις μορφές ανοιχτών πινάκων.
- Apache Hadoop με HDFS: Η αρχική επιλογή εσωτερικής εγκατάστασης, η οποία εξακολουθεί να χρησιμοποιείται όταν τα δεδομένα πρέπει να παραμένουν εντός ενός ιδιωτικού κέντρου δεδομένων.
- Databricks και Snowflake: Πλατφόρμες που δημιουργούν επίπεδα σε μορφές πινάκων, όπως Delta Lake και Apache Iceberg πάνω από την αποθήκευση αντικειμένων για την προσθήκη συναλλαγών και διαχείρισης εκδόσεων.
Η επιλογή συνήθως ακολουθεί τον πάροχο cloud που ήδη χρησιμοποιεί ένας οργανισμός, από την εισαγωγή και την εργαλεία επιχειρησιακής νοημοσύνης ενσωματώνονται με τον πιο οικονομικό τρόπο σε ένα ενιαίο οικοσύστημα.
Στάδια ωριμότητας της Λίμνης Δεδομένων
Ο ορισμός των σταδίων ωριμότητας της λίμνης δεδομένων διαφέρει από εγχειρίδιο σε άλλο. Αν και η ουσία παραμένει η ίδια. Μετά την ωριμότητα, ο σκηνικός ορισμός είναι από λαϊκή σκοπιά.
Στάδιο 1: Χειρισμός και απορρόφηση δεδομένων σε κλίμακα
Αυτό το πρώτο στάδιο της ωριμότητας δεδομένων περιλαμβάνει τη βελτίωση της ικανότητας μετασχηματισμού και ανάλυσης δεδομένων. Εδώ, οι ιδιοκτήτες επιχειρήσεων πρέπει να βρουν τα εργαλεία σύμφωνα με το σύνολο δεξιοτήτων τους για τη λήψη περισσότερων δεδομένων και τη δημιουργία αναλυτικών εφαρμογών.
Στάδιο 2: Δόμηση του αναλυτικού μυός
Αυτό είναι ένα δεύτερο στάδιο που περιλαμβάνει τη βελτίωση της ικανότητας μετασχηματισμού και ανάλυσης δεδομένων. Σε αυτό το στάδιο, οι εταιρείες χρησιμοποιούν το εργαλείο που είναι πιο κατάλληλο για τις δεξιότητές τους. Αρχίζουν να αποκτούν περισσότερα δεδομένα και να δημιουργούν εφαρμογές. Εδώ, οι δυνατότητες της αποθήκης δεδομένων της επιχείρησης και της λίμνης δεδομένων χρησιμοποιούνται μαζί.
Στάδιο 3: EDW και Data Lake εργάζονται από κοινού
Αυτό το βήμα περιλαμβάνει τη μεταφορά δεδομένων και αναλυτικών στοιχείων στα χέρια όσο το δυνατόν περισσότερων ανθρώπων. Σε αυτό το στάδιο, η λίμνη δεδομένων και η αποθήκη δεδομένων της επιχείρησης αρχίζουν να λειτουργούν σε μια ένωση. Και οι δύο παίζουν το ρόλο τους στην ανάλυση
Στάδιο 4: Επιχειρηματική ικανότητα στη λίμνη
Σε αυτό το στάδιο ωριμότητας της λίμνης δεδομένων, οι επιχειρηματικές δυνατότητες προστίθενται στη λίμνη δεδομένων. Υιοθέτηση της διακυβέρνησης πληροφοριών, των δυνατοτήτων διαχείρισης του κύκλου ζωής των πληροφοριών και της διαχείρισης μεταδεδομένων. Ωστόσο, πολύ λίγοι οργανισμοί μπορούν να φτάσουν σε αυτό το επίπεδο ωριμότητας, αλλά αυτός ο απολογισμός θα αυξηθεί στο μέλλον.
καλυτερα πρακτικες για Εφαρμογή Δεδομένων Λίμνης
- Archiτα τεχνικά στοιχεία, η αλληλεπίδρασή τους και τα αναγνωρισμένα προϊόντα θα πρέπει να υποστηρίζουν εγγενείς τύπους δεδομένων
- Ο σχεδιασμός του Data Lake θα πρέπει να βασίζεται σε αυτό που είναι διαθέσιμο αντί για αυτό που απαιτείται. Η απαίτηση σχήματος και δεδομένων δεν ορίζεται μέχρι να υποβληθεί ερώτημα
- Ο σχεδιασμός θα πρέπει να καθοδηγείται από εξαρτήματα μιας χρήσης ενσωματωμένα με το Service API.
- Η ανακάλυψη, η κατάποση, η αποθήκευση, η διαχείριση, η ποιότητα, ο μετασχηματισμός και η οπτικοποίηση δεδομένων θα πρέπει να διαχειρίζονται ανεξάρτητα.
- Η αρχιτεκτονική της Data Lake θα πρέπει να είναι προσαρμοσμένη σε μια συγκεκριμένη βιομηχανία. Θα πρέπει να διασφαλίζει ότι οι απαραίτητες δυνατότητες για αυτόν τον τομέα αποτελούν εγγενές μέρος του σχεδιασμού
- Η ταχύτερη ενσωμάτωση πηγών δεδομένων που ανακαλύφθηκαν πρόσφατα είναι σημαντική
- Η Data Lake βοηθά στην προσαρμοσμένη διαχείριση για την extracμέγιστη τιμή t
- Η Λίμνη Δεδομένων θα πρέπει να υποστηρίζει τις υπάρχουσες τεχνικές και μεθόδους διαχείρισης εταιρικών δεδομένων
Προκλήσεις για την κατασκευή μιας λίμνης δεδομένων:
- Στο Data Lake, ο όγκος δεδομένων είναι υψηλότερος, επομένως η διαδικασία πρέπει να εξαρτάται περισσότερο από τη διαχείριση μέσω προγραμματισμού
- Είναι δύσκολο να αντιμετωπίσεις αραιά, ελλιπή, ασταθή δεδομένα
- Το ευρύτερο εύρος δεδομένων και πηγής χρειάζεται μεγαλύτερη διαχείριση και υποστήριξη δεδομένων
⚠️ Προειδοποίηση: Μια λίμνη χωρίς καταλογογραφημένα μεταδεδομένα και επιβεβλημένους κανόνες πρόσβασης μετατρέπεται σε βάλτο δεδομένων. Τα δεδομένα υπάρχουν, αλλά κανείς δεν μπορεί να τα βρει, να τα εμπιστευτεί ή να αποδείξει ποιος τα άλλαξε. Η διακυβέρνηση είναι επομένως μια απαίτηση για την έναρξη λειτουργίας και όχι μια μεταγενέστερη φάση.
Διαφορά μεταξύ λιμνών δεδομένων και αποθήκης δεδομένων
Η ακόλουθη σύγκριση συνοψίζει πού ταιριάζει κάθε κατάστημα. Μια πιο λεπτομερής ανάλυση είναι διαθέσιμη στο Λίμνη δεδομένων έναντι αποθήκης δεδομένων σύγκριση.
| Παράμετροι | Λίμνες δεδομένων | Αποθήκη δεδομένων |
|---|---|---|
| ημερομηνία | Οι λίμνες δεδομένων αποθηκεύουν τα πάντα. | Το Data Warehouse εστιάζει μόνο στις Επιχειρηματικές Διαδικασίες. |
| Επεξεργασία | Τα δεδομένα είναι κυρίως μη επεξεργασμένα | Δεδομένα υψηλής επεξεργασίας. |
| Τύπος Δεδομένων | Μπορεί να είναι Μη δομημένο, ημιδομημένο και δομημένο. | Είναι κυρίως σε μορφή και δομή πίνακα. |
| Έργο | Κοινή διαχείριση δεδομένων | Βελτιστοποιημένο για ανάκτηση δεδομένων |
| Ευκινησία | Εξαιρετικά ευέλικτο, διαμορφώστε και επαναδιαμορφώστε τις παραμέτρους όπως απαιτείται. | Σε σύγκριση με τη λίμνη Data είναι λιγότερο ευέλικτη και έχει σταθερή διαμόρφωση. |
| Χρήστες | Το Data Lake χρησιμοποιείται κυρίως από το Data Scientist | Οι επαγγελματίες των επιχειρήσεων χρησιμοποιούν ευρέως το Data Warehouse |
| Αποθηκευτικός χώρος | Σχεδιασμός λιμνών δεδομένων για αποθήκευση χαμηλού κόστους. | Χρησιμοποιείται ακριβός χώρος αποθήκευσης που δίνει γρήγορους χρόνους απόκρισης |
| Ασφάλεια | Προσφέρει μικρότερο έλεγχο. | Επιτρέπει τον καλύτερο έλεγχο των δεδομένων. |
| Αντικατάσταση EDW | Η λίμνη δεδομένων μπορεί να είναι πηγή για το EDW | Συμπληρωματικό του EDW (όχι αντικατάσταση) |
| Schema | Σχήμα κατά την ανάγνωση (χωρίς προκαθορισμένα σχήματα) | Σχήμα κατά την εγγραφή (προκαθορισμένα σχήματα) |
| Επεξεργασία δεδομένων | Βοηθά στη γρήγορη απορρόφηση νέων δεδομένων. | Χρονοβόρα η εισαγωγή νέου περιεχομένου. |
| Κοκκοποίηση δεδομένων | Δεδομένα σε χαμηλό επίπεδο λεπτομέρειας ή ευαισθησίας. | Δεδομένα σε συνοπτικό ή συγκεντρωτικό επίπεδο λεπτομέρειας. |
| Κόλλα | Μπορεί να χρησιμοποιεί ανοιχτού κώδικα/εργαλεία όπως το Hadoop/Μείωση χάρτη | Εμπορικά εργαλεία κυρίως. |
Τι είναι ένα Data Lakehouse;
Η παραπάνω σύγκριση υποθέτει δύο ξεχωριστά συστήματα. Ένα Data Lakehouse τα συγχωνεύει σε ένα, γι' αυτό και ο όρος εμφανίζεται στις περισσότερες τρέχουσες συζητήσεις για την αρχιτεκτονική.
Ένα lakehouse διατηρεί τα ακατέργαστα αρχεία σε χώρο αποθήκευσης αντικειμένων χαμηλού κόστους και στη συνέχεια προσθέτει ένα επίπεδο μεταδεδομένων συναλλαγών μέσω μορφών ανοιχτού πίνακα, όπως Delta Λίμνη, Apache Iceberg ή Apache Hudi. Αυτό το επίπεδο παρέχει τις εγγυήσεις που παρέχει μια αποθήκη ενώ τα υποκείμενα αρχεία παραμένουν ανοιχτά.
| Ικανότητα | Λίμνη δεδομένων | Data Lakehouse |
|---|---|---|
| Συναλλαγές | Δεν υποστηρίζεται | Συναλλαγές ACID σε τραπέζια |
| Χειρισμός σχήματος | Σχήμα μόνο για ανάγνωση | Επιβολή και εξέλιξη σχήματος |
| Κύριοι χρήστες | Επιστήμονες δεδομένων | Αναλυτές και επιστήμονες δεδομένων μαζί |
| Ταχύτητα αναφοράς | Αργή λειτουργία χωρίς ξεχωριστή αποθήκη | Άμεση υποβολή ερωτημάτων με ευρετηρίαση και προσωρινή αποθήκευση |
Για ομάδες που ήδη διαχειρίζονται μια λίμνη με κυβερνώμενο σύστημα, η υιοθέτηση μιας μορφής τραπεζιού είναι συνήθως μια σταδιακή αναβάθμιση και όχι μια ανακατασκευή.
Οφέλη και κίνδυνοι από τη χρήση της Data Lake
Ακολουθούν ορισμένα σημαντικά οφέλη από τη χρήση μιας λίμνης δεδομένων:
- Βοηθά πλήρως στην παραγωγικότητα και στις προηγμένες αναλύσεις
- Προσφέρει οικονομικά αποδοτική επεκτασιμότητα και ευελιξία
- Προσφέρει αξία από απεριόριστους τύπους δεδομένων
- Μειώνει το μακροπρόθεσμο κόστος ιδιοκτησίας
- Επιτρέπει την οικονομική αποθήκευση αρχείων
- Γρήγορα προσαρμόσιμο στις αλλαγές
- Το κύριο πλεονέκτημα της λίμνης δεδομένων είναι το συγκέντρωση διαφορετικών πηγών περιεχομένου
- Χρήστες, από διάφορα τμήματα, μπορεί να είναι διασκορπισμένοι σε όλο τον κόσμο ευέλικτη πρόσβαση στα δεδομένα
Κίνδυνος χρήσης Data Lake:
- Μετά από κάποιο χρονικό διάστημα, το Data Lake μπορεί να χάσει τη συνάφεια και την ορμή
- Υπάρχει μεγαλύτερος κίνδυνος κατά τον σχεδιασμό της Data Lake
- Τα μη δομημένα δεδομένα ενδέχεται να οδηγήσουν σε ακυβέρνητο χάος, άχρηστα δεδομένα, ανόμοια και πολύπλοκα εργαλεία και αδύναμη συνεργασία σε ολόκληρη την επιχείρηση.
- Αυξάνει επίσης την αποθήκευση και υπολογίζει το κόστος
- Δεν υπάρχει τρόπος να λάβετε πληροφορίες από άλλους που έχουν εργαστεί με τα δεδομένα, επειδή δεν υπάρχει αναφορά της γενεαλογίας των ευρημάτων από προηγούμενους αναλυτές
- Ο μεγαλύτερος κίνδυνος των λιμνών δεδομένων είναι η ασφάλεια και ο έλεγχος πρόσβασης. Μερικές φορές τα δεδομένα μπορούν να τοποθετηθούν σε μια λίμνη χωρίς καμία επίβλεψη, καθώς ορισμένα από τα δεδομένα μπορεί να έχουν προστασία της ιδιωτικής ζωής και ρυθμιστική ανάγκη
