Μη εποπτευόμενη μηχανική εκμάθηση: Algorithms, Τύποι & Παράδειγμα

⚡ Έξυπνη Σύνοψη

Η Μη Εποπτευόμενη Μάθηση είναι μια τεχνική μηχανικής μάθησης που λειτουργεί σε δεδομένα χωρίς ετικέτα, επιτρέποντας στο μοντέλο να ανακαλύπτει τη δομή μόνο του μέσω ομαδοποίησης, κανόνων συσχέτισης και μείωσης διαστάσεων και όχι από απαντήσεις που παρέχονται εκ των προτέρων.

  • 🔘 Δεν χρειάζονται ετικέτες: Ο αλγόριθμος αναζητά δομή αντί να αντιστοιχίζει γνωστές απαντήσεις.
  • ☑️ Τρεις οικογένειες εργασιών: Clustering, εξόρυξη κανόνων συσχέτισης και μείωση διαστάσεων.
  • Τέσσερα στυλ ομαδοποίησης: Αποκλειστική, συσσωρευτική, επικάλυψηping και πιθανοκρατικό.
  • 🧪 Ονομασμένοι αλγόριθμοι: K-μέσες τιμές, ιεραρχική ομαδοποίηση, ασαφείς C-μέσες τιμές, PCA, SVD και ICA.
  • Από πού βγάζει τα προς το ζην: Τμηματοποίηση πελατών, ανίχνευση απάτης και ανωμαλιών, ανάλυση καλαθιού αγοράς, προεπεξεργασία δεδομένων.
  • ⚙️ Το αντάλλαγμα: Καμία βασική αλήθεια δεν σημαίνει ότι τα αποτελέσματα πρέπει να ερμηνεύονται, να επικυρώνονται και να ονομάζονται από έναν άνθρωπο.

Μη Εποπτευόμενη Μηχανική Μάθηση: αλγόριθμοι, τύποι με παράδειγμα

Τι είναι η μάθηση χωρίς επίβλεψη;

Η Μη Εποπτευόμενη Μάθηση είναι μια τεχνική μηχανικής μάθησης στην οποία ο χρήστης δεν χρειάζεται να επιβλέπει το μοντέλο. Αντίθετα, επιτρέπει στο μοντέλο να λειτουργεί μόνο του για να ανακαλύπτει μοτίβα και πληροφορίες που προηγουμένως δεν είχαν εντοπιστεί. Ασχολείται κυρίως με δεδομένα χωρίς ετικέτα.

Μη εποπτευόμενη μάθηση Algorithms

Μη εποπτευόμενη μάθηση Algorithms επιτρέπουν στους χρήστες να εκτελούν πιο σύνθετες εργασίες επεξεργασίας σε σύγκριση με εποπτευόμενη μάθησηΗ μη επιβλεπόμενη μάθηση μπορεί, ωστόσο, να είναι πιο απρόβλεπτη από τις μεθόδους που έχουν εκπαιδευτεί με βάση γνωστές απαντήσεις. Οι αλγόριθμοι μη επιβλεπόμενης μάθησης περιλαμβάνουν την ομαδοποίηση, την ανίχνευση ανωμαλιών, τη μείωση διαστάσεων και τα αυτοοργανούμενα νευρωνικά δίκτυα.

Παράδειγμα Μη εποπτευόμενης Μηχανικής Εκμάθησης

Ας πάρουμε ένα παράδειγμα Μάθησης χωρίς Επίβλεψη για ένα μωρό και τον σκύλο της οικογένειάς του. Η πρώτη εικόνα δείχνει το κατοικίδιο που το μωρό ήδη αναγνωρίζει.

Ένα μωρό με τον σκύλο της οικογένειάς της, το ζώο που ήδη αναγνωρίζει

Γνωρίζει και αναγνωρίζει αυτό το σκυλί. Λίγες εβδομάδες αργότερα, μια οικογενειακή φίλη φέρνει μαζί της ένα σκυλί και προσπαθεί να παίξει με το μωρό. Αυτό το δεύτερο, άγνωστο σκυλί φαίνεται παρακάτω.

Ένα άγνωστο σκυλί που το μωρό δεν έχει ξαναδεί

Το μωρό δεν έχει δει αυτόν τον σκύλο νωρίτερα. Αλλά αναγνωρίζει ότι πολλά χαρακτηριστικά (2 αυτιά, μάτια, περπάτημα στα 4 πόδια) είναι σαν του σκύλου της. Αναγνωρίζει το νέο ζώο ως σκύλο. Αυτή είναι η μάθηση χωρίς επίβλεψη, όπου δεν διδάσκεσαι αλλά μαθαίνεις από τα δεδομένα (στην προκειμένη περίπτωση δεδομένα για έναν σκύλο). Αν επρόκειτο για μάθηση με επίβλεψη, ο οικογενειακός φίλος θα είχε πει στο μωρό ότι είναι σκύλος, όπως φαίνεται στο παραπάνω παράδειγμα Μάθησης Χωρίς Επίβλεψη.

Γιατί μάθηση χωρίς επίβλεψη;

Εδώ είναι οι κύριοι λόγοι για τη χρήση της Μη Εποπτευόμενης Μάθησης Μηχανική μάθηση:

  • Η μη επιβλεπόμενη μηχανική μάθηση εντοπίζει κάθε είδους άγνωστα μοτίβα στα δεδομένα.
  • Οι μέθοδοι χωρίς επίβλεψη σάς βοηθούν να βρείτε λειτουργίες που μπορεί να είναι χρήσιμες για την κατηγοριοποίηση.
  • Μπορεί να εκτελεστεί με δεδομένα καθώς αυτά φτάνουν, επομένως τα εισερχόμενα αρχεία αναλύονται και ομαδοποιούνται χωρίς να περιμένει κάποιος να τα επισημάνει πρώτα.
  • Είναι ευκολότερο να λαμβάνετε δεδομένα χωρίς ετικέτα από έναν υπολογιστή παρά δεδομένα με ετικέτα, τα οποία χρειάζονται χειροκίνητη παρέμβαση.

ClusterΤύποι μάθησης χωρίς επίβλεψη Algorithms

Τα προβλήματα μη επιβλεπόμενης μάθησης ομαδοποιούνται περαιτέρω σε προβλήματα ομαδοποίησης, συσχέτισης και μείωσης διαστάσεων. ClusterΗ ομαδοποίηση παρόμοιων εγγραφών, η συσχέτιση βρίσκει στοιχεία που εμφανίζονται μαζί και η μείωση της διαστατικότητας συμπιέζει πολλά χαρακτηριστικά σε λίγα.

ClusterING

ClusterΗ μάθηση είναι μια σημαντική έννοια όταν πρόκειται για μάθηση χωρίς επίβλεψη. Ασχολείται κυρίως με την εύρεση μιας δομής ή μοτίβου σε μια συλλογή μη κατηγοριοποιημένων δεδομένων. Μάθηση χωρίς επίβλεψη ClusterΟι αλγόριθμοι ing θα επεξεργαστούν τα δεδομένα σας και θα βρουν φυσικά clusters (ομάδες) εάν υπάρχουν στα δεδομένα. Μπορείτε επίσης να τροποποιήσετε τον αριθμό των clusters που θα πρέπει να αναγνωρίσουν οι αλγόριθμοί σας. Σας επιτρέπει να προσαρμόσετε την λεπτομέρεια αυτών των ομάδων. Το παρακάτω διάγραμμα δείχνει διάσπαρτα αρχεία που έχουν αναλυθεί σε ξεχωριστές ομάδες.

Clusterδιάγραμμα που δείχνει σημεία δεδομένων χωρίς ετικέτα ομαδοποιημένα σε ξεχωριστές συστάδες

Υπάρχουν διάφοροι τύποι ομαδοποίησης που μπορείτε να χρησιμοποιήσετε:

Αποκλειστικό (διαμερισμός)

Σε αυτήν τη μέθοδο ομαδοποίησης, τα δεδομένα ομαδοποιούνται με τέτοιο τρόπο ώστε μία εγγραφή να μπορεί να ανήκει μόνο σε μία συστάδα.

Παράδειγμα: Κ-μέσα

Συγκεντρωτικά

Σε αυτήν την τεχνική ομαδοποίησης, κάθε εγγραφή ξεκινά ως το δικό της σύμπλεγμα. Οι επαναληπτικές ενώσεις μεταξύ των δύο πλησιέστερων συστάδων μειώνουν τον αριθμό των συστάδων.

Παράδειγμα: Ιεραρχική ομαδοποίηση

επικάλυψηping

Σε αυτήν την τεχνική, ασαφή σύνολα χρησιμοποιούνται για την ομαδοποίηση δεδομένων. Κάθε σημείο μπορεί να ανήκει σε δύο ή περισσότερες συστάδες με διαφορετικούς βαθμούς συμμετοχής.

Εδώ, τα δεδομένα θα συσχετιστούν με μια κατάλληλη τιμή συνδρομής. Παράδειγμα: Fuzzy C-Means

Πιθανοτική

Αυτή η τεχνική χρησιμοποιεί μια κατανομή πιθανοτήτων για τη δημιουργία των συστάδων.

Παράδειγμα: Οι ακόλουθες λέξεις-κλειδιά

  • «Αντρικό παπούτσι».
  • “γυναικείο παπούτσι.”
  • «γυναικείο γάντι».
  • «Αντρικό γάντι».

μπορούν να ομαδοποιηθούν σε δύο κατηγορίες, «παπούτσι» και «γάντι» ή «άνδρας» και «γυναίκες».

ClusterΤύποι

Ακολουθούν οι αλγόριθμοι που συναντώνται συχνότερα στη μη επιβλεπόμενη μηχανική μάθηση. Οι δύο πρώτες εγγραφές ομάδας, οι τρεις τελευταίες μειώνουν τις διαστάσεις αντί να σχηματίζουν συστάδες, και ο αλγόριθμος K-NN παρατίθεται επειδή συχνά συγχέεται με τους K-means.

  • Ιεραρχική ομαδοποίηση — ομαδοποίηση
  • K-σημαίνει ομαδοποίηση — ομαδοποίηση
  • K-NN (k πλησιέστεροι γείτονες) — ένας εποπτευόμενος ταξινομητής, όχι μια μέθοδος ομαδοποίησης
  • Ανάλυση Κύριων Συνιστωσών — μείωση διαστάσεων
  • Αποσύνθεση Μοναδικής Τιμής — μείωση διαστάσεων
  • Ανεξάρτητη Ανάλυση Συνιστωσών — μείωση διαστάσεων

Ιεραρχικός ClusterING

Η ιεραρχική ομαδοποίηση είναι ένας αλγόριθμος που δημιουργεί μια ιεραρχία συστάδων. Ξεκινά με όλα τα δεδομένα που έχουν αντιστοιχιστεί σε ένα δικό του σύμπλεγμα. Εδώ, δύο κοντινά συμπλέγματα θα συγχωνευθούν στο ίδιο σύμπλεγμα. Αυτός ο αλγόριθμος τερματίζεται όταν απομείνει μόνο ένα σύμπλεγμα. Ορίζει δύο ιδέες που αξίζει να ονομαστούν ξεχωριστά.

Συσσωματωτική ομαδοποίηση

Αυτή η μορφή ιεραρχικής ομαδοποίησης από κάτω προς τα πάνω δεν απαιτεί τον αριθμό των συστάδων K ως είσοδο. Η διαδικασία συσσωμάτωσης ξεκινά με τη διαμόρφωση κάθε εγγραφής ως μίας ενιαίας συστάδας.

Αυτή η μέθοδος χρησιμοποιεί κάποιο μέτρο απόστασης και μειώνει τον αριθμό των συστάδων (μία σε κάθε επανάληψη) μέσω μιας διαδικασίας συγχώνευσης. Τέλος, έχουμε μια μεγάλη συστάδα που περιέχει όλα τα αντικείμενα και ο αναλυτής κόβει το δέντρο στο ύψος που δίνει έναν λογικό αριθμό ομάδων.

Δενδρογράφημα

Στη μέθοδο ομαδοποίησης Δενδρογραμμάτων, κάθε επίπεδο θα αντιπροσωπεύει μια πιθανή συστάδα. Το ύψος του δενδρογράμματος δείχνει το επίπεδο ομοιότητας μεταξύ δύο ενωμένων συστάδων. Όσο πιο κοντά στο κάτω μέρος της διαδικασίας βρίσκονται, τόσο πιο παρόμοιες είναι οι συστάδες. Η επιλογή της τομής που ορίζει τις τελικές ομάδες δεν είναι αυτόματη και είναι ως επί το πλείστον υποκειμενική.

Κ-μέσα ClusterING

Το K-means είναι ένας επαναληπτικός αλγόριθμος ομαδοποίησης που βελτιώνει την ομάδα.ping σε κάθε επανάληψη. Αρχικά, επιλέγεται ο επιθυμητός αριθμός συστάδων. Σε αυτήν τη μέθοδο ομαδοποίησης, πρέπει να ομαδοποιήσετε τα σημεία δεδομένων σε k ομάδες. Ένα μεγαλύτερο k σημαίνει μικρότερες ομάδες με μεγαλύτερη λεπτομέρεια. Ένα χαμηλότερο k σημαίνει μεγαλύτερες ομάδες με λιγότερη λεπτομέρεια.

Η έξοδος του αλγορίθμου είναι μια ομάδα «ετικετών». Αντιστοιχίζει κάθε σημείο δεδομένων σε μία από τις k ομάδες. Στην ομαδοποίηση k-means, κάθε ομάδα ορίζεται δημιουργώντας ένα κεντροειδές για αυτήν την ομάδα. Τα κεντροειδή είναι σαν την καρδιά του cluster, το οποίο καταγράφει τα σημεία που βρίσκονται πιο κοντά σε αυτά και τα προσθέτει στο cluster.

Κ- Πλησιέστεροι γείτονες

Ο K-πλησιέστερος γείτονας είναι ο απλούστερος από όλους τους ταξινομητές μηχανικής μάθησης. Διαφέρει από άλλες τεχνικές μηχανικής μάθησης στο ότι δεν παράγει μοντέλο. Είναι ένας απλός αλγόριθμος που αποθηκεύει όλες τις διαθέσιμες περιπτώσεις και ταξινομεί νέες περιπτώσεις με βάση ένα μέτρο ομοιότητας. Επειδή χρειάζεται επισημασμένες περιπτώσεις για να ταξινομηθεί, το K-NN είναι μια εποπτευόμενη μέθοδος. Εμφανίζεται εδώ μόνο επειδή η λογική του που βασίζεται στην απόσταση μοιάζει με ομαδοποίηση.

Λειτουργεί πολύ καλά όταν υπάρχει μια σημαντική απόσταση μεταξύ των παραδειγμάτων. Η ταχύτητα εκμάθησης είναι αργή όταν το σύνολο εκπαίδευσης είναι μεγάλο και ο υπολογισμός της απόστασης είναι μη τετριμμένος.

Ανάλυση βασικών εξαρτημάτων

Η Ανάλυση Κύριων Συνιστωσών λαμβάνει έναν χώρο υψηλής διάστασης και επιλέγει μια νέα βάση, διατηρώνταςping μόνο τα πιο σημαντικά σκορ του. Κάθε κατεύθυνση σε αυτή τη βάση είναι γνωστή ως κύρια συνιστώσα. Το υποσύνολο που διατηρείτε αποτελεί έναν νέο χώρο που είναι μικρός σε μέγεθος σε σύγκριση με τον αρχικό χώρο. Διατηρεί όσο το δυνατόν μεγαλύτερη πολυπλοκότητα των δεδομένων.

Σχέση

Οι κανόνες συσχέτισης σάς επιτρέπουν να δημιουργήσετε συσχετίσεις μεταξύ αντικειμένων δεδομένων μέσα σε μεγάλες βάσεις δεδομένων. Αυτή η μη επιβλεπόμενη τεχνική αφορά την ανακάλυψη ενδιαφέρουσων σχέσεων μεταξύ μεταβλητών σε μεγάλες βάσεις δεδομένων και αποτελεί βασικό στοιχείο της... εξόρυξη δεδομένωνΓια παράδειγμα, οι άνθρωποι που αγοράζουν ένα νέο σπίτι είναι πιο πιθανό να αγοράσουν καινούργια έπιπλα.

Άλλα παραδείγματα:

  • Μια υποομάδα ασθενών με καρκίνο ομαδοποιημένων με βάση τις μετρήσεις γονιδιακής έκφρασης
  • Ομάδες αγοραστών με βάση το ιστορικό περιήγησης και αγορών τους
  • Ταινίες ομαδοποιημένες με βάση τις αξιολογήσεις που έδωσαν οι θεατές

Εποπτευόμενη έναντι Μη εποπτευόμενης Μηχανικής Εκμάθησης

Εδώ είναι η κύρια διαφορά μεταξύ Εποπτευόμενη έναντι μη εποπτευόμενης μάθησης:

Παράμετροι Εποπτευόμενη τεχνική μηχανικής εκμάθησης Τεχνική μηχανικής εκμάθησης χωρίς επίβλεψη
Εισαγωγή δεδομένων Algorithms εκπαιδεύονται χρησιμοποιώντας δεδομένα με ετικέτα. Algorithms χρησιμοποιούνται έναντι δεδομένων που δεν φέρουν ετικέτα
Υπολογιστική Πολυπλοκότητα Η εποπτευόμενη μάθηση είναι μια απλούστερη μέθοδος. Η μάθηση χωρίς επίβλεψη είναι υπολογιστικά περίπλοκη
Ακρίβεια Η ακρίβεια μπορεί να μετρηθεί απευθείας σε σχέση με γνωστές ετικέτες. Η ακρίβεια δεν μπορεί να μετρηθεί άμεσα· τα αποτελέσματα χρειάζονται ερμηνεία
Τυπική έξοδος Μια πρόβλεψη για κάθε νέα εγγραφή Ομάδες, κανόνες ή συμπιεσμένα χαρακτηριστικά

Εφαρμογές Μη εποπτευόμενης Μηχανικής Εκμάθησης

Μερικές εφαρμογές των Τεχνικών Μάθησης χωρίς Επίβλεψη είναι:

  • ClusterΗ λειτουργία διαχωρίζει αυτόματα το σύνολο δεδομένων σε ομάδες με βάση τις ομοιότητές τους
  • Ο εντοπισμός ανωμαλιών μπορεί να ανακαλύψει ασυνήθιστα σημεία δεδομένων στο σύνολο δεδομένων σας. Είναι χρήσιμο για την εύρεση δόλιων συναλλαγών
  • Η εξόρυξη συσχέτισης προσδιορίζει σύνολα στοιχείων που συχνά εμφανίζονται μαζί στο σύνολο δεδομένων σας
  • Τα μοντέλα λανθανουσών μεταβλητών χρησιμοποιούνται ευρέως για την προεπεξεργασία δεδομένων, όπως η μείωση του αριθμού των χαρακτηριστικών σε ένα σύνολο δεδομένων ή η αποσύνθεση του συνόλου δεδομένων σε πολλαπλά στοιχεία.

Μειονεκτήματα της μάθησης χωρίς επίβλεψη

  • Δεν μπορείτε να λάβετε ακριβείς πληροφορίες σχετικά με την ταξινόμηση δεδομένων, επειδή τα δεδομένα που χρησιμοποιούνται στη μη επιβλεπόμενη μάθηση δεν φέρουν ετικέτα και η πραγματική τους ομάδαping δεν είναι γνωστό
  • Less ακρίβεια των αποτελεσμάτων, επειδή τα δεδομένα εισόδου δεν είναι γνωστά και δεν έχουν επισημανθεί εκ των προτέρων από άτομα. Αυτό σημαίνει ότι το μηχάνημα υποχρεούται να το κάνει αυτό μόνο του.
  • Οι φασματικές κλάσεις δεν αντιστοιχούν πάντα σε κλάσεις πληροφοριών.
  • Ο χρήστης πρέπει να αφιερώσει χρόνο στην ερμηνεία και την επισήμανση των κλάσεων που προκύπτουν από την ταξινόμηση.
  • Οι φασματικές ιδιότητες των κλάσεων μπορούν επίσης να αλλάξουν με την πάροδο του χρόνου, επομένως δεν μπορείτε να διατηρήσετε τις ίδιες πληροφορίες κλάσης ενώ μετακινείστε από τη μία εικόνα στην άλλη.

Συχνές Ερωτήσεις

Η μέθοδος αγκώνα απεικονίζει το σφάλμα εντός της συστάδας ως προς το k και αναζητά την καμπύλη. Η βαθμολογία σιλουέτας, που κυμαίνεται από -1 έως 1, αξιολογεί πόσο καλά ταιριάζει κάθε σημείο στην συστάδα του. Διαβάστε και τα δύο μαζί.

Οι αλγόριθμοι που βασίζονται στην απόσταση αντιμετωπίζουν κάθε μονάδα ισότιμα, επομένως μια στήλη μισθού σε χιλιάδες θα κυριαρχεί σε μια στήλη ηλικίας σε έτη. Η τυποποίηση κάθε χαρακτηριστικού πρώτα δίνει σε κάθε μεταβλητή δικαίωμα λόγου στην απόσταση.

Το Apriori είναι το κλασικό εργαλείο εξόρυξης κανόνων συσχέτισης που βρίσκεται πίσω από την ανάλυση του καλαθιού αγοράς. Εντοπίζει συχνά σύνολα στοιχείων και στη συνέχεια τα μετατρέπει σε κανόνες που κατατάσσονται με βάση την υποστήριξη, την εμπιστοσύνη και την αύξηση. Η ανάπτυξη FP και το Eclat κάνουν το ίδιο πιο γρήγορα.

Η ημι-εποπτευόμενη μάθηση χρησιμοποιεί ένα μικρό σύνολο με ετικέτες παράλληλα με ένα μεγάλο σύνολο χωρίς ετικέτες. Η δομή που βρίσκεται στα δεδομένα χωρίς ετικέτες καθοδηγεί το μοντέλο, έτσι ώστε η ακρίβεια να προσεγγίζει ένα εποπτευόμενο αποτέλεσμα με πολύ χαμηλότερο κόστος επισήμανσης.

Ο PCA είναι ένας γραμμικός μετασχηματισμός που διατηρεί την καθολική διακύμανση και εφαρμόζεται σε νέες εγγραφές. Ο t-SNE είναι μη γραμμικός και έχει σχεδιαστεί για την οπτικοποίηση τοπικών γειτονιών σε δύο διαστάσεις. Οι αποστάσεις μεταξύ χωρισμένων ομάδων δεν πρέπει να διαβάζονται κυριολεκτικά.

Οι συνήθεις επιλογές είναι το Isolation Forest, το One-Class SVM, το DBSCAN και το σφάλμα ανακατασκευής αυτόματου κωδικοποιητή. Κάθε μία από αυτές αξιολογεί την απόσταση μιας εγγραφής από το μεγαλύτερο μέρος των δεδομένων, επομένως ένα όριο αποφασίζει τι θεωρείται ανώμαλο.

Οι αυτοματοποιημένοι αλγόριθμοι σάρωσης αγωγών, οι μετρήσεις απόστασης και οι τιμές του k, κατατάσσουν στη συνέχεια τις εκτελέσεις με βάση τις εσωτερικές βαθμολογίες εγκυρότητας. Τα γλωσσικά μοντέλα σχεδιάζουν ολοένα και περισσότερο απλά αγγλικά ονόματα για τα τμήματα που προκύπτουν, συντομεύοντας το βήμα ερμηνείας.

GitHub Copilot scaffolds scikit-learn pipelines, skifteries elbow pages και silhouettes από μια μονογραμμική προτροπή. Ελέγξτε ότι έχει κλιμακώσει τα χαρακτηριστικά και ορίστε έναν τυχαίο σπόρο, ο οποίος συχνά παραλείπει τα δημιουργημένα αποσπάσματα.

Συνοψίστε αυτήν την ανάρτηση με: