Unüberwachtes maschinelles Lernen: AlgorithmsTypen & Beispiele

⚡ Intelligente Zusammenfassung

Unüberwachtes Lernen ist eine Technik des maschinellen Lernens, die mit unbeschrifteten Daten arbeitet und es dem Modell ermöglicht, Strukturen selbstständig durch Clustering, Assoziationsregeln und Dimensionsreduktion zu entdecken, anstatt auf im Voraus bereitgestellte Antworten zurückzugreifen.

  • 🔘 Keine Etiketten erforderlich: Der Algorithmus sucht nach Strukturen, anstatt nach bekannten Antworten zu suchen.
  • ☑️ Drei Aufgabenfamilien: Clustering, Assoziationsregelanalyse und Dimensionsreduktion.
  • Vier Clustering-Stile: Exklusiv, agglomerativ, Überschneidungping und probabilistisch.
  • 🧪 Benannte Algorithmen: K-Means, hierarchisches Clustering, Fuzzy C-Means, PCA, SVD und ICA.
  • Wo es seinen Nutzen hat: Kundensegmentierung, Betrugs- und Anomalieerkennung, Warenkorbanalyse, Datenvorverarbeitung.
  • ⚙️ Der Kompromiss: Das Fehlen einer absoluten Wahrheit bedeutet, dass die Ergebnisse von einem Menschen interpretiert, validiert und benannt werden müssen.

Unüberwachtes maschinelles Lernen: Algorithmen, Typen mit Beispielen

Was ist unüberwachtes Lernen?

Unüberwachtes Lernen ist eine Technik des maschinellen Lernens, bei der der Benutzer das Modell nicht überwachen muss. Stattdessen kann das Modell selbstständig Muster und Informationen entdecken, die zuvor unentdeckt blieben. Es befasst sich hauptsächlich mit ungelabelten Daten.

Unbeaufsichtigtes Lernen Algorithms

Unbeaufsichtigtes Lernen Algorithms ermöglichen es Benutzern, im Vergleich zu komplexeren Verarbeitungsaufgaben durchzuführen überwachtes LernenUnüberwachtes Lernen kann jedoch unvorhersehbarer sein als Methoden, die mit bekannten Antworten trainiert wurden. Zu den Algorithmen des unüberwachten Lernens gehören Clustering, Anomalieerkennung, Dimensionsreduktion und selbstorganisierende neuronale Netze.

Beispiel für unbeaufsichtigtes maschinelles Lernen

Betrachten wir als Beispiel unüberwachtes Lernen bei einem Baby und seinem Familienhund. Das erste Bild zeigt das Haustier, das das Baby bereits erkennt.

Ein Baby mit dem Familienhund, dem Tier, das es bereits kennt.

Sie kennt und identifiziert diesen Hund. Einige Wochen später bringt ein Freund der Familie einen Hund mit und versucht, mit dem Baby zu spielen. Dieser zweite, unbekannte Hund ist unten abgebildet.

Ein unbekannter Hund, den das Baby noch nie zuvor gesehen hat.

Das Baby hat diesen Hund noch nie zuvor gesehen. Es erkennt aber viele Merkmale (zwei Ohren, Augen, Gang auf vier Beinen) an seinen eigenen Hund. Es identifiziert das neue Tier als Hund. Dies ist unüberwachtes Lernen, bei dem das Kind nicht angeleitet wird, sondern aus den vorhandenen Daten (in diesem Fall Daten über einen Hund) lernt. Wäre es überwachtes Lernen gewesen, hätte der Freund der Familie dem Baby gesagt, dass es ein Hund ist, wie im obigen Beispiel für unüberwachtes Lernen dargestellt.

Warum unüberwachtes Lernen?

Hier sind die wichtigsten Gründe für die Verwendung von unüberwachtem Lernen in Maschinelles lernen:

  • Unüberwachtes maschinelles Lernen findet alle möglichen unbekannten Muster in den Daten.
  • Unüberwachte Methoden helfen Ihnen, Funktionen zu finden, die für die Kategorisierung nützlich sein können.
  • Es kann mit Daten arbeiten, sobald diese eintreffen, sodass eingehende Datensätze analysiert und gruppiert werden, ohne dass sie vorher von einem Menschen gekennzeichnet werden müssen.
  • Es ist einfacher, unbeschriftete Daten von einem Computer abzurufen als beschriftete Daten, die einen manuellen Eingriff erfordern.

Clustering Arten des unüberwachten Lernens Algorithms

Unüberwachte Lernprobleme werden weiter in Clustering-, Assoziations- und Dimensionsreduktionsprobleme unterteilt. ClusterDie Gruppierung ähnlicher Datensätze, die Assoziationsanalyse findet Elemente, die zusammen auftreten, und die Dimensionsreduktion komprimiert viele Merkmale zu wenigen.

ClusterIng.

Clustering ist ein wichtiges Konzept, wenn es um unbeaufsichtigtes Lernen geht. Dabei geht es hauptsächlich darum, eine Struktur oder ein Muster in einer Sammlung nicht kategorisierter Daten zu finden. Unbeaufsichtigtes Lernen ClusterDie Algorithmen verarbeiten Ihre Daten und finden natürliche Cluster (Gruppen), sofern diese in den Daten vorhanden sind. Sie können auch die Anzahl der zu identifizierenden Cluster anpassen. Dadurch lässt sich die Granularität dieser Gruppen festlegen. Das folgende Diagramm zeigt, wie verstreute Datensätze in verschiedene Gruppen unterteilt wurden.

ClusterDiagramm mit unbeschrifteten Datenpunkten, die in separate Cluster gruppiert sind

Sie können verschiedene Clustertypen nutzen:

Exklusiv (Partitionierung)

Bei dieser Clustermethode werden die Daten so gruppiert, dass ein Datensatz nur zu einem Cluster gehören kann.

Ejemplo: K-Mittel

Agglomerativ

Bei diesem Clustering-Verfahren bildet jeder Datensatz zunächst einen eigenen Cluster. Durch die iterative Vereinigung der beiden nächstgelegenen Cluster wird die Anzahl der Cluster reduziert.

Beispiel: Hierarchisches Clustering

Überlappungping

Bei dieser Technik unscharfe Sätze werden verwendet, um Daten zu gruppieren. Jeder Punkt kann zwei oder mehr Clustern mit unterschiedlichem Zugehörigkeitsgrad angehören.

Dabei werden die Daten mit einem entsprechenden Mitgliedswert verknüpft. Beispiel: Fuzzy C-Means

Probabilistisch

Bei dieser Technik wird eine Wahrscheinlichkeitsverteilung verwendet, um die Cluster zu erzeugen.

Beispiel: Die folgenden Schlüsselwörter

  • „Männerschuh.“
  • „Damenschuh.“
  • „Damenhandschuh.“
  • „Männerhandschuh.“

lassen sich in zwei Kategorien einteilen, „Schuh“ und „Handschuh“ oder „Mann“ und „Frau“.

Clustering-Typen

Im Folgenden werden die Algorithmen aufgeführt, die am häufigsten im unüberwachten maschinellen Lernen zum Einsatz kommen. Die ersten beiden gruppieren Datensätze, die letzten drei reduzieren Dimensionen anstatt Cluster zu bilden, und K-NN wird aufgeführt, da es häufig mit K-Means verwechselt wird.

  • Hierarchisches Clustering — Clustering
  • K-Means-Clustering — Clustering
  • K-NN (k nächste Nachbarn) – ein überwachtes Klassifikationsverfahren, keine Clustering-Methode
  • Hauptkomponentenanalyse – Dimensionsreduktion
  • Singulärwertzerlegung – Dimensionsreduktion
  • Unabhängige Komponentenanalyse – Dimensionsreduktion

Hierarchisch ClusterIng.

Hierarchisches Clustering ist ein Algorithmus, der eine Hierarchie von Clustern erstellt. Zunächst werden alle Daten einem eigenen Cluster zugeordnet. Zwei nahe beieinander liegende Cluster werden zusammengeführt. Der Algorithmus endet, sobald nur noch ein Cluster übrig ist. Er definiert zwei Konzepte, die gesondert erwähnt werden sollten.

Agglomerative Clusterbildung

Diese Bottom-up-Form des hierarchischen Clusterings benötigt die Anzahl der Cluster K nicht als Eingabe. Der Agglomerationsprozess beginnt damit, jeden Datensatz als einen einzelnen Cluster zu bilden.

Diese Methode verwendet ein Distanzmaß und reduziert die Anzahl der Cluster (einen in jeder Iteration) durch einen Zusammenführungsprozess. Schließlich erhalten wir einen großen Cluster, der alle Objekte enthält, und der Analyst teilt den Baum auf der Höhe, die eine sinnvolle Anzahl von Gruppen ergibt.

Dendrogramm

Bei der Dendrogramm-Clusteranalyse repräsentiert jede Ebene einen möglichen Cluster. Die Höhe des Dendrogramms zeigt den Grad der Ähnlichkeit zwischen zwei verbundenen Clustern an. Je näher sie am unteren Ende des Diagramms liegen, desto ähnlicher sind sie. Die Wahl des Schnittpunkts, der die endgültigen Gruppen definiert, erfolgt nicht automatisch und ist größtenteils subjektiv.

K-Mittel ClusterIng.

K-Means ist ein iterativer Clustering-Algorithmus, der die Gruppierung verfeinert.ping Bei jedem Iterationsschritt wird zunächst die gewünschte Anzahl an Clustern festgelegt. Bei diesem Clustering-Verfahren werden die Datenpunkte in k Gruppen eingeteilt. Ein größeres k bedeutet kleinere Gruppen mit feinerer Granularität; ein kleineres k bedeutet größere Gruppen mit geringerer Granularität.

Das Ergebnis des Algorithmus ist eine Gruppe von „Labels“. Jeder Datenpunkt wird einer der k Gruppen zugeordnet. Beim k-Means-Clustering wird jede Gruppe durch die Erstellung eines Zentroiden definiert. Die Zentroide bilden quasi das Herzstück des Clusters; sie erfassen die ihnen nächstgelegenen Punkte und fügen sie dem Cluster hinzu.

K- Nächste Nachbarn

Der K-Nächste-Nachbarn-Algorithmus (K-NN) ist der einfachste aller Klassifikatoren des maschinellen Lernens. Er unterscheidet sich von anderen Verfahren dadurch, dass er kein Modell erzeugt. Es handelt sich um einen einfachen Algorithmus, der alle verfügbaren Fälle speichert und neue Instanzen anhand eines Ähnlichkeitsmaßes klassifiziert. Da er gelabelte Fälle für die Klassifizierung benötigt, ist K-NN ein überwachtes Lernverfahren; er wird hier nur erwähnt, weil seine distanzbasierte Logik dem Clustering ähnelt.

Es funktioniert sehr gut, wenn ein sinnvoller Abstand zwischen den Beispielen besteht. Die Lerngeschwindigkeit ist langsam, wenn der Trainingsdatensatz groß ist und die Abstandsberechnung komplex wird.

Hauptkomponentenanalyse

Die Hauptkomponentenanalyse betrachtet einen hochdimensionalen Raum und wählt eine neue Basis aus, wobei die Hauptkomponentenanalyse eine neue Basis für die Hauptkomponentenanalyse darstellt.ping Es werden nur die wichtigsten Werte berücksichtigt. Jede Richtung in dieser Basis wird als Hauptkomponente bezeichnet. Die beibehaltene Teilmenge bildet einen neuen, im Vergleich zum ursprünglichen Raum kleinen Raum. Dabei bleibt so viel wie möglich von der Komplexität der Daten erhalten.

Verein

Assoziationsregeln ermöglichen es, Beziehungen zwischen Datenobjekten in großen Datenbanken herzustellen. Diese unüberwachte Technik dient dazu, interessante Beziehungen zwischen Variablen in großen Datenbanken zu entdecken und ist ein Grundpfeiler der Datenbankentwicklung. Data MiningBeispielsweise kaufen Menschen, die ein neues Haus kaufen, mit hoher Wahrscheinlichkeit auch neue Möbel.

Andere Beispiele:

  • Eine Untergruppe von Krebspatienten, gruppiert nach ihren Genexpressionsmessungen
  • Gruppen von Käufern basierend auf ihrem Browser- und Kaufverhalten
  • Filme, gruppiert nach den von den Zuschauern vergebenen Bewertungen

Überwachtes vs. unüberwachtes maschinelles Lernen

Hier ist der Hauptunterschied zwischen Überwachtes vs. unüberwachtes Lernen:

Kenngrößen Überwachte maschinelle Lerntechnik Unbeaufsichtigte maschinelle Lerntechnik
Eingabedaten Algorithms werden anhand gekennzeichneter Daten trainiert. Algorithms werden für Daten verwendet, die nicht gekennzeichnet sind
Rechenkomplexität Überwachtes Lernen ist eine einfachere Methode. Unüberwachtes Lernen ist rechnerisch komplex
Genauigkeit Die Genauigkeit kann direkt anhand bekannter Etiketten gemessen werden. Genauigkeit lässt sich nicht direkt messen; die Ergebnisse müssen interpretiert werden.
Typische Ausgabe Eine Vorhersage für jeden neuen Rekord Gruppen, Regeln oder komprimierte Funktionen

Anwendungen des unbeaufsichtigten maschinellen Lernens

Anwendungsbeispiele für unüberwachte Lernverfahren sind:

  • Clustering teilt den Datensatz automatisch anhand seiner Ähnlichkeiten in Gruppen auf.
  • Die Anomalieerkennung kann ungewöhnliche Datenpunkte in Ihrem Datensatz entdecken. Es ist nützlich, um betrügerische Transaktionen zu finden
  • Association Mining identifiziert Gruppen von Elementen, die in Ihrem Datensatz häufig zusammen vorkommen
  • Latentvariablenmodelle werden häufig zur Datenvorverarbeitung eingesetzt, beispielsweise zur Reduzierung der Anzahl von Merkmalen in einem Datensatz oder zur Zerlegung des Datensatzes in mehrere Komponenten.

Nachteile des unüberwachten Lernens

  • Man kann keine genauen Informationen über die Datensortierung erhalten, da die beim unüberwachten Lernen verwendeten Daten ungelabelt sind und ihre wahre Gruppe unbekannt ist.ping ist nicht bekannt
  • Less Die Genauigkeit der Ergebnisse ist beeinträchtigt, da die Eingangsdaten unbekannt und nicht im Voraus von Menschen gekennzeichnet sind. Das bedeutet, dass die Maschine dies selbstständig durchführen muss.
  • Die Spektralklassen entsprechen nicht immer Informationsklassen.
  • Der Benutzer muss Zeit aufwenden, um die sich aus der Klassifizierung ergebenden Klassen zu interpretieren und zu benennen.
  • Die spektralen Eigenschaften von Klassen können sich im Laufe der Zeit ändern, daher können Sie beim Wechsel von einem Bild zum anderen nicht dieselben Klasseninformationen beibehalten.

Häufig gestellte Fragen

Die Ellbogenmethode stellt den Fehler innerhalb eines Clusters gegen k dar und sucht nach dem Knickpunkt. Der Silhouette-Score, der zwischen −1 und 1 liegt, bewertet, wie gut jeder Punkt zu seinem Cluster passt. Beide Werte sollten zusammen betrachtet werden.

Distanzbasierte Algorithmen behandeln jede Einheit gleich, sodass eine Gehaltsspalte in Tausenderwerten eine Altersspalte in Jahren deutlich überwiegt. Durch die vorherige Standardisierung jedes Merkmals erhält jede Variable ein faires Gewicht bei der Distanzberechnung.

Apriori ist der klassische Algorithmus zur Assoziationsregelanalyse, der der Warenkorbanalyse zugrunde liegt. Er findet häufige Artikelmengen und wandelt diese anschließend in Regeln um, die nach Support, Konfidenz und Lift geordnet sind. FP-growth und Eclat erledigen dies schneller.

Beim halbüberwachten Lernen wird ein kleiner Datensatz mit gelabelten Daten zusammen mit einem großen Datensatz ohne Label verwendet. Die in den ungelabelten Daten gefundene Struktur leitet das Modell, sodass die Genauigkeit bei deutlich geringerem Labeling-Aufwand nahezu an die Ergebnisse des überwachten Lernens heranreicht.

Die Hauptkomponentenanalyse (PCA) ist eine lineare Transformation, die die globale Varianz erhält und auf neue Datensätze angewendet wird. t-SNE ist nichtlinear und dient der Visualisierung lokaler Nachbarschaften in zwei Dimensionen; die Abstände zwischen getrennten Gruppen sollten nicht wörtlich interpretiert werden.

Isolation Forest, One-Class SVM, DBSCAN und der Rekonstruktionsfehler des Autoencoders sind gängige Verfahren. Jedes dieser Verfahren bewertet, wie weit ein Datensatz vom Rest der Daten entfernt ist; ein Schwellenwert legt fest, was als Anomalie gilt.

Automatisierte Pipelines durchsuchen Algorithmen, Distanzmaße und k-Werte und ordnen die Ergebnisse anschließend nach internen Validitätswerten. Sprachmodelle entwerfen zunehmend leicht verständliche englische Namen für die resultierenden Segmente, wodurch der Interpretationsschritt verkürzt wird.

GitHub-Copilot Erstellt Scikit-learn-Pipelines, Elbow-Plots und Silhouette-Diagramme anhand einer einzigen Eingabeaufforderung. Überprüfen Sie, ob die Merkmale skaliert und ein Zufallswert festgelegt wurde, was bei generierten Code-Snippets oft fehlt.

Fassen Sie diesen Beitrag mit folgenden Worten zusammen: