Unüberwachtes maschinelles Lernen: AlgorithmsTypen & Beispiele
⚡ Intelligente Zusammenfassung
Unüberwachtes Lernen ist eine Technik des maschinellen Lernens, die mit unbeschrifteten Daten arbeitet und es dem Modell ermöglicht, Strukturen selbstständig durch Clustering, Assoziationsregeln und Dimensionsreduktion zu entdecken, anstatt auf im Voraus bereitgestellte Antworten zurückzugreifen.
Was ist unüberwachtes Lernen?
Unüberwachtes Lernen ist eine Technik des maschinellen Lernens, bei der der Benutzer das Modell nicht überwachen muss. Stattdessen kann das Modell selbstständig Muster und Informationen entdecken, die zuvor unentdeckt blieben. Es befasst sich hauptsächlich mit ungelabelten Daten.
Unbeaufsichtigtes Lernen Algorithms
Unbeaufsichtigtes Lernen Algorithms ermöglichen es Benutzern, im Vergleich zu komplexeren Verarbeitungsaufgaben durchzuführen überwachtes LernenUnüberwachtes Lernen kann jedoch unvorhersehbarer sein als Methoden, die mit bekannten Antworten trainiert wurden. Zu den Algorithmen des unüberwachten Lernens gehören Clustering, Anomalieerkennung, Dimensionsreduktion und selbstorganisierende neuronale Netze.
Beispiel für unbeaufsichtigtes maschinelles Lernen
Betrachten wir als Beispiel unüberwachtes Lernen bei einem Baby und seinem Familienhund. Das erste Bild zeigt das Haustier, das das Baby bereits erkennt.
Sie kennt und identifiziert diesen Hund. Einige Wochen später bringt ein Freund der Familie einen Hund mit und versucht, mit dem Baby zu spielen. Dieser zweite, unbekannte Hund ist unten abgebildet.
Das Baby hat diesen Hund noch nie zuvor gesehen. Es erkennt aber viele Merkmale (zwei Ohren, Augen, Gang auf vier Beinen) an seinen eigenen Hund. Es identifiziert das neue Tier als Hund. Dies ist unüberwachtes Lernen, bei dem das Kind nicht angeleitet wird, sondern aus den vorhandenen Daten (in diesem Fall Daten über einen Hund) lernt. Wäre es überwachtes Lernen gewesen, hätte der Freund der Familie dem Baby gesagt, dass es ein Hund ist, wie im obigen Beispiel für unüberwachtes Lernen dargestellt.
Warum unüberwachtes Lernen?
Hier sind die wichtigsten Gründe für die Verwendung von unüberwachtem Lernen in Maschinelles lernen:
- Unüberwachtes maschinelles Lernen findet alle möglichen unbekannten Muster in den Daten.
- Unüberwachte Methoden helfen Ihnen, Funktionen zu finden, die für die Kategorisierung nützlich sein können.
- Es kann mit Daten arbeiten, sobald diese eintreffen, sodass eingehende Datensätze analysiert und gruppiert werden, ohne dass sie vorher von einem Menschen gekennzeichnet werden müssen.
- Es ist einfacher, unbeschriftete Daten von einem Computer abzurufen als beschriftete Daten, die einen manuellen Eingriff erfordern.
Clustering Arten des unüberwachten Lernens Algorithms
Unüberwachte Lernprobleme werden weiter in Clustering-, Assoziations- und Dimensionsreduktionsprobleme unterteilt. ClusterDie Gruppierung ähnlicher Datensätze, die Assoziationsanalyse findet Elemente, die zusammen auftreten, und die Dimensionsreduktion komprimiert viele Merkmale zu wenigen.
ClusterIng.
Clustering ist ein wichtiges Konzept, wenn es um unbeaufsichtigtes Lernen geht. Dabei geht es hauptsächlich darum, eine Struktur oder ein Muster in einer Sammlung nicht kategorisierter Daten zu finden. Unbeaufsichtigtes Lernen ClusterDie Algorithmen verarbeiten Ihre Daten und finden natürliche Cluster (Gruppen), sofern diese in den Daten vorhanden sind. Sie können auch die Anzahl der zu identifizierenden Cluster anpassen. Dadurch lässt sich die Granularität dieser Gruppen festlegen. Das folgende Diagramm zeigt, wie verstreute Datensätze in verschiedene Gruppen unterteilt wurden.
Sie können verschiedene Clustertypen nutzen:
Exklusiv (Partitionierung)
Bei dieser Clustermethode werden die Daten so gruppiert, dass ein Datensatz nur zu einem Cluster gehören kann.
Ejemplo: K-Mittel
Agglomerativ
Bei diesem Clustering-Verfahren bildet jeder Datensatz zunächst einen eigenen Cluster. Durch die iterative Vereinigung der beiden nächstgelegenen Cluster wird die Anzahl der Cluster reduziert.
Beispiel: Hierarchisches Clustering
Überlappungping
Bei dieser Technik unscharfe Sätze werden verwendet, um Daten zu gruppieren. Jeder Punkt kann zwei oder mehr Clustern mit unterschiedlichem Zugehörigkeitsgrad angehören.
Dabei werden die Daten mit einem entsprechenden Mitgliedswert verknüpft. Beispiel: Fuzzy C-Means
Probabilistisch
Bei dieser Technik wird eine Wahrscheinlichkeitsverteilung verwendet, um die Cluster zu erzeugen.
Beispiel: Die folgenden Schlüsselwörter
- „Männerschuh.“
- „Damenschuh.“
- „Damenhandschuh.“
- „Männerhandschuh.“
lassen sich in zwei Kategorien einteilen, „Schuh“ und „Handschuh“ oder „Mann“ und „Frau“.
Clustering-Typen
Im Folgenden werden die Algorithmen aufgeführt, die am häufigsten im unüberwachten maschinellen Lernen zum Einsatz kommen. Die ersten beiden gruppieren Datensätze, die letzten drei reduzieren Dimensionen anstatt Cluster zu bilden, und K-NN wird aufgeführt, da es häufig mit K-Means verwechselt wird.
- Hierarchisches Clustering — Clustering
- K-Means-Clustering — Clustering
- K-NN (k nächste Nachbarn) – ein überwachtes Klassifikationsverfahren, keine Clustering-Methode
- Hauptkomponentenanalyse – Dimensionsreduktion
- Singulärwertzerlegung – Dimensionsreduktion
- Unabhängige Komponentenanalyse – Dimensionsreduktion
Hierarchisch ClusterIng.
Hierarchisches Clustering ist ein Algorithmus, der eine Hierarchie von Clustern erstellt. Zunächst werden alle Daten einem eigenen Cluster zugeordnet. Zwei nahe beieinander liegende Cluster werden zusammengeführt. Der Algorithmus endet, sobald nur noch ein Cluster übrig ist. Er definiert zwei Konzepte, die gesondert erwähnt werden sollten.
Agglomerative Clusterbildung
Diese Bottom-up-Form des hierarchischen Clusterings benötigt die Anzahl der Cluster K nicht als Eingabe. Der Agglomerationsprozess beginnt damit, jeden Datensatz als einen einzelnen Cluster zu bilden.
Diese Methode verwendet ein Distanzmaß und reduziert die Anzahl der Cluster (einen in jeder Iteration) durch einen Zusammenführungsprozess. Schließlich erhalten wir einen großen Cluster, der alle Objekte enthält, und der Analyst teilt den Baum auf der Höhe, die eine sinnvolle Anzahl von Gruppen ergibt.
Dendrogramm
Bei der Dendrogramm-Clusteranalyse repräsentiert jede Ebene einen möglichen Cluster. Die Höhe des Dendrogramms zeigt den Grad der Ähnlichkeit zwischen zwei verbundenen Clustern an. Je näher sie am unteren Ende des Diagramms liegen, desto ähnlicher sind sie. Die Wahl des Schnittpunkts, der die endgültigen Gruppen definiert, erfolgt nicht automatisch und ist größtenteils subjektiv.
K-Mittel ClusterIng.
K-Means ist ein iterativer Clustering-Algorithmus, der die Gruppierung verfeinert.ping Bei jedem Iterationsschritt wird zunächst die gewünschte Anzahl an Clustern festgelegt. Bei diesem Clustering-Verfahren werden die Datenpunkte in k Gruppen eingeteilt. Ein größeres k bedeutet kleinere Gruppen mit feinerer Granularität; ein kleineres k bedeutet größere Gruppen mit geringerer Granularität.
Das Ergebnis des Algorithmus ist eine Gruppe von „Labels“. Jeder Datenpunkt wird einer der k Gruppen zugeordnet. Beim k-Means-Clustering wird jede Gruppe durch die Erstellung eines Zentroiden definiert. Die Zentroide bilden quasi das Herzstück des Clusters; sie erfassen die ihnen nächstgelegenen Punkte und fügen sie dem Cluster hinzu.
K- Nächste Nachbarn
Der K-Nächste-Nachbarn-Algorithmus (K-NN) ist der einfachste aller Klassifikatoren des maschinellen Lernens. Er unterscheidet sich von anderen Verfahren dadurch, dass er kein Modell erzeugt. Es handelt sich um einen einfachen Algorithmus, der alle verfügbaren Fälle speichert und neue Instanzen anhand eines Ähnlichkeitsmaßes klassifiziert. Da er gelabelte Fälle für die Klassifizierung benötigt, ist K-NN ein überwachtes Lernverfahren; er wird hier nur erwähnt, weil seine distanzbasierte Logik dem Clustering ähnelt.
Es funktioniert sehr gut, wenn ein sinnvoller Abstand zwischen den Beispielen besteht. Die Lerngeschwindigkeit ist langsam, wenn der Trainingsdatensatz groß ist und die Abstandsberechnung komplex wird.
Hauptkomponentenanalyse
Die Hauptkomponentenanalyse betrachtet einen hochdimensionalen Raum und wählt eine neue Basis aus, wobei die Hauptkomponentenanalyse eine neue Basis für die Hauptkomponentenanalyse darstellt.ping Es werden nur die wichtigsten Werte berücksichtigt. Jede Richtung in dieser Basis wird als Hauptkomponente bezeichnet. Die beibehaltene Teilmenge bildet einen neuen, im Vergleich zum ursprünglichen Raum kleinen Raum. Dabei bleibt so viel wie möglich von der Komplexität der Daten erhalten.
Verein
Assoziationsregeln ermöglichen es, Beziehungen zwischen Datenobjekten in großen Datenbanken herzustellen. Diese unüberwachte Technik dient dazu, interessante Beziehungen zwischen Variablen in großen Datenbanken zu entdecken und ist ein Grundpfeiler der Datenbankentwicklung. Data MiningBeispielsweise kaufen Menschen, die ein neues Haus kaufen, mit hoher Wahrscheinlichkeit auch neue Möbel.
Andere Beispiele:
- Eine Untergruppe von Krebspatienten, gruppiert nach ihren Genexpressionsmessungen
- Gruppen von Käufern basierend auf ihrem Browser- und Kaufverhalten
- Filme, gruppiert nach den von den Zuschauern vergebenen Bewertungen
Überwachtes vs. unüberwachtes maschinelles Lernen
Hier ist der Hauptunterschied zwischen Überwachtes vs. unüberwachtes Lernen:
| Kenngrößen | Überwachte maschinelle Lerntechnik | Unbeaufsichtigte maschinelle Lerntechnik |
| Eingabedaten | Algorithms werden anhand gekennzeichneter Daten trainiert. | Algorithms werden für Daten verwendet, die nicht gekennzeichnet sind |
| Rechenkomplexität | Überwachtes Lernen ist eine einfachere Methode. | Unüberwachtes Lernen ist rechnerisch komplex |
| Genauigkeit | Die Genauigkeit kann direkt anhand bekannter Etiketten gemessen werden. | Genauigkeit lässt sich nicht direkt messen; die Ergebnisse müssen interpretiert werden. |
| Typische Ausgabe | Eine Vorhersage für jeden neuen Rekord | Gruppen, Regeln oder komprimierte Funktionen |
Anwendungen des unbeaufsichtigten maschinellen Lernens
Anwendungsbeispiele für unüberwachte Lernverfahren sind:
- Clustering teilt den Datensatz automatisch anhand seiner Ähnlichkeiten in Gruppen auf.
- Die Anomalieerkennung kann ungewöhnliche Datenpunkte in Ihrem Datensatz entdecken. Es ist nützlich, um betrügerische Transaktionen zu finden
- Association Mining identifiziert Gruppen von Elementen, die in Ihrem Datensatz häufig zusammen vorkommen
- Latentvariablenmodelle werden häufig zur Datenvorverarbeitung eingesetzt, beispielsweise zur Reduzierung der Anzahl von Merkmalen in einem Datensatz oder zur Zerlegung des Datensatzes in mehrere Komponenten.
Nachteile des unüberwachten Lernens
- Man kann keine genauen Informationen über die Datensortierung erhalten, da die beim unüberwachten Lernen verwendeten Daten ungelabelt sind und ihre wahre Gruppe unbekannt ist.ping ist nicht bekannt
- Less Die Genauigkeit der Ergebnisse ist beeinträchtigt, da die Eingangsdaten unbekannt und nicht im Voraus von Menschen gekennzeichnet sind. Das bedeutet, dass die Maschine dies selbstständig durchführen muss.
- Die Spektralklassen entsprechen nicht immer Informationsklassen.
- Der Benutzer muss Zeit aufwenden, um die sich aus der Klassifizierung ergebenden Klassen zu interpretieren und zu benennen.
- Die spektralen Eigenschaften von Klassen können sich im Laufe der Zeit ändern, daher können Sie beim Wechsel von einem Bild zum anderen nicht dieselben Klasseninformationen beibehalten.



