Apprentissage automatique non supervisé : AlgorithmsTypes et exemples

⚡ Résumé intelligent

L'apprentissage non supervisé est une technique d'apprentissage automatique qui fonctionne sur des données non étiquetées, laissant le modèle découvrir lui-même la structure grâce au regroupement, aux règles d'association et à la réduction de dimensionnalité plutôt qu'à partir de réponses fournies à l'avance.

  • (I.e. Aucune étiquette nécessaire : L'algorithme recherche une structure au lieu de se contenter de trouver des réponses connues.
  • ☑️ Trois familles de tâches : Clustering, extraction de règles d'association et réduction de dimensionnalité.
  • Quatre styles de clustering : Exclusif, agglomératif, chevauchementping et probabiliste.
  • 🧪 Algorithmes nommés : K-means, clustering hiérarchique, Fuzzy C-Means, PCA, SVD et ICA.
  • Là où elle gagne sa vie : Segmentation de la clientèle, détection des fraudes et des anomalies, analyse du panier d'achat, prétraitement des données.
  • ⚙️ Le compromis : L'absence de vérité de référence signifie que les résultats doivent être interprétés, validés et nommés par un humain.

Apprentissage automatique non supervisé : algorithmes, types et exemples

Qu'est-ce que l'apprentissage non supervisé ?

L'apprentissage non supervisé est une technique d'apprentissage automatique où l'utilisateur n'intervient pas dans le fonctionnement du modèle. Ce dernier peut ainsi découvrir par lui-même des schémas et des informations auparavant insoupçonnés. Il traite principalement de données non étiquetées.

Apprentissage non supervisé Algorithms

Apprentissage non supervisé Algorithms permettre aux utilisateurs d'effectuer des tâches de traitement plus complexes que enseignement superviséL’apprentissage non supervisé peut toutefois se révéler plus imprévisible que les méthodes entraînées à partir de réponses connues. Parmi les algorithmes d’apprentissage non supervisé, on trouve le clustering, la détection d’anomalies, la réduction de dimensionnalité et les réseaux de neurones auto-organisateurs.

Exemple d'apprentissage automatique non supervisé

Prenons l'exemple de l'apprentissage non supervisé chez un bébé et le chien de sa famille. La première image montre l'animal que le bébé reconnaît déjà.

Un bébé avec le chien de sa famille, l'animal qu'elle reconnaît déjà.

Elle connaît ce chien et l'identifie. Quelques semaines plus tard, un ami de la famille amène un chien et tente de jouer avec le bébé. Ce deuxième chien, inconnu du bébé, est présenté ci-dessous.

Un chien inconnu que le bébé n'a jamais vu auparavant.

Le bébé n'a jamais vu ce chien auparavant. Pourtant, elle reconnaît plusieurs caractéristiques (deux oreilles, des yeux, la marche à quatre pattes) semblables à celles de son propre chien. Elle identifie donc le nouvel animal comme un chien. Il s'agit d'un apprentissage non supervisé, où l'enfant n'obtient rien par la méthode traditionnelle mais apprend directement à partir des données (ici, des données concernant un chien). Dans le cas d'un apprentissage supervisé, l'ami de la famille aurait dit au bébé qu'il s'agissait d'un chien, comme illustré dans l'exemple d'apprentissage non supervisé ci-dessus.

Pourquoi un apprentissage non supervisé ?

Voici les principales raisons d'utiliser l'apprentissage non supervisé dans Machine Learning:

  • L'apprentissage automatique non supervisé permet de découvrir toutes sortes de modèles inconnus dans les données.
  • Les méthodes non supervisées vous aident à trouver des fonctionnalités qui peuvent être utiles pour la catégorisation.
  • Il peut traiter les données au fur et à mesure de leur arrivée, de sorte que les enregistrements entrants sont analysés et regroupés sans attendre qu'un humain les étiquette au préalable.
  • Il est plus facile d'obtenir des données non étiquetées à partir d'un ordinateur que des données étiquetées, qui nécessitent une intervention manuelle.

ClusterTypes d'apprentissage non supervisé Algorithms

Les problèmes d'apprentissage non supervisé sont regroupés en problèmes de clustering, d'association et de réduction de dimensionnalité. ClusterLe regroupement par groupes d'enregistrements similaires, l'association trouve les éléments qui apparaissent ensemble et la réduction de dimensionnalité compresse de nombreuses caractéristiques en quelques-unes.

Clusterfaire respecter

ClusterL'apprentissage est un concept important lorsqu'il s'agit d'apprentissage non supervisé. Il s’agit principalement de trouver une structure ou un modèle dans une collection de données non catégorisées. Apprentissage non supervisé ClusterLes algorithmes traiteront vos données et identifieront les regroupements naturels (ou clusters) s'ils existent. Vous pouvez également modifier le nombre de clusters que vos algorithmes doivent identifier, ce qui vous permet d'ajuster la granularité de ces groupes. Le diagramme ci-dessous illustre des enregistrements dispersés et regroupés en clusters distincts.

ClusterDiagramme montrant les points de données non étiquetés regroupés en clusters distincts

Il existe différents types de clustering que vous pouvez utiliser :

Exclusif (partitionnement)

Dans cette méthode de clustering, les données sont regroupées de telle sorte qu'un enregistrement ne puisse appartenir qu'à un seul cluster.

Exemple : K-signifie

Agglomératif

Dans cette technique de clustering, chaque enregistrement constitue initialement un cluster distinct. Les unions itératives entre les deux clusters les plus proches réduisent le nombre de clusters.

Exemple : clustering hiérarchique

Chevauchementping

Dans cette technique, ensembles flous sont utilisées pour regrouper les données. Chaque point peut appartenir à deux groupes ou plus, avec des degrés d'appartenance distincts.

Ici, les données seront associées à une valeur d'adhésion appropriée. Exemple : C-Means floues

probabiliste

Cette technique utilise une distribution de probabilité pour créer les groupes.

Exemple : Les mots-clés suivants

  • "chaussure d'homme".
  • "chaussure pour femme."
  • "gant pour femme."
  • "gant d'homme."

peuvent être regroupées en deux catégories, « chaussures » et « gants », ou « hommes » et « femmes ».

ClusterTypes d'utilisation

Voici les algorithmes les plus fréquemment rencontrés en apprentissage automatique non supervisé. Les deux premiers regroupent les enregistrements, les trois derniers réduisent la dimensionnalité plutôt que de former des clusters, et l'algorithme K-NN est mentionné car il est souvent confondu avec l'algorithme K-means.

  • Classification hiérarchique — classification
  • Clustering K-means — clustering
  • K-NN (k plus proches voisins) — un classificateur supervisé, et non une méthode de clustering
  • Analyse en composantes principales — réduction de dimensionnalité
  • Décomposition en valeurs singulières — réduction de dimensionnalité
  • Analyse en composantes indépendantes — réduction de dimensionnalité

Hiérarchique Clusterfaire respecter

Le clustering hiérarchique est un algorithme qui construit une hiérarchie de clusters. Il commence par assigner toutes les données à un cluster. Deux clusters proches sont ensuite fusionnés. L'algorithme s'arrête lorsqu'il ne reste plus qu'un seul cluster. Il repose sur deux concepts qu'il convient d'aborder séparément.

Regroupement aggloméré

Cette forme ascendante de classification hiérarchique ne nécessite pas de spécifier le nombre de clusters K. Le processus d'agglomération commence par la formation de chaque enregistrement en un cluster unique.

Cette méthode utilise une mesure de distance et réduit le nombre de clusters (un à chaque itération) par un processus de fusion. Au final, on obtient un grand cluster contenant tous les objets, et l'analyste tronque l'arbre à la hauteur qui donne un nombre de groupes pertinent.

Dendrogramme

Dans la méthode de classification par dendrogramme, chaque niveau représente un groupe potentiel. La hauteur du dendrogramme indique le degré de similarité entre deux groupes adjacents. Plus les groupes sont proches du bas du dendrogramme, plus ils sont similaires ; le choix du seuil définissant les groupes finaux n'est pas automatique et repose en grande partie sur une appréciation subjective.

K-signifie Clusterfaire respecter

K-means est un algorithme de clustering itératif qui affine le groupeping À chaque itération, le nombre de clusters souhaité est initialement sélectionné. Cette méthode de clustering consiste à regrouper les points de données en k groupes. Plus k est grand, plus les groupes sont petits et fins ; plus k est petit, plus les groupes sont grands et fins.

L'algorithme produit un ensemble d'« étiquettes » en attribuant chaque point de données à l'un des k groupes. Dans le clustering k-means, chaque groupe est défini par la création d'un centroïde. Ces centroïdes, véritables centres du cluster, regroupent les points les plus proches et les ajoutent à celui-ci.

K- Voisins les plus proches

L'algorithme des k plus proches voisins (k-NN) est le plus simple des classificateurs d'apprentissage automatique. Il se distingue des autres techniques d'apprentissage automatique par le fait qu'il ne produit pas de modèle. Il s'agit d'un algorithme simple qui stocke tous les cas disponibles et classe les nouvelles instances en fonction d'une mesure de similarité. Comme il nécessite des cas étiquetés pour la classification, le k-NN est une méthode supervisée ; il est mentionné ici uniquement parce que sa logique basée sur la distance s'apparente au clustering.

Cette méthode fonctionne très bien lorsqu'il existe une distance significative entre les exemples. La vitesse d'apprentissage est lente lorsque l'ensemble d'entraînement est volumineux et que le calcul des distances est complexe.

Analyse des principales composantes

L'analyse en composantes principales prend un espace de grande dimension et sélectionne une nouvelle base, gardeping Seules ses composantes les plus importantes sont conservées. Chaque direction de cette base est appelée composante principale. Le sous-ensemble retenu constitue un nouvel espace de taille réduite par rapport à l'espace d'origine. Il préserve au maximum la complexité des données.

Association

Les règles d'association permettent d'établir des liens entre les objets de données au sein de grandes bases de données. Cette technique non supervisée consiste à découvrir des relations intéressantes entre les variables dans les grandes bases de données et constitue un élément fondamental de… data miningPar exemple, les personnes qui achètent une nouvelle maison sont plus susceptibles d'acheter de nouveaux meubles.

Autres exemples:

  • Un sous-groupe de patients atteints de cancer, regroupés selon leurs mesures d'expression génique
  • Groupes d'acheteurs en fonction de leur historique de navigation et d'achats
  • Films regroupés selon les notes attribuées par les spectateurs

Apprentissage automatique supervisé ou non supervisé

Voici la principale différence entre Apprentissage supervisé ou non supervisé:

Paramètres Technique d'apprentissage automatique supervisé Technique d'apprentissage automatique non supervisé
Des données d'entrée Algorithms sont formés à l’aide de données étiquetées. Algorithms sont utilisés contre des données qui ne sont pas étiquetées
Complexité informatique L'apprentissage supervisé est une méthode plus simple. L'apprentissage non supervisé est complexe sur le plan informatique
Exactitude La précision peut être mesurée directement par rapport à des étiquettes connues. La précision ne peut être mesurée directement ; les résultats nécessitent une interprétation.
Sortie typique Une prédiction pour chaque nouveau record Groupes, règles ou fonctionnalités compressées

Applications de l'apprentissage automatique non supervisé

Voici quelques applications des techniques d'apprentissage non supervisé :

  • ClusterLe système divise automatiquement l'ensemble de données en groupes en fonction de leurs similarités.
  • La détection d'anomalies peut découvrir des points de données inhabituels dans votre ensemble de données. C'est utile pour trouver des transactions frauduleuses
  • L'exploration d'associations identifie des ensembles d'éléments qui apparaissent souvent ensemble dans votre ensemble de données
  • Les modèles à variables latentes sont largement utilisés pour le prétraitement des données, notamment pour réduire le nombre de caractéristiques d'un ensemble de données ou pour décomposer cet ensemble en plusieurs composantes.

Inconvénients de l’apprentissage non supervisé

  • Il est impossible d'obtenir des informations précises concernant le tri des données, car les données utilisées dans l'apprentissage non supervisé ne sont pas étiquetées et leur véritable groupeping n'est pas connu
  • Less La précision des résultats est compromise car les données d'entrée sont inconnues et non étiquetées au préalable. La machine doit donc effectuer cette opération elle-même.
  • Les classes spectrales ne correspondent pas toujours à des classes informationnelles.
  • L'utilisateur doit consacrer du temps à interpréter et à étiqueter les classes découlant de la classification.
  • Les propriétés spectrales des classes peuvent également évoluer au fil du temps, il est donc impossible de conserver les mêmes informations de classe en passant d'une image à une autre.

FAQ

La méthode du coude représente graphiquement l'erreur intra-cluster en fonction de k et repère le point d'inflexion. Le score de silhouette, compris entre -1 et 1, évalue la qualité d'ajustement de chaque point à son cluster. Il est conseillé de lire les deux résultats conjointement.

Les algorithmes basés sur la distance traitent chaque unité de manière égale ; ainsi, une colonne de salaire en milliers prévaudra sur une colonne d'âge en années. Standardiser chaque caractéristique au préalable permet à chaque variable de peser équitablement dans le calcul de la distance.

Apriori est l'algorithme classique d'extraction de règles d'association utilisé dans l'analyse du panier d'achat. Il identifie les ensembles d'articles fréquents, puis les transforme en règles classées selon leur support, leur confiance et leur impact. FP-growth et Eclat font de même, mais plus rapidement.

L'apprentissage semi-supervisé utilise un petit ensemble de données étiquetées et un grand ensemble de données non étiquetées. La structure présente dans les données non étiquetées guide le modèle, ce qui permet d'atteindre une précision proche de celle de l'apprentissage supervisé, pour un coût d'étiquetage bien moindre.

L'ACP est une transformation linéaire qui préserve la variance globale et s'applique aux nouvelles données. Le t-SNE est non linéaire et conçu pour visualiser les voisinages locaux en deux dimensions ; les distances entre les groupes séparés ne doivent pas être interprétées littéralement.

Les méthodes Isolation Forest, One-Class SVM, DBSCAN et l'erreur de reconstruction de l'auto-encodeur sont généralement utilisées. Chacune évalue l'écart d'un enregistrement par rapport à l'ensemble des données ; un seuil détermine ce qui est considéré comme anormal.

Les pipelines automatisés analysent les algorithmes, les mesures de distance et les valeurs de k, puis classent les résultats selon leur score de validité interne. Les modèles de langage génèrent de plus en plus de noms en langage clair pour les segments résultants, ce qui raccourcit l'étape d'interprétation.

Copilote GitHub Génère des pipelines scikit-learn, des graphiques en coude et des diagrammes de silhouette à partir d'une simple ligne de commande. Vérifiez que les caractéristiques ont été mises à l'échelle et qu'une graine aléatoire a été définie, ce que les extraits de code générés omettent souvent.

Résumez cet article avec :