Apprentissage automatique non supervisé : AlgorithmsTypes et exemples
⚡ Résumé intelligent
L'apprentissage non supervisé est une technique d'apprentissage automatique qui fonctionne sur des données non étiquetées, laissant le modèle découvrir lui-même la structure grâce au regroupement, aux règles d'association et à la réduction de dimensionnalité plutôt qu'à partir de réponses fournies à l'avance.
Qu'est-ce que l'apprentissage non supervisé ?
L'apprentissage non supervisé est une technique d'apprentissage automatique où l'utilisateur n'intervient pas dans le fonctionnement du modèle. Ce dernier peut ainsi découvrir par lui-même des schémas et des informations auparavant insoupçonnés. Il traite principalement de données non étiquetées.
Apprentissage non supervisé Algorithms
Apprentissage non supervisé Algorithms permettre aux utilisateurs d'effectuer des tâches de traitement plus complexes que enseignement superviséL’apprentissage non supervisé peut toutefois se révéler plus imprévisible que les méthodes entraînées à partir de réponses connues. Parmi les algorithmes d’apprentissage non supervisé, on trouve le clustering, la détection d’anomalies, la réduction de dimensionnalité et les réseaux de neurones auto-organisateurs.
Exemple d'apprentissage automatique non supervisé
Prenons l'exemple de l'apprentissage non supervisé chez un bébé et le chien de sa famille. La première image montre l'animal que le bébé reconnaît déjà.
Elle connaît ce chien et l'identifie. Quelques semaines plus tard, un ami de la famille amène un chien et tente de jouer avec le bébé. Ce deuxième chien, inconnu du bébé, est présenté ci-dessous.
Le bébé n'a jamais vu ce chien auparavant. Pourtant, elle reconnaît plusieurs caractéristiques (deux oreilles, des yeux, la marche à quatre pattes) semblables à celles de son propre chien. Elle identifie donc le nouvel animal comme un chien. Il s'agit d'un apprentissage non supervisé, où l'enfant n'obtient rien par la méthode traditionnelle mais apprend directement à partir des données (ici, des données concernant un chien). Dans le cas d'un apprentissage supervisé, l'ami de la famille aurait dit au bébé qu'il s'agissait d'un chien, comme illustré dans l'exemple d'apprentissage non supervisé ci-dessus.
Pourquoi un apprentissage non supervisé ?
Voici les principales raisons d'utiliser l'apprentissage non supervisé dans Machine Learning:
- L'apprentissage automatique non supervisé permet de découvrir toutes sortes de modèles inconnus dans les données.
- Les méthodes non supervisées vous aident à trouver des fonctionnalités qui peuvent être utiles pour la catégorisation.
- Il peut traiter les données au fur et à mesure de leur arrivée, de sorte que les enregistrements entrants sont analysés et regroupés sans attendre qu'un humain les étiquette au préalable.
- Il est plus facile d'obtenir des données non étiquetées à partir d'un ordinateur que des données étiquetées, qui nécessitent une intervention manuelle.
ClusterTypes d'apprentissage non supervisé Algorithms
Les problèmes d'apprentissage non supervisé sont regroupés en problèmes de clustering, d'association et de réduction de dimensionnalité. ClusterLe regroupement par groupes d'enregistrements similaires, l'association trouve les éléments qui apparaissent ensemble et la réduction de dimensionnalité compresse de nombreuses caractéristiques en quelques-unes.
Clusterfaire respecter
ClusterL'apprentissage est un concept important lorsqu'il s'agit d'apprentissage non supervisé. Il s’agit principalement de trouver une structure ou un modèle dans une collection de données non catégorisées. Apprentissage non supervisé ClusterLes algorithmes traiteront vos données et identifieront les regroupements naturels (ou clusters) s'ils existent. Vous pouvez également modifier le nombre de clusters que vos algorithmes doivent identifier, ce qui vous permet d'ajuster la granularité de ces groupes. Le diagramme ci-dessous illustre des enregistrements dispersés et regroupés en clusters distincts.
Il existe différents types de clustering que vous pouvez utiliser :
Exclusif (partitionnement)
Dans cette méthode de clustering, les données sont regroupées de telle sorte qu'un enregistrement ne puisse appartenir qu'à un seul cluster.
Exemple : K-signifie
Agglomératif
Dans cette technique de clustering, chaque enregistrement constitue initialement un cluster distinct. Les unions itératives entre les deux clusters les plus proches réduisent le nombre de clusters.
Exemple : clustering hiérarchique
Chevauchementping
Dans cette technique, ensembles flous sont utilisées pour regrouper les données. Chaque point peut appartenir à deux groupes ou plus, avec des degrés d'appartenance distincts.
Ici, les données seront associées à une valeur d'adhésion appropriée. Exemple : C-Means floues
probabiliste
Cette technique utilise une distribution de probabilité pour créer les groupes.
Exemple : Les mots-clés suivants
- "chaussure d'homme".
- "chaussure pour femme."
- "gant pour femme."
- "gant d'homme."
peuvent être regroupées en deux catégories, « chaussures » et « gants », ou « hommes » et « femmes ».
ClusterTypes d'utilisation
Voici les algorithmes les plus fréquemment rencontrés en apprentissage automatique non supervisé. Les deux premiers regroupent les enregistrements, les trois derniers réduisent la dimensionnalité plutôt que de former des clusters, et l'algorithme K-NN est mentionné car il est souvent confondu avec l'algorithme K-means.
- Classification hiérarchique — classification
- Clustering K-means — clustering
- K-NN (k plus proches voisins) — un classificateur supervisé, et non une méthode de clustering
- Analyse en composantes principales — réduction de dimensionnalité
- Décomposition en valeurs singulières — réduction de dimensionnalité
- Analyse en composantes indépendantes — réduction de dimensionnalité
Hiérarchique Clusterfaire respecter
Le clustering hiérarchique est un algorithme qui construit une hiérarchie de clusters. Il commence par assigner toutes les données à un cluster. Deux clusters proches sont ensuite fusionnés. L'algorithme s'arrête lorsqu'il ne reste plus qu'un seul cluster. Il repose sur deux concepts qu'il convient d'aborder séparément.
Regroupement aggloméré
Cette forme ascendante de classification hiérarchique ne nécessite pas de spécifier le nombre de clusters K. Le processus d'agglomération commence par la formation de chaque enregistrement en un cluster unique.
Cette méthode utilise une mesure de distance et réduit le nombre de clusters (un à chaque itération) par un processus de fusion. Au final, on obtient un grand cluster contenant tous les objets, et l'analyste tronque l'arbre à la hauteur qui donne un nombre de groupes pertinent.
Dendrogramme
Dans la méthode de classification par dendrogramme, chaque niveau représente un groupe potentiel. La hauteur du dendrogramme indique le degré de similarité entre deux groupes adjacents. Plus les groupes sont proches du bas du dendrogramme, plus ils sont similaires ; le choix du seuil définissant les groupes finaux n'est pas automatique et repose en grande partie sur une appréciation subjective.
K-signifie Clusterfaire respecter
K-means est un algorithme de clustering itératif qui affine le groupeping À chaque itération, le nombre de clusters souhaité est initialement sélectionné. Cette méthode de clustering consiste à regrouper les points de données en k groupes. Plus k est grand, plus les groupes sont petits et fins ; plus k est petit, plus les groupes sont grands et fins.
L'algorithme produit un ensemble d'« étiquettes » en attribuant chaque point de données à l'un des k groupes. Dans le clustering k-means, chaque groupe est défini par la création d'un centroïde. Ces centroïdes, véritables centres du cluster, regroupent les points les plus proches et les ajoutent à celui-ci.
K- Voisins les plus proches
L'algorithme des k plus proches voisins (k-NN) est le plus simple des classificateurs d'apprentissage automatique. Il se distingue des autres techniques d'apprentissage automatique par le fait qu'il ne produit pas de modèle. Il s'agit d'un algorithme simple qui stocke tous les cas disponibles et classe les nouvelles instances en fonction d'une mesure de similarité. Comme il nécessite des cas étiquetés pour la classification, le k-NN est une méthode supervisée ; il est mentionné ici uniquement parce que sa logique basée sur la distance s'apparente au clustering.
Cette méthode fonctionne très bien lorsqu'il existe une distance significative entre les exemples. La vitesse d'apprentissage est lente lorsque l'ensemble d'entraînement est volumineux et que le calcul des distances est complexe.
Analyse des principales composantes
L'analyse en composantes principales prend un espace de grande dimension et sélectionne une nouvelle base, gardeping Seules ses composantes les plus importantes sont conservées. Chaque direction de cette base est appelée composante principale. Le sous-ensemble retenu constitue un nouvel espace de taille réduite par rapport à l'espace d'origine. Il préserve au maximum la complexité des données.
Association
Les règles d'association permettent d'établir des liens entre les objets de données au sein de grandes bases de données. Cette technique non supervisée consiste à découvrir des relations intéressantes entre les variables dans les grandes bases de données et constitue un élément fondamental de… data miningPar exemple, les personnes qui achètent une nouvelle maison sont plus susceptibles d'acheter de nouveaux meubles.
Autres exemples:
- Un sous-groupe de patients atteints de cancer, regroupés selon leurs mesures d'expression génique
- Groupes d'acheteurs en fonction de leur historique de navigation et d'achats
- Films regroupés selon les notes attribuées par les spectateurs
Apprentissage automatique supervisé ou non supervisé
Voici la principale différence entre Apprentissage supervisé ou non supervisé:
| Paramètres | Technique d'apprentissage automatique supervisé | Technique d'apprentissage automatique non supervisé |
| Des données d'entrée | Algorithms sont formés à l’aide de données étiquetées. | Algorithms sont utilisés contre des données qui ne sont pas étiquetées |
| Complexité informatique | L'apprentissage supervisé est une méthode plus simple. | L'apprentissage non supervisé est complexe sur le plan informatique |
| Exactitude | La précision peut être mesurée directement par rapport à des étiquettes connues. | La précision ne peut être mesurée directement ; les résultats nécessitent une interprétation. |
| Sortie typique | Une prédiction pour chaque nouveau record | Groupes, règles ou fonctionnalités compressées |
Applications de l'apprentissage automatique non supervisé
Voici quelques applications des techniques d'apprentissage non supervisé :
- ClusterLe système divise automatiquement l'ensemble de données en groupes en fonction de leurs similarités.
- La détection d'anomalies peut découvrir des points de données inhabituels dans votre ensemble de données. C'est utile pour trouver des transactions frauduleuses
- L'exploration d'associations identifie des ensembles d'éléments qui apparaissent souvent ensemble dans votre ensemble de données
- Les modèles à variables latentes sont largement utilisés pour le prétraitement des données, notamment pour réduire le nombre de caractéristiques d'un ensemble de données ou pour décomposer cet ensemble en plusieurs composantes.
Inconvénients de l’apprentissage non supervisé
- Il est impossible d'obtenir des informations précises concernant le tri des données, car les données utilisées dans l'apprentissage non supervisé ne sont pas étiquetées et leur véritable groupeping n'est pas connu
- Less La précision des résultats est compromise car les données d'entrée sont inconnues et non étiquetées au préalable. La machine doit donc effectuer cette opération elle-même.
- Les classes spectrales ne correspondent pas toujours à des classes informationnelles.
- L'utilisateur doit consacrer du temps à interpréter et à étiqueter les classes découlant de la classification.
- Les propriétés spectrales des classes peuvent également évoluer au fil du temps, il est donc impossible de conserver les mêmes informations de classe en passant d'une image à une autre.



