Apprentissage automatique supervisé : qu'est-ce que c'est, Algorithms avec des exemples

Qu'est-ce que l'apprentissage automatique supervisé ?

Apprentissage automatique supervisé est un algorithme qui apprend à partir des données d'entraînement étiquetées pour vous aider à prédire les résultats de données imprévues. Dans l’apprentissage supervisé, vous entraînez la machine à l’aide de données bien « étiquetées ». Cela signifie que certaines données contiennent déjà des réponses correctes. Cela peut être comparé à un apprentissage en présence d’un superviseur ou d’un enseignant.

Réussir la création, la mise à l'échelle et le déploiement précise Les modèles d’apprentissage automatique supervisés nécessitent du temps et l’expertise technique d’une équipe de data scientists hautement qualifiés. De plus, Centres de données le scientifique doit reconstruire numériques jumeaux (digital twin models) pour s'assurer que les informations fournies restent vraies jusqu'à ce que ses données changent.

Comment fonctionne l'apprentissage supervisé

L'apprentissage automatique supervisé utilise des ensembles de données de formation pour obtenir les résultats souhaités. Ces ensembles de données contiennent des entrées et la sortie correcte qui aident le modèle à apprendre plus rapidement. Par exemple, vous souhaitez former une machine pour vous aider à prédire combien de temps il vous faudra pour rentrer chez vous depuis votre lieu de travail.

Ici, vous commencez par créer un ensemble de données étiquetées. Ces données comprennent :

  • Conditions météorologiques
  • Moment de la journée
  • Les Fêtes de Fin d'Année

Tous ces détails sont vos entrées dans cet exemple d’apprentissage supervisé. Le résultat correspond au temps qu'il a fallu pour rentrer chez soi ce jour-là.

Comment fonctionne l'apprentissage automatique supervisé

Vous savez instinctivement que s’il pleut dehors, il vous faudra plus de temps pour rentrer chez vous. Mais la machine a besoin de données et de statistiques.

Voyons quelques exemples d'apprentissage supervisé sur la façon dont vous pouvez développer un modèle d'apprentissage supervisé de cet exemple qui aide l'utilisateur à déterminer le temps de trajet. La première chose que vous devez créer est un ensemble de formation. Cet ensemble de formation contiendra la durée totale du trajet et les facteurs correspondants tels que la météo, l'heure, etc. Sur la base de cet ensemble de formation, votre machine pourrait constater qu'il existe une relation directe entre la quantité de pluie et le temps qu'il vous faudra pour rentrer chez vous.

Ainsi, il constate que plus il pleut, plus vous conduirez longtemps pour rentrer chez vous. Il peut également établir un lien entre l'heure à laquelle vous quittez le travail et l'heure à laquelle vous serez sur la route.

Plus vous approchez de 6 heures, plus il vous faudra du temps pour rentrer chez vous. Votre machine peut trouver certaines relations avec vos données étiquetées.

Fonctionnement de l’apprentissage automatique supervisé
Fonctionnement de l’apprentissage automatique supervisé

C'est le début de votre modèle de données. Cela commence à avoir un impact sur l’impact de la pluie sur la façon dont les gens conduisent. On commence également à constater que davantage de personnes voyagent à un moment donné de la journée.

Types d’apprentissage automatique supervisé Algorithms

Voici les types d’algorithmes d’apprentissage automatique supervisé :

Régression

La technique de régression prédit une valeur de sortie unique à l'aide des données d'entraînement.

Exemple: Vous pouvez utiliser la régression pour prédire le prix de l'immobilier à partir des données de formation. Les variables d'entrée seront la localité, la taille d'une maison, etc.

Points forts: Les sorties ont toujours une interprétation probabiliste et l'algorithme peut être régularisé pour éviter le surajustement.

Points faibles : La régression logistique peut sous-performer lorsqu'il existe des limites de décision multiples ou non linéaires. Cette méthode n’est pas flexible et ne prend donc pas en compte les relations plus complexes.

Régression logistique:

Méthode de régression logistique utilisée pour estimer des valeurs discrètes en fonction d'un ensemble donné de variables indépendantes. Il vous aide à prédire la probabilité d'occurrence d'un événement en ajustant les données à une fonction logit. C’est pourquoi on l’appelle également régression logistique. Comme il prédit la probabilité, sa valeur de sortie se situe entre 0 et 1.

Voici quelques types de régression Algorithms

Classification

La classification signifie regrouper la sortie dans une classe. Si l’algorithme tente d’étiqueter les entrées en deux classes distinctes, on parle de classification binaire. La sélection entre plus de deux classes est appelée classification multiclasse.

Exemple: Déterminer si quelqu'un sera ou non un défaillant du prêt.

Points forts: L'arbre de classification fonctionne très bien en pratique

Points faibles : Sans contrainte, les arbres individuels sont sujets au surajustement.

Voici quelques types de classification Algorithms

Classificateurs bayésiens naïfs

Le modèle bayésien naïf (NBN) est facile à créer et très utile pour les grands ensembles de données. Cette méthode est composée de graphes acycliques directs avec un parent et plusieurs enfants. Cela suppose l’indépendance des nœuds enfants séparés de leur parent.

Arbres de décision

Les arbres de décision classent les instances en les triant en fonction de la valeur de la fonctionnalité. Dans cette méthode, chaque mode est la fonctionnalité d'une instance. Il doit être classé et chaque branche représente une valeur que le nœud peut prendre. C'est une technique de classification largement utilisée. Dans cette méthode, la classification est un arbre appelé arbre de décision.

Il vous aide à estimer des valeurs réelles (coût d'achat d'une voiture, nombre d'appels, ventes mensuelles totales, etc.).

Soutenir la machine vectorielle

La machine à vecteurs de support (SVM) est un type d'algorithme d'apprentissage développé en 1990. Cette méthode est basée sur les résultats de la théorie de l'apprentissage statistique introduite par Vap Nik.

Les machines SVM sont également étroitement liées aux fonctions du noyau, ce qui constitue un concept central pour la plupart des tâches d'apprentissage. Le framework du noyau et SVM sont utilisés dans divers domaines. Il comprend la recherche d'informations multimédias, la bioinformatique et la reconnaissance de formes.

Techniques d’apprentissage automatique supervisé ou non supervisé

Basé sur Technique d'apprentissage automatique supervisé Technique d'apprentissage automatique non supervisé
Des données d'entrée Algorithms sont formés à l’aide de données étiquetées. Algorithms sont utilisés contre des données qui ne sont pas étiquetées
Complexité informatique L'apprentissage supervisé est une méthode plus simple. L'apprentissage non supervisé est complexe sur le plan informatique
Exactitude Méthode très précise et fiable. Less méthode précise et fiable.

Les défis de l'apprentissage automatique supervisé

Voici les défis rencontrés dans l’apprentissage automatique supervisé :

  • Une fonctionnalité de saisie non pertinente présente des données d'entraînement pourrait donner des résultats inexacts
  • La préparation et le prétraitement des données constituent toujours un défi.
  • La précision souffre lorsque des valeurs impossibles, improbables et incomplètes ont été saisies comme données d'entraînement
  • Si l’expert concerné n’est pas disponible, l’autre approche est la « force brute ». Cela signifie que vous devez penser aux bonnes fonctionnalités (variables d'entrée) sur lesquelles former la machine. Cela pourrait être inexact.

Avantages de l'apprentissage supervisé

Voici les avantages de l’apprentissage automatique supervisé :

  • Apprentissage supervisé en Machine Learning vous permet de collecter des données ou de produire une sortie de données à partir de l'expérience précédente
  • Vous aide à optimiser les critères de performance en utilisant l’expérience
  • L'apprentissage automatique supervisé vous aide à résoudre différents types de problèmes de calcul réels.

Inconvénients de l’apprentissage supervisé

Vous trouverez ci-dessous les inconvénients de l’apprentissage automatique supervisé :

  • La limite de décision peut être surentraînée si votre ensemble de formation ne contient pas d'exemples que vous souhaitez avoir dans une classe.
  • Vous devez sélectionner de nombreux bons exemples dans chaque classe pendant que vous entraînez le classificateur.
  • Classement le Big Data peut être un vrai défi.
  • La formation à l’apprentissage supervisé nécessite beaucoup de temps de calcul.

Les meilleures pratiques en matière d'apprentissage supervisé

  • Avant de faire quoi que ce soit d'autre, vous devez décider quel type de données doit être utilisé comme ensemble de formation.
  • Vous devez décider de la structure de la fonction apprise et de l'algorithme d'apprentissage.
  • Recueillir les résultats correspondants soit auprès d'experts humains, soit à partir de mesures

Résumé

  • Dans les algorithmes d’apprentissage supervisé, vous entraînez la machine à l’aide de données bien « étiquetées ».
  • Vous souhaitez former une machine qui vous aide à prédire combien de temps il vous faudra pour rentrer chez vous depuis votre lieu de travail est un exemple d'apprentissage supervisé.
  • La régression et la classification sont deux dimensions d'un algorithme d'apprentissage automatique supervisé.
  • Enseignement supervisé est une méthode plus simple tandis que l’apprentissage non supervisé est une méthode complexe.
  • Le plus grand défi de l’apprentissage supervisé est que les données de formation présentes dans les fonctionnalités de saisie non pertinentes pourraient donner des résultats inexacts.
  • Le principal avantage de l’apprentissage supervisé est qu’il vous permet de collecter des données ou de produire des données à partir de l’expérience précédente.
  • L'inconvénient de ce modèle est que les limites de décision peuvent être surchargées si votre ensemble de formation ne contient pas d'exemples que vous souhaitez avoir dans une classe.
  • En tant que bonne pratique d’apprentissage supervisé, vous devez d’abord décider quel type de données doit être utilisé comme ensemble de formation.

Résumez cet article avec :