Apprendimento automatico supervisionato: Algorithms, Tipi ed esempi

โšก Riepilogo intelligente

L'apprendimento automatico supervisionato addestra un algoritmo su esempi etichettati in modo che possa prevedere i risultati per dati mai visti prima, utilizzando la regressione per obiettivi numerici e la classificazione per obiettivi categoriali come spam o frode.

  • ๐Ÿ”˜ Impara dalle risposte: Ogni riga di addestramento contiene l'output corretto, quindi il modello apprende una mappatura diretta input-output.ping.
  • โ˜‘๏ธ Due famiglie di attivitร : La regressione prevede un numero; la classificazione assegna un'etichetta a una di due o piรน classi.
  • โœ… Algoritmi denominati: Regressione lineare e logistica, Naive Bayes, alberi decisionali, foreste casuali e macchine a vettori di supporto.
  • ๐Ÿงช Esempio pratico: Tempo di percorrenza previsto in base alle condizioni meteorologiche, all'ora del giorno, ai giorni festivi e al percorso scelto.
  • ๏ธ Misurabile per sua stessa natura: Poichรฉ esiste una veritร  di base, accuratezza, precisione, richiamo e RMSE valutano il modello in modo oggettivo.
  • โš™๏ธ Il compromesso: L'etichettatura รจ costosa e una classe mancante nell'addestramento non verrร  mai prevista correttamente.

Apprendimento automatico supervisionato: algoritmi, tipologie ed esempi

Che cos'รจ l'apprendimento automatico supervisionato?

L'apprendimento automatico supervisionato รจ un algoritmo che apprende da dati di addestramento etichettati per aiutare a prevedere i risultati di dati imprevisti. Nell'apprendimento supervisionato, si addestra la macchina utilizzando dati ben "etichettati", ovvero dati giร  associati a risposte corrette. Puรฒ essere paragonato all'apprendimento in presenza di un supervisore o di un insegnante.

La creazione, la scalabilitร  e l'implementazione di modelli di apprendimento automatico supervisionato accurati richiedono tempo e competenze tecniche da parte di un team di data scientist altamente qualificati. I data scientist devono inoltre ricostruire periodicamente i modelli affinchรฉ le informazioni che producono rimangano valide anche al variare dei dati sottostanti.

Come funziona l'apprendimento supervisionato

L'apprendimento automatico supervisionato utilizza set di dati di addestramento per ottenere i risultati desiderati. Questi set di dati contengono input e l'output corretto che aiuta il modello ad apprendere piรน velocemente. Ad esempio, vuoi addestrare una macchina per aiutarti a prevedere quanto tempo impiegherai per tornare a casa dal posto di lavoro.

Qui inizierai creando un set di dati etichettati. Questi dati includono:

  • Condizioni meteo
  • Ora del giorno
  • Festivitร 
  • Percorso scelto

Tutti questi dettagli rappresentano i tuoi input in questo esempio di apprendimento supervisionato. L'output รจ il tempo impiegato per tornare a casa in quel giorno specifico, come mostrato nell'immagine sottostante.

Fattori che influenzano la previsione dei tempi di percorrenza: condizioni meteorologiche, ora del giorno, festivitร  e percorso scelto.

Istintivamente sai che se fuori piove, ci metterai piรน tempo ad arrivare a casa in macchina. Ma la macchina ha bisogno di dati e statistiche.

La prima cosa da creare รจ un set di dati di addestramento. Questo set conterrร  il tempo totale di percorrenza e i fattori correlati, come le condizioni meteorologiche, l'orario, ecc. Sulla base di questo set di dati di addestramento, il sistema potrebbe rilevare una relazione diretta tra la quantitร  di pioggia e il tempo impiegato per tornare a casa.

Quindi, si deduce che piรน piove, piรน tempo impiegherai a guidare per tornare a casa. Si potrebbe anche considerare la correlazione tra l'orario di uscita dal lavoro e il tempo che trascorrerai in strada. Piรน ci si avvicina alle 18:00, piรน tempo ci vorrร  per arrivare a casa.

La tua macchina potrebbe individuare alcune delle relazioni con i tuoi dati etichettati. Questa fase di apprendimento รจ illustrata di seguito.

Pipeline della fase di apprendimento: dai dati di addestramento al vettore delle caratteristiche, all'algoritmo, al modello addestrato.
Fase di apprendimento: dati di addestramento โ†’ vettore delle caratteristiche โ†’ algoritmo โ†’ modello

Questo รจ l'inizio del tuo modello di dati. Inizia a registrare come la pioggia influisce sul modo in cui le persone guidano e che un maggior numero di persone si sposta durante una determinata fascia oraria della giornata.

Tipi di machine learning supervisionato Algorithms

Di seguito sono riportati i tipi di algoritmi di apprendimento automatico supervisionato:

Regressione

La tecnica di regressione prevede un singolo valore di output continuo utilizzando i dati di addestramento.

Esempio: puoi utilizzare la regressione per prevedere il prezzo della casa dai dati di addestramento. Le variabili di input saranno la localitร , la dimensione di una casa, ecc.

Punti di forza: i risultati sono facili da interpretare e l'algoritmo puรฒ essere regolarizzato per evitare l'overfitting.

Punti deboli: un modello lineare non รจ flessibile, quindi non riesce a cogliere relazioni complesse senza l'aggiunta di nuove funzionalitร .

Ecco alcuni tipi di regressione Algorithms:

  • Regressione lineare
  • Regressione polinomiale
  • Regressione Ridge e Lasso
  • Regressione logistica (per la classificazione)
  • Regressione tramite albero decisionale e foresta casuale
  • Supporta la regressione vettoriale

Regressione logistica:

La regressione logistica viene utilizzata per stimare valori discreti in base a un dato insieme di variabili indipendenti. Aiuta a prevedere la probabilitร  di occorrenza di un evento adattando i dati a una funzione logit. Per questo motivo, รจ anche nota come regressione logistica. Poichรฉ prevede una probabilitร , il suo valore di output รจ compreso tra 0 e 1 e potrebbe risultare meno efficace in presenza di confini decisionali multipli o non lineari.

Classificazione

Classificare significa raggruppare l'output all'interno di una classe. Se l'algoritmo tenta di etichettare l'input in due classi distinte, si parla di classificazione binaria. La selezione tra piรน di due classi รจ definita classificazione multiclasse.

Esempio: Determinare se una persona sarร  o meno inadempiente nel pagamento del prestito.

Punti di forza: Gli alberi di classificazione funzionano molto bene nella pratica.

Punti deboli: non essendo vincolati, i singoli alberi sono soggetti a overfitting.

Ecco alcuni tipi di classificazione Algorithms:

  • Classificatori Bayesiani ingenui
  • Alberi decisionali
  • Supporta la macchina vettoriale
  • K-vicini piรน vicini
  • Foresta casuale e boosting del gradiente

Classificatori Naive Bayes

Migliori Ingenuo Bayes Questo modello รจ facile da costruire e molto utile per grandi insiemi di dati. Il metodo si basa su grafi aciclici diretti con un nodo padre e diversi nodi figli. Presuppone l'indipendenza tra i nodi figli separati dal loro nodo padre.

Alberi decisionali

Gli alberi decisionali classificano un'istanza ordinandola in base al valore di una caratteristica. In questo metodo, ogni nodo rappresenta la caratteristica di un'istanza da classificare e ogni ramo rappresenta un valore che il nodo puรฒ assumere. รˆ una tecnica di classificazione ampiamente utilizzata.

La stessa struttura funziona anche per la regressione: un albero di regressione aiuta a stimare valori reali (costo di acquisto di un'auto, numero di chiamate, vendite mensili totali, ecc.).

Supporta la macchina vettoriale

La Support Vector Machine (SVM) รจ un tipo di algoritmo di apprendimento introdotto negli anni '1990. Questo metodo si basa sui risultati della teoria dell'apprendimento statistico sviluppata da Vladimir Vapnik e dai suoi colleghi.

Le SVM sono anche strettamente connesse alle funzioni kernel, che sono un concetto centrale per la maggior parte delle attivitร  di apprendimento. Il framework kernel e le SVM sono utilizzati in una varietร  di campi. Tra questi figurano il recupero di informazioni multimediali, la bioinformatica e il riconoscimento di pattern. Ogni stimatore sopra menzionato รจ documentato con i suoi parametri di regolazione nel scikit-impara riferimento.

Tecniche di apprendimento automatico supervisionato e non supervisionato

Mettere il metodo accanto apprendimento senza supervisione definisce chiaramente i suoi confini.

Basato su Tecnica di machine learning supervisionata Tecnica di machine learning non supervisionata
Dati in ingresso Algorithms vengono addestrati utilizzando dati etichettati. Algorithms vengono utilizzati rispetto a dati non etichettati
Complessitร  computazionale Lโ€™apprendimento supervisionato รจ un metodo piรน semplice. L'apprendimento non supervisionato รจ computazionalmente complesso
Precisione Metodo estremamente accurato e affidabile. Less metodo accurato e affidabile.
Algoritmi tipici Regressione logistica, alberi decisionali, SVM, Naive Bayes K-means, clustering gerarchico, PCA
Come vengono valutati i risultati Punteggio calcolato rispetto alle risposte note (accuratezza, RMSE) Valutato in base a criteri interni e a una revisione umana.

Sfide nell'apprendimento automatico supervisionato

Ecco le sfide affrontate nell'apprendimento automatico supervisionato:

  • Le caratteristiche di input irrilevanti nei dati di addestramento possono produrre risultati inaccurati
  • La preparazione e la pre-elaborazione dei dati rappresentano sempre una sfida.
  • L'accuratezza diminuisce quando vengono inseriti come dati di addestramento valori impossibili, improbabili e incompleti.
  • Se l'esperto in questione non รจ disponibile, l'alternativa รจ la "forza bruta". Ciรฒ significa che bisogna indovinare quali caratteristiche (variabili di input) utilizzare per addestrare la macchina, e questa intuizione potrebbe rivelarsi errata.

Vantaggi dell'apprendimento supervisionato

A fronte di queste sfide, ecco i vantaggi dell'apprendimento automatico supervisionato:

  • Apprendimento supervisionato in machine Learning consente di raccogliere dati o produrre un output di dati da esperienze precedenti
  • Ti aiuta a ottimizzare i criteri di prestazione utilizzando l'esperienza
  • L'apprendimento automatico supervisionato ti aiuta a risolvere vari tipi di problemi di calcolo del mondo reale.

Svantaggi dell'apprendimento supervisionato

Di seguito sono elencati gli svantaggi dell'apprendimento automatico supervisionato:

  • Il confine decisionale potrebbe essere sovra-addestrato se il set di addestramento non contiene esempi che si desidera avere in una classe
  • Devi selezionare molti buoni esempi da ogni classe mentre stai addestrando il classificatore.
  • Classificare i big data puรฒ essere una vera sfida.
  • La formazione per lโ€™apprendimento supervisionato richiede molto tempo di calcolo.

Migliori pratiche per l'apprendimento supervisionato

La seguente sequenza mantiene un progetto attivo track:

  • Prima di fare qualsiasi altra cosa, decidi quale tipo di dati utilizzare come set di addestramento.
  • Definisci la struttura della funzione da apprendere e l'algoritmo di apprendimento.
  • Raccogli i risultati corrispondenti da esperti umani o da misurazioni
  • Riserva un set di test che il modello non vedrร  mai e riporta il punteggio ottenuto.

DOMANDE FREQUENTI

I classificatori vengono valutati con accuratezza, precisione, richiamo e F1, letti da un matrice di confusioneI regressori utilizzano RMSE, MAE o Rยฒ. Riportare sempre il punteggio sui dati non visti.

I dati etichettati vengono suddivisi, in genere 70-80% per l'addestramento e il resto per il test. Le righe di test rimangono invariate fino alla fine, quindi il punteggio riflette dati non ancora visti.

Un modello sovradattato memorizza il rumore: il punteggio di addestramento รจ elevato, quello di test รจ basso. Un modello sottodattato รจ troppo semplice e ottiene risultati scadenti in entrambi i casi. La regolarizzazione e la potatura ripristinano l'equilibrio.

Non esiste un numero fisso. Aumenta con il numero di caratteristiche e classi. La qualitร  delle etichette รจ piรน importante del volume grezzo: etichette incoerenti compromettono la precisione in modo permanente.

Filtro antispam, valutazione del credito, rilevamento delle frodi, triage medico, previsione della domanda, stima del prezzo delle case e riconoscimento vocale. Ognuno di questi sistemi associa input storici a risultati registrati, la forma necessaria per l'apprendimento supervisionato.

L'apprendimento semi-supervisionato combina un piccolo set di dati etichettati con un ampio set di dati non etichettati. La struttura presente nelle righe non etichettate guida il modello, in modo che l'accuratezza si avvicini a quella di un risultato supervisionato con un costo di etichettatura inferiore.

Gli strumenti AutoML ricercano algoritmi, trasformazioni di caratteristiche e iperparametri, quindi classificano i candidati in base a un punteggio convalidato incrociatamente. Questo elimina la maggior parte dei tentativi ed errori manuali, ma un essere umano sceglie comunque la metrica e verifica la presenza di fughe di informazioni.

Copilota GitHub Genera pipeline di scikit-learn, suddivisioni tra set di training e di test e report di valutazione a partire da un breve prompt. Verifica che la suddivisione sia stata stratificata e che sia stato impostato un seed casuale.

Riassumi questo post con: