Apprendimento automatico non supervisionato: AlgorithmsTipi ed esempi

โšก Riepilogo intelligente

L'apprendimento non supervisionato รจ una tecnica di apprendimento automatico che opera su dati non etichettati, consentendo al modello di scoprire autonomamente la struttura attraverso il clustering, le regole di associazione e la riduzione della dimensionalitร , anzichรฉ a partire da risposte fornite in anticipo.

  • ๐Ÿ”˜ Non servono etichette: L'algoritmo cerca la struttura anzichรฉ la corrispondenza con risposte note.
  • โ˜‘๏ธ Tre famiglie di attivitร : Clustering, estrazione di regole di associazione e riduzione della dimensionalitร .
  • โœ… Quattro stili di clustering: Esclusivo, agglomerativo, sovrapposizioneping e probabilistico.
  • ๐Ÿงช Algoritmi denominati: K-means, clustering gerarchico, Fuzzy C-Means, PCA, SVD e ICA.
  • ๏ธ Dove si guadagna da vivere: Segmentazione della clientela, rilevamento di frodi e anomalie, analisi del carrello della spesa, preelaborazione dei dati.
  • โš™๏ธ Il compromesso: L'assenza di dati di riferimento significa che i risultati devono essere interpretati, convalidati e denominati da un essere umano.

Apprendimento automatico non supervisionato: algoritmi, tipologie ed esempi

Cos'รจ l'apprendimento non supervisionato?

L'apprendimento non supervisionato รจ una tecnica di apprendimento automatico in cui l'utente non ha bisogno di supervisionare il modello. Al contrario, permette al modello di lavorare autonomamente per scoprire schemi e informazioni precedentemente non rilevati. Si occupa principalmente di dati non etichettati.

Apprendimento senza supervisione Algorithms

Apprendimento senza supervisione Algorithms consentire agli utenti di eseguire attivitร  di elaborazione piรน complesse rispetto a apprendimento supervisionatoL'apprendimento non supervisionato puรฒ tuttavia risultare piรน imprevedibile rispetto ai metodi addestrati su risposte note. Gli algoritmi di apprendimento non supervisionato includono il clustering, il rilevamento delle anomalie, la riduzione della dimensionalitร  e le reti neurali auto-organizzanti.

Esempio di machine learning non supervisionato

Prendiamo come esempio l'apprendimento non supervisionato di una bambina e del suo cane di famiglia. La prima immagine mostra l'animale domestico che la bambina giร  riconosce.

Una bambina con il cane di famiglia, l'animale che giร  riconosce

Lei conosce e identifica questo cane. Qualche settimana dopo, un amico di famiglia porta con sรฉ un cane e cerca di giocare con la bambina. Quel secondo cane, sconosciuto, รจ raffigurato qui sotto.

Un cane sconosciuto che il bambino non ha mai visto prima

La bambina non aveva mai visto prima questo cane. Tuttavia, riconosce che molte caratteristiche (due orecchie, occhi, camminare su quattro zampe) sono simili a quelle del suo cane domestico. Identifica quindi il nuovo animale come un cane. Questo รจ un esempio di apprendimento non supervisionato, in cui non si viene istruiti, ma si apprende dai dati (in questo caso dati relativi a un cane). Se si fosse trattato di apprendimento supervisionato, l'amico di famiglia avrebbe detto alla bambina che si trattava di un cane, come mostrato nell'esempio di apprendimento non supervisionato precedente.

Perchรฉ lโ€™apprendimento non supervisionato?

Ecco i motivi principali per utilizzare l'apprendimento non supervisionato in machine Learning:

  • L'apprendimento automatico non supervisionato individua ogni sorta di schema sconosciuto nei dati.
  • I metodi non supervisionati ti aiutano a trovare funzionalitร  che possono essere utili per la categorizzazione.
  • Puรฒ elaborare i dati man mano che arrivano, quindi i record in entrata vengono analizzati e raggruppati senza dover attendere che un essere umano li etichetti prima.
  • รˆ piรน semplice ottenere dati senza etichetta da un computer rispetto a dati etichettati, che richiedono un intervento manuale.

ClusterTipi di apprendimento non supervisionato Algorithms

I problemi di apprendimento non supervisionato vengono ulteriormente suddivisi in problemi di clustering, associazione e riduzione della dimensionalitร . ClusterL'analisi raggruppa record simili, l'analisi delle associazioni individua elementi che appaiono insieme e la riduzione della dimensionalitร  comprime molte caratteristiche in poche.

ClusterING

ClusterL'apprendimento รจ un concetto importante quando si parla di apprendimento non supervisionato. Si occupa principalmente di trovare una struttura o un modello in una raccolta di dati non categorizzati. Apprendimento non supervisionato ClusterGli algoritmi elaboreranno i tuoi dati e individueranno i cluster (gruppi) naturali, se presenti. Puoi anche modificare il numero di cluster che gli algoritmi devono identificare. Ciรฒ ti consente di regolare la granularitร  di questi gruppi. Il diagramma seguente mostra i record sparsi suddivisi in gruppi distinti.

ClusterDiagramma che mostra punti dati non etichettati raggruppati in cluster separati

Esistono diversi tipi di clustering che puoi utilizzare:

Esclusivo (partizionamento)

In questo metodo di clustering, i dati vengono raggruppati in modo tale che ogni record possa appartenere a un solo cluster.

Esempio: K-significa

agglomerante

In questa tecnica di clustering, ogni record inizia come un cluster a sรฉ stante. Le unioni iterative tra i due cluster piรน vicini riducono il numero di cluster.

Esempio: Clustering gerarchico

sovrapposizioneping

In questa tecnica, set sfocati vengono utilizzati per raggruppare i dati. Ogni punto puรฒ appartenere a due o piรน cluster con gradi di appartenenza differenti.

Qui, i dati verranno associati a un valore di iscrizione appropriato. Esempio: medie C fuzzy

probabilistico

Questa tecnica utilizza una distribuzione di probabilitร  per creare i cluster.

Esempio: Le seguenti parole chiave

  • โ€œscarpa da uomoโ€.
  • โ€œscarpa da donnaโ€.
  • "guanto da donna."
  • "guanto da uomo."

possono essere raggruppati in due categorie, "scarpa" e "guanto", oppure "uomo" e "donna".

Clustertipi

Di seguito sono elencati gli algoritmi piรน frequentemente utilizzati nell'apprendimento automatico non supervisionato. I primi due raggruppano i record, gli ultimi tre riducono le dimensioni anzichรฉ formare cluster, e K-NN รจ incluso perchรฉ viene spesso confuso con K-means.

  • Clustering gerarchico โ€” clustering
  • Clustering K-means โ€” clustering
  • K-NN (k vicini piรน prossimi) โ€” un classificatore supervisionato, non un metodo di clustering
  • Analisi delle componenti principali - riduzione della dimensionalitร 
  • Decomposizione ai valori singolari - riduzione della dimensionalitร 
  • Analisi delle componenti indipendenti - riduzione della dimensionalitร 

Hierarchical ClusterING

Il clustering gerarchico รจ un algoritmo che costruisce una gerarchia di cluster. Inizia assegnando tutti i dati a un cluster specifico. In questo caso, due cluster vicini vengono uniti in un unico cluster. L'algoritmo termina quando rimane un solo cluster. Definisce due concetti che meritano di essere approfonditi separatamente.

Raggruppamento agglomerativo

Questa forma di clustering gerarchico dal basso verso l'alto non richiede il numero di cluster K come input. Il processo di agglomerazione inizia formando ogni record come un singolo cluster.

Questo metodo utilizza una misura di distanza e riduce il numero di cluster (uno per ogni iterazione) tramite un processo di fusione. Infine, si ottiene un unico grande cluster contenente tutti gli oggetti, e l'analista taglia l'albero all'altezza che fornisce un numero ragionevole di gruppi.

Dendrogramma

Nel metodo di clustering a dendrogramma, ogni livello rappresenta un possibile cluster. L'altezza del dendrogramma indica il grado di somiglianza tra due cluster uniti. Piรน i cluster sono vicini alla base del processo, piรน sono simili; la scelta del punto di taglio che definisce i gruppi finali non รจ automatica ed รจ per lo piรน soggettiva.

K-significa ClusterING

K-means รจ un algoritmo di clustering iterativo che affina il gruppoping ad ogni iterazione. Inizialmente, viene selezionato il numero desiderato di cluster. In questo metodo di clustering, รจ necessario raggruppare i punti dati in k gruppi. Un valore di k maggiore significa gruppi piรน piccoli con maggiore granularitร ; un valore di k minore significa gruppi piรน grandi con minore granularitร .

L'output dell'algoritmo รจ un gruppo di "etichette". Assegna ogni punto dati a uno dei k gruppi. Nel clustering k-means, ogni gruppo รจ definito creando un centroide per quel gruppo. I centroidi sono come il cuore del cluster, che cattura i punti piรน vicini a loro e li aggiunge al cluster.

K- Vicini piรน prossimi

L'algoritmo dei k-vicini piรน prossimi (K-NN) รจ il piรน semplice tra tutti i classificatori di apprendimento automatico. Si differenzia dalle altre tecniche di apprendimento automatico perchรฉ non produce un modello. Si tratta di un semplice algoritmo che memorizza tutti i casi disponibili e classifica le nuove istanze in base a una misura di similaritร . Poichรฉ necessita di casi etichettati da classificare, il K-NN รจ un metodo supervisionato; compare qui solo perchรฉ la sua logica basata sulla distanza ricorda il clustering.

Funziona molto bene quando esiste una distanza significativa tra gli esempi. La velocitร  di apprendimento รจ lenta quando il set di addestramento รจ grande e il calcolo della distanza non รจ banale.

Analisi delle componenti principali

L'analisi delle componenti principali prende uno spazio ad alta dimensionalitร  e seleziona una nuova base, mantenendoping solo i punteggi piรน importanti. Ogni direzione in questa base รจ nota come componente principale. Il sottoinsieme che si conserva costituisce un nuovo spazio di dimensioni ridotte rispetto allo spazio originale. In questo modo si mantiene quanta piรน complessitร  possibile dei dati.

Associazione

Le regole di associazione consentono di stabilire associazioni tra oggetti dati all'interno di grandi database. Questa tecnica non supervisionata riguarda la scoperta di relazioni interessanti tra variabili in grandi database ed รจ un elemento fondamentale di data miningAd esempio, chi acquista una casa nuova tende ad acquistare anche mobili nuovi.

Altri esempi:

  • Un sottogruppo di pazienti oncologici raggruppati in base alle misurazioni dell'espressione genica.
  • Gruppi di acquirenti in base alla cronologia di navigazione e di acquisto
  • Film raggruppati in base alle valutazioni assegnate dagli spettatori

Apprendimento automatico supervisionato e non supervisionato

Ecco la differenza principale tra Apprendimento supervisionato e non supervisionato:

Scheda Sintetica Tecnica di machine learning supervisionata Tecnica di machine learning non supervisionata
Dati in ingresso Algorithms vengono addestrati utilizzando dati etichettati. Algorithms vengono utilizzati rispetto a dati non etichettati
Complessitร  computazionale Lโ€™apprendimento supervisionato รจ un metodo piรน semplice. L'apprendimento non supervisionato รจ computazionalmente complesso
Precisione L'accuratezza puรฒ essere misurata direttamente confrontandola con etichette note. L'accuratezza non puรฒ essere misurata direttamente; i risultati necessitano di interpretazione.
Uscita tipica Una previsione per ogni nuovo record Gruppi, regole o funzionalitร  compresse

Applicazioni dell'apprendimento automatico non supervisionato

Alcune applicazioni delle tecniche di apprendimento non supervisionato sono:

  • Clustering suddivide automaticamente il set di dati in gruppi in base alle loro somiglianze
  • Il rilevamento delle anomalie puรฒ scoprire punti dati insoliti nel set di dati. รˆ utile per trovare transazioni fraudolente
  • L'estrazione associativa identifica insiemi di elementi che spesso si presentano insieme nel set di dati
  • I modelli a variabili latenti sono ampiamente utilizzati per la preelaborazione dei dati, ad esempio per ridurre il numero di caratteristiche in un dataset o per scomporre il dataset in piรน componenti.

Svantaggi dell'apprendimento non supervisionato

  • Non รจ possibile ottenere informazioni precise sull'ordinamento dei dati, perchรฉ i dati utilizzati nell'apprendimento non supervisionato non sono etichettati e il loro vero gruppoping non รจ conosciuto
  • Less L'accuratezza dei risultati รจ compromessa perchรฉ i dati di input non sono noti nรฉ etichettati in anticipo da persone. Ciรฒ significa che รจ la macchina a dover fare tutto questo autonomamente.
  • Le classi spettrali non sempre corrispondono alle classi informative.
  • L'utente deve dedicare del tempo all'interpretazione e all'etichettatura delle classi che derivano dalla classificazione.
  • Le proprietร  spettrali delle classi possono cambiare nel tempo, quindi non รจ possibile mantenere le stesse informazioni sulla classe passando da un'immagine all'altra.

DOMANDE FREQUENTI

Il metodo del gomito traccia l'errore all'interno del cluster in funzione di k e cerca la curva. Il punteggio silhouette, che va da -1 a 1, valuta quanto bene ogni punto si adatti al suo cluster. Leggeteli entrambi insieme.

Gli algoritmi basati sulla distanza trattano ogni unitร  allo stesso modo, quindi una colonna relativa allo stipendio in migliaia avrร  un peso maggiore rispetto a una colonna relativa all'etร  in anni. Standardizzare prima ogni caratteristica permette a ogni variabile di avere voce in capitolo nel calcolo della distanza.

Apriori รจ il classico strumento di estrazione di regole di associazione alla base dell'analisi del carrello della spesa. Individua insiemi di elementi frequenti e li trasforma in regole classificate in base a supporto, affidabilitร  e lift. FP-growth ed Eclat svolgono la stessa operazione piรน velocemente.

L'apprendimento semi-supervisionato utilizza un piccolo set di dati etichettati insieme a un ampio set di dati non etichettati. La struttura individuata nei dati non etichettati guida il modello, in modo che l'accuratezza si avvicini a quella di un risultato supervisionato, ma con un costo di etichettatura molto inferiore.

La PCA รจ una trasformazione lineare che preserva la varianza globale e si applica ai nuovi record. La t-SNE รจ non lineare ed รจ progettata per visualizzare le relazioni locali in due dimensioni; le distanze tra gruppi separati non devono essere interpretate letteralmente.

Isolation Forest, One-Class SVM, DBSCAN e l'errore di ricostruzione dell'autoencoder sono le scelte piรน comuni. Ciascuno di essi valuta quanto un record si discosti dalla maggior parte dei dati, quindi una soglia determina cosa viene considerato anomalo.

Le pipeline automatizzate analizzano algoritmi, misure di distanza e valori di k, quindi classificano le esecuzioni in base a punteggi di validitร  interna. I modelli linguistici generano sempre piรน spesso nomi in inglese semplice per i segmenti risultanti, abbreviando la fase di interpretazione.

Copilota GitHub Crea pipeline, grafici a gomito e grafici a silhouette con scikit-learn a partire da un singolo prompt. Verifica che abbia scalato le caratteristiche e impostato un seed casuale, cosa che gli snippet generati spesso omettono.

Riassumi questo post con: