Învățare automată supravegheată: Algorithms, Tipuri și exemple

⚡ Rezumat inteligent

Învățarea automată supravegheată antrenează un algoritm pe exemple etichetate, astfel încât să poată prezice rezultatele pentru date pe care nu le-a mai văzut până acum, utilizând regresia pentru ținte numerice și clasificarea pentru ținte de categorie, cum ar fi spamul sau frauda.

  • 🔘 Învață din răspunsuri: Fiecare rând de antrenament are ieșirea corectă, astfel încât modelul învață o hartă directă de la intrare la ieșireping.
  • ☑️ Două familii de sarcini: Regresia prezice un număr; clasificarea atribuie o etichetă uneia dintre două sau mai multe clase.
  • Algoritmi numiți: Regresie liniară și logistică, Naive Bayes, arbori de decizie, păduri aleatoare și mașini cu vectori de suport.
  • 🧪 Exemplu lucrat: Timpul de navetă prezis în funcție de vreme, ora zilei, sărbători și ruta aleasă.
  • 🛠️ Măsurabil prin proiectare: Deoarece există adevăr practic, acuratețea, precizia, rechemarea și RMSE clasifică modelul în mod obiectiv.
  • ⚙️ Compromisul: Etichetarea este costisitoare, iar o clasă lipsă din antrenament nu va fi niciodată prezisă corect.

Învățare automată supravegheată: algoritmi, tipuri cu exemple

Ce este învățarea automată supravegheată?

Învățarea automată supervizată este un algoritm care învață din date de antrenament etichetate pentru a vă ajuta să preziceți rezultatele unor date neprevăzute. În învățarea supervizată, antrenați mașina folosind date care sunt bine „etichetate”. Aceasta înseamnă că unele date sunt deja etichetate cu răspunsuri corecte. Poate fi comparată cu învățarea în prezența unui supervizor sau a unui profesor.

Construirea, scalarea și implementarea cu succes a unor modele precise de învățare automată supravegheată necesită timp și expertiză tehnică din partea unei echipe de oameni de știință cu înaltă calificare în domeniul datelor. De asemenea, aceștia trebuie să reconstruiască periodic modelele, astfel încât informațiile pe care le produc să rămână reale pe măsură ce datele subiacente se modifică.

Cum funcționează învățarea supravegheată

Învățarea automată supravegheată utilizează seturi de date de antrenament pentru a obține rezultatele dorite. Aceste seturi de date conțin intrări și ieșirea corectă care ajută modelul să învețe mai rapid. De exemplu, vrei să antrenezi o mașină care să te ajute să prezici cât timp îți va dura să conduci acasă de la locul de muncă.

Aici, începeți prin a crea un set de date etichetate. Aceste date includ:

  • Conditiile meteo
  • Timpul zilei
  • Concediu
  • Traseul ales

Toate aceste detalii reprezintă datele introduse în acest exemplu de învățare supravegheată. Rezultatul este timpul necesar pentru a conduce înapoi acasă în ziua respectivă, așa cum se arată în imaginea de mai jos.

Intrări pentru predicția timpului de navetă: condițiile meteorologice, ora zilei, sărbătorile și ruta aleasă

Instinctiv știi că dacă afară plouă, îți va lua mai mult timp să conduci până acasă. Dar mașina are nevoie de date și statistici.

Primul lucru pe care trebuie să-l creezi este un set de antrenament. Acesta va conține timpul total de navetă și factorii corespunzători, cum ar fi vremea, ora etc. Pe baza acestui set de antrenament, mașina ta ar putea observa că există o relație directă între cantitatea de ploaie și timpul necesar pentru a ajunge acasă.

Așadar, stabilește că, cu cât plouă mai mult, cu atât vei conduce mai mult pentru a te întoarce acasă. Ar putea observa, de asemenea, legătura dintre ora la care pleci de la serviciu și ora la care vei fi pe drum. Cu cât ești mai aproape de ora 18:00, cu atât îți ia mai mult timp să ajungi acasă.

Este posibil ca mașina dvs. să găsească unele dintre relațiile cu datele dvs. etichetate. Această fază de învățare este prezentată mai jos.

Conductă de faze de învățare: date de antrenament către vectorul caracteristicilor către algoritm și modelul antrenat
Faza de învățare: date de antrenament → vector de caracteristici → algoritm → model

Acesta este începutul modelului tău de date. Acesta începe să înregistreze modul în care ploaia influențează modul în care oamenii conduc și faptul că mai mulți oameni călătoresc la o anumită oră a zilei.

Tipuri de învățare automată supravegheată Algorithms

Următoarele sunt tipurile de algoritmi de învățare automată supravegheată:

Regres

Tehnica de regresie prezice o singură valoare continuă de ieșire folosind date de antrenament.

Exemplu: puteți folosi regresia pentru a estima prețul casei din datele de instruire. Variabilele de intrare vor fi localitatea, dimensiunea unei case etc.

Puncte tari: Rezultatele sunt ușor de interpretat, iar algoritmul poate fi regularizat pentru a evita supraadaptarea.

Puncte slabe: Un model liniar nu este flexibil, deci nu surprinde relații complexe fără caracteristici suplimentare.

Iată câteva tipuri de regresie Algorithms:

  • Regresie liniara
  • Regresia polinomială
  • Regresia Ridge și Lasso
  • Regresie logistică (pentru clasificare)
  • Arbore de decizie și regresie ale pădurii aleatorii
  • Regresia vectorului de suport

Regresie logistică:

Regresia logistică este utilizată pentru a estima valori discrete pe baza unui set dat de variabile independente. Aceasta vă ajută să preziceți probabilitatea apariției unui eveniment prin ajustarea datelor la o funcție logit. Prin urmare, este cunoscută și sub numele de regresie logit. Deoarece prezice o probabilitate, valoarea sa de ieșire se află între 0 și 1 și poate avea performanțe mai slabe atunci când există limite de decizie multiple sau neliniare.

Clasificare

Clasificarea înseamnă gruparea ieșirilor într-o clasă. Dacă algoritmul încearcă să eticheteze intrările în două clase distincte, aceasta se numește clasificare binară. Selectarea între mai mult de două clase se numește clasificare multiclasă.

Exemplu: Determinarea dacă o persoană va rămâne sau nu în incapacitate de plată a împrumutului.

Puncte tari: Arborii de clasificare funcționează foarte bine în practică.

Puncte slabe: Arborii individuali neconstrânși sunt predispuși la supraadaptare.

Iată câteva tipuri de clasificare Algorithms:

  • Clasificatori Naive Bayes
  • Copacii de decizie
  • Suport Vector Machine
  • K-Cei mai apropiati vecini
  • Pădure aleatorie și amplificare a gradientului

Clasificatori naivi Bayes

Bayes naiv Modelul este ușor de construit și foarte util pentru seturi mari de date. Această metodă este compusă din grafuri aciclice direcționate cu un părinte și mai mulți copii. Presupune independența între nodurile copil separate de părintele lor.

Arbori de decizie

Arborii de decizie clasifică o instanță prin sortarea ei în funcție de valoarea caracteristicii. În această metodă, fiecare nod reprezintă caracteristica unei instanțe care ar trebui clasificată, iar fiecare ramură reprezintă o valoare pe care nodul o poate asuma. Este o tehnică utilizată pe scară largă pentru clasificare.

Aceeași structură funcționează și pentru regresie: un arbore de regresie vă ajută să estimați valorile reale (costul de achiziționare a unei mașini, numărul de apeluri, vânzările lunare totale etc.).

Suport Vector Machine

Mașina cu vectori de suport (SVM) este un tip de algoritm de învățare introdus în anii 1990. Această metodă se bazează pe rezultatele teoriei învățării statistice dezvoltate de Vladimir Vapnik și colegii săi.

SVM-urile sunt, de asemenea, strâns legate de funcțiile kernelului, care reprezintă un concept central pentru majoritatea sarcinilor de învățare. Framework-ul kernelului și SVM-ul sunt utilizate într-o varietate de domenii. Acesta include recuperarea informațiilor multimedia, bioinformatica și recunoașterea tiparelor. Fiecare estimator de mai sus este documentat cu parametrii săi de reglare în scikit-learn referinţă.

Tehnici de învățare automată supravegheate vs. nesupravegheate

Plasarea metodei lângă învățare nesupravegheată își clarifică limitele.

Bazat pe Tehnica de învățare automată supravegheată Tehnica de învățare automată nesupravegheată
Date de intrare Algorithms sunt instruiți folosind date etichetate. Algorithms sunt utilizate împotriva datelor care nu sunt etichetate
Complexitatea computațională Învățarea supravegheată este o metodă mai simplă. Învățarea nesupravegheată este complexă din punct de vedere computațional
Acuratețe Metodă extrem de precisă și de încredere. Less metoda corecta si de incredere.
Algoritmi tipici Regresie logistică, arbori de decizie, SVM, Bayes naiv K-medii, clusterizare ierarhică, PCA
Cum sunt evaluate rezultatele Scor acordat în funcție de răspunsurile cunoscute (precizie, RMSE) Evaluat prin măsurători interne și revizuire umană

Provocări în învățarea automată supervizată

Iată provocările cu care se confruntă învățarea automată supravegheată:

  • Caracteristicile de intrare irelevante din datele de antrenament pot produce rezultate inexacte
  • Pregătirea și preprocesarea datelor reprezintă întotdeauna o provocare.
  • Precizia are de suferit atunci când valori imposibile, improbabile și incomplete au fost introduse ca date de antrenament.
  • Dacă expertul în cauză nu este disponibil, atunci cealaltă abordare este „forța brută”. Aceasta înseamnă că trebuie să ghicești pe baza căror caracteristici (variabile de intrare) să antrenezi mașina, iar această presupunere ar putea fi inexactă.

Avantajele învățării supravegheate

Având în vedere aceste provocări, iată avantajele învățării automate supravegheate:

  • Învățare supravegheată în Invatare mecanica vă permite să colectați date sau să produceți un rezultat de date din experiența anterioară
  • Vă ajută să optimizați criteriile de performanță folosind experiența
  • Învățarea automată supravegheată vă ajută să rezolvați diferite tipuri de probleme de calcul din lumea reală.

Dezavantajele învățării supravegheate

Mai jos sunt dezavantajele învățării automate supravegheate:

  • Limita de decizie ar putea fi supraantrenată dacă setul de antrenament nu conține exemple pe care doriți să le aveți într-o clasă.
  • Trebuie să selectați o mulțime de exemple bune din fiecare clasă în timp ce antrenați clasificatorul.
  • Clasificarea big data poate fi o adevărată provocare.
  • Instruirea pentru învățarea supravegheată necesită mult timp de calcul.

Cele mai bune practici pentru învățarea supravegheată

Următoarea secvență menține un proiect activ track:

  • Înainte de a face orice altceva, decideți ce fel de date vor fi utilizate ca set de antrenament
  • Decideți structura funcției învățate și algoritmul de învățare.
  • Colectați rezultatele corespunzătoare fie de la experți umani, fie din măsurători
  • Reține un set de teste pe care modelul nu îl vede niciodată și raportează scorul pentru acesta

Întrebări frecvente

Clasificatorii sunt evaluați cu acuratețe, precizie, rechemare și F1, citiți dintr-o matrice de confuzieRegresorii folosesc RMSE, MAE sau R². Scorul este întotdeauna raportat pe datele nevăzute.

Datele etichetate sunt împărțite, de obicei 70-80% pentru antrenament și restul pentru testare. Rândurile de testare rămân neatinse până la sfârșit, astfel încât scorul reflectă datele nevăzute.

Un model supraadaptat memorează zgomotul: scor la antrenament mare, scor la test slab. Un model subadaptat este prea simplu și obține scoruri slabe la ambele. Regularizarea și eliminarea erorilor restabilesc echilibrul.

Nu există un număr fix. Acesta crește odată cu numărul de caracteristici și clase. Calitatea etichetelor contează mai mult decât volumul brut — etichetele inconsistente limitează permanent precizia.

Filtrare spam, scor de credit, detectarea fraudelor, triaj medical, prognozarea cererii, estimarea prețurilor locuințelor și recunoașterea vorbirii. Fiecare asociere combină intrările istorice cu un rezultat înregistrat, formând nevoile de învățare supravegheată.

Învățarea semi-supervizată combină un set mic etichetat cu unul mare neetichetat. Structura din rândurile neetichetate ghidează modelul, astfel încât precizia se apropie de un rezultat supervizat la un cost de etichetare mai mic.

Instrumentele AutoML caută algoritmi, transformări de caracteristici și hiperparametri, apoi clasifică candidații în funcție de scorul validat încrucișat. Acest lucru elimină majoritatea încercărilor manuale și erorilor, dar o persoană alege în continuare metrica și verifică dacă există scurgeri.

Copilotul GitHub elaborează canale scikit-learn, diviziuni train-test și rapoarte de evaluare dintr-un prompt scurt. Verifică dacă a stratificat diviziunea și a fixat o valoare inițială aleatorie.

Rezumați această postare cu: