Învățare automată supravegheată: Algorithms, Tipuri și exemple
⚡ Rezumat inteligent
Învățarea automată supravegheată antrenează un algoritm pe exemple etichetate, astfel încât să poată prezice rezultatele pentru date pe care nu le-a mai văzut până acum, utilizând regresia pentru ținte numerice și clasificarea pentru ținte de categorie, cum ar fi spamul sau frauda.
Ce este învățarea automată supravegheată?
Învățarea automată supervizată este un algoritm care învață din date de antrenament etichetate pentru a vă ajuta să preziceți rezultatele unor date neprevăzute. În învățarea supervizată, antrenați mașina folosind date care sunt bine „etichetate”. Aceasta înseamnă că unele date sunt deja etichetate cu răspunsuri corecte. Poate fi comparată cu învățarea în prezența unui supervizor sau a unui profesor.
Construirea, scalarea și implementarea cu succes a unor modele precise de învățare automată supravegheată necesită timp și expertiză tehnică din partea unei echipe de oameni de știință cu înaltă calificare în domeniul datelor. De asemenea, aceștia trebuie să reconstruiască periodic modelele, astfel încât informațiile pe care le produc să rămână reale pe măsură ce datele subiacente se modifică.
Cum funcționează învățarea supravegheată
Învățarea automată supravegheată utilizează seturi de date de antrenament pentru a obține rezultatele dorite. Aceste seturi de date conțin intrări și ieșirea corectă care ajută modelul să învețe mai rapid. De exemplu, vrei să antrenezi o mașină care să te ajute să prezici cât timp îți va dura să conduci acasă de la locul de muncă.
Aici, începeți prin a crea un set de date etichetate. Aceste date includ:
- Conditiile meteo
- Timpul zilei
- Concediu
- Traseul ales
Toate aceste detalii reprezintă datele introduse în acest exemplu de învățare supravegheată. Rezultatul este timpul necesar pentru a conduce înapoi acasă în ziua respectivă, așa cum se arată în imaginea de mai jos.
Instinctiv știi că dacă afară plouă, îți va lua mai mult timp să conduci până acasă. Dar mașina are nevoie de date și statistici.
Primul lucru pe care trebuie să-l creezi este un set de antrenament. Acesta va conține timpul total de navetă și factorii corespunzători, cum ar fi vremea, ora etc. Pe baza acestui set de antrenament, mașina ta ar putea observa că există o relație directă între cantitatea de ploaie și timpul necesar pentru a ajunge acasă.
Așadar, stabilește că, cu cât plouă mai mult, cu atât vei conduce mai mult pentru a te întoarce acasă. Ar putea observa, de asemenea, legătura dintre ora la care pleci de la serviciu și ora la care vei fi pe drum. Cu cât ești mai aproape de ora 18:00, cu atât îți ia mai mult timp să ajungi acasă.
Este posibil ca mașina dvs. să găsească unele dintre relațiile cu datele dvs. etichetate. Această fază de învățare este prezentată mai jos.

Acesta este începutul modelului tău de date. Acesta începe să înregistreze modul în care ploaia influențează modul în care oamenii conduc și faptul că mai mulți oameni călătoresc la o anumită oră a zilei.
Tipuri de învățare automată supravegheată Algorithms
Următoarele sunt tipurile de algoritmi de învățare automată supravegheată:
Regres
Tehnica de regresie prezice o singură valoare continuă de ieșire folosind date de antrenament.
Exemplu: puteți folosi regresia pentru a estima prețul casei din datele de instruire. Variabilele de intrare vor fi localitatea, dimensiunea unei case etc.
Puncte tari: Rezultatele sunt ușor de interpretat, iar algoritmul poate fi regularizat pentru a evita supraadaptarea.
Puncte slabe: Un model liniar nu este flexibil, deci nu surprinde relații complexe fără caracteristici suplimentare.
Iată câteva tipuri de regresie Algorithms:
- Regresie liniara
- Regresia polinomială
- Regresia Ridge și Lasso
- Regresie logistică (pentru clasificare)
- Arbore de decizie și regresie ale pădurii aleatorii
- Regresia vectorului de suport
Regresie logistică:
Regresia logistică este utilizată pentru a estima valori discrete pe baza unui set dat de variabile independente. Aceasta vă ajută să preziceți probabilitatea apariției unui eveniment prin ajustarea datelor la o funcție logit. Prin urmare, este cunoscută și sub numele de regresie logit. Deoarece prezice o probabilitate, valoarea sa de ieșire se află între 0 și 1 și poate avea performanțe mai slabe atunci când există limite de decizie multiple sau neliniare.
Clasificare
Clasificarea înseamnă gruparea ieșirilor într-o clasă. Dacă algoritmul încearcă să eticheteze intrările în două clase distincte, aceasta se numește clasificare binară. Selectarea între mai mult de două clase se numește clasificare multiclasă.
Exemplu: Determinarea dacă o persoană va rămâne sau nu în incapacitate de plată a împrumutului.
Puncte tari: Arborii de clasificare funcționează foarte bine în practică.
Puncte slabe: Arborii individuali neconstrânși sunt predispuși la supraadaptare.
Iată câteva tipuri de clasificare Algorithms:
- Clasificatori Naive Bayes
- Copacii de decizie
- Suport Vector Machine
- K-Cei mai apropiati vecini
- Pădure aleatorie și amplificare a gradientului
Clasificatori naivi Bayes
Bayes naiv Modelul este ușor de construit și foarte util pentru seturi mari de date. Această metodă este compusă din grafuri aciclice direcționate cu un părinte și mai mulți copii. Presupune independența între nodurile copil separate de părintele lor.
Arbori de decizie
Arborii de decizie clasifică o instanță prin sortarea ei în funcție de valoarea caracteristicii. În această metodă, fiecare nod reprezintă caracteristica unei instanțe care ar trebui clasificată, iar fiecare ramură reprezintă o valoare pe care nodul o poate asuma. Este o tehnică utilizată pe scară largă pentru clasificare.
Aceeași structură funcționează și pentru regresie: un arbore de regresie vă ajută să estimați valorile reale (costul de achiziționare a unei mașini, numărul de apeluri, vânzările lunare totale etc.).
Suport Vector Machine
Mașina cu vectori de suport (SVM) este un tip de algoritm de învățare introdus în anii 1990. Această metodă se bazează pe rezultatele teoriei învățării statistice dezvoltate de Vladimir Vapnik și colegii săi.
SVM-urile sunt, de asemenea, strâns legate de funcțiile kernelului, care reprezintă un concept central pentru majoritatea sarcinilor de învățare. Framework-ul kernelului și SVM-ul sunt utilizate într-o varietate de domenii. Acesta include recuperarea informațiilor multimedia, bioinformatica și recunoașterea tiparelor. Fiecare estimator de mai sus este documentat cu parametrii săi de reglare în scikit-learn referinţă.
Tehnici de învățare automată supravegheate vs. nesupravegheate
Plasarea metodei lângă învățare nesupravegheată își clarifică limitele.
| Bazat pe | Tehnica de învățare automată supravegheată | Tehnica de învățare automată nesupravegheată |
|---|---|---|
| Date de intrare | Algorithms sunt instruiți folosind date etichetate. | Algorithms sunt utilizate împotriva datelor care nu sunt etichetate |
| Complexitatea computațională | Învățarea supravegheată este o metodă mai simplă. | Învățarea nesupravegheată este complexă din punct de vedere computațional |
| Acuratețe | Metodă extrem de precisă și de încredere. | Less metoda corecta si de incredere. |
| Algoritmi tipici | Regresie logistică, arbori de decizie, SVM, Bayes naiv | K-medii, clusterizare ierarhică, PCA |
| Cum sunt evaluate rezultatele | Scor acordat în funcție de răspunsurile cunoscute (precizie, RMSE) | Evaluat prin măsurători interne și revizuire umană |
Provocări în învățarea automată supervizată
Iată provocările cu care se confruntă învățarea automată supravegheată:
- Caracteristicile de intrare irelevante din datele de antrenament pot produce rezultate inexacte
- Pregătirea și preprocesarea datelor reprezintă întotdeauna o provocare.
- Precizia are de suferit atunci când valori imposibile, improbabile și incomplete au fost introduse ca date de antrenament.
- Dacă expertul în cauză nu este disponibil, atunci cealaltă abordare este „forța brută”. Aceasta înseamnă că trebuie să ghicești pe baza căror caracteristici (variabile de intrare) să antrenezi mașina, iar această presupunere ar putea fi inexactă.
Avantajele învățării supravegheate
Având în vedere aceste provocări, iată avantajele învățării automate supravegheate:
- Învățare supravegheată în Invatare mecanica vă permite să colectați date sau să produceți un rezultat de date din experiența anterioară
- Vă ajută să optimizați criteriile de performanță folosind experiența
- Învățarea automată supravegheată vă ajută să rezolvați diferite tipuri de probleme de calcul din lumea reală.
Dezavantajele învățării supravegheate
Mai jos sunt dezavantajele învățării automate supravegheate:
- Limita de decizie ar putea fi supraantrenată dacă setul de antrenament nu conține exemple pe care doriți să le aveți într-o clasă.
- Trebuie să selectați o mulțime de exemple bune din fiecare clasă în timp ce antrenați clasificatorul.
- Clasificarea big data poate fi o adevărată provocare.
- Instruirea pentru învățarea supravegheată necesită mult timp de calcul.
Cele mai bune practici pentru învățarea supravegheată
Următoarea secvență menține un proiect activ track:
- Înainte de a face orice altceva, decideți ce fel de date vor fi utilizate ca set de antrenament
- Decideți structura funcției învățate și algoritmul de învățare.
- Colectați rezultatele corespunzătoare fie de la experți umani, fie din măsurători
- Reține un set de teste pe care modelul nu îl vede niciodată și raportează scorul pentru acesta

