Overvåket maskinlæring: Algorithms, Typer og eksempler

⚡ Smart oppsummering

Overvåket maskinlæring trener en algoritme på merkede eksempler, slik at den kan forutsi utfall for data den aldri har sett før, ved å bruke regresjon for numeriske mål og klassifisering for kategorimål som spam eller svindel.

  • 🔘 Lærer av svarene: Hver treningsrad har riktig utdata, slik at modellen lærer en direkte input-til-output-map.ping.
  • ☑️ To oppgavefamilier: Regresjon forutsier et tall; klassifisering tildeler en etikett til én av to eller flere klasser.
  • Navngitte algoritmer: Lineær og logistisk regresjon, Naive Bayes, beslutningstrær, tilfeldige skoger og støttevektormaskiner.
  • 🧪 Utarbeidet eksempel: Pendlertid forventet ut fra vær, tidspunkt på dagen, helligdager og valgt rute.
  • 🛠️ Målbar etter design: Fordi grunnsannhet eksisterer, graderer nøyaktighet, presisjon, gjenkallelse og RMSE modellen objektivt.
  • ⚙️ Avveiningen: Merking er dyrt, og en klasse som mangler i opplæringen vil aldri bli forutsagt riktig.

Veiledet maskinlæring: algoritmer, typer med eksempler

Hva er overvåket maskinlæring?

Veiledet maskinlæring er en algoritme som lærer fra merkede treningsdata for å hjelpe deg med å forutsi utfall for uforutsette data. I veiledet læring trener du maskinen ved hjelp av data som er godt «merket». Det betyr at noen data allerede er merket med riktige svar. Det kan sammenlignes med læring i nærvær av en veileder eller en lærer.

Det krever tid og teknisk ekspertise fra et team av dyktige dataforskere å bygge, skalere og distribuere nøyaktige maskinlæringsmodeller med suksess. Dataforskere må også gjenoppbygge modeller med jevne mellomrom, slik at innsikten de produserer forblir sann etter hvert som de underliggende dataene endres.

Hvordan veiledet læring fungerer

Overvåket maskinlæring bruker treningsdatasett for å oppnå ønskede resultater. Disse datasettene inneholder innganger og riktig utgang som hjelper modellen til å lære raskere. Du vil for eksempel trene en maskin for å hjelpe deg med å forutsi hvor lang tid det vil ta deg å kjøre hjem fra arbeidsplassen din.

Her starter du med å lage et sett med merkede data. Disse dataene inkluderer:

  • Værforhold
  • Tid på dagen
  • Reise
  • Rute valgt

Alle disse detaljene er dine inndata i dette eksemplet på veiledet læring. Utdataene er hvor lang tid det tok å kjøre hjem den spesifikke dagen, som bildet nedenfor viser.

Inndata for pendlertidsforutsigelser: værforhold, tidspunkt på dagen, helligdager og valgt rute

Du vet instinktivt at hvis det regner ute, vil det ta deg lengre tid å kjøre hjem. Men maskinen trenger data og statistikk.

Det første du må opprette er et treningssett. Det vil inneholde den totale reisetiden og tilhørende faktorer som vær, tid osv. Basert på dette treningssettet kan maskinen din se at det er en direkte sammenheng mellom mengden regn og tiden det tar å komme hjem.

Så den fastslår at jo mer det regner, desto lenger tid må du kjøre for å komme hjem. Den kan også se en sammenheng mellom tidspunktet du drar fra jobb og tiden du vil være på veien. Jo nærmere klokken 6 du er, desto lengre tid tar det for deg å komme hjem.

Maskinen din kan finne noen av sammenhengene med de merkede dataene dine. Denne læringsfasen vises nedenfor.

Læringsfasepipeline: treningsdata til funksjoner, vektor til algoritme til trent modell
Læringsfase: treningsdata → funksjonsvektor → algoritme → modell

Dette er starten på datamodellen din. Den begynner å registrere hvordan regn påvirker måten folk kjører på, og at flere reiser på et bestemt tidspunkt på døgnet.

Typer overvåket maskinlæring Algorithms

Følgende er typene overvåket maskinlæringsalgoritmer:

Regresjon

Regresjonsteknikken forutsier en enkelt kontinuerlig utgangsverdi ved hjelp av treningsdata.

Eksempel: Du kan bruke regresjon til å forutsi boligprisen fra treningsdata. Inndatavariablene vil være lokalitet, størrelse på et hus osv.

Styrker: Utdataene er enkle å tolke, og algoritmen kan regulariseres for å unngå overtilpasning.

Svakheter: En lineær modell er ikke fleksibel, så den fanger ikke opp komplekse sammenhenger uten tilleggsfunksjoner.

Her er noen få typer regresjon Algorithms:

  • Lineær regresjon
  • Polynom regresjon
  • Ridge- og Lasso-regresjon
  • Logistisk regresjon (for klassifisering)
  • Beslutningstre og tilfeldig skogregresjon
  • Støtt vektorregresjon

Logistisk regresjon:

Logistisk regresjon brukes til å estimere diskrete verdier basert på et gitt sett med uavhengige variabler. Den hjelper deg med å forutsi sannsynligheten for at en hendelse inntreffer ved å tilpasse data til en logit-funksjon. Derfor er den også kjent som logit-regresjon. Siden den forutsier en sannsynlighet, ligger utgangsverdien mellom 0 og 1, og den kan underprestere når det er flere eller ikke-lineære beslutningsgrenser.

Klassifisering

Klassifisering betyr å gruppere utdataene i en klasse. Hvis algoritmen prøver å merke inndataene i to distinkte klasser, kalles det binær klassifisering. Å velge mellom mer enn to klasser kalles flerklasseklassifisering.

Eksempel: Å avgjøre om noen vil misligholde lånet eller ikke.

Styrker: Klassifiseringstrær fungerer veldig bra i praksis.

Svakheter: Ubegrensede, individuelle trær er utsatt for overtilpasning.

Her er noen typer klassifisering Algorithms:

  • Naive Bayes-klassifikatorer
  • Beslutningstrær
  • Støtt vektormaskin
  • K-Nærmeste Naboer
  • Tilfeldig skog og gradientforsterkning

Naive Bayes-klassifiseringer

Ocuco Naiv Bayes Modellen er enkel å bygge og svært nyttig for store datasett. Denne metoden består av rettede asykliske grafer med én forelder og flere barn. Den forutsetter uavhengighet mellom barnnoder atskilt fra foreldrenodene.

Beslutningstrær

Beslutningstrær klassifiserer en instans ved å sortere den basert på funksjonsverdien. I denne metoden er hver node funksjonen til en instans som skal klassifiseres, og hver gren representerer en verdi som noden kan anta. Det er en mye brukt teknikk for klassifisering.

Den samme strukturen fungerer for regresjon: et regresjonstre hjelper deg med å estimere reelle verdier (kostnad for å kjøpe en bil, antall samtaler, totalt månedlig salg osv.).

Støtt vektormaskin

Support Vector Machine (SVM) er en type læringsalgoritme som ble introdusert på 1990-tallet. Denne metoden er basert på resultater fra statistisk læringsteori utviklet av Vladimir Vapnik og kollegene hans.

SVM-er er også nært knyttet til kjernefunksjoner, som er et sentralt konsept for de fleste læringsoppgavene. Kjernerammeverket og SVM brukes innen en rekke felt. Det inkluderer multimedieinformasjonsinnhenting, bioinformatikk og mønstergjenkjenning. Hver estimator ovenfor er dokumentert med sine innstillingsparametere i scikit lære henvisning.

Veiledede vs. uveiledede maskinlæringsteknikker

Plasser metoden ved siden av uovervåket læring gjør sine grenser tydelige.

Basert på Veiledet maskinlæringsteknikk Uovervåket maskinlæringsteknikk
Inngangsdata Algorithms er opplært ved hjelp av merkede data. Algorithms brukes mot data som ikke er merket
Beregningsmessig kompleksitet Veiledet læring er en enklere metode. Uovervåket læring er beregningsmessig kompleks
Nøyaktighet Svært nøyaktig og pålitelig metode. Less nøyaktig og pålitelig metode.
Typiske algoritmer Logistisk regresjon, beslutningstrær, SVM, Naive Bayes K-gjennomsnitt, hierarkisk klynging, PCA
Hvordan resultatene bedømmes Poengbestemt mot kjente svar (nøyaktighet, RMSE) Bedømt etter interne målinger og menneskelig vurdering

Utfordringer i veiledet maskinlæring

Her er utfordringene i veiledet maskinlæring:

  • Irrelevante inndatafunksjoner i treningsdataene kan gi unøyaktige resultater
  • Dataforberedelse og forhåndsbehandling er alltid en utfordring.
  • Nøyaktigheten blir dårligere når umulige, usannsynlige og ufullstendige verdier er lagt inn som treningsdata.
  • Hvis den aktuelle eksperten ikke er tilgjengelig, er den andre tilnærmingen «brute-force». Det betyr at du må gjette hvilke funksjoner (inndatavariabler) du skal trene maskinen på, og den gjetningen kan være unøyaktig.

Fordeler med veiledet læring

Sett i lys av disse utfordringene er her fordelene med veiledet maskinlæring:

  • Veiledet læring i Maskinlæring lar deg samle inn data eller produsere data fra tidligere erfaring
  • Hjelper deg med å optimalisere ytelseskriteriene ved å bruke erfaring
  • Overvåket maskinlæring hjelper deg med å løse ulike typer regneproblemer i den virkelige verden.

Ulemper ved veiledet læring

Nedenfor er ulempene med veiledet maskinlæring:

  • Beslutningsgrensen kan være overtrent hvis treningssettet ditt ikke har eksempler du ønsker å ha i en klasse.
  • Du må velge ut mange gode eksempler fra hver klasse mens du trener klassifisereren.
  • Klassifisering av stordata kan være en skikkelig utfordring.
  • Opplæring for veiledet læring krever mye regnetid.

Beste praksis for veiledet læring

Følgende sekvens holder et prosjekt på track:

  • Før du gjør noe annet, bestem deg for hva slags data som skal brukes som et treningssett.
  • Bestem strukturen til den lærte funksjonen og læringsalgoritmen.
  • Samle inn tilsvarende resultater enten fra menneskelige eksperter eller fra målinger
  • Hold tilbake et testsett som modellen aldri ser, og rapporter poengsummen på det

Spørsmål og svar

Klassifikatorer scores med nøyaktighet, presisjon, gjenkjenning og F1, lest fra en forvirringsmatriseRegresjonsanalyser bruker RMSE, MAE eller R². Rapporter alltid poengsummen på usynlige data.

De merkede dataene er delt, vanligvis 70–80 prosent for trening og resten for testing. Testrader forblir urørte til slutten, slik at poengsummen gjenspeiler usete data.

En overtilpasset modell husker støy: høy treningsscore, dårlig testscore. En undertilpasset modell er for enkel og scorer dårlig på begge. Regularisering og beskjæring gjenoppretter balansen.

Det finnes ikke noe fast tall. Det øker med antall funksjoner og klasser. Etikettkvalitet er viktigere enn råvolum – inkonsekvente etiketter begrenser nøyaktigheten permanent.

Spamfiltrering, kredittvurdering, svindeldeteksjon, medisinsk triage, etterspørselsprognoser, boligprisestimering og talegjenkjenning. Hver av dem kobler historiske inndata med et registrert resultat, og former dermed veiledede læringsbehov.

Semi-veiledet læring kombinerer et lite merket sett med et stort umerket sett. Struktur i de umerkede radene styrer modellen, slik at nøyaktigheten nærmer seg et veiledet resultat til lavere merkekostnad.

AutoML-verktøy søker etter algoritmer, funksjonstransformasjoner og hyperparametere, og rangerer deretter kandidater etter kryssvalidert poengsum. Det fjerner mesteparten av manuell prøving og feiling, men et menneske velger fortsatt metrikken og sjekker for lekkasjer.

GitHub Copilot utkaster scikit-learn-pipelines, train-test-splitter og evalueringsrapporter fra en kort prompt. Bekreft at den stratifiserte splitten og fikset et tilfeldig frø.

Oppsummer dette innlegget med: