Supervised vs Unsupervised Learning: Forskellen mellem dem
Nรธgleforskel mellem overvรฅget og uovervรฅget lรฆring
- I Supervised learning trรฆner du maskinen ved hjรฆlp af data, som er godt "mรฆrket".
- Unsupervised learning er en maskinlรฆringsteknik, hvor du ikke behรธver at overvรฅge modellen.
- Overvรฅget lรฆring giver dig mulighed for at indsamle data eller producere et dataoutput fra den tidligere erfaring.
- Uovervรฅget maskinlรฆring hjรฆlper dig med at finde alle slags ukendte mรธnstre i data.
- Regression og klassificering er to typer overvรฅgede maskinlรฆringsteknikker.
- Clustering og association er to typer uovervรฅget lรฆring.
- I en overvรฅget lรฆringsmodel vil input- og outputvariabler blive givet, mens der med en ikke-overvรฅget lรฆringsmodel kun gives inputdata
Hvad er Supervised Machine Learning?
I Supervised learning trรฆner du maskinen ved hjรฆlp af data, hvilket er godt "mรฆrket." Det betyder, at nogle data allerede er mรฆrket med det rigtige svar. Det kan sammenlignes med lรฆring, der foregรฅr i nรฆrvรฆrelse af en vejleder eller en lรฆrer.
En overvรฅget lรฆringsalgoritme lรฆrer af mรฆrkede trรฆningsdata, hjรฆlper dig med at forudsige resultater for uforudsete data. Succesfuld opbygning, skalering og implementering af nรธjagtig overvรฅget maskinlรฆring Datavidenskabsmodel tager tid og teknisk ekspertise fra et team af hรธjtuddannede dataforskere. Desuden skal dataforskere genopbygge modeller for at sikre, at den indsigt, der gives, forbliver sand, indtil dens data รฆndres.
Hvad er uovervรฅget lรฆring?
Unsupervised learning er en maskinlรฆringsteknik, hvor du ikke behรธver at overvรฅge modellen. I stedet skal du give modellen lov til at arbejde pรฅ egen hรฅnd for at opdage information. Det omhandler hovedsageligt de umรฆrkede data.
Uovervรฅgede lรฆringsalgoritmer giver dig mulighed for at udfรธre mere komplekse behandlingsopgaver sammenlignet med overvรฅget lรฆring. Selvom uovervรฅget lรฆring kan vรฆre mere uforudsigelig sammenlignet med andre naturlige dyb lรฆrings- og forstรฆrkende lรฆringsmetoder.
Hvorfor Supervised Learning?
- Overvรฅget lรฆring giver dig mulighed for at indsamle data eller producere et dataoutput fra den tidligere erfaring.
- Hjรฆlper dig med at optimere prรฆstationskriterier ved hjรฆlp af erfaring
- Overvรฅget maskinlรฆring hjรฆlper dig med at lรธse forskellige typer af regneproblemer i den virkelige verden.
Hvorfor uovervรฅget lรฆring?
Her er de vigtigste grunde til at bruge uovervรฅget lรฆring:
- Uovervรฅget maskinlรฆring finder alle slags ukendte mรธnstre i data.
- Uovervรฅgede metoder hjรฆlper dig med at finde funktioner, der kan vรฆre nyttige til kategorisering.
- Det foregรฅr i realtid, sรฅ alle inputdata skal analyseres og mรฆrkes i nรฆrvรฆrelse af elever.
- Det er lettere at fรฅ umรฆrkede data fra en computer end mรฆrkede data, som krรฆver manuel indgriben.
Hvordan fungerer Supervised Learning?
For eksempel vil du trรฆne en maskine til at hjรฆlpe dig med at forudsige, hvor lang tid det vil tage dig at kรธre hjem fra din arbejdsplads. Her starter du med at oprette et sรฆt mรฆrkede data. Disse data omfatter
- Vejrforhold
- Tid pรฅ dagen
- Holidays
Alle disse detaljer er dine input. Outputtet er den tid, det tog at kรธre hjem pรฅ den specifikke dag.

Du ved instinktivt, at hvis det regner udenfor, sรฅ vil det tage dig lรฆngere tid at kรธre hjem. Men maskinen har brug for data og statistik.
Lad os nu se, hvordan du kan udvikle en overvรฅget lรฆringsmodel af dette eksempel, som hjรฆlper brugeren med at bestemme pendlingstiden. Den fรธrste ting, du skal lave, er et trรฆningsdatasรฆt. Dette trรฆningssรฆt vil indeholde den samlede pendlingstid og tilsvarende faktorer som vejr, tid osv. Baseret pรฅ dette trรฆningssรฆt kan din maskine se, at der er en direkte sammenhรฆng mellem mรฆngden af โโregn og den tid, det tager at komme hjem.
Sรฅ den konstaterer, at jo mere det regner, jo lรฆngere vil du kรธre for at komme tilbage til dit hjem. Det kan ogsรฅ se sammenhรฆngen mellem den tid, du forlader arbejdet, og den tid, du er pรฅ farten.
Jo tรฆttere du er pรฅ klokken 6, jo lรฆngere tid tager det for dig at komme hjem. Din maskine kan muligvis finde nogle af relationerne til dine mรฆrkede data.

Dette er starten pรฅ din datamodel. Det begynder at pรฅvirke, hvordan regn pรฅvirker den mรฅde, folk kรธrer pรฅ. Det begynder ogsรฅ at se, at flere mennesker rejser pรฅ et bestemt tidspunkt pรฅ dagen.
Hvordan fungerer uovervรฅget lรฆring?
Lad os tage sagen om en baby og hendes familiehund.

Hun kender og identificerer denne hund. Et par uger senere tager en ven af โโfamilien en hund med og prรธver at lege med babyen.
Baby har ikke set denne hund tidligere. Men den genkender mange trรฆk (2 รธrer, รธjne, at gรฅ pรฅ 4 ben) er som hendes hund. Hun identificerer et nyt dyr som en hund. Dette er uovervรฅget lรฆring, hvor du ikke bliver undervist, men du lรฆrer af dataene (i dette tilfรฆlde data om en hund). Havde dette vรฆret overvรฅget lรฆring, ville familievennen have fortalt barnet, at det er en hund.
Typer af overvรฅgede maskinlรฆringsteknikker

Regression
Regressionsteknik forudsiger en enkelt outputvรฆrdi ved hjรฆlp af trรฆningsdata.
Eksempel: Du kan bruge regression til at forudsige boligprisen ud fra trรฆningsdata. Inputvariablerne vil vรฆre lokalitet, stรธrrelse pรฅ et hus osv.
Klassifikation
Klassificering betyder at gruppere outputtet i en klasse. Hvis algoritmen forsรธger at mรฆrke input i to adskilte klasser, kaldes det binรฆr klassifikation. At vรฆlge mellem mere end to klasser kaldes multiklasseklassifikation.
Eksempel: Bestemmelse af, om nogen vil vรฆre en misligholder af lรฅnet.
Styrker: Outputs har altid en probabilistisk fortolkning, og algoritmen kan reguleres for at undgรฅ overfitting.
Svagheder: Logistisk regression kan underperforme, nรฅr der er flere eller ikke-lineรฆre beslutningsgrรฆnser. Denne metode er ikke fleksibel, sรฅ den fanger ikke mere komplekse relationer.
Typer af uovervรฅgede maskinlรฆringsteknikker
Uovervรฅgede lรฆringsproblemer blev yderligere grupperet i klynge- og associationsproblemer.
ClusterING
Clustering er et vigtigt begreb, nรฅr det kommer til uovervรฅget lรฆring. Det handler hovedsageligt om at finde en struktur eller et mรธnster i en samling af ukategoriserede data. Clustering-algoritmer vil behandle dine data og finde naturlige klynger(grupper), hvis de findes i dataene. Du kan ogsรฅ รฆndre, hvor mange klynger dine algoritmer skal identificere. Det giver dig mulighed for at justere granulariteten af โโdisse grupper.
Association
Tilknytningsregler giver dig mulighed for at etablere associationer mellem dataobjekter i store databaser. Denne uovervรฅgede teknik handler om at opdage spรฆndende relationer mellem variabler i store databaser. For eksempel vil folk, der kรธber et nyt hjem, hรธjst sandsynligt kรธbe nye mรธbler.
Andre eksempler:
- En undergruppe af cancerpatienter grupperet efter deres genekspressionsmรฅlinger
- Grupper af shoppere baseret pรฅ deres browser- og kรธbshistorik
- Filmgruppe efter bedรธmmelsen givet af filmseere
Forskellen mellem overvรฅget og uovervรฅget lรฆring

| Driftsparametre | Overvรฅget maskinlรฆringsteknik | Uovervรฅget maskinlรฆringsteknik |
|---|---|---|
| Proces | I en superviseret lรฆringsmodel vil input- og outputvariabler blive givet. | I uovervรฅget lรฆringsmodel vil kun inputdata blive givet |
| Inputdata | Algorithms trรฆnes ved hjรฆlp af mรฆrkede data. | Algorithms bruges mod data, der ikke er mรฆrket |
| Algorithms KรB Brugte | Support vektormaskine, neuralt netvรฆrk, lineรฆr og logistisk regression, tilfรฆldig skov og klassifikationstrรฆer. | Uovervรฅgede algoritmer kan opdeles i forskellige kategorier: f.eks Cluster algoritmer, K-midler, Hierarkisk clustering mv. |
| Beregningsmรฆssig kompleksitet | Superviseret lรฆring er en enklere metode. | Uovervรฅget lรฆring er beregningsmรฆssigt komplekst |
| Brug af data | Superviseret lรฆringsmodel bruger trรฆningsdata til at lรฆre en sammenhรฆng mellem input og output. | Uovervรฅget lรฆring bruger ikke outputdata. |
| Nรธjagtighed af resultater | Meget nรธjagtig og pรฅlidelig metode. | Less prรฆcis og trovรฆrdig metode. |
| Realtidslรฆring | Lรฆringsmetoden foregรฅr offline. | Lรฆringsmetoden foregรฅr i realtid. |
| Antal klasser | Antallet af klasser er kendt. | Antallet af klasser kendes ikke. |
| Vigtigste ulempe | Klassificering af big data kan vรฆre en reel udfordring i Supervised Learning. | Du kan ikke fรฅ prรฆcis information om datasortering, og output som data brugt i uovervรฅget lรฆring er mรฆrket og ikke kendt. |


