Data Mining Tutorial: Hvad er Data Mining? Teknikker, proces
Hvad er Data Mining?
Data Mining er en proces med at finde potentielt nyttige mรธnstre fra enorme datasรฆt. Det er en tvรฆrfaglig fรฆrdighed, der bruger machine learning, statistik og AI til f.eks.tracInformation til at evaluere sandsynligheden for fremtidige begivenheder. Indsigten fra data mining bruges til markedsfรธring, afslรธring af svindel, videnskabelig opdagelse osv.
Data mining handler om at opdage skjulte, uanede og tidligere ukendte, men gyldige relationer mellem data. Data mining kaldes ogsรฅ Knowledge Discovery in Data (KDD), Knowledge extraction, data-/mรธnsteranalyse, informationshรธstning osv.
Typer af data
Data mining kan udfรธres pรฅ fรธlgende typer data
- Relationsdatabaser
- Datavarehuse
- Avanceret DB og informationslagre
- Objektorienterede og objektrelationelle databaser
- Transaktionelle og rumlige databaser
- Heterogene og รฆldre databaser
- Multimedie- og streamingdatabase
- Tekstdatabaser
- Tekstmining og webmining
Implementeringsproces for Data Mining

Lad os studere Data Mining implementeringsprocessen i detaljer
Forretningsforstรฅelse
I denne fase etableres forretnings- og data-mining-mรฅl.
- Fรธrst skal du forstรฅ forretnings- og klientmรฅl. Du skal definere, hvad din klient รธnsker (som mange gange selv de ikke ved selv)
- Gรธr status over det aktuelle data mining-scenarie. Inddrag ressourcer, antagelser, begrรฆnsninger og andre vรฆsentlige faktorer i din vurdering.
- Brug forretningsmรฅl og nuvรฆrende scenarie til at definere dine data mining-mรฅl.
- En god dataminingplan er meget detaljeret og bรธr udvikles til at nรฅ bรฅde forretnings- og dataminingmรฅl.
Dataforstรฅelse
I denne fase udfรธres fornuftstjek pรฅ data for at kontrollere, om det er passende for datamining-mรฅlene.
- For det fรธrste indsamles data fra flere tilgรฆngelige datakilder i organisationen.
- Disse datakilder kan omfatte flere databaser, flade filer eller datakuber. Der er problemer som objektmatching og skemaintegration, som kan opstรฅ under dataintegrationsprocessen. Det er en ret kompleks og vanskelig proces, da data fra forskellige kilder nรฆppe vil matche let. For eksempel indeholder tabel A en enhed med navnet kunde_nr, mens en anden tabel B indeholder en enhed med navnet kunde-id.
- Derfor er det ret svรฆrt at sikre, at begge disse givne objekter refererer til den samme vรฆrdi eller ej. Her bรธr Metadata bruges til at reducere fejl i dataintegrationsprocessen.
- Dernรฆst er trinnet at sรธge efter egenskaber for erhvervede data. En god mรฅde at udforske dataene pรฅ er at besvare data mining-spรธrgsmรฅlene (afgjort i forretningsfasen) ved hjรฆlp af forespรธrgsels-, rapporterings- og visualiseringsvรฆrktรธjerne.
- Baseret pรฅ resultaterne af forespรธrgslen bรธr datakvaliteten fastslรฅs. Manglende data, hvis nogen skulle indhentes.
Forberedelse af data
I denne fase gรธres data produktionsklar.
Dataforberedelsesprocessen bruger omkring 90 % af projektets tid.
Dataene fra forskellige kilder bรธr udvรฆlges, renses, transformeres, formateres, anonymiseres og konstrueres (hvis pรฅkrรฆvet).
Datarensning er en proces til at "rense" dataene ved at udjรฆvne stรธjende data og udfylde manglende vรฆrdier.
For en kundedemografisk profil mangler der f.eks. aldersdata. Dataene er ufuldstรฆndige og skal udfyldes. I nogle tilfรฆlde kan der vรฆre dataudlignere. For eksempel har alder en vรฆrdi pรฅ 300. Data kan vรฆre inkonsistente. For eksempel er navnet pรฅ kunden forskelligt i forskellige tabeller.
Datatransformationsoperationer รฆndrer dataene for at gรธre dem nyttige i datamining. Fรธlgende transformation kan anvendes
Datatransformation
Datatransformationsoperationer vil bidrage til minedriftsprocessens succes.
Udjรฆvning: Det hjรฆlper med at fjerne stรธj fra dataene.
Aggregation: Opsummerings- eller aggregeringsoperationer anvendes pรฅ dataene. Dvs. de ugentlige salgsdata aggregeres for at beregne den mรฅnedlige og รฅrlige total.
Generalisering: I dette trin erstattes data pรฅ lavt niveau af begreber pรฅ hรธjere niveau ved hjรฆlp af begrebshierarkier. Eksempelvis erstattes byen af โโamtet.
Normalisering: Normalisering udfรธres, nรฅr attributdata er skaleret op eller nedskaleret. Eksempel: Data skal ligge i omrรฅdet -2.0 til 2.0 efter normalisering.
Attributkonstruktion: disse attributter er konstrueret og inkluderet det givne sรฆt attributter, der er nyttige til data mining.
Resultatet af denne proces er et endeligt datasรฆt, der kan bruges i modellering.
Stรธbning
I denne fase bruges matematiske modeller til at bestemme datamรธnstre.
- Baseret pรฅ forretningsmรฅlene bรธr egnede modelleringsteknikker vรฆlges til det forberedte datasรฆt.
- Opret et scenarie for at teste kvaliteten og validiteten af โโmodellen.
- Kรธr modellen pรฅ det forberedte datasรฆt.
- Resultaterne bรธr vurderes af alle interessenter for at sikre, at modellen kan opfylde data mining-mรฅlene.
Evaluering
I denne fase evalueres identificerede mรธnstre i forhold til forretningsmรฅlene.
- Resultater genereret af datamining-modellen bรธr evalueres i forhold til forretningsmรฅlene.
- At opnรฅ forretningsforstรฅelse er en iterativ proces. Faktisk, mens du forstรฅr, kan nye forretningskrav blive rejst pรฅ grund af data mining.
- Der tages en go eller no-go beslutning om at flytte modellen i implementeringsfasen.
Deployment
I implementeringsfasen sender du dine data mining-opdagelser til daglige forretningsdrift.
- Den viden eller information, der opdages under data mining-processen, bรธr gรธres let at forstรฅ for ikke-tekniske interessenter.
- En detaljeret udrulningsplan for skibeping, vedligeholdelse og overvรฅgning af datamining-opdagelser oprettes.
- Der laves en afsluttende projektrapport med erfaringer og nรธgleerfaringer i lรธbet af projektet. Dette er med til at forbedre organisationens forretningspolitik.
Data Mining Techniques

1. Klassificering
Denne analyse bruges til at hente vigtig og relevant information om data og metadata. Denne data mining-metode hjรฆlper med at klassificere data i forskellige klasser.
2. ClusterING
Clustering-analyse er en data mining-teknik til at identificere data, der ligner hinanden. Denne proces hjรฆlper med at forstรฅ forskellene og lighederne mellem dataene.
3. Regression
Regressionsanalyse er data mining-metoden til at identificere og analysere sammenhรฆngen mellem variabler. Det bruges til at identificere sandsynligheden for en specifik variabel, givet tilstedevรฆrelsen af โโandre variabler.
4. Foreningens regler
Denne data mining-teknik hjรฆlper med at finde sammenhรฆngen mellem to eller flere elementer. Den opdager et skjult mรธnster i datasรฆttet.
5. Ydre detektion
Denne type datamining-teknik refererer til observation af dataelementer i datasรฆttet, som ikke matcher et forventet mรธnster eller forventet adfรฆrd. Denne teknik kan bruges i en rรฆkke forskellige domรฆner, sรฅsom indtrรฆngen, detektion, bedrageri eller fejldetektion osv. Ydre detektion kaldes ogsรฅ Outlier Analysis eller Outlier mining.
6. Sekventielle mรธnstre
Denne dataminingteknik hjรฆlper med at opdage eller identificere lignende mรธnstre eller tendenser i transaktionsdata for en bestemt periode.
7. Forudsigelse
Forudsigelse har brugt en kombination af de andre teknikker inden for datamining som trends, sekventielle mรธnstre, clustering, klassificering osv. Den analyserer tidligere hรฆndelser eller tilfรฆlde i den rigtige rรฆkkefรธlge for at forudsige en fremtidig hรฆndelse.
Udfordringer ved implementering af datamine
- Dygtige eksperter er nรธdvendige for at formulere datamining-forespรธrgslerne.
- Overfitting: Pรฅ grund af en lille trรฆningsdatabase passer en model muligvis ikke til fremtidige tilstande.
- Data mining krรฆver store databaser, som nogle gange er svรฆre at administrere
- Forretningspraksis skal muligvis รฆndres for at beslutte at bruge de afslรธrede oplysninger.
- Hvis datasรฆttet ikke er forskelligartet, er data mining-resultaterne muligvis ikke nรธjagtige.
- Integrationsoplysninger, der er nรธdvendige fra heterogene databaser og globale informationssystemer, kan vรฆre komplekse
Eksempler pรฅ data mining
Lad os nu i dette Data Mining-kursus lรฆre om Data Mining med eksempler:
Eksempel 1:
Overvej en marketingchef for teletjenester, der รธnsker at รธge indtรฆgterne fra langdistancetjenester. For hรธj ROI pรฅ hans salgs- og marketingindsats er kundeprofilering vigtig. Han har en stor datapulje af kundeoplysninger som alder, kรธn, indkomst, kredithistorik osv. Men det er umuligt at bestemme karakteristika for personer, der foretrรฆkker langdistanceopkald med manuel analyse. Ved hjรฆlp af data mining-teknikker kan han afdรฆkke mรธnstre mellem brugere af langdistanceopkald og deres egenskaber.
For eksempel kan han lรฆre, at hans bedste kunder er gifte kvinder mellem 45 og 54 รฅr, som tjener mere end $80,000 om รฅret. Marketingindsatsen kan mรฅlrettes mod sรฅdanne demografiske.
Eksempel 2:
En bank รธnsker at finde nye mรฅder at รธge indtรฆgterne fra sine kreditkortoperationer. De vil undersรธge, om forbruget ville fordobles, hvis gebyrerne blev halveret.
Banken har flere รฅrs rekord pรฅ gennemsnitlige kreditkortsaldi, betalingsbelรธb, brug af kreditgrรฆnser og andre nรธgleparametre. De skaber en model til at kontrollere virkningen af โโden foreslรฅede nye erhvervspolitik. Dataresultaterne viser, at halvering af gebyrer for en mรฅlrettet kundebase kan รธge indtรฆgterne med $10 millioner.
Data Mining vรฆrktรธjer
Fรธlgende er 2 populรฆre Data Mining vรฆrktรธjer meget brugt i industrien
R-sprog:
R sprog er et open source-vรฆrktรธj til statistisk databehandling og grafik. R har en bred vifte af statistiske, klassiske statistiske test, tidsserieanalyse, klassifikation og grafiske teknikker. Det tilbyder effektiv datahรฅndtering og lagringsfacilitet.
Oracle Data mining:
Oracle Data Mining populรฆrt kendt som ODM er et modul af Oracle Avanceret analysedatabase. Dette Data mining-vรฆrktรธj giver dataanalytikere mulighed for at generere detaljeret indsigt og lave forudsigelser. Det hjรฆlper med at forudsige kundeadfรฆrd, udvikler kundeprofiler, identificerer krydssalgsmuligheder.
Fordele ved Data Mining
- Data mining-teknik hjรฆlper virksomheder med at fรฅ videnbaseret information.
- Data mining hjรฆlper organisationer med at foretage de rentable tilpasninger i drift og produktion.
- Data mining er en omkostningseffektiv og effektiv lรธsning sammenlignet med andre statistiske dataapplikationer.
- Data mining hjรฆlper med beslutningsprocessen.
- Faciliterer automatiseret forudsigelse af trends og adfรฆrd samt automatiseret opdagelse af skjulte mรธnstre.
- Det kan implementeres i nye systemer sรฅvel som eksisterende platforme
- Det er den hurtige proces, der gรธr det nemt for brugerne at analysere enorme mรฆngder data pรฅ kortere tid.
Ulemper ved Data Mining
- Der er chancer for, at virksomheder kan sรฆlge nyttige oplysninger om deres kunder til andre virksomheder for penge. For eksempel har American Express solgt kreditkortkรธb af deres kunder til de andre selskaber.
- Mange data mining-analysesoftware er vanskelige at betjene og krรฆver forudgรฅende uddannelse at arbejde pรฅ.
- Forskellige data mining-vรฆrktรธjer fungerer pรฅ forskellige mรฅder pรฅ grund af forskellige algoritmer, der anvendes i deres design. Derfor er udvรฆlgelsen af โโkorrekt data mining-vรฆrktรธj en meget vanskelig opgave.
- Data mining-teknikkerne er ikke nรธjagtige, og det kan derfor have alvorlige konsekvenser under visse forhold.
Data Mining-applikationer
| Applikationer | Brug |
|---|---|
| Kommunikation | Data mining-teknikker bruges i kommunikationssektoren til at forudsige kundeadfรฆrd for at tilbyde meget mรฅlrettede og relevante kampagner. |
| Forsikring | Data mining hjรฆlper forsikringsselskaber med at prissรฆtte deres produkter rentable og fremme nye tilbud til deres nye eller eksisterende kunder. |
| Uddannelse | Data mining gavner undervisere til at fรฅ adgang til elevdata, forudsige prรฆstationsniveauer og finde elever eller grupper af elever, som har brug for ekstra opmรฆrksomhed. For eksempel elever, der er svage i matematikfaget. |
| Manufacturing | Med hjรฆlp fra Data Mining kan producenter forudsige slid og รฆlde af produktionsaktiver. De kan forudse vedligeholdelse, som hjรฆlper dem med at reducere dem for at minimere nedetiden. |
| Bank | Data mining hjรฆlper finanssektoren med at fรฅ overblik over markedsrisici og styre overholdelse af lovgivningen. Det hjรฆlper banker med at identificere sandsynlige misligholdere for at beslutte, om de vil udstede kreditkort, lรฅn osv. |
| Retail | Data Mining-teknikker hjรฆlper detailcentre og kรธbmandsforretninger med at identificere og arrangere de mest salgbare varer i de mest opmรฆrksomme positioner. Det hjรฆlper butiksejere med at komme med tilbuddet, som opfordrer kunderne til at รธge deres forbrug. |
| Service Providers | Tjenesteudbydere som mobiltelefoner og forsyningsvirksomheder bruger Data Mining til at forudsige รฅrsagerne til, at en kunde forlader deres virksomhed. De analyserer faktureringsoplysninger, kundeserviceinteraktioner, klager til virksomheden for at tildele hver kunde en sandsynlighedsscore og tilbyder incitamenter. |
| E-Commerce | E-handelswebsteder bruger Data Mining til at tilbyde krydssalg og opsalg gennem deres websteder. Et af de mest kendte navne er Amazon, der bruger Data mining-teknikker til at fรฅ flere kunder ind i deres e-handelsbutik. |
| Supermarkeder | Data Mining gรธr det muligt for supermarkeder at udvikle regler til at forudsige, om deres kunder sandsynligvis ville forvente. Ved at evaluere deres kรธbsmรธnster kunne de finde kvindelige kunder, der hรธjst sandsynligt er gravide. De kan begynde at mรฅlrette produkter som babypudder, babybutik, bleer og sรฅ videre. |
| Efterforskning af kriminalitet | Data Mining hjรฆlper kriminalitetsefterforskningsbureauer med at indsรฆtte politipersonale (hvor er det mest sandsynligt, at en forbrydelse finder sted, og hvornรฅr?), hvem skal sรธge ved en grรฆnseovergang osv. |
| Bioinformatik | Data Mining hjรฆlper med at mine biologiske data fra massive datasรฆt indsamlet inden for biologi og medicin. |
Resumรฉ
- Data Mining definition: Data Mining handler om at forklare fortiden og forudsige fremtiden via Dataanalyse.
- Data mining hjรฆlper med attracinformation fra enorme datamรฆngder. Det er proceduren med at udvinde viden fra data.
- Data mining-processen omfatter forretningsforstรฅelse, dataforstรฅelse, dataforberedelse, modellering, evolution, implementering.
- Vigtige data mining-teknikker er klassificering, clustering, regression, associationsregler, ydre detektion, sekventielle mรธnstre og forudsigelse
- R-sprog og Oracle Data mining er fremtrรฆdende data mining vรฆrktรธjer og teknikker.
- Data mining-teknik hjรฆlper virksomheder med at fรฅ videnbaseret information.
- Den stรธrste ulempe ved datamining er, at mange analysesoftware er vanskelige at betjene og krรฆver forudgรฅende uddannelse at arbejde pรฅ.
- Data mining bruges i forskellige brancher sรฅsom kommunikation, forsikring, uddannelse, fremstilling, bank, detailhandel, tjenesteudbydere, e-handel, supermarkeder bioinformatik.
