Datamining-tutorial: wat is datamining? Technieken, proces
⚡ Slimme samenvatting
Datamining is het proces waarbij potentieel bruikbare patronen in grote datasets worden gevonden. Deze pagina beschrijft het implementatieproces in zes fasen, zeven kerntechnieken, de tools die daarbij horen, praktijkvoorbeelden uit het bedrijfsleven en de voordelen en beperkingen van elke aanpak.

Wat is datamining?
Data Mining is een proces waarbij potentieel bruikbare patronen uit enorme datasets worden gevonden. Het is een multidisciplinaire vaardigheid die wordt gebruikt machine learning, statistieken en AI om uit tetracDatamining gebruikt informatie om de waarschijnlijkheid van toekomstige gebeurtenissen te evalueren. De inzichten die worden verkregen via datamining worden gebruikt voor marketing, fraudebestrijding, wetenschappelijke ontdekkingen, enzovoort.
Datamining draait om het ontdekken van verborgen, onverwachte en voorheen onbekende, maar wel degelijke verbanden tussen de gegevens. Datamining wordt ook wel Knowledge Discovery in Data (KDD) of Knowledge ex genoemd.tracinformatieverzameling, data-/patroonanalyse, data-analyse, enz.
Typen gegevens
Data mining kan worden uitgevoerd op de volgende soorten gegevens
- Relationele databases
- Datawarehouses
- Geavanceerde DB- en informatieopslagplaatsen
- Objectgeoriënteerde en object-relationele databases
- Transactionele en ruimtelijke databases
- Heterogene en verouderde databases
- Multimedia- en streamingdatabase
- Tekstdatabases
- Tekstmining en webmining
Ongeacht de bron, dezelfde gedisciplineerde reeks fasen zet die ruwe data om in een bruikbaar model.
Implementatieproces van datamining

Laten we het implementatieproces van Data Mining eens in detail bestuderen
Zakelijk begrip
In deze fase worden bedrijfs- en dataminingdoelen vastgesteld.
- Ten eerste moet u de bedrijfs- en klantdoelstellingen begrijpen. U moet definiëren wat uw klant wil (wat hij vaak zelf niet weet)
- Maak de balans op van het huidige dataminingscenario. Houd bij uw beoordeling rekening met middelen, aannames, beperkingen en andere belangrijke factoren.
- Gebruik zakelijke doelstellingen en het huidige scenario om uw dataminingdoelen te definiëren.
- Een goed dataminingplan is zeer gedetailleerd en moet worden ontwikkeld om zowel zakelijke als dataminingdoelen te bereiken.
Gegevens begrijpen
In deze fase wordt een controle uitgevoerd op de gegevens om te verifiëren of ze geschikt zijn voor de doelstellingen van de data mining.
- Allereerst worden gegevens verzameld uit meerdere gegevensbronnen die binnen de organisatie beschikbaar zijn.
- Deze gegevensbronnen kunnen meerdere databases, platte bestanden of datakubussen omvatten. Tijdens het data-integratieproces kunnen zich problemen voordoen zoals objectmatching en schema-integratie. Het is een vrij complex en lastig proces, omdat gegevens uit verschillende bronnen niet gemakkelijk te matchen zijn. Tabel A bevat bijvoorbeeld een entiteit met de naam cust_no, terwijl een andere tabel B een entiteit met de naam cust-id bevat.
- Daarom is het vrij moeilijk om ervoor te zorgen dat beide gegeven objecten naar dezelfde waarde verwijzen of niet. Hier moeten metadata worden gebruikt om fouten in het data-integratieproces te verminderen.
- Vervolgens is de stap het zoeken naar eigenschappen van verkregen gegevens. Een goede manier om de gegevens te verkennen is door de dataminingvragen (die in de bedrijfsfase worden besloten) te beantwoorden met behulp van de hulpprogramma's voor zoekopdrachten, rapportage en visualisatie.
- Op basis van de queryresultaten moet de datakwaliteit worden vastgesteld. Eventuele ontbrekende gegevens moeten worden aangevuld.
Data voorbereiding
In deze fase worden de gegevens productierijp gemaakt.
De datavoorbereiding is doorgaans de langste fase en neemt vaak 60% tot 80% van de totale tijd in beslag.
De gegevens uit verschillende bronnen moeten worden geselecteerd, opgeschoond, getransformeerd, geformatteerd, geanonimiseerd en (indien nodig) gestructureerd.
Het opschonen van gegevens is een proces waarbij de gegevens worden ‘opgeschoond’ door gegevens met ruis glad te strijken en ontbrekende waarden in te vullen.
Voor een demografisch klantprofiel ontbreken bijvoorbeeld leeftijdsgegevens. De gegevens zijn onvolledig en moeten worden ingevuld. In sommige gevallen kunnen er gegevensuitschieters zijn. Leeftijd heeft bijvoorbeeld de waarde 300. Gegevens kunnen inconsistent zijn. De naam van de klant is bijvoorbeeld verschillend in verschillende tabellen.
Gegevenstransformaties veranderen de gegevens zodat ze bruikbaar zijn voor data mining. De volgende transformaties kunnen worden toegepast.
Datatransformatie
Gegevenstransformatie-operaties dragen bij aan het succes van het miningproces.
Afvlakken: Het helpt om ruis uit de gegevens te verwijderen.
Aggregatie: Samenvattings- of aggregatiebewerkingen worden toegepast op de gegevens. Dat wil zeggen dat de wekelijkse verkoopgegevens worden geaggregeerd om het maandelijkse en jaarlijkse totaal te berekenen.
Generalisatie: In deze stap worden gegevens op laag niveau vervangen door concepten op een hoger niveau met behulp van concepthiërarchieën. Zo wordt bijvoorbeeld de stad vervangen door de staat of het land.
Normalisatie: Normalisatie wordt uitgevoerd wanneer de attribuutgegevens worden opgeschaald of afgeschaald. Bijvoorbeeld: de gegevens moeten na normalisatie binnen het bereik van -2.0 tot 2.0 vallen.
Attribuut constructieDeze kenmerken zijn geconstrueerd en omvatten de gegeven set kenmerken die nuttig zijn voor data mining.
Het resultaat van dit proces is een definitieve dataset die kan worden gebruikt bij het modelleren.
Modellering
In deze fase worden wiskundige modellen gebruikt om datapatronen te bepalen.
- Op basis van de bedrijfsdoelstellingen moeten geschikte modelleringstechnieken worden geselecteerd voor de voorbereide dataset.
- Creëer een scenario om de kwaliteit en validiteit van het model te testen.
- Voer het model uit op de voorbereide gegevensset.
- De resultaten moeten door alle belanghebbenden worden beoordeeld om er zeker van te zijn dat het model aan de dataminingdoelstellingen kan voldoen.
Evaluatie
In deze fase worden de geïdentificeerde patronen geëvalueerd aan de hand van de bedrijfsdoelstellingen.
- Resultaten gegenereerd door het dataminingmodel moeten worden beoordeeld aan de hand van de bedrijfsdoelstellingen.
- Het verkrijgen van zakelijk inzicht is een iteratief proces. Hoewel we dit begrijpen, kunnen er door datamining nieuwe bedrijfsvereisten ontstaan.
- Er wordt een go- of no-go-beslissing genomen om het model in de implementatiefase te verplaatsen.
Deployment
In de implementatiefase worden uw data mining-ontdekkingen geïmplementeerd in de dagelijkse bedrijfsvoering.
- De kennis of informatie die tijdens het dataminingproces wordt ontdekt, moet gemakkelijk begrijpelijk worden gemaakt voor niet-technische belanghebbenden.
- Een gedetailleerd inzetplan voor schepenpingEr wordt een systeem opgezet voor het onderhoud en de monitoring van data mining-ontdekkingen.
- Er wordt een eindprojectrapport opgesteld met de geleerde lessen en de belangrijkste ervaringen tijdens het project. Dit helpt het bedrijfsbeleid van de organisatie te verbeteren.
De hierboven beschreven modelleringsfase maakt gebruik van een vastgestelde reeks technieken, die elk geschikt zijn voor een ander soort vraag.
Data Mining Techniques
1. Classificatie
Deze analyse wordt gebruikt om belangrijke en relevante informatie over data en metadata te achterhalen. Deze dataminingmethode helpt gegevens in verschillende klassen te classificeren.
2. ClusterING
Clustering-analyse is een dataminingtechniek om gegevens te identificeren die op elkaar lijken. Dit proces helpt om de verschillen en overeenkomsten tussen de gegevens te begrijpen.
3. regressie
Regressieanalyse is de dataminingmethode voor het identificeren en analyseren van de relatie tussen variabelen. Het wordt gebruikt om de waarschijnlijkheid van een specifieke variabele te identificeren, gegeven de aanwezigheid van andere variabelen.
4. Verenigingsregels
Deze dataminingtechniek helpt bij het vinden van de associatie tussen twee of meer items. Het ontdekt een verborgen patroon in de dataset.
5. Detectie van uitschieters
Deze data mining-techniek richt zich op het observeren van data-items in de dataset die niet overeenkomen met een verwacht patroon of gedrag. Deze techniek kan worden gebruikt in diverse domeinen, zoals inbraakdetectie, fraude- of foutdetectie, enzovoort. Uitschieterdetectie wordt ook wel uitschieteranalyse of uitschietermining genoemd.
6. Opeenvolgende patronen
Deze dataminingtechniek helpt bij het ontdekken of identificeren van vergelijkbare patronen of trends in transactiegegevens voor een bepaalde periode.
7. Voorspelling
Voorspelling maakt gebruik van een combinatie van andere technieken van data mining, zoals trends, sequentiële patronen, clustering, classificatie, etc. Het analyseert gebeurtenissen uit het verleden of instanties in de juiste volgorde om een toekomstige gebeurtenis te voorspellen.
DescriptLive versus voorspellende data mining
De zeven bovenstaande technieken vallen in twee categorieën, en weten tot welke categorie een vraag behoort, bepaalt hoe het resultaat moet worden geïnterpreteerd.
Descriptlive data mining Het vat samen wat er al is gebeurd. Het zoekt naar structuur binnen de bestaande data zonder een specifiek doel voor ogen, vandaar dat het soms 'ongesuperviseerd' wordt genoemd. ClusterAssociatieregels en sequentiële patronen horen hier thuis. Dat een supermarkt leert dat luiers en bier vaak samen worden gekocht, is een beschrijvende bevinding: het verklaart het verleden, en een mens besluit wat hij ermee gaat doen.
Voorspellende data mining Het schat in wat er vervolgens zal gebeuren. Het leert van historische gegevens waar het antwoord al bekend is en past die kennis vervolgens toe op nieuwe gegevens. Daarom wordt het 'supervised learning' genoemd. Classificatie, regressie en voorspelling horen hier ook bij. Het beoordelen van een leningaanvrager als waarschijnlijk of onwaarschijnlijk dat hij in gebreke blijft, is een voorspellende bevinding.
Uit dit onderscheid vloeien twee praktische consequenties voort.
- Validatie verschilt: Een voorspellend model kan worden beoordeeld op nauwkeurigheid aan de hand van bekende uitkomsten. Een beschrijvend resultaat kan dat niet, dus wordt het beoordeeld op de vraag of het interessant en bruikbaar is.
- De datavereisten verschillen: Voorspellend werk vereist een kolom met gelabelde historische uitkomsten. DescriptDat geldt niet voor werk, waardoor het meestal het startpunt is wanneer een bedrijf wel data heeft, maar nog geen duidelijk doel voor ogen.
Uitdagingen bij de implementatie van data mining
- Er zijn deskundige experts nodig om de dataminingquery's te formuleren.
- Overfitting: vanwege de kleine trainingsdatabase past een model mogelijk niet in toekomstige toestanden.
- Voor datamining zijn grote databases nodig die soms moeilijk te beheren zijn
- Bedrijfspraktijken moeten mogelijk worden aangepast om te bepalen of de blootgelegde informatie kan worden gebruikt.
- Als de dataset niet divers is, zijn de resultaten van datamining mogelijk niet nauwkeurig.
- De integratie-informatie die nodig is uit heterogene databases en mondiale informatiesystemen kan complex zijn
Voorbeelden van data mining
Laten we nu in deze Data Mining-cursus meer leren over Data Mining met voorbeelden:
Voorbeeld 1:
Stel je voor dat een marketingmanager van een telecomaanbieder de inkomsten uit langeafstandsgesprekken wil verhogen. Voor een hoog rendement op zijn verkoop- en marketinginspanningen is klantprofilering essentieel. Hij beschikt over een enorme hoeveelheid klantgegevens, zoals leeftijd, geslacht, inkomen, kredietgeschiedenis, enzovoort. Maar het is onmogelijk om met handmatige analyse de kenmerken te bepalen van mensen die de voorkeur geven aan langeafstandsgesprekken. Door gebruik te maken van data mining-technieken kan hij patronen ontdekken tussen frequente langeafstandsgebruikers en hun specifieke kenmerken.
Hij zou bijvoorbeeld kunnen vernemen dat zijn beste klanten getrouwde vrouwen tussen de 45 en 54 jaar zijn, die meer dan $80,000 per jaar verdienen. Marketinginspanningen kunnen op deze doelgroep worden gericht.
Voorbeeld 2:
Een bank wil nieuwe manieren onderzoeken om de inkomsten uit haar creditcardactiviteiten te verhogen. Ze willen nagaan of het gebruik zou verdubbelen als de kosten gehalveerd zouden worden.
De bank beschikt over jarenlange gegevens over gemiddelde creditcardtegoeden, betaalbedragen, kredietlimietgebruik en andere belangrijke parameters. Ze hebben een model ontwikkeld om de impact van het voorgestelde nieuwe bedrijfsbeleid te controleren. De resultaten laten zien dat het halveren van de kosten voor een specifieke klantengroep de omzet met 10 miljoen dollar zou kunnen verhogen.
Datamining versus machinaal leren
De twee termen overlappen elkaar sterk en worden vaak door elkaar gebruikt, maar ze beantwoorden verschillende vragen. Datamining heeft als doel een patroon te ontdekken dat iemand nog niet kende. Machine learning heeft als doel een systeem te bouwen dat zijn eigen voorspellingen verbetert naarmate er meer data binnenkomt.
| Punt van verschil | Data Mining | Machine leren |
|---|---|---|
| Hoofd doel | Ontdek onbekende patronen in bestaande gegevens. | Ontwikkel een model dat voorspellingen doet op basis van nieuwe gegevens. |
| Menselijke betrokkenheid | Een analist interpreteert de bevindingen en onderneemt actie op basis daarvan. | Het algoritme past de regel automatisch toe. |
| gegevensvolume | Werkt met een gedefinieerde, historische dataset. | De kwaliteit verbetert naarmate er in de loop der tijd meer gegevens worden aangeleverd. |
| Typische output | Een regel, cluster of associatie die iemand kan lezen. | Een getraind model dat een score of klasse retourneert. |
| Verhouding | Datamining maakt vaak gebruik van machine learning-algoritmen als motor. | |
Kortom, machine learning is een van de instrumenten waarop data mining voortbouwt, en eenvoudige data mining kan ook met alleen statistiek worden uitgevoerd.
Hulpmiddelen voor datamining
Hieronder volgen 2 populaire Hulpmiddelen voor datamining veel gebruikt in de industrie
R-taal:
R taal is een open source-tool voor statistische berekeningen en grafische afbeeldingen. R beschikt over een breed scala aan statistische, klassieke statistische tests, tijdreeksanalyse, classificatie en grafische technieken. Het biedt effectieve gegevensoverdracht en opslagfaciliteiten.
Oracle Datamining:
Oracle Data MiningODM, ook wel bekend als ODM, is een module van de Oracle De geavanceerde analysedatabase wordt nu geleverd als onderdeel van Oracle Machine learning. Deze data mining tool stelt data-analisten in staat gedetailleerde inzichten te genereren en voorspellingen te doen. Het helpt bij het voorspellen van klantgedrag, het ontwikkelen van klantprofielen en het identificeren van cross-sellingmogelijkheden.
Voordelen van datamining
- Dataminingtechniek helpt bedrijven om op kennis gebaseerde informatie te verkrijgen.
- Data mining helpt organisaties om winstgevende aanpassingen door te voeren in de bedrijfsvoering en productie.
- De datamining is een kosteneffectieve en efficiënte oplossing in vergelijking met andere statistische datatoepassingen.
- Datamining helpt bij het besluitvormingsproces.
- Vergemakkelijkt geautomatiseerde voorspelling van trends en gedrag, evenals geautomatiseerde ontdekking van verborgen patronen.
- Het kan zowel in nieuwe systemen als in bestaande platforms worden geïmplementeerd
- Het is het snelle proces dat het voor de gebruikers gemakkelijk maakt om grote hoeveelheden gegevens in minder tijd te analyseren.
Nadelen van datamining
- Er bestaat een risico dat bedrijven nuttige informatie over hun klanten verkopen aan andere organisaties, wat aanzienlijke privacybezwaren met zich meebrengt.
- Veel data mining-analysesoftware is moeilijk te bedienen en vereist voorafgaande training om ermee te kunnen werken.
- Verschillende data mining tools werken op verschillende manieren vanwege verschillende algoritmes die in hun ontwerp worden gebruikt. Daarom is de selectie van de juiste data mining tool een zeer moeilijke taak.
- De dataminingtechnieken zijn niet nauwkeurig en kunnen dus onder bepaalde omstandigheden ernstige gevolgen hebben.
Datamining-applicaties
| Toepassingen | Gebruik |
|---|---|
| Communicatie | In de communicatiesector worden dataminingtechnieken gebruikt om klantgedrag te voorspellen en zo zeer gerichte en relevante campagnes aan te bieden. |
| Verzekeringen | Met data mining kunnen verzekeringsmaatschappijen hun producten winstgevend prijzen en nieuwe aanbiedingen promoten bij hun nieuwe en bestaande klanten. |
| Educatie | Datamining biedt docenten de mogelijkheid toegang te krijgen tot gegevens van leerlingen, prestatieniveaus te voorspellen en leerlingen of groepen leerlingen te vinden die extra aandacht nodig hebben. Bijvoorbeeld leerlingen die zwak zijn in wiskundevakken. |
| Productie | Met behulp van data mining kunnen fabrikanten de slijtage van productiemiddelen voorspellen. Ze kunnen anticiperen op onderhoud, waardoor ze de stilstandtijd kunnen minimaliseren. |
| Bankieren | Datamining helpt de financiële sector om inzicht te krijgen in de marktrisico's en om de naleving van de regelgeving te beheren. Het helpt banken waarschijnlijke wanbetalers te identificeren en te beslissen of ze creditcards, leningen, enz. willen uitgeven. |
| Retail | Dataminingtechnieken helpen winkelcentra en supermarkten bij het identificeren en plaatsen van de meest verkoopbare artikelen op de meest aantrekkelijke plekken. Dit helpt winkeliers bij het bedenken van aanbiedingen die klanten stimuleren om meer uit te geven. |
| Service Providers | Dienstverleners zoals mobiele telefoon- en nutsbedrijven gebruiken Data Mining om de redenen te voorspellen waarom een klant hun bedrijf verlaat. Ze analyseren factureringsgegevens, interacties met de klantenservice, klachten die bij het bedrijf zijn ingediend om elke klant een waarschijnlijkheidsscore toe te kennen en incentives te bieden. |
| E-Commerce | E-commercewebsites gebruiken datamining om cross-sells en up-sells via hun websites aan te bieden. Eén van de bekendste namen is Amazon, die dataminingtechnieken gebruiken om meer klanten naar hun e-commerce winkel te krijgen. |
| Supermarkten | Datamining stelt supermarkten in staat om regels te ontwikkelen waarmee ze kunnen voorspellen of hun klanten waarschijnlijk zwanger zijn. Door hun koopgedrag te analyseren, kunnen ze vrouwelijke klanten identificeren die het meest waarschijnlijk zwanger zijn. Ze kunnen zich vervolgens richten op producten zoals babypoeder, babyzeep, luiers, enzovoort. |
| misdaadonderzoek | Datamining helpt misdaadonderzoeksbureaus bij het inzetten van politiepersoneel (waar kan een misdrijf het meest waarschijnlijk plaatsvinden en wanneer?), wie moet worden gefouilleerd bij een grensovergang, enz. |
| Bioinformatics | Datamining helpt biologische gegevens te ontginnen uit enorme datasets die zijn verzameld in de biologie en geneeskunde. |
