Datamining-tutorial: wat is datamining? Technieken, proces

⚡ Slimme samenvatting

Datamining is het proces waarbij potentieel bruikbare patronen in grote datasets worden gevonden. Deze pagina beschrijft het implementatieproces in zes fasen, zeven kerntechnieken, de tools die daarbij horen, praktijkvoorbeelden uit het bedrijfsleven en de voordelen en beperkingen van elke aanpak.

  • 🔍 Definitie: Data mining maakt gebruik van machine learning, statistiek en AI om gegevens te extraheren.tract verborgen verbanden in grote datasets.
  • 🗂️ Data bronnen: Relationele databases, datawarehouses, transactionele, ruimtelijke, multimedia- en tekstarchieven ondersteunen allemaal data mining.
  • 🔄 Implementatie proces: Bedrijfskennis, data-analyse, datavoorbereiding, modellering, evaluatie en implementatie.
  • 🧩 Kerntechnieken: Classificatie, clustering, regressie, associatieregels, detectie van uitschieters, sequentiële patronen en voorspelling.
  • Tools: R en Oracle Machine learning biedt statistische berekeningen en voorspellende modellen binnen databases.
  • 🏢 toepassingen: Banken, detailhandel, verzekeringen, onderwijs, productie en misdaadonderzoek passen mijnbouw toe in hun dagelijkse besluitvorming.
  • ⚠️ Beperkingen: Overfitting, tekorten aan gekwalificeerd personeel en privacybezwaren beperken de mate waarin resultaten betrouwbaar zijn.

Wat is data mining, welke technieken en processen worden gebruikt?

Wat is datamining?

Data Mining is een proces waarbij potentieel bruikbare patronen uit enorme datasets worden gevonden. Het is een multidisciplinaire vaardigheid die wordt gebruikt machine learning, statistieken en AI om uit tetracDatamining gebruikt informatie om de waarschijnlijkheid van toekomstige gebeurtenissen te evalueren. De inzichten die worden verkregen via datamining worden gebruikt voor marketing, fraudebestrijding, wetenschappelijke ontdekkingen, enzovoort.

Datamining draait om het ontdekken van verborgen, onverwachte en voorheen onbekende, maar wel degelijke verbanden tussen de gegevens. Datamining wordt ook wel Knowledge Discovery in Data (KDD) of Knowledge ex genoemd.tracinformatieverzameling, data-/patroonanalyse, data-analyse, enz.

Typen gegevens

Data mining kan worden uitgevoerd op de volgende soorten gegevens

  • Relationele databases
  • Datawarehouses
  • Geavanceerde DB- en informatieopslagplaatsen
  • Objectgeoriënteerde en object-relationele databases
  • Transactionele en ruimtelijke databases
  • Heterogene en verouderde databases
  • Multimedia- en streamingdatabase
  • Tekstdatabases
  • Tekstmining en webmining

Ongeacht de bron, dezelfde gedisciplineerde reeks fasen zet die ruwe data om in een bruikbaar model.

Implementatieproces van datamining

Implementatieproces voor datamining
Implementatieproces voor datamining

Laten we het implementatieproces van Data Mining eens in detail bestuderen

Zakelijk begrip

In deze fase worden bedrijfs- en dataminingdoelen vastgesteld.

  • Ten eerste moet u de bedrijfs- en klantdoelstellingen begrijpen. U moet definiëren wat uw klant wil (wat hij vaak zelf niet weet)
  • Maak de balans op van het huidige dataminingscenario. Houd bij uw beoordeling rekening met middelen, aannames, beperkingen en andere belangrijke factoren.
  • Gebruik zakelijke doelstellingen en het huidige scenario om uw dataminingdoelen te definiëren.
  • Een goed dataminingplan is zeer gedetailleerd en moet worden ontwikkeld om zowel zakelijke als dataminingdoelen te bereiken.

Gegevens begrijpen

In deze fase wordt een controle uitgevoerd op de gegevens om te verifiëren of ze geschikt zijn voor de doelstellingen van de data mining.

  • Allereerst worden gegevens verzameld uit meerdere gegevensbronnen die binnen de organisatie beschikbaar zijn.
  • Deze gegevensbronnen kunnen meerdere databases, platte bestanden of datakubussen omvatten. Tijdens het data-integratieproces kunnen zich problemen voordoen zoals objectmatching en schema-integratie. Het is een vrij complex en lastig proces, omdat gegevens uit verschillende bronnen niet gemakkelijk te matchen zijn. Tabel A bevat bijvoorbeeld een entiteit met de naam cust_no, terwijl een andere tabel B een entiteit met de naam cust-id bevat.
  • Daarom is het vrij moeilijk om ervoor te zorgen dat beide gegeven objecten naar dezelfde waarde verwijzen of niet. Hier moeten metadata worden gebruikt om fouten in het data-integratieproces te verminderen.
  • Vervolgens is de stap het zoeken naar eigenschappen van verkregen gegevens. Een goede manier om de gegevens te verkennen is door de dataminingvragen (die in de bedrijfsfase worden besloten) te beantwoorden met behulp van de hulpprogramma's voor zoekopdrachten, rapportage en visualisatie.
  • Op basis van de queryresultaten moet de datakwaliteit worden vastgesteld. Eventuele ontbrekende gegevens moeten worden aangevuld.

Data voorbereiding

In deze fase worden de gegevens productierijp gemaakt.

De datavoorbereiding is doorgaans de langste fase en neemt vaak 60% tot 80% van de totale tijd in beslag.

De gegevens uit verschillende bronnen moeten worden geselecteerd, opgeschoond, getransformeerd, geformatteerd, geanonimiseerd en (indien nodig) gestructureerd.

Het opschonen van gegevens is een proces waarbij de gegevens worden ‘opgeschoond’ door gegevens met ruis glad te strijken en ontbrekende waarden in te vullen.

Voor een demografisch klantprofiel ontbreken bijvoorbeeld leeftijdsgegevens. De gegevens zijn onvolledig en moeten worden ingevuld. In sommige gevallen kunnen er gegevensuitschieters zijn. Leeftijd heeft bijvoorbeeld de waarde 300. Gegevens kunnen inconsistent zijn. De naam van de klant is bijvoorbeeld verschillend in verschillende tabellen.

Gegevenstransformaties veranderen de gegevens zodat ze bruikbaar zijn voor data mining. De volgende transformaties kunnen worden toegepast.

Datatransformatie

Gegevenstransformatie-operaties dragen bij aan het succes van het miningproces.

Afvlakken: Het helpt om ruis uit de gegevens te verwijderen.

Aggregatie: Samenvattings- of aggregatiebewerkingen worden toegepast op de gegevens. Dat wil zeggen dat de wekelijkse verkoopgegevens worden geaggregeerd om het maandelijkse en jaarlijkse totaal te berekenen.

Generalisatie: In deze stap worden gegevens op laag niveau vervangen door concepten op een hoger niveau met behulp van concepthiërarchieën. Zo wordt bijvoorbeeld de stad vervangen door de staat of het land.

Normalisatie: Normalisatie wordt uitgevoerd wanneer de attribuutgegevens worden opgeschaald of afgeschaald. Bijvoorbeeld: de gegevens moeten na normalisatie binnen het bereik van -2.0 tot 2.0 vallen.

Attribuut constructieDeze kenmerken zijn geconstrueerd en omvatten de gegeven set kenmerken die nuttig zijn voor data mining.

Het resultaat van dit proces is een definitieve dataset die kan worden gebruikt bij het modelleren.

Modellering

In deze fase worden wiskundige modellen gebruikt om datapatronen te bepalen.

  • Op basis van de bedrijfsdoelstellingen moeten geschikte modelleringstechnieken worden geselecteerd voor de voorbereide dataset.
  • Creëer een scenario om de kwaliteit en validiteit van het model te testen.
  • Voer het model uit op de voorbereide gegevensset.
  • De resultaten moeten door alle belanghebbenden worden beoordeeld om er zeker van te zijn dat het model aan de dataminingdoelstellingen kan voldoen.

Evaluatie

In deze fase worden de geïdentificeerde patronen geëvalueerd aan de hand van de bedrijfsdoelstellingen.

  • Resultaten gegenereerd door het dataminingmodel moeten worden beoordeeld aan de hand van de bedrijfsdoelstellingen.
  • Het verkrijgen van zakelijk inzicht is een iteratief proces. Hoewel we dit begrijpen, kunnen er door datamining nieuwe bedrijfsvereisten ontstaan.
  • Er wordt een go- of no-go-beslissing genomen om het model in de implementatiefase te verplaatsen.

Deployment

In de implementatiefase worden uw data mining-ontdekkingen geïmplementeerd in de dagelijkse bedrijfsvoering.

  • De kennis of informatie die tijdens het dataminingproces wordt ontdekt, moet gemakkelijk begrijpelijk worden gemaakt voor niet-technische belanghebbenden.
  • Een gedetailleerd inzetplan voor schepenpingEr wordt een systeem opgezet voor het onderhoud en de monitoring van data mining-ontdekkingen.
  • Er wordt een eindprojectrapport opgesteld met de geleerde lessen en de belangrijkste ervaringen tijdens het project. Dit helpt het bedrijfsbeleid van de organisatie te verbeteren.

De hierboven beschreven modelleringsfase maakt gebruik van een vastgestelde reeks technieken, die elk geschikt zijn voor een ander soort vraag.

Data Mining Techniques

1. Classificatie

Deze analyse wordt gebruikt om belangrijke en relevante informatie over data en metadata te achterhalen. Deze dataminingmethode helpt gegevens in verschillende klassen te classificeren.

2. ClusterING

Clustering-analyse is een dataminingtechniek om gegevens te identificeren die op elkaar lijken. Dit proces helpt om de verschillen en overeenkomsten tussen de gegevens te begrijpen.

3. regressie

Regressieanalyse is de dataminingmethode voor het identificeren en analyseren van de relatie tussen variabelen. Het wordt gebruikt om de waarschijnlijkheid van een specifieke variabele te identificeren, gegeven de aanwezigheid van andere variabelen.

4. Verenigingsregels

Deze dataminingtechniek helpt bij het vinden van de associatie tussen twee of meer items. Het ontdekt een verborgen patroon in de dataset.

5. Detectie van uitschieters

Deze data mining-techniek richt zich op het observeren van data-items in de dataset die niet overeenkomen met een verwacht patroon of gedrag. Deze techniek kan worden gebruikt in diverse domeinen, zoals inbraakdetectie, fraude- of foutdetectie, enzovoort. Uitschieterdetectie wordt ook wel uitschieteranalyse of uitschietermining genoemd.

6. Opeenvolgende patronen

Deze dataminingtechniek helpt bij het ontdekken of identificeren van vergelijkbare patronen of trends in transactiegegevens voor een bepaalde periode.

7. Voorspelling

Voorspelling maakt gebruik van een combinatie van andere technieken van data mining, zoals trends, sequentiële patronen, clustering, classificatie, etc. Het analyseert gebeurtenissen uit het verleden of instanties in de juiste volgorde om een ​​toekomstige gebeurtenis te voorspellen.

DescriptLive versus voorspellende data mining

De zeven bovenstaande technieken vallen in twee categorieën, en weten tot welke categorie een vraag behoort, bepaalt hoe het resultaat moet worden geïnterpreteerd.

Descriptlive data mining Het vat samen wat er al is gebeurd. Het zoekt naar structuur binnen de bestaande data zonder een specifiek doel voor ogen, vandaar dat het soms 'ongesuperviseerd' wordt genoemd. ClusterAssociatieregels en sequentiële patronen horen hier thuis. Dat een supermarkt leert dat luiers en bier vaak samen worden gekocht, is een beschrijvende bevinding: het verklaart het verleden, en een mens besluit wat hij ermee gaat doen.

Voorspellende data mining Het schat in wat er vervolgens zal gebeuren. Het leert van historische gegevens waar het antwoord al bekend is en past die kennis vervolgens toe op nieuwe gegevens. Daarom wordt het 'supervised learning' genoemd. Classificatie, regressie en voorspelling horen hier ook bij. Het beoordelen van een leningaanvrager als waarschijnlijk of onwaarschijnlijk dat hij in gebreke blijft, is een voorspellende bevinding.

Uit dit onderscheid vloeien twee praktische consequenties voort.

  • Validatie verschilt: Een voorspellend model kan worden beoordeeld op nauwkeurigheid aan de hand van bekende uitkomsten. Een beschrijvend resultaat kan dat niet, dus wordt het beoordeeld op de vraag of het interessant en bruikbaar is.
  • De datavereisten verschillen: Voorspellend werk vereist een kolom met gelabelde historische uitkomsten. DescriptDat geldt niet voor werk, waardoor het meestal het startpunt is wanneer een bedrijf wel data heeft, maar nog geen duidelijk doel voor ogen.

Uitdagingen bij de implementatie van data mining

  • Er zijn deskundige experts nodig om de dataminingquery's te formuleren.
  • Overfitting: vanwege de kleine trainingsdatabase past een model mogelijk niet in toekomstige toestanden.
  • Voor datamining zijn grote databases nodig die soms moeilijk te beheren zijn
  • Bedrijfspraktijken moeten mogelijk worden aangepast om te bepalen of de blootgelegde informatie kan worden gebruikt.
  • Als de dataset niet divers is, zijn de resultaten van datamining mogelijk niet nauwkeurig.
  • De integratie-informatie die nodig is uit heterogene databases en mondiale informatiesystemen kan complex zijn

Voorbeelden van data mining

Laten we nu in deze Data Mining-cursus meer leren over Data Mining met voorbeelden:

Voorbeeld 1:

Stel je voor dat een marketingmanager van een telecomaanbieder de inkomsten uit langeafstandsgesprekken wil verhogen. Voor een hoog rendement op zijn verkoop- en marketinginspanningen is klantprofilering essentieel. Hij beschikt over een enorme hoeveelheid klantgegevens, zoals leeftijd, geslacht, inkomen, kredietgeschiedenis, enzovoort. Maar het is onmogelijk om met handmatige analyse de kenmerken te bepalen van mensen die de voorkeur geven aan langeafstandsgesprekken. Door gebruik te maken van data mining-technieken kan hij patronen ontdekken tussen frequente langeafstandsgebruikers en hun specifieke kenmerken.

Hij zou bijvoorbeeld kunnen vernemen dat zijn beste klanten getrouwde vrouwen tussen de 45 en 54 jaar zijn, die meer dan $80,000 per jaar verdienen. Marketinginspanningen kunnen op deze doelgroep worden gericht.

Voorbeeld 2:

Een bank wil nieuwe manieren onderzoeken om de inkomsten uit haar creditcardactiviteiten te verhogen. Ze willen nagaan of het gebruik zou verdubbelen als de kosten gehalveerd zouden worden.

De bank beschikt over jarenlange gegevens over gemiddelde creditcardtegoeden, betaalbedragen, kredietlimietgebruik en andere belangrijke parameters. Ze hebben een model ontwikkeld om de impact van het voorgestelde nieuwe bedrijfsbeleid te controleren. De resultaten laten zien dat het halveren van de kosten voor een specifieke klantengroep de omzet met 10 miljoen dollar zou kunnen verhogen.

Datamining versus machinaal leren

De twee termen overlappen elkaar sterk en worden vaak door elkaar gebruikt, maar ze beantwoorden verschillende vragen. Datamining heeft als doel een patroon te ontdekken dat iemand nog niet kende. Machine learning heeft als doel een systeem te bouwen dat zijn eigen voorspellingen verbetert naarmate er meer data binnenkomt.

Punt van verschil Data Mining Machine leren
Hoofd doel Ontdek onbekende patronen in bestaande gegevens. Ontwikkel een model dat voorspellingen doet op basis van nieuwe gegevens.
Menselijke betrokkenheid Een analist interpreteert de bevindingen en onderneemt actie op basis daarvan. Het algoritme past de regel automatisch toe.
gegevensvolume Werkt met een gedefinieerde, historische dataset. De kwaliteit verbetert naarmate er in de loop der tijd meer gegevens worden aangeleverd.
Typische output Een regel, cluster of associatie die iemand kan lezen. Een getraind model dat een score of klasse retourneert.
Verhouding Datamining maakt vaak gebruik van machine learning-algoritmen als motor.

Kortom, machine learning is een van de instrumenten waarop data mining voortbouwt, en eenvoudige data mining kan ook met alleen statistiek worden uitgevoerd.

Hulpmiddelen voor datamining

Hieronder volgen 2 populaire Hulpmiddelen voor datamining veel gebruikt in de industrie

R-taal:

R taal is een open source-tool voor statistische berekeningen en grafische afbeeldingen. R beschikt over een breed scala aan statistische, klassieke statistische tests, tijdreeksanalyse, classificatie en grafische technieken. Het biedt effectieve gegevensoverdracht en opslagfaciliteiten.

Meer informatie hier

Oracle Datamining:

Oracle Data MiningODM, ook wel bekend als ODM, is een module van de Oracle De geavanceerde analysedatabase wordt nu geleverd als onderdeel van Oracle Machine learning. Deze data mining tool stelt data-analisten in staat gedetailleerde inzichten te genereren en voorspellingen te doen. Het helpt bij het voorspellen van klantgedrag, het ontwikkelen van klantprofielen en het identificeren van cross-sellingmogelijkheden.

Meer informatie hier

Voordelen van datamining

  • Dataminingtechniek helpt bedrijven om op kennis gebaseerde informatie te verkrijgen.
  • Data mining helpt organisaties om winstgevende aanpassingen door te voeren in de bedrijfsvoering en productie.
  • De datamining is een kosteneffectieve en efficiënte oplossing in vergelijking met andere statistische datatoepassingen.
  • Datamining helpt bij het besluitvormingsproces.
  • Vergemakkelijkt geautomatiseerde voorspelling van trends en gedrag, evenals geautomatiseerde ontdekking van verborgen patronen.
  • Het kan zowel in nieuwe systemen als in bestaande platforms worden geïmplementeerd
  • Het is het snelle proces dat het voor de gebruikers gemakkelijk maakt om grote hoeveelheden gegevens in minder tijd te analyseren.

Nadelen van datamining

  • Er bestaat een risico dat bedrijven nuttige informatie over hun klanten verkopen aan andere organisaties, wat aanzienlijke privacybezwaren met zich meebrengt.
  • Veel data mining-analysesoftware is moeilijk te bedienen en vereist voorafgaande training om ermee te kunnen werken.
  • Verschillende data mining tools werken op verschillende manieren vanwege verschillende algoritmes die in hun ontwerp worden gebruikt. Daarom is de selectie van de juiste data mining tool een zeer moeilijke taak.
  • De dataminingtechnieken zijn niet nauwkeurig en kunnen dus onder bepaalde omstandigheden ernstige gevolgen hebben.

Datamining-applicaties

Toepassingen Gebruik
Communicatie In de communicatiesector worden dataminingtechnieken gebruikt om klantgedrag te voorspellen en zo zeer gerichte en relevante campagnes aan te bieden.
Verzekeringen Met data mining kunnen verzekeringsmaatschappijen hun producten winstgevend prijzen en nieuwe aanbiedingen promoten bij hun nieuwe en bestaande klanten.
Educatie Datamining biedt docenten de mogelijkheid toegang te krijgen tot gegevens van leerlingen, prestatieniveaus te voorspellen en leerlingen of groepen leerlingen te vinden die extra aandacht nodig hebben. Bijvoorbeeld leerlingen die zwak zijn in wiskundevakken.
Productie Met behulp van data mining kunnen fabrikanten de slijtage van productiemiddelen voorspellen. Ze kunnen anticiperen op onderhoud, waardoor ze de stilstandtijd kunnen minimaliseren.
Bankieren Datamining helpt de financiële sector om inzicht te krijgen in de marktrisico's en om de naleving van de regelgeving te beheren. Het helpt banken waarschijnlijke wanbetalers te identificeren en te beslissen of ze creditcards, leningen, enz. willen uitgeven.
Retail Dataminingtechnieken helpen winkelcentra en supermarkten bij het identificeren en plaatsen van de meest verkoopbare artikelen op de meest aantrekkelijke plekken. Dit helpt winkeliers bij het bedenken van aanbiedingen die klanten stimuleren om meer uit te geven.
Service Providers Dienstverleners zoals mobiele telefoon- en nutsbedrijven gebruiken Data Mining om de redenen te voorspellen waarom een ​​klant hun bedrijf verlaat. Ze analyseren factureringsgegevens, interacties met de klantenservice, klachten die bij het bedrijf zijn ingediend om elke klant een waarschijnlijkheidsscore toe te kennen en incentives te bieden.
E-Commerce E-commercewebsites gebruiken datamining om cross-sells en up-sells via hun websites aan te bieden. Eén van de bekendste namen is Amazon, die dataminingtechnieken gebruiken om meer klanten naar hun e-commerce winkel te krijgen.
Supermarkten Datamining stelt supermarkten in staat om regels te ontwikkelen waarmee ze kunnen voorspellen of hun klanten waarschijnlijk zwanger zijn. Door hun koopgedrag te analyseren, kunnen ze vrouwelijke klanten identificeren die het meest waarschijnlijk zwanger zijn. Ze kunnen zich vervolgens richten op producten zoals babypoeder, babyzeep, luiers, enzovoort.
misdaadonderzoek Datamining helpt misdaadonderzoeksbureaus bij het inzetten van politiepersoneel (waar kan een misdrijf het meest waarschijnlijk plaatsvinden en wanneer?), wie moet worden gefouilleerd bij een grensovergang, enz.
Bioinformatics Datamining helpt biologische gegevens te ontginnen uit enorme datasets die zijn verzameld in de biologie en geneeskunde.

Veelgestelde vragen

Niet helemaal. Kennisontdekking in databases omvat het hele proces, van selectie en opschoning tot interpretatie. Datamining is de stap in het proces van patroonherkenning, hoewel de twee termen in de praktijk vaak door elkaar worden gebruikt.

SQL voor bijvoorbeeldtracgegevens, statistieken om te beoordelen of een patroon echt is, één programmeertaal zoals R of PythonEn domeinkennis van de betreffende branche. Communicatie is net zo belangrijk, omdat de bevindingen niet-technische belanghebbenden moeten overtuigen.

Het is legaal wanneer de gegevens rechtmatig worden verzameld en gebruikt. Regelgeving zoals de AVG vereist een wettelijke grondslag, doelbinding en vaak anonimisering, waardoor persoonsgegevens doorgaans worden verwijderd voordat met data mining wordt begonnen.

Het verkort de langzaamste stappen. AI-assistenten schrijven extracDe analist voert vragen uit, stelt schoonmaakregels voor en beschrijft in begrijpelijke taal hoe een model voor belanghebbenden kan worden uitgelegd. De analist blijft de zakelijke vraag formuleren en valideert elk resultaat.

Ja, als uitgangspunt. Beschrijf de data en de vraag, en een AI-assistent adviseert classificatie, clustering of regressie en legt uit waarom. Bevestig de keuze met een aparte dataset voordat je er volledig op vertrouwt.

Vat dit bericht samen met: