Data Mining Handledning: Vad är Data Mining? Tekniker, process

⚡ Smart sammanfattning

Datautvinning är processen att hitta potentiellt användbara mönster i stora datamängder. Den här sidan förklarar implementeringsprocessen i sex faser, sju kärntekniker, de verktyg som stöder dem, exempel på verkliga affärsmetoder samt fördelarna och begränsningarna med varje metod.

  • 🔍 Definition: Data Mining använder maskininlärning, statistik och AI för atttracdolda relationer från stora datamängder.
  • 🗂️ Datakällor: Relationsdatabaser, datalager, transaktionella, rumsliga, multimedia- och textarkiv stöder alla mining.
  • 🔄 Implementeringsprocess: Affärsförståelse, dataförståelse, dataförberedelse, modellering, utvärdering och implementering.
  • 🧩 Kärntekniker: Klassificering, klustring, regression, associationsregler, detektion av extremvärden, sekventiella mönster och prediktion.
  • 🛠️ Verktyg: R och Oracle Maskininlärning tillhandahåller statistisk beräkning och prediktiv modellering i databaser.
  • 🏢 Program: Bank, detaljhandel, försäkring, utbildning, tillverkning och brottsutredning tillämpar mining i dagliga beslut.
  • ⚠️ Begränsningar: Överanpassning, kompetensbrist och integritetsproblem begränsar hur tillförlitliga resultaten kan vara.

Vad är data mining, tekniker och processer

Vad är Data Mining?

Data Mining är en process för att hitta potentiellt användbara mönster från enorma datamängder. Det är en multidisciplinär färdighet som använder maskininlärning, statistik och AI till exempeltracinformation för att utvärdera sannolikheten för framtida händelser. Insikterna som härrör från datautvinning används för marknadsföring, bedrägeriupptäckt, vetenskapliga upptäckter etc.

Data mining handlar om att upptäcka dolda, oanade och tidigare okända men giltiga samband mellan data. Data mining kallas även Knowledge Discovery in Data (KDD), Knowledge ex...traction, data-/mönsteranalys, informationsinsamling etc.

Typer av data

Data mining kan utföras på följande typer av data

  • Relationsdatabaser
  • Datalager
  • Avancerade DB och informationsarkiv
  • Objektorienterade och objektrelationella databaser
  • Transaktionella och rumsliga databaser
  • Heterogena och äldre databaser
  • Multimedia och strömmande databas
  • Textdatabaser
  • Text mining och Web mining

Oavsett källan förvandlar samma disciplinerade sekvens av faser den rådata till en användbar modell.

Implementeringsprocess för Data Mining

Data Mining Implementeringsprocess
Data Mining Implementeringsprocess

Låt oss studera implementeringsprocessen för Data Mining i detalj

Affärsförståelse

I denna fas fastställs affärs- och datautvinningsmål.

  • Först måste du förstå affärs- och kundmål. Du måste definiera vad din klient vill ha (vilket många gånger inte ens de själva vet)
  • Gör en inventering av det aktuella datautvinningsscenariot. Ta med resurser, antaganden, begränsningar och andra viktiga faktorer i din bedömning.
  • Använd affärsmål och nuvarande scenario, definiera dina datautvinningsmål.
  • En bra datautvinningsplan är mycket detaljerad och bör utvecklas för att uppnå både affärs- och datautvinningsmål.

Dataförståelse

I den här fasen utförs en sanity check av datan för att kontrollera om den är lämplig för data mining-målen.

  • Först samlas data in från flera datakällor som är tillgängliga i organisationen.
  • Dessa datakällor kan inkludera flera databaser, platta filer eller datakuber. Det finns problem som objektmatchning och schemaintegration som kan uppstå under dataintegrationsprocessen. Det är en ganska komplex och knepig process eftersom data från olika källor sannolikt inte matchar varandra enkelt. Till exempel innehåller tabell A en entitet med namnet kundnr medan en annan tabell B innehåller en entitet med namnet kund-id.
  • Därför är det ganska svårt att säkerställa att båda dessa givna objekt hänvisar till samma värde eller inte. Här bör Metadata användas för att minska fel i dataintegrationsprocessen.
  • Därefter är steget att söka efter egenskaper för förvärvad data. Ett bra sätt att utforska data är att svara på datautvinningsfrågorna (besluts i affärsfasen) med hjälp av fråge-, rapporterings- och visualiseringsverktygen.
  • Baserat på resultaten av frågan bör datakvaliteten fastställas. Om någon data saknas bör den inhämtas.

Dataförberedelse

I denna fas görs data produktionsklar.

Dataförberedelse är normalt den längsta fasen och anges vanligtvis till 60 % till 80 % av den totala arbetsinsatsen.

Data från olika källor bör väljas, rensas, omvandlas, formateras, anonymiseras och konstrueras (vid behov).

Datarensning är en process för att "rensa" data genom att jämna ut bullriga data och fylla i saknade värden.

Till exempel, för en kunddemografisk profil, saknas åldersdata. Uppgifterna är ofullständiga och bör fyllas i. I vissa fall kan det finnas dataavvikelser. Till exempel har ålder värdet 300. Data kan vara inkonsekventa. Till exempel är kundens namn olika i olika tabeller.

Datatransformationsoperationer ändrar data för att göra dem användbara vid datautvinning. Följande transformationer kan tillämpas.

Datatransformation

Datatransformationsoperationer skulle bidra till framgången för gruvprocessen.

Glättning: Det hjälper till att ta bort brus från data.

Aggregering: Sammanfattnings- eller aggregeringsoperationer tillämpas på data. Dvs. veckoförsäljningsdata aggregeras för att beräkna månads- och årssumman.

Generalisering: I det här steget ersätts lågnivådata med högre nivåkoncept med hjälp av koncepthierarkier. Till exempel ersätts staden med delstaten eller landet.

Normalisering: Normalisering utförs när attributdata skalas upp eller ned. Exempel: Data bör ligga inom intervallet -2.0 till 2.0 efter normalisering.

AttributkonstruktionDessa attribut är konstruerade och inkluderar den givna uppsättningen attribut som är användbara för datautvinning.

Resultatet av denna process är en slutlig datamängd som kan användas i modellering.

Modellering

I denna fas används matematiska modeller för att bestämma datamönster.

  • Baserat på affärsmålen bör lämpliga modelleringstekniker väljas för den förberedda datamängden.
  • Skapa ett scenario för att testkontrollera modellens kvalitet och giltighet.
  • Kör modellen på den förberedda datamängden.
  • Resultaten bör bedömas av alla intressenter för att säkerställa att modellen kan uppfylla målen för datautvinning.

Utvärdering

I denna fas utvärderas identifierade mönster mot affärsmålen.

  • Resultat som genereras av datautvinningsmodellen bör utvärderas mot affärsmålen.
  • Att få affärsförståelse är en iterativ process. I själva verket, medan man förstår, kan nya affärskrav höjas på grund av datautvinning.
  • Ett go eller no-go-beslut fattas för att flytta modellen i utbyggnadsfasen.

konfiguration

I implementeringsfasen skickar du dina datautvinningsupptäckter till den dagliga affärsverksamheten.

  • Den kunskap eller information som upptäcks under datautvinningsprocessen bör göras lätt att förstå för icke-tekniska intressenter.
  • En detaljerad utplaceringsplan för fartygping, underhåll och övervakning av datautvinningsupptäckter skapas.
  • En slutlig projektrapport skapas med lärdomar och nyckelerfarenheter under projektet. Detta bidrar till att förbättra organisationens affärspolicy.

Modelleringsfasen ovan bygger på en definierad uppsättning tekniker, som var och en är lämpad för en annan typ av fråga.

Data Mining Techniques

1. Klassificering

Denna analys används för att hämta viktig och relevant information om data och metadata. Denna datautvinningsmetod hjälper till att klassificera data i olika klasser.

2. Clusteranvändning

Clusteringanalys är en datautvinningsteknik för att identifiera data som liknar varandra. Denna process hjälper till att förstå skillnaderna och likheterna mellan data.

3. Regression

Regressionsanalys är datautvinningsmetoden för att identifiera och analysera sambandet mellan variabler. Den används för att identifiera sannolikheten för en specifik variabel, givet närvaron av andra variabler.

4. Föreningsregler

Denna datautvinningsteknik hjälper till att hitta sambandet mellan två eller flera objekt. Den upptäcker ett dolt mönster i datamängden.

5. Avvikardetektering

Denna typ av data mining-teknik avser observation av dataelement i datamängden som inte matchar ett förväntat mönster eller förväntat beteende. Denna teknik kan användas inom en mängd olika områden, såsom intrångsdetektering, bedrägeri- eller feldetektering etc. Outlier-detektering kallas även outlier-analys eller outlier mining.

6. Sekventiella mönster

Denna datautvinningsteknik hjälper till att upptäcka eller identifiera liknande mönster eller trender i transaktionsdata för en viss period.

7. Förutsägelse

Prediction har använt en kombination av de andra teknikerna för datautvinning som trender, sekventiella mönster, klustring, klassificering, etc. Den analyserar tidigare händelser eller instanser i rätt sekvens för att förutsäga en framtida händelse.

Descriptive vs prediktiv datautvinning

De sju teknikerna ovan faller inom två familjer, och att veta vilken familj en fråga tillhör avgör hur resultatet ska läsas.

Descriptiv datautvinning sammanfattar vad som redan har hänt. Den letar efter struktur inuti befintliga data utan något mål att sikta på, vilket är anledningen till att den ibland kallas oövervakad. Clusterning, associationsregler och sekventiella mönster hör hemma här. En stormarknad som får veta att blöjor och öl ofta köps tillsammans är ett beskrivande fynd: det förklarar det förflutna, och en människa bestämmer vad man ska göra åt det.

Prediktiv datautvinning uppskattar vad som kommer att hända härnäst. Den lär sig från historiska register där svaret redan är känt, och tillämpar sedan detta lärande på nya register, vilket är anledningen till att det kallas övervakat. Klassificering, regression och prediktion hör hemma här. Att bedöma en lånesökande som sannolikt eller osannolikt att han eller hon kommer att fallera är ett prediktivt resultat.

Två praktiska konsekvenser följer av skillnaden.

  • Valideringen skiljer sig åt: En prediktiv modell kan poängsättas för noggrannhet mot kända utfall. Ett beskrivande resultat kan inte, så det bedöms utifrån huruvida det är intressant och handlingsbart.
  • Datakraven skiljer sig åt: Förutsägande arbete behöver en märkt kolumn för historiska utfall. DescriptLivet gör inte det, vilket gör det till den vanliga utgångspunkten när ett företag har data men ännu inget tydligt mål.

Utmaningar med att implementera data mining

  • Skickliga experter behövs för att formulera datautvinningsfrågor.
  • Övermontering: På grund av en liten träningsdatabas, kanske en modell inte passar framtida tillstånd.
  • Datautvinning kräver stora databaser som ibland är svåra att hantera
  • Affärspraxis kan behöva ändras för att bestämma att den information som avslöjas ska användas.
  • Om datamängden inte är olika kan det hända att datautvinningsresultaten inte är korrekta.
  • Integrationsinformation som behövs från heterogena databaser och globala informationssystem kan vara komplex

Exempel på datautvinning

Nu i denna Data Mining-kurs, låt oss lära oss om Data Mining med exempel:

Exempel 1:

Tänk dig en marknadschef för telekomtjänster som vill öka intäkterna från långdistanssamtal. För att få hög avkastning på sina försäljnings- och marknadsföringsinsatser är kundprofilering viktig. Han har en stor databas med kundinformation som ålder, kön, inkomst, kredithistorik etc. Men det är omöjligt att fastställa egenskaper hos personer som föredrar långdistanssamtal med manuell analys. Med hjälp av data mining-tekniker kan han upptäcka mönster mellan användare som ringer många långdistanssamtal och deras egenskaper.

Till exempel kan han lära sig att hans bästa kunder är gifta kvinnor mellan 45 och 54 år som tjänar mer än 80,000 XNUMX USD per år. Marknadsföringsinsatser kan riktas mot sådana demografiska.

Exempel 2:

En bank vill söka nya sätt att öka intäkterna från sin kreditkortsverksamhet. De vill undersöka om användningen skulle fördubblas om avgifterna halverades.

Banken har flera års dokumenterad genomsnittlig kreditkortsbalans, betalningsbelopp, kreditgränsanvändning och andra viktiga parametrar. De skapar en modell för att kontrollera effekten av den föreslagna nya affärspolicyn. Dataresultaten visar att en halvering av avgifterna för en riktad kundbas skulle kunna öka intäkterna med 10 miljoner dollar.

Datautvinning kontra maskininlärning

De två termerna överlappar varandra starkt och används ofta synonymt, men de besvarar olika frågor. Data mining syftar till att upptäcka ett mönster som en person inte tidigare kände till. Maskininlärning syftar till att bygga ett system som förbättrar sina egna förutsägelser allt eftersom mer data anländer.

Skillnadspunkt Data Mining Maskininlärning
Huvudmål Upptäck okända mönster i befintlig data Bygg en modell som förutsäger ny data
Mänskligt engagemang En analytiker tolkar och agerar utifrån resultatet Algoritmen tillämpar regeln automatiskt
datavolym Fungerar på en definierad, historisk datamängd Förbättras allt eftersom mer data tillhandahålls över tid
Typisk utgång En regel, ett kluster eller en association som en person kan läsa En tränad modell som returnerar ett resultat eller en klass
Förhållande Data mining använder ofta maskininlärningsalgoritmer som motor

Kort sagt är maskininlärning ett av de verktyg som data mining använder sig av, och enkel data mining kan göras enbart med statistik.

Datautvinningsverktyg

Följande är 2 populära Datautvinningsverktyg används i stor utsträckning inom industrin

R-språk:

R-språk är ett verktyg med öppen källkod för statistisk beräkning och grafik. R har ett brett utbud av statistiska, klassiska statistiska tester, tidsserieanalys, klassificering och grafiska tekniker. Det erbjuder effektiv datahantering och lagringsmöjligheter.

Läs mer här

Oracle Datautvinning:

Oracle Data Mining, allmänt känd som ODM, är en modul i Oracle Avancerad analysdatabas och levereras nu som en del av Oracle Maskininlärning. Detta datautvinningsverktyg gör det möjligt för dataanalytiker att generera detaljerade insikter och göra förutsägelser. Det hjälper till att förutsäga kundbeteende, utveckla kundprofiler och identifiera korsförsäljningsmöjligheter.

Läs mer här

Fördelar med Data Mining

  • Data mining-teknik hjälper företag att få kunskapsbaserad information.
  • Data mining hjälper organisationer att göra lönsamma justeringar i drift och produktion.
  • Data mining är en kostnadseffektiv och effektiv lösning jämfört med andra statistiska dataapplikationer.
  • Data mining hjälper till med beslutsprocessen.
  • Underlättar automatisk förutsägelse av trender och beteenden samt automatisk upptäckt av dolda mönster.
  • Det kan implementeras i nya system såväl som befintliga plattformar
  • Det är den snabba processen som gör det enkelt för användarna att analysera enorma mängder data på kortare tid.

Nackdelar med Data Mining

  • Det finns risk att företag säljer användbar information om sina kunder till andra organisationer, vilket ger upphov till betydande integritetsproblem.
  • Många datautvinningsanalysprogram är svåra att använda och kräver förhandsutbildning att arbeta med.
  • Olika verktyg för datautvinning fungerar på olika sätt på grund av olika algoritmer som används i deras design. Därför är valet av korrekt datautvinningsverktyg en mycket svår uppgift.
  • Datautvinningsteknikerna är inte korrekta och kan därför orsaka allvarliga konsekvenser under vissa förhållanden.

Data Mining-applikationer

Tillämpningar Användning
Trygghet i vårdförloppet Data mining-tekniker används inom kommunikationssektorn för att förutsäga kundbeteende för att kunna erbjuda mycket riktade och relevanta kampanjer.
Försäkring Data mining hjälper försäkringsbolag att prissätta sina produkter lönsamma och marknadsföra nya erbjudanden till sina nya eller befintliga kunder.
Utbildning Datautvinning gynnar lärare att få tillgång till elevdata, förutsäga prestationsnivåer och hitta elever eller grupper av elever som behöver extra uppmärksamhet. Till exempel elever som är svaga i matteämne.
Produktion Med hjälp av datautvinning kan tillverkare förutsäga slitage på produktionstillgångar. De kan förutse underhåll vilket hjälper dem att minimera driftstopp.
Banking Data mining hjälper finanssektorn att få en överblick över marknadsrisker och hantera regelefterlevnad. Det hjälper banker att identifiera sannolika försummelser för att besluta om de ska utfärda kreditkort, lån etc.
Detaljhandeln Datautvinningstekniker hjälper köpcentra och livsmedelsbutiker att identifiera och arrangera de mest säljbara varorna på de mest uppmärksammade platserna. Det hjälper butiksägare att komma med erbjudanden som uppmuntrar kunderna att öka sina utgifter.
Tjänsteleverantörer Tjänsteleverantörer som mobiltelefoner och allmännyttiga industrier använder Data Mining för att förutsäga orsakerna när en kund lämnar sitt företag. De analyserar faktureringsdetaljer, kundtjänstinteraktioner, klagomål till företaget för att tilldela varje kund en sannolikhetspoäng och erbjuder incitament.
E-handel E-handelswebbplatser använder Data Mining för att erbjuda korsförsäljning och merförsäljning via sina webbplatser. Ett av de mest kända namnen är Amazon, som använder datautvinningstekniker för att få fler kunder till sin e-handelsbutik.
Supermarknader Datautvinning gör det möjligt för stormarknader att utveckla regler för att förutsäga om deras kunder sannolikt var gravida. Genom att utvärdera deras köpmönster kan de hitta kvinnliga kunder som troligtvis är gravida. De kan börja rikta in sig på produkter som babypuder, tvål, blöjor och så vidare.
Brottsutredning Data Mining hjälper brottsutredande myndigheter att distribuera polispersonal (var är det mest sannolikt att ett brott inträffar och när?), vem ska söka vid en gränsövergång etc.
bioinformatik Data Mining hjälper till att bryta biologiska data från enorma datamängder som samlats in inom biologi och medicin.

Vanliga frågor

Inte exakt. Kunskapsupptäckt i databaser är hela processen, från urval och rensning till tolkning. Datautvinning är mönsterfyndningssteget inuti den, även om de två namnen nu används synonymt i praktiken.

SQL till exempeltracdata, statistik för att bedöma om ett mönster är verkligt, ett språk som R eller Pythonoch domänkunskap om verksamheten. Kommunikation är lika viktig, eftersom resultaten måste övertyga icke-tekniska intressenter.

Det är lagligt när uppgifterna samlas in och används på ett lagligt sätt. Regler som GDPR kräver en laglig grund, ändamålsbegränsning och ofta anonymisering, så personliga identifierare tas vanligtvis bort innan datautvinning påbörjas.

Det förkortar de långsammaste stegen. AI-assistenter skriver exempeltracfrågor, föreslå rengöringsregler och utarbeta tydliga förklaringar av en modell för intressenter. Analytikern formulerar fortfarande affärsfrågan och validerar varje resultat.

Ja, som utgångspunkt. Beskriv data och fråga, och en AI-assistent rekommenderar klassificering, kluster eller regression och förklarar varför. Bekräfta valet mot ett utebliven urval innan du förlitar dig på det.

Sammanfatta detta inlägg med: