Vodič za rudarenje podataka: Što je rudarenje podataka? Tehnike, Proces
⚡ Pametni sažetak
Rudarenje podataka je proces pronalaženja potencijalno korisnih obrazaca u velikim skupovima podataka. Ova stranica objašnjava proces implementacije u šest faza, sedam osnovnih tehnika, alate koji ih podržavaju, stvarne poslovne primjere te prednosti i ograničenja svakog pristupa.

Što je Data Mining?
Data Mining je proces pronalaženja potencijalno korisnih uzoraka iz ogromnih skupova podataka. To je multidisciplinarna vještina koja koristi stroj za učenje, statistika i umjetna inteligencija za bivšetracinformacije za procjenu vjerojatnosti budućih događaja. Uvidi dobiveni iz rudarenja podataka koriste se za marketing, otkrivanje prijevara, znanstvena otkrića itd.
Rudarenje podataka odnosi se na otkrivanje skrivenih, neočekivanih i prethodno nepoznatih, ali valjanih odnosa među podacima. Rudarenje podataka naziva se i otkrivanje znanja u podacima (KDD), istraživanje znanjatraccija, analiza podataka/uzoraka, prikupljanje informacija itd.
Vrste podataka
Rudarenje podataka može se izvesti na sljedećim vrstama podataka
- Relacijske baze podataka
- Skladišta podataka
- Napredni DB i spremišta informacija
- Objektno orijentirane i objektno-relacijske baze podataka
- Transakcijske i prostorne baze podataka
- Heterogene i naslijeđene baze podataka
- Multimedijska i streaming baza podataka
- Tekstualne baze podataka
- Text mining i Web mining
Bez obzira na izvor, isti disciplinirani slijed faza pretvara te sirove podatke u upotrebljiv model.
Implementacijski proces rudarenja podataka

Proučimo detaljno proces implementacije Data Mininga
Poslovno razumijevanje
U ovoj fazi uspostavljaju se poslovni ciljevi i ciljevi rudarenja podataka.
- Prvo morate razumjeti poslovne ciljeve i ciljeve klijenata. Morate definirati što vaš klijent želi (što često ni sami ne znaju)
- Pregledajte trenutni scenarij rudarenja podataka. U svoju procjenu uračunajte resurse, pretpostavke, ograničenja i druge značajne čimbenike.
- Koristeći poslovne ciljeve i trenutni scenarij, definirajte svoje ciljeve rudarenja podataka.
- Dobar plan rudarenja podataka vrlo je detaljan i treba ga razviti kako bi se postigli i poslovni i ciljevi rudarenja podataka.
Razumijevanje podataka
U ovoj fazi provodi se provjera ispravnosti podataka kako bi se utvrdilo jesu li prikladni za ciljeve rudarenja podataka.
- Prvo, podaci se prikupljaju iz više izvora podataka dostupnih u organizaciji.
- Ti izvori podataka mogu uključivati više baza podataka, ravne datoteke ili kocke podataka. Tijekom procesa integracije podataka mogu se pojaviti problemi poput podudaranja objekata i integracije shema. To je prilično složen i nezgodan proces jer se podaci iz različitih izvora vjerojatno neće lako podudarati. Na primjer, tablica A sadrži entitet pod nazivom cust_no, dok druga tablica B sadrži entitet pod nazivom cust-id.
- Stoga je prilično teško osigurati da se oba navedena objekta odnose na istu vrijednost ili ne. Ovdje se metapodaci trebaju koristiti za smanjenje pogrešaka u procesu integracije podataka.
- Sljedeći korak je traženje svojstava prikupljenih podataka. Dobar način za istraživanje podataka je odgovaranje na pitanja rudarenja podataka (o kojima se odlučuje u poslovnoj fazi) pomoću alata za upite, izvješća i vizualizaciju.
- Na temelju rezultata upita treba utvrditi kvalitetu podataka. Treba prikupiti nedostajuće podatke, ako ih ima.
Priprema podataka
U ovoj fazi podaci su spremni za proizvodnju.
Priprema podataka je obično najduža faza, koja se obično navodi kao 60% do 80% ukupnog napora.
Podatke iz različitih izvora treba odabrati, očistiti, transformirati, formatirati, anonimizirati i konstruirati (ako je potrebno).
Čišćenje podataka je proces "čišćenja" podataka izglađivanjem podataka s šumom i popunjavanjem vrijednosti koje nedostaju.
Na primjer, za demografski profil kupca nedostaju podaci o dobi. Podaci su nepotpuni i potrebno ih je popuniti. U nekim slučajevima može doći do odstupanja podataka. Na primjer, dob ima vrijednost 300. Podaci mogu biti nedosljedni. Na primjer, ime kupca je različito u različitim tablicama.
Operacije transformacije podataka mijenjaju podatke kako bi ih učinile korisnima u rudarenju podataka. Mogu se primijeniti sljedeće transformacije.
Transformacija podataka
Operacije transformacije podataka pridonijele bi uspjehu procesa rudarenja.
zaglađivanje: Pomaže u uklanjanju šuma iz podataka.
združivanje: Na podatke se primjenjuju operacije sažetka ili agregacije. Odnosno, podaci o tjednoj prodaji prikupljaju se kako bi se izračunao mjesečni i godišnji ukupni iznos.
Generalizacija: U ovom koraku, podaci niske razine zamjenjuju se konceptima više razine uz pomoć hijerarhija koncepata. Na primjer, grad se zamjenjuje državom ili zemljom.
Normalizacija: Normalizacija se izvodi kada se podaci atributa skaliraju prema gore ili dolje. Primjer: Podaci bi trebali biti u rasponu od -2.0 do 2.0 nakon normalizacije.
Konstrukcija atributa: ovi atributi su konstruirani i uključuju zadani skup atributa korisnih za rudarenje podataka.
Rezultat ovog procesa je konačni skup podataka koji se može koristiti u modeliranju.
Manekenstvo
U ovoj fazi koriste se matematički modeli za određivanje obrazaca podataka.
- Na temelju poslovnih ciljeva treba odabrati odgovarajuće tehnike modeliranja za pripremljeni skup podataka.
- Napravite scenarij za provjeru kvalitete i valjanosti modela.
- Pokrenite model na pripremljenom skupu podataka.
- Rezultate bi trebali procijeniti svi dionici kako bi bili sigurni da model može ispuniti ciljeve rudarenja podataka.
Procjena
U ovoj fazi, identificirani obrasci se procjenjuju u odnosu na poslovne ciljeve.
- Rezultate generirane modelom rudarenja podataka treba procijeniti u odnosu na poslovne ciljeve.
- Stjecanje poslovnog razumijevanja ponavljajući je proces. Zapravo, uz razumijevanje, novi poslovni zahtjevi mogu nastati zbog rudarenja podataka.
- Donosi se odluka o pokretanju ili nekretanju za premještanje modela u fazi postavljanja.
razvoj
U fazi implementacije, svoja otkrića rudarenja podataka šaljete u svakodnevne poslovne operacije.
- Znanje ili informacije otkrivene tijekom procesa rudarenja podataka trebaju biti lako razumljive netehničkim dionicima.
- Detaljan plan raspoređivanja za brodping, održavanje i praćenje otkrića rudarenja podataka je stvoreno.
- Izrađuje se konačno projektno izvješće s naučenim lekcijama i ključnim iskustvima tijekom projekta. To pomaže u poboljšanju poslovne politike organizacije.
Gornja faza modeliranja koristi definirani skup tehnika, od kojih je svaka prikladna za drugačiju vrstu pitanja.
Tehnike rudarenja podataka
1. Klasifikacija
Ova se analiza koristi za dohvaćanje važnih i relevantnih informacija o podacima i metapodacima. Ova metoda rudarenja podataka pomaže klasificirati podatke u različite klase.
2. Clustering.
Clustering analiza je tehnika rudarenja podataka za identifikaciju podataka koji su slični jedni drugima. Ovaj postupak pomaže u razumijevanju razlika i sličnosti između podataka.
3. Regresija
Regresijska analiza je metoda rudarenja podataka kojom se identificira i analizira odnos između varijabli. Koristi se za utvrđivanje vjerojatnosti specifične varijable, s obzirom na prisutnost drugih varijabli.
4. Pravila udruge
Ova tehnika rudarenja podataka pomaže pronaći vezu između dvije ili više stavki. Otkriva skriveni uzorak u skupu podataka.
5. Detekcija outliera
Ova vrsta tehnike rudarenja podataka odnosi se na promatranje podatkovnih elemenata u skupu podataka koji ne odgovaraju očekivanom obrascu ili očekivanom ponašanju. Ova se tehnika može koristiti u raznim domenama, kao što su otkrivanje upada, otkrivanje prijevara ili grešaka itd. Otkrivanje outliera naziva se i Analiza outliera ili Rudarenje outliera.
6. Sekvencijalni obrasci
Ova tehnika rudarenja podataka pomaže otkriti ili identificirati slične obrasce ili trendove u podacima o transakcijama za određeno razdoblje.
7. Predviđanje
Predviđanje je koristilo kombinaciju drugih tehnika rudarenja podataka kao što su trendovi, sekvencijalni obrasci, grupiranje, klasifikacija itd. Analizira prošle događaje ili slučajeve u pravom slijedu za predviđanje budućih događaja.
DescriptIve vs. Prediktivno rudarenje podataka
Sedam gore navedenih tehnika spadaju u dvije obitelji, a poznavanje kojoj obitelji pitanje pripada određuje kako treba čitati rezultat.
Descriptivno rudarenje podataka sažima ono što se već dogodilo. Traži strukturu unutar postojećih podataka bez ikakvog cilja kojem bi težio, zbog čega se ponekad naziva nenadziranim. ClusterOvdje pripadaju pravila asocijacije i sekvencijalni obrasci. Spoznaja supermarketa da se pelene i pivo često kupuju zajedno deskriptivna je: objašnjava prošlost, a čovjek odlučuje što će s tim učiniti.
Prediktivno rudarenje podataka procjenjuje što će se sljedeće dogoditi. Uči iz povijesnih zapisa gdje je odgovor već poznat, a zatim primjenjuje to učenje na nove zapise, zbog čega se naziva nadziranim. Ovdje spadaju klasifikacija, regresija i predviđanje. Ocjena podnositelja zahtjeva za kredit kao vjerojatnog ili malo vjerojatnog neplaćanja obveza je prediktivni nalaz.
Iz te razlike proizlaze dvije praktične posljedice.
- Validacija se razlikuje: Prediktivni model može se ocijeniti s obzirom na točnost u odnosu na poznate ishode. Deskriptivni rezultat ne može, pa se procjenjuje je li zanimljiv i primjenjiv.
- Zahtjevi za podatke se razlikuju: Prediktivni rad treba označeni stupac s povijesnim ishodima. DescriptIvan rad to ne čini, što ga čini uobičajenom početnom točkom kada tvrtka ima podatke, ali još nema jasan cilj.
Izazovi implementacije rudarenja podataka
- Za formuliranje upita za rudarenje podataka potrebni su kvalificirani stručnjaci.
- Prekomjerno opremanje: Zbog male baze podataka za obuku, model možda neće odgovarati budućim stanjima.
- Data mining zahtijeva velike baze podataka kojima je ponekad teško upravljati
- Možda će biti potrebno promijeniti poslovne prakse kako bi se odlučilo koristiti nepokrivene informacije.
- Ako skup podataka nije raznolik, rezultati rudarenja podataka možda neće biti točni.
- Integracijske informacije potrebne iz heterogenih baza podataka i globalnih informacijskih sustava mogu biti složene
Primjeri rudarenja podataka
Sada u ovom tečaju rudarenja podataka naučimo o rudarenju podataka na primjerima:
Primjer 1:
Razmotrimo voditelja marketinga tvrtke koja pruža telekomunikacijske usluge i želi povećati prihode od usluga na velike udaljenosti. Za visok povrat ulaganja u njegove prodajne i marketinške napore važno je profiliranje kupaca. Ima opsežan skup podataka o kupcima poput dobi, spola, prihoda, kreditne povijesti itd. No, nemoguće je ručnom analizom odrediti karakteristike ljudi koji preferiraju pozive na velike udaljenosti. Korištenjem tehnika rudarenja podataka, može otkriti obrasce između korisnika velikih poziva na velike udaljenosti i njihovih karakteristika.
Na primjer, mogao bi saznati da su njegove najbolje mušterije udate žene u dobi između 45 i 54 godine koje zarađuju više od 80,000 dolara godišnje. Marketinški napori mogu se usmjeriti na takve demografske skupine.
Primjer 2:
Banka želi pronaći nove načine za povećanje prihoda od poslovanja s kreditnim karticama. Želi provjeriti bi li se korištenje udvostručilo ako bi se naknade prepolovile.
Banka ima višegodišnju evidenciju o prosječnim stanjima kreditnih kartica, iznosima plaćanja, korištenju kreditnog limita i drugim ključnim parametrima. Izradili su model za provjeru utjecaja predložene nove poslovne politike. Rezultati podataka pokazuju da bi smanjenje naknada za pola za ciljanu bazu klijenata moglo povećati prihode za 10 milijuna dolara.
Rudarenje podataka u odnosu na strojno učenje
Ta se dva pojma uvelike preklapaju i često se koriste naizmjenično, ali odgovaraju na različita pitanja. Rudarenje podataka ima za cilj otkriti obrazac za koji osoba prije nije znala. Strojno učenje ima za cilj izgraditi sustav koji poboljšava vlastita predviđanja kako pristiže više podataka.
| Točka razlike | Data Mining | Strojno učenje |
|---|---|---|
| Glavni cilj | Otkrijte nepoznate obrasce u postojećim podacima | Izradite model koji predviđa na temelju novih podataka |
| Ljudska uključenost | Analitičar interpretira i djeluje na temelju nalaza | Algoritam automatski primjenjuje pravilo |
| količina podataka | Radi na definiranom, povijesnom skupu podataka | Poboljšava se kako se s vremenom dostavlja više podataka |
| Tipični izlaz | Pravilo, klaster ili asocijacija koju osoba može pročitati | Obučeni model koji vraća rezultat ili klasu |
| Odnos | Rudarenje podataka često koristi algoritme strojnog učenja kao svoj mehanizam | |
Ukratko, strojno učenje je jedan od alata na koje se rudarenje podataka oslanja, a jednostavno rudarenje podataka može se obaviti samo statistikom.
Alati za rudarenje podataka
Slijede 2 popularne Alati za rudarenje podataka naširoko korišten u industriji
R-jezik:
R jezik je alat otvorenog koda za statističko računanje i grafiku. R ima širok izbor statističkih, klasičnih statističkih testova, analize vremenskih nizova, klasifikacije i grafičkih tehnika. Nudi učinkovito rukovanje i skladištenje podataka.
Oracle Rudarenje podataka:
Oracle Data Mining, popularno poznat kao ODM, je modul od Oracle Napredna analitička baza podataka i sada se isporučuje kao dio Oracle Strojno učenje. Ovaj alat za rudarenje podataka omogućuje analitičarima podataka generiranje detaljnih uvida i izradu predviđanja. Pomaže u predviđanju ponašanja kupaca, razvoju profila kupaca i identificiranju mogućnosti unakrsne prodaje.
Prednosti rudarenja podataka
- Tehnika rudarenja podataka pomaže tvrtkama da dobiju informacije temeljene na znanju.
- Rudarenje podataka pomaže organizacijama da naprave profitabilne prilagodbe u radu i proizvodnji.
- Data mining je isplativo i učinkovito rješenje u usporedbi s drugim aplikacijama za statističke podatke.
- Rudarenje podataka pomaže u procesu donošenja odluka.
- Olakšava automatsko predviđanje trendova i ponašanja kao i automatsko otkrivanje skrivenih obrazaca.
- Može se implementirati u nove sustave kao iu postojeće platforme
- To je brz proces koji korisnicima olakšava analizu ogromne količine podataka u kraćem vremenu.
Nedostaci Data Mininga
- Postoji rizik da tvrtke prodaju korisne informacije o svojim kupcima drugim organizacijama, što izaziva značajne probleme u vezi s privatnošću.
- Mnogim analitičkim softverom za rudarenje podataka teško je upravljati i zahtijeva naprednu obuku za rad.
- Različiti alati za rudarenje podataka rade na različite načine zbog različitih algoritama korištenih u njihovom dizajnu. Stoga je odabir ispravnog alata za rudarenje podataka vrlo težak zadatak.
- Tehnike rudarenja podataka nisu točne, pa mogu uzrokovati ozbiljne posljedice u određenim uvjetima.
Aplikacije za rudarenje podataka
| Aplikacije | Upotreba |
|---|---|
| komunikacije | Tehnike rudarenja podataka koriste se u komunikacijskom sektoru za predviđanje ponašanja kupaca kako bi se ponudile visoko ciljane i relevantne kampanje. |
| Osiguranje | Rudarenje podataka pomaže osiguravajućim društvima da cijene svoje proizvode isplativo i promoviraju nove ponude svojim novim ili postojećim kupcima. |
| Obrazovanje | Rudarenje podataka koristi nastavnicima za pristup podacima učenika, predviđanje razina postignuća i pronalaženje učenika ili grupa učenika kojima je potrebna dodatna pozornost. Na primjer, učenici koji su slabi u predmetu matematika. |
| Proizvodnja | Uz pomoć rudarenja podataka proizvođači mogu predvidjeti habanje proizvodne imovine. Mogu predvidjeti održavanje što im pomaže smanjiti vrijeme zastoja. |
| Bankarstvo | Rudarenje podataka pomaže financijskom sektoru da dobije uvid u tržišne rizike i upravlja usklađenošću s propisima. Pomaže bankama da identificiraju vjerojatne neplatiše kako bi odlučile hoće li izdati kreditne kartice, zajmove itd. |
| Maloprodaja | Tehnike rudarenja podataka pomažu maloprodajnim centrima i trgovinama mješovitom robom da identificiraju i rasporede najprodavanije artikle na najzanimljivije pozicije. Pomažu vlasnicima trgovina da osmisle ponude koje potiču kupce na povećanje potrošnje. |
| Davatelji usluga | Pružatelji usluga poput industrije mobilnih telefona i komunalnih usluga koriste Data Mining za predviđanje razloga kada klijent napusti njihovu tvrtku. Oni analiziraju podatke o naplati, interakcije s korisničkom službom, pritužbe upućene tvrtki kako bi svakom kupcu dodijelili ocjenu vjerojatnosti i ponudili poticaje. |
| E-commerce | Web-mjesta za e-trgovinu koriste Data Mining kako bi ponudila unakrsnu i skuplju prodaju putem svojih web-mjesta. Jedno od najpoznatijih imena je Amazon, koji koriste tehnike rudarenja podataka kako bi privukli više kupaca u svoju eCommerce trgovinu. |
| Super tržnice | Rudarenje podataka omogućuje supermarketima da razviju pravila za predviđanje jesu li njihovi kupci vjerojatno trudni. Procjenom njihovih obrazaca kupnje mogli bi pronaći kupke koje su najvjerojatnije trudne. Mogu početi ciljati proizvode poput dječjeg pudera, dječjeg sapuna, pelena i tako dalje. |
| Istraživanje zločina | Data Mining pomaže agencijama za kriminalističke istrage da rasporede policijsku radnu snagu (gdje će se zločin najvjerojatnije dogoditi i kada?), koga pretražiti na graničnom prijelazu itd. |
| Bioinformatika | Data Mining pomaže u rudarenju bioloških podataka iz golemih skupova podataka prikupljenih u biologiji i medicini. |
