Andmekaevandamise õpetus: mis on andmekaevandamine? Tehnikad, protsess

⚡ Nutikas kokkuvõte

Andmekaeve on protsess, mille käigus leitakse potentsiaalselt kasulikke mustreid suurtest andmekogumitest. See leht selgitab kuuefaasilist rakendusprotsessi, seitset põhitehnikat, neid toetavaid tööriistu, reaalseid ärinäiteid ning iga lähenemisviisi eeliseid ja piiranguid.

  • 🔍 Määratlus: Andmekaevandamine kasutab masinõpet, statistikat ja tehisintellekti, et uuridatract varjatud seosed suurtest andmekogumitest.
  • 🗂️ Andmeallikad: Relatsioonandmebaasid, andmelaod, tehingu-, ruumi-, multimeedia- ja tekstihoidlad toetavad kõik kaevandamist.
  • 🔄 Rakendusprotsess: Äritegevuse mõistmine, andmete mõistmine, andmete ettevalmistamine, modelleerimine, hindamine ja juurutamine.
  • 🧩 Põhitehnikad: Klassifikatsioon, klasterdamine, regressioon, assotsiatsioonireeglid, kõrvalekallete tuvastamine, järjestikused mustrid ja ennustamine.
  • 🛠️ Vahendid: R ja Oracle Masinõpe pakub statistilist arvutamist ja andmebaasisisest ennustavat modelleerimist.
  • 🏢 Rakendused: Pangandus, jaemüük, kindlustus, haridus, tootmine ja kuritegevuse uurimine rakendavad kaevandamist igapäevaste otsuste tegemisel.
  • ⚠️ Piirangud: Ülekoormamine, oskuste puudus ja privaatsusprobleemid piiravad tulemuste usaldusväärsust.

Mis on andmekaeve, tehnikad ja protsess

Mis on andmekaeve?

Data Mining on protsess potentsiaalselt kasulike mustrite leidmiseks tohututest andmekogumitest. See on multidistsiplinaarne oskus, mida kasutatakse masinõpe, statistika ja tehisintellekti näidetekstracAndmekaeve abil saadud teadmisi kasutatakse turunduse, pettuste avastamise, teaduslike avastuste jms jaoks.

Andmekaeve seisneb varjatud, kahtlustamatute ja varem tundmatute, kuid kehtivate seoste avastamises andmete vahel. Andmekaeve nimetatakse ka teadmiste avastamiseks andmetes (KDD), teadmiste uurimisekstracanalüüs, andmete/mustrite analüüs, teabe kogumine jne.

Andmete tüübid

Andmekaevet saab teostada järgmist tüüpi andmete puhul

  • Relatsioonandmebaasid
  • Andmelaod
  • Täiustatud DB ja teabehoidlad
  • Objektorienteeritud ja objektrelatsioonilised andmebaasid
  • Tehingu- ja ruumiandmebaasid
  • Heterogeensed ja pärandandmebaasid
  • Multimeedia ja voogesituse andmebaas
  • Teksti andmebaasid
  • Tekstikaevandamine ja veebikaevandamine

Olenemata allikast, muudab sama distsiplineeritud faaside jada need toorandmed kasutatavaks mudeliks.

Andmekaeve rakendusprotsess

Andmekaevandamise juurutamisprotsess
Andmekaevandamise juurutamisprotsess

Uurime üksikasjalikult andmekaeve juurutamisprotsessi

Äri mõistmine

Selles etapis kehtestatakse äri- ja andmekaevandamise eesmärgid.

  • Esiteks peate mõistma ettevõtte ja kliendi eesmärke. Peate määratlema, mida teie klient soovib (mida sageli isegi ta ise ei tea)
  • Tehke ülevaade praegusest andmekaeve stsenaariumist. Võtke oma hinnangus arvesse ressursse, eeldusi, piiranguid ja muid olulisi tegureid.
  • Määrake oma andmekaevandamise eesmärgid ärieesmärke ja praegust stsenaariumi kasutades.
  • Hea andmekaeveplaan on väga üksikasjalik ja see tuleks välja töötada nii äri- kui ka andmekaeveeesmärkide saavutamiseks.

Andmete mõistmine

Selles etapis kontrollitakse andmete õigsust, et veenduda, kas need sobivad andmekaevandamise eesmärkide saavutamiseks.

  • Esiteks kogutakse andmeid mitmest organisatsioonis saadaolevast andmeallikast.
  • Need andmeallikad võivad hõlmata mitut andmebaasi, lamefaile või andmekuubikuid. Andmete integreerimise protsessi käigus võivad tekkida probleemid, näiteks objektide sobitamine ja skeemide integreerimine. See on üsna keeruline ja kaval protsess, kuna erinevatest allikatest pärit andmed ei pruugi kergesti sobida. Näiteks tabel A sisaldab üksust nimega kliendi_number, samas kui teine ​​tabel B sisaldab üksust nimega kliendi_id.
  • Seetõttu on üsna raske kindlaks teha, kas need mõlemad antud objektid viitavad samale väärtusele või mitte. Siin tuleks metaandmeid kasutada andmete integreerimise protsessis esinevate vigade vähendamiseks.
  • Järgmisena tuleb otsida omandatud andmete atribuute. Hea viis andmete uurimiseks on vastata andmekaeve küsimustele (mis on otsustatud ärifaasis), kasutades päringu-, aruandlus- ja visualiseerimistööriistu.
  • Päringu tulemuste põhjal tuleks kindlaks teha andmete kvaliteet. Vajadusel tuleks puuduvad andmed hankida.

Andmete ettevalmistamine

Selles etapis valmistatakse andmed tootmisvalmis.

Andmete ettevalmistamine on tavaliselt kõige pikem etapp, millele viidatakse sageli kui 60–80% kogu töömahust.

Erinevatest allikatest pärit andmed tuleks valida, puhastada, teisendada, vormindada, anonüümida ja vajadusel konstrueerida.

Andmete puhastamine on protsess andmete "puhastamiseks", siludes mürarikkaid andmeid ja täites puuduvad väärtused.

Näiteks kliendi demograafilise profiili puhul puuduvad vanuseandmed. Andmed on puudulikud ja tuleks täita. Mõnel juhul võivad andmed esineda kõrvalekaldeid. Näiteks vanuse väärtus on 300. Andmed võivad olla vastuolulised. Näiteks on kliendi nimi erinevates tabelites erinev.

Andmete teisendusoperatsioonid muudavad andmeid andmekaevandamises kasulikuks. Rakendada saab järgmisi teisendusi.

Andmete teisendamine

Andmete teisendamise toimingud aitaksid kaasa kaevandamisprotsessi edule.

Silumine: See aitab andmetest müra eemaldada.

Koondamine: Andmetele rakendatakse kokkuvõtvaid või liitmisoperatsioone. St iganädalased müügiandmed koondatakse, et arvutada kuu ja aasta kogusumma.

Üldistus: Selles etapis asendatakse madala taseme andmed kõrgema taseme mõistetega mõistehierarhiate abil. Näiteks linn asendatakse osariigi või riigiga.

Normaliseerimine: Normaliseerimine toimub atribuudiandmete skaleerimisel üles- või allapoole. Näide: Andmed peaksid pärast normaliseerimist jääma vahemikku -2.0 kuni 2.0.

Atribuudi ehitus: need atribuudid on konstrueeritud ja sisaldavad antud atribuutide komplekti, mis on abiks andmekaevandamisel.

Selle protsessi tulemuseks on lõplik andmekogum, mida saab kasutada modelleerimisel.

Modelleerimine

Selles faasis kasutatakse andmemustrite määramiseks matemaatilisi mudeleid.

  • Ärieesmärkidest lähtuvalt tuleks koostatud andmestiku jaoks valida sobivad modelleerimistehnikad.
  • Looge mudeli kvaliteedi ja kehtivuse testimiseks stsenaarium.
  • Käivitage mudel ettevalmistatud andmekogumil.
  • Tulemusi peaksid hindama kõik sidusrühmad, et veenduda mudeli vastavuses andmekaeve eesmärkidele.

Hindamine

Selles etapis hinnatakse tuvastatud mustreid ärieesmärkide alusel.

  • Andmekaevemudeli abil saadud tulemusi tuleks hinnata ärieesmärkide alusel.
  • Ettevõtlusest arusaamise omandamine on iteratiivne protsess. Tegelikult võivad andmekaevandamise tõttu tekkida uued ärinõuded, kuigi mõista.
  • Mudeli kasutuselevõtufaasis teisaldamiseks tehakse otsus kas minna või mitte.

Deployment

Juurutamisetapis saadate oma andmekaevandamise avastused igapäevasesse äritegevusse.

  • Andmekaevandamise käigus avastatud teadmised või teave tuleks teha mittetehnilistele sidusrühmadele kergesti arusaadavaks.
  • Laeva üksikasjalik kasutuselevõtu plaanpingLuuakse andmekaevandamise avastuste hooldus ja jälgimine.
  • Projekti lõpparuanne koostatakse projekti käigus saadud õppetundide ja peamiste kogemustega. See aitab parandada organisatsiooni äripoliitikat.

Ülaltoodud modelleerimisetapp tugineb kindlaksmääratud tehnikate komplektile, millest igaüks sobib erinevat tüüpi küsimustele.

Andmekaevandamise tehnikad

1. Klassifikatsioon

Seda analüüsi kasutatakse andmete ja metaandmete kohta olulise ja asjakohase teabe hankimiseks. See andmekaevandamise meetod aitab klassifitseerida andmeid erinevatesse klassidesse.

2. Clusterse

Clusteranalüüs on andmekaevetehnika, mille abil tuvastatakse üksteisega sarnased andmed. See protsess aitab mõista andmete erinevusi ja sarnasusi.

3. Taandareng

Regressioonanalüüs on andmekaeve meetod muutujate vaheliste seoste tuvastamiseks ja analüüsimiseks. Seda kasutatakse konkreetse muutuja tõenäosuse tuvastamiseks, võttes arvesse teiste muutujate olemasolu.

4. Ühingu reeglid

See andmekaevetehnika aitab leida seose kahe või enama üksuse vahel. See avastab andmekogumis peidetud mustri.

5. Kõrvalväärtuste tuvastamine

Seda tüüpi andmekaeve tehnika viitab andmekogumis olevate andmeüksuste jälgimisele, mis ei vasta oodatavale mustrile või käitumisele. Seda tehnikat saab kasutada erinevates valdkondades, näiteks sissetungimise tuvastamine, pettuste või vigade tuvastamine jne. Kõrvalväärtuste tuvastamist nimetatakse ka kõrvalekallete analüüsiks või kõrvalekallete kaevandamiseks.

6. Järjestikused mustrid

See andmekaevetehnika aitab avastada või tuvastada tehinguandmetes teatud perioodi jooksul sarnaseid mustreid või suundumusi.

7. Ennustamine

Prognoos on kasutanud kombinatsiooni muudest andmekaevandamise tehnikatest, nagu trendid, järjestikused mustrid, rühmitamine, klassifitseerimine jne. See analüüsib minevikusündmusi või juhtumeid õiges järjestuses, et ennustada tulevast sündmust.

Descriptive vs ennustav andmekaevandamine

Need seitse ülaltoodud tehnikat jagunevad kahte perekonda ja teadmine, millisesse perekonda küsimus kuulub, määrab, kuidas tulemust lugeda.

Descriptive andmekaevandamine võtab kokku juba toimunu. See otsib olemasolevate andmete seest struktuuri ilma sihtmärgita, mistõttu seda nimetatakse mõnikord ka järelevalveta meetodiks. ClusterSiia kuuluvad nii seotusreeglid kui ka järjestikused mustrid. See, et supermarket saab teada, et mähkmeid ja õlut ostetakse sageli koos, on kirjeldav leid: see selgitab minevikku ja inimene otsustab, mida sellega peale hakata.

Ennustav andmekaevandamine hindab, mis edasi saab. See õpib ajaloolistest andmetest, mille vastus on juba teada, ja rakendab seejärel õpitut uutele andmetele, mistõttu seda nimetatakse juhendatud meetodiks. Siia kuuluvad klassifitseerimine, regressioon ja ennustamine. Laenutaotleja maksejõuetuse tõenäosuse või ebatõenäolisuse hindamine on ennustav leid.

Sellest eristusest tulenevad kaks praktilist tagajärge.

  • Valideerimine erineb: Ennustava mudeli täpsust saab hinnata teadaolevate tulemuste suhtes. Kirjeldavat tulemust aga mitte, seega hinnatakse selle huvi ja tegutsemisvõimet.
  • Andmetele esitatavad nõuded on erinevad: Ennustav töö vajab märgistatud ajalooliste tulemuste veergu. DescriptIve töö seda ei tee, mistõttu on see tavaline lähtepunkt, kui ettevõttel on andmed, kuid selget eesmärki veel pole.

Andmekaevandamise rakendamise väljakutsed

  • Andmekaevepäringute formuleerimiseks on vaja kvalifitseeritud eksperte.
  • Ülesobitamine: väiksuse koolitusandmebaasi tõttu ei pruugi mudel tulevastesse olekutesse sobida.
  • Andmekaeve vajab suuri andmebaase, mida mõnikord on raske hallata
  • Avatud teabe kasutamise otsustamiseks võib olla vaja äritavasid muuta.
  • Kui andmekogum ei ole mitmekesine, ei pruugi andmekaeve tulemused olla täpsed.
  • Heterogeensetest andmebaasidest ja globaalsetest infosüsteemidest saadav integratsiooniteave võib olla keeruline

Andmekaevandamise näited

Nüüd sellel andmekaeve kursusel tutvume andmekaevandamisega näidete abil.

Näide 1:

Kujutage ette telekommunikatsiooniteenuste pakkuja turundusjuhti, kes soovib suurendada kaugekõnede tulusid. Müügi- ja turundustegevuse kõrge investeeringutasuvuse saavutamiseks on oluline klientide profiilide koostamine. Tal on ulatuslik kliendiandmete kogum, nagu vanus, sugu, sissetulek, krediidiajalugu jne. Kuid käsitsi analüüsi abil on võimatu kindlaks teha kaugekõnesid eelistavate inimeste omadusi. Andmekaevandamise tehnikate abil saab ta paljastada mustreid paljude kaugekõnesid tegevate kasutajate ja nende omaduste vahel.

Näiteks võib ta teada saada, et tema parimad kliendid on 45–54-aastased abielus naised, kes teenivad aastas üle 80,000 XNUMX dollari. Turundustegevus võib olla suunatud sellisele demograafilisele tasemele.

Näide 2:

Pank soovib otsida uusi viise krediitkaarditehingutest saadava tulu suurendamiseks. Nad tahavad kontrollida, kas kasutus kahekordistuks, kui tasud poole võrra vähendataks.

Pangal on mitme aasta pikkune statistika krediitkaardi keskmiste saldode, maksete summade, krediidilimiidi kasutamise ja muude oluliste parameetrite kohta. Nad loovad mudeli, et kontrollida kavandatud uue äripoliitika mõju. Andmetulemused näitavad, et sihtrühma kuuluvate klientide tasude poole võrra vähendamine võiks suurendada tulusid 10 miljoni dollari võrra.

Andmekaevandamine vs masinõpe

Need kaks terminit kattuvad suuresti ja neid kasutatakse sageli vaheldumisi, kuid nad vastavad erinevatele küsimustele. Andmekaevandamise eesmärk on avastada mustreid, millest inimene varem ei teadnud. Masinõpe eesmärk on luua süsteem, mis parandab oma ennustusi rohkemate andmete saabudes.

Erinevuspunkt Data Mining Masinõpe
Peamine eesmärk Avastage olemasolevates andmetes tundmatuid mustreid Looge mudel, mis ennustab uusi andmeid
Inimese kaasamine Analüütik tõlgendab leidu ja tegutseb selle põhjal Algoritm rakendab reeglit automaatselt
andmemaht Töötab määratletud ajaloolise andmekogumi peal Paraneb aja jooksul, kui esitatakse rohkem andmeid
Tüüpiline väljund Reegel, klaster või seos, mida inimene saab lugeda Treenitud mudel, mis tagastab skoori või klassi
Suhe Andmekaevandamine kasutab mootorina sageli masinõppe algoritme

Lühidalt öeldes on masinõpe üks tööriistakomplektidest, millele andmekaevandamine tugineb, ja lihtsat andmekaevandamist saab teha ainult statistika abil.

Andmekaevandamise tööriistad

Järgmised on 2 populaarset Andmekaevandamise tööriistad kasutatakse laialdaselt tööstuses

R-keel:

R keel on avatud lähtekoodiga tööriist statistilise andmetöötluse ja graafika jaoks. R-l on lai valik statistilisi, klassikalisi statistilisi teste, aegridade analüüsi, klassifikatsiooni ja graafilisi tehnikaid. See pakub tõhusat andmete edastamise ja säilitamise võimalust.

Loe lähemalt siit

Oracle Andmete kaevandamine:

Oracle Data Mining, rahvasuus tuntud kui ODM, on moodul Oracle Täiustatud analüütikaandmebaas ja see on nüüd osa teenusest Oracle Masinõpe. See andmekaeve tööriist võimaldab andmeanalüütikutel genereerida üksikasjalikke teadmisi ja teha ennustusi. See aitab ennustada klientide käitumist, arendada kliendiprofiile ja tuvastada ristmüügivõimalusi.

Loe lähemalt siit

Andmekaevandamise eelised

  • Andmekaevandamise tehnika aitab ettevõtetel saada teadmistepõhist teavet.
  • Andmekaevandamine aitab organisatsioonidel teha kasumlikke kohandusi töös ja tootmises.
  • Andmekaeve on kulutõhus ja tõhus lahendus võrreldes teiste statistiliste andmerakendustega.
  • Andmekaeve aitab otsustusprotsessis kaasa aidata.
  • Hõlbustab suundumuste ja käitumise automatiseeritud ennustamist ning peidetud mustrite automaatset avastamist.
  • Seda saab rakendada nii uutes süsteemides kui ka olemasolevates platvormides
  • See on kiire protsess, mis võimaldab kasutajatel analüüsida tohutul hulgal andmeid lühema ajaga.

Andmekaevandamise puudused

  • On oht, et ettevõtted müüvad oma klientide kohta kasulikku teavet teistele organisatsioonidele, mis tekitab olulisi privaatsusprobleeme.
  • Paljusid andmekaeve analüüsitarkvarasid on raske kasutada ja see nõuab eelkoolitust.
  • Erinevad andmekaevetööriistad töötavad erinevatel viisidel nende disainis kasutatavate erinevate algoritmide tõttu. Seetõttu on õige andmekaevetööriista valimine väga keeruline ülesanne.
  • Andmekaevetehnikad ei ole täpsed ja seetõttu võib see teatud tingimustel põhjustada tõsiseid tagajärgi.

Andmekaevandamise rakendused

Rakendused Kasutus
Side Andmekaeve tehnikaid kasutatakse kommunikatsioonisektoris klientide käitumise ennustamiseks, et pakkuda sihipäraseid ja asjakohaseid kampaaniaid.
Kindlustus Andmekaevandamine aitab kindlustusseltsidel oma tooteid kasumlikult hinnata ja uutele või olemasolevatele klientidele uusi pakkumisi reklaamida.
Käsitöö Andmekaevandamine aitab õpetajatel juurdepääsu õpilaste andmetele, ennustada saavutuste taset ja leida õpilasi või õpilaste rühmi, kes vajavad erilist tähelepanu. Näiteks õpilased, kes on matemaatika aines nõrgad.
tootmine Andmekaevandamise abil saavad tootjad ennustada tootmisvahendite kulumist. Nad saavad ette näha hooldust, mis aitab neil seisakuid minimeerida.
Pangandus Andmekaevandamine aitab finantssektoril saada ülevaadet tururiskidest ja hallata regulatiivset vastavust. See aitab pankadel tuvastada tõenäolisi maksehäireid, et otsustada, kas väljastada krediitkaarte, laene vms.
Jaekaubandus Andmekaeve tehnikad aitavad jaekaubanduskeskustel ja toidupoodidel tuvastada ja paigutada kõige müüdavamad tooted kõige tähelepanuväärsematele positsioonidele. See aitab kaupluste omanikel välja pakkuda pakkumisi, mis julgustavad kliente oma kulutusi suurendama.
Service Providers Teenusepakkujad, nagu mobiiltelefonide ja kommunaalteenuste tööstus, kasutavad andmekaevet, et ennustada põhjuseid, miks klient ettevõttest lahkub. Nad analüüsivad arvelduse üksikasju, klienditeeninduse suhtlust, ettevõttele esitatud kaebusi, et määrata igale kliendile tõenäosusskoor ja pakkuda stiimuleid.
E-kaubandus E-kaubanduse veebisaidid kasutavad andmete kaevandamist, et pakkuda oma veebisaitide kaudu rist- ja ülesmüüki. Üks kuulsamaid nimesid on Amazon, kes kasutavad andmekaevetehnikaid, et meelitada oma e-poodi rohkem kliente.
Super turud Andmekaevandamine võimaldab supermarketitel välja töötada reegleid, mis ennustavad, kas nende ostjad on tõenäoliselt rasedad. Ostuharjumuste hindamise abil saavad nad leida naiskliente, kes on suure tõenäosusega rasedad. Nad saavad hakata sihtima selliseid tooteid nagu beebipuuder, beebiseep, mähkmed jne.
Kuriteouurimine Andmekaevandamine aitab kuritegude uurimisasutustel paigutada politseitööjõudu (kus on kuritegu kõige tõenäolisem ja millal?), keda piiripunktis otsida jne.
Bioinformaatika Andmekaevandamine aitab kaevandada bioloogilisi andmeid tohututest bioloogias ja meditsiinis kogutud andmekogumitest.

KKK

Mitte päris. Teadmiste avastamine andmebaasides on kogu protsess alates valikust ja puhastamisest kuni tõlgendamiseni. Andmekaevandamine on selle sees mustrite leidmise samm, kuigi praktikas kasutatakse neid kahte nimetust nüüd sünonüümidena.

SQL näitekstracandmete kogumine, statistika mustri reaalsuse hindamiseks, üks keel, näiteks R või Pythonja ettevõtte valdkonna tundmine. Suhtlemine on sama oluline, sest tulemused peavad veenma mitte-tehnilisi sidusrühmi.

See on seaduslik, kui andmeid kogutakse ja kasutatakse seaduslikult. Sellised määrused nagu isikuandmete kaitse üldmäärus nõuavad seaduslikku alust, eesmärgi piiramist ja sageli anonüümseks muutmist, seega eemaldatakse isikut tuvastavad elemendid tavaliselt enne kaevandamise alustamist.

See lühendab kõige aeglasemaid samme. Tehisintellekti assistendid kirjutavad näidettracpäringuid, soovitada puhastusreegleid ja koostada sidusrühmadele mudeli kohta lihtsas keeles selgitusi. Analüütik sõnastab endiselt äriküsimuse ja valideerib iga tulemuse.

Jah, lähtepunktina. Kirjelda andmeid ja küsimust ning tehisintellekti assistent soovitab klassifitseerimist, klasterdamist või regressiooni ja selgitab, miks. Enne valikule toetumist kinnita see mõne teise valimiga.

Võta see postitus kokku järgmiselt: