Mis on suurandmed? Tüübid, omadused ja näited
⚡ Nutikas kokkuvõte
Suurandmed kirjeldavad nii suuri, mitmekesiseid ja kiiresti liikuvaid infokogusid, et tavalised andmebaasitööriistad ei suuda neid salvestada ega töödelda, mistõttu tekkis vajadus hajutatud platvormide ja uute analüüsimeetodite järele.

Enne suurandmete tutvustuse juurde asumist tuleb kõigepealt teada, mis andmed ise on.
Mis on andmed?
Andmed on suurused, tähemärgid või sümbolid, millega arvuti toiminguid teeb ja mida saab salvestada ja transmitedastatakse elektriliste signaalide kujul ja salvestatakse magnetilistele, optilistele või mehaanilistele salvestuskandjatele.
Nüüd vaatame suurandmete definitsiooni.
Mis on suured andmed?
Big andmed on tohutu andmekogum, mis kasvab aja jooksul eksponentsiaalselt. See on nii suur ja keerukas andmestik, et ükski traditsiooniline andmehaldustööriist ei suuda seda tõhusalt salvestada ega töödelda. Suurandmed on ikkagi andmed, kuid sellise suurusega, mis ületab tavapäraste tööriistade võimalused.
Allolev diagramm võrdleb seda definitsiooni tavaliste andmetega, mida organisatsioon juba haldab, seega on ulatuse hüpe selgelt nähtav.
Mis on suured andmed?
Mis on suurandmete näide?
Järgnevalt on toodud mõned suurandmete näited -
Börsi andmed
. New York Stock Exchange on näide suurandmetest, mis genereerivad umbes üks terabait uutest kaubandusandmetest päevas.
Sotsiaalmeedia
Statistika näitab seda 500+ terabaiti uutest andmetest siseneb sotsiaalmeedia saidi andmebaasidesse Facebook, iga päev. Need andmed genereeritakse peamiselt fotode ja videote üleslaadimise, sõnumivahetuse, kommentaaride jms kaudu.
Reaktiivmootorid
Üksik Reaktiivmootor saab genereerida 10+ terabaiti andmetest sisse 30 minuti lennuajast. Paljude tuhandete lendudega päevas ulatub andmete genereerimine kuni paljudeni Petabaidid.
Need kolm arvu on allikate kaupa hetktõmmised perioodist, mil näited esmakordselt avaldati, ja need on sellest ajast alates ainult kasvanud. Praeguse mastaabipildi kohaselt loob maailm tervikuna nüüd umbes 402 miljonit terabaiti andmeid iga päev, pannes 2026. aasta kogusumma track rohkem kui 200 zettabaidi jaoks.
Suurandmete tüübid
Suurandmete tüübid on järgmised:
- Struktureeritud
- Struktureerimata
- Poolstruktureeritud
Struktureeritud
Kõiki andmeid, mida saab salvestada, millele saab juurde pääseda ja mida saab töödelda fikseeritud vormingus, nimetatakse struktureeritud andmeteks. Aja jooksul on arvutiteadus saavutanud arenduses suurt edu.ping tehnikad seda tüüpi andmetega töötamiseks, mille formaat on ette teada, ja neist väärtuse ammutamiseks. Nüüd seisame aga silmitsi probleemidega, kui selliste andmete maht kasvab tohutult, ulatudes tüüpiliselt mitme zettabaidini.
Kas sa tead? Üks zettabait on 1021 bytes, Mis on üks miljard terabaiti.
Neid numbreid vaadates on lihtne mõista, miks neile anti nimetus Big Data, ja ette kujutada väljakutseid, mis kaasnevad nende salvestamise ja töötlemisega.
Kas sa tead? Relatsioonandmebaaside haldussüsteemis talletatud andmed on üks näide 'struktureeritud' andmed.
Struktureeritud andmete näited
Andmebaasis olev tabel „Töötaja” on struktureeritud andmete näide. Igal real on samad viis veergu ja igal veerul on teadaolev tüüp, mis teeb andmete päringute tegemise lihtsaks.
| Töötaja_ID | Töötaja_nimi | SUGU | osakond | Palk_laekides |
|---|---|---|---|---|
| 2365 | Rajesh Kulkarni | Mees | Turundus | 650000 |
| 3398 | Pratibha Joshi | Naine | admin | 650000 |
| 7465 | Shushil Roy | Mees | admin | 500000 |
| 7500 | Shubhojit Das | Mees | Turundus | 500000 |
| 7699 | Priya Sane | Naine | Turundus | 550000 |
Struktureerimata
Kõik tundmatu vormi või struktuuriga andmed liigitatakse struktureerimata andmeteks. Lisaks tohutule suurusele tekitab struktureerimata andmete töötlemine väärtuse saamiseks mitmeid väljakutseid. Tüüpiline näide struktureerimata andmetest on heterogeenne andmeallikas, mis sisaldab lihtsate tekstifailide, piltide, videote jms kombinatsiooni. Tänapäeval on organisatsioonidel saadaval palju andmeid, kuid kahjuks ei tea nad, kuidas neist väärtust ammutada, kuna need andmed on töötlemata ehk struktureerimata vormingus.
Struktureerimata andmete näited
Funktsiooni ' tagastatud väljundGoogle „Otsing” on struktureerimata: sama päring tagastab lehti, pilte, koodilõike ja linke, millel puudub ühine skeem.
Näide struktureerimata andmetest
Poolstruktureeritud
Poolstruktureeritud andmed võivad sisaldada mõlemat ülaltoodud vormi. Need näevad välja struktureeritud, kuid neid ei defineeri formaalne skeem, näiteks tabeli definitsioon relatsioonilises andmebaasis. DB-süsteemidLevinud näide poolstruktureeritud andmetest on XML-failis esitatud andmed. JSON-dokumendid ja võtme-väärtuse paaridega logiread kuuluvad samasse kategooriasse.
Poolstruktureeritud andmete näited
XML-failis salvestatud isikuandmed-
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
Andmete kasv aastate jooksul
Allolev diagramm tracKuidas on struktureeritud ja struktureerimata andmete segu muutunud, kuna kogumaht on kasvanud.
Andmete kasv aastate jooksul
Pange tähele, et veebirakendus Struktureerimata andmed koosnevad logifailidest, tehinguajaloo failidest jne. OLTP-süsteemid on loodud töötama struktureeritud andmetega, kusjuures andmed salvestatakse seostes (tabelites).
Suurandmete omadused
Suurandmeid saab kirjeldada järgmiste omadustega:
- maht
- Sort
- Kiirus
- Varieeruvus
(i) maht – Nimetus suurandmed ise on seotud tohutu suurusega. Andmete maht mängib väga olulist rolli nendest saadava väärtuse määramisel. Samuti sõltub see, kas konkreetset andmekogumit saab tegelikult suurandmeteks pidada või mitte, selle mahust. Seega "Köide" on üks omadus, mida tuleb suurandmete lahendustega tegelemisel arvestada.
(ii) sort – Suurandmete järgmine aspekt on see sort.
Mitmekesisus viitab heterogeensetele allikatele ja andmete olemusele, nii struktureeritud kui ka struktureerimata andmetele. Varem olid enamik rakendusi ainsad andmeallikad, mida arvutustabelid ja andmebaasid arvesse võtsid. Tänapäeval arvestatakse analüüsirakendustes ka andmetega e-kirjade, fotode, videote, jälgimisseadmete, PDF-ide, heli jms kujul. See struktureerimata andmete mitmekesisus tekitab teatud probleeme andmete salvestamisel, kaevandamisel ja analüüsimisel.
iii) kiirus – Mõiste 'kiirus' viitab andmete genereerimise kiirusele. See, kui kiiresti andmeid genereeritakse ja töödeldakse nõudluse rahuldamiseks, määrab andmete tegeliku potentsiaali.
Suurandmete kiirus on seotud kiirusega, millega andmed voolavad sisse sellistest allikatest nagu äriprotsessid, rakenduste logid, võrgud, sotsiaalmeedia saidid, andurid, liikuv seadmed jne. Andmevoog on tohutu ja pidev.
(iv) varieeruvus – See viitab ebajärjekindlusele, mida andmed mõnikord võivad näidata, takistades seega andmete tõhusat käsitlemist ja haldamist.
Tänapäeval lisatakse sellele loendile tavaliselt veel kaks omadust, mis moodustavad laialdaselt tsiteeritud „viis V-d”:
- tõepärasus – kui usaldusväärsed ja täpsed andmed on. Topeltkirjed, andurite triiv ja puuduvad väljad vähendavad kõik tõesust ning ükski andmemaht seda ei kompenseeri.
- Väärtus – kui palju andmed pärast analüüsimist tegelikult väärt on. Andmed, millest otsust ei tehta, lisavad ainult salvestuskulusid.
Suurandmete töötlemise eelised
Suurandmete töötlemise võimalus andmebaasihaldussüsteemis pakub mitmeid eeliseid, näiteks:
Ettevõtted saavad otsuste tegemisel kasutada välist luureteavet
Juurdepääs sotsiaalandmetele aadressilt otsingumootorid ja sellised saidid nagu Facebook ja X (endine Twitter) võimaldavad organisatsioonidel oma äristrateegiaid täiustada.
Täiustatud klienditeenindus
Traditsioonilisi klientide tagasiside süsteeme asendavad uued süsteemid, mis on loodud suurandmete tehnoloogiate abil. Nendes uutes süsteemides kasutatakse suurandmete ja loomuliku keele töötlemise tehnoloogiaid tarbijate vastuste lugemiseks ja hindamiseks.
Toodete ja teenuste riski varajane tuvastamine
Tehingukirjete, andurite näitude ja tugiteenuse piletite pidev analüüs toob esile väikesed vead, pettusemustrid ja teenuse tõrked, selle asemel, et oodata igakuist aruannet.
Parem Operarahvusvaheline efektiivsus
Suurandmete tehnoloogiaid saab kasutada uute andmete jaoks ettevalmistava ala või sihtkoha loomiseks enne, kui tehakse kindlaks, mis sinna teisaldada tuleks. andmekogusLisaks aitab suurandmete tehnoloogiate ja andmelao selline integreerimine organisatsioonil harva kasutatavate andmete koormuse vähendamisest vabaneda.






