Mis on suurandmed? Tüübid, omadused ja näited

⚡ Nutikas kokkuvõte

Suurandmed kirjeldavad nii suuri, mitmekesiseid ja kiiresti liikuvaid infokogusid, et tavalised andmebaasitööriistad ei suuda neid salvestada ega töödelda, mistõttu tekkis vajadus hajutatud platvormide ja uute analüüsimeetodite järele.

  • 🔘 Määratlus: Maht üksi ei tee andmeid suureks; keerukus ja kasvukiirus on sama olulised.
  • ☑️ Kolm tüüpi: Struktureeritud andmetel on fikseeritud vorming, struktureerimata andmetel puudub see ja poolstruktureeritud andmed asuvad nende kahe vahel.
  • Toimivad näited: Börsid, sotsiaalmeedia platvormid ja reaktiivmootorid toodavad iga päev terabaite uusi rekordeid.
  • 🧪 Omadused: Maht, mitmekesisus, kiirus ja varieeruvus on neli klassi, millele sageli lisanduvad tõepärasus ja väärtus.
  • 🛠️ Äriväärtus: Väline luure, kiirem klientide tagasiside analüüs, varasem riskide tuvastamine ja odavam lao mahalaadimine.
  • ⚠️ Skaala täna: Maailm loob nüüd iga päev umbes 402 miljonit terabaiti. track üle 200 zettabaidi eest aastal 2026.

Suurandmete tüübid ja omadused näidetega selgitatud

Enne suurandmete tutvustuse juurde asumist tuleb kõigepealt teada, mis andmed ise on.

Mis on andmed?

Andmed on suurused, tähemärgid või sümbolid, millega arvuti toiminguid teeb ja mida saab salvestada ja transmitedastatakse elektriliste signaalide kujul ja salvestatakse magnetilistele, optilistele või mehaanilistele salvestuskandjatele.

Nüüd vaatame suurandmete definitsiooni.

Mis on suured andmed?

Big andmed on tohutu andmekogum, mis kasvab aja jooksul eksponentsiaalselt. See on nii suur ja keerukas andmestik, et ükski traditsiooniline andmehaldustööriist ei suuda seda tõhusalt salvestada ega töödelda. Suurandmed on ikkagi andmed, kuid sellise suurusega, mis ületab tavapäraste tööriistade võimalused.

Allolev diagramm võrdleb seda definitsiooni tavaliste andmetega, mida organisatsioon juba haldab, seega on ulatuse hüpe selgelt nähtav.

Diagramm, mis defineerib suurandmeid ja kuidas need erinevad traditsiooniliste haldustööriistade abil töödeldavatest andmetest

Mis on suured andmed?

Mis on suurandmete näide?

Järgnevalt on toodud mõned suurandmete näited -

Börsi andmed

. New York Stock Exchange on näide suurandmetest, mis genereerivad umbes üks terabait uutest kaubandusandmetest päevas.

Börsi kauplemispõrand genereerib umbes ühe terabaidi kauplemisandmeid päevas

Sotsiaalmeedia

Statistika näitab seda 500+ terabaiti uutest andmetest siseneb sotsiaalmeedia saidi andmebaasidesse Facebook, iga päev. Need andmed genereeritakse peamiselt fotode ja videote üleslaadimise, sõnumivahetuse, kommentaaride jms kaudu.

Sotsiaalmeedia ikoonid, mis illustreerivad fotode, videote ja sõnumite andmete igapäevast mahtu

Reaktiivmootorid

Üksik Reaktiivmootor saab genereerida 10+ terabaiti andmetest sisse 30 minuti lennuajast. Paljude tuhandete lendudega päevas ulatub andmete genereerimine kuni paljudeni Petabaidid.

Reaktiivmootori andurid, mis toodavad kolmekümne lennuminutilise lennu jooksul üle kümne terabaiti telemeetriat

Need kolm arvu on allikate kaupa hetktõmmised perioodist, mil näited esmakordselt avaldati, ja need on sellest ajast alates ainult kasvanud. Praeguse mastaabipildi kohaselt loob maailm tervikuna nüüd umbes 402 miljonit terabaiti andmeid iga päev, pannes 2026. aasta kogusumma track rohkem kui 200 zettabaidi jaoks.

Suurandmete tüübid

Suurandmete tüübid on järgmised:

  1. Struktureeritud
  2. Struktureerimata
  3. Poolstruktureeritud

Struktureeritud

Kõiki andmeid, mida saab salvestada, millele saab juurde pääseda ja mida saab töödelda fikseeritud vormingus, nimetatakse struktureeritud andmeteks. Aja jooksul on arvutiteadus saavutanud arenduses suurt edu.ping tehnikad seda tüüpi andmetega töötamiseks, mille formaat on ette teada, ja neist väärtuse ammutamiseks. Nüüd seisame aga silmitsi probleemidega, kui selliste andmete maht kasvab tohutult, ulatudes tüüpiliselt mitme zettabaidini.

Kas sa tead? Üks zettabait on 1021 bytes, Mis on üks miljard terabaiti.

Neid numbreid vaadates on lihtne mõista, miks neile anti nimetus Big Data, ja ette kujutada väljakutseid, mis kaasnevad nende salvestamise ja töötlemisega.

Kas sa tead? Relatsioonandmebaaside haldussüsteemis talletatud andmed on üks näide 'struktureeritud' andmed.

Struktureeritud andmete näited

Andmebaasis olev tabel „Töötaja” on struktureeritud andmete näide. Igal real on samad viis veergu ja igal veerul on teadaolev tüüp, mis teeb andmete päringute tegemise lihtsaks.

Töötaja_ID Töötaja_nimi SUGU osakond Palk_laekides
2365 Rajesh Kulkarni Mees Turundus 650000
3398 Pratibha Joshi Naine admin 650000
7465 Shushil Roy Mees admin 500000
7500 Shubhojit Das Mees Turundus 500000
7699 Priya Sane Naine Turundus 550000

Struktureerimata

Kõik tundmatu vormi või struktuuriga andmed liigitatakse struktureerimata andmeteks. Lisaks tohutule suurusele tekitab struktureerimata andmete töötlemine väärtuse saamiseks mitmeid väljakutseid. Tüüpiline näide struktureerimata andmetest on heterogeenne andmeallikas, mis sisaldab lihtsate tekstifailide, piltide, videote jms kombinatsiooni. Tänapäeval on organisatsioonidel saadaval palju andmeid, kuid kahjuks ei tea nad, kuidas neist väärtust ammutada, kuna need andmed on töötlemata ehk struktureerimata vormingus.

Struktureerimata andmete näited

Funktsiooni ' tagastatud väljundGoogle „Otsing” on struktureerimata: sama päring tagastab lehti, pilte, koodilõike ja linke, millel puudub ühine skeem.

Google otsingutulemuste leht kui näide struktureerimata andmetest, mis sisaldavad segatud teksti, linke ja pilte

Näide struktureerimata andmetest

Poolstruktureeritud

Poolstruktureeritud andmed võivad sisaldada mõlemat ülaltoodud vormi. Need näevad välja struktureeritud, kuid neid ei defineeri formaalne skeem, näiteks tabeli definitsioon relatsioonilises andmebaasis. DB-süsteemidLevinud näide poolstruktureeritud andmetest on XML-failis esitatud andmed. JSON-dokumendid ja võtme-väärtuse paaridega logiread kuuluvad samasse kategooriasse.

Poolstruktureeritud andmete näited

XML-failis salvestatud isikuandmed-

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Andmete kasv aastate jooksul

Allolev diagramm tracKuidas on struktureeritud ja struktureerimata andmete segu muutunud, kuna kogumaht on kasvanud.

Andmete kasvu diagramm aastate jooksul, mis näitab, et struktureerimata andmed edestavad struktureeritud andmeid

Andmete kasv aastate jooksul

Pange tähele, et veebirakendus Struktureerimata andmed koosnevad logifailidest, tehinguajaloo failidest jne. OLTP-süsteemid on loodud töötama struktureeritud andmetega, kusjuures andmed salvestatakse seostes (tabelites).

Suurandmete omadused

Suurandmeid saab kirjeldada järgmiste omadustega:

  • maht
  • Sort
  • Kiirus
  • Varieeruvus

(i) maht – Nimetus suurandmed ise on seotud tohutu suurusega. Andmete maht mängib väga olulist rolli nendest saadava väärtuse määramisel. Samuti sõltub see, kas konkreetset andmekogumit saab tegelikult suurandmeteks pidada või mitte, selle mahust. Seega "Köide" on üks omadus, mida tuleb suurandmete lahendustega tegelemisel arvestada.

(ii) sort – Suurandmete järgmine aspekt on see sort.

Mitmekesisus viitab heterogeensetele allikatele ja andmete olemusele, nii struktureeritud kui ka struktureerimata andmetele. Varem olid enamik rakendusi ainsad andmeallikad, mida arvutustabelid ja andmebaasid arvesse võtsid. Tänapäeval arvestatakse analüüsirakendustes ka andmetega e-kirjade, fotode, videote, jälgimisseadmete, PDF-ide, heli jms kujul. See struktureerimata andmete mitmekesisus tekitab teatud probleeme andmete salvestamisel, kaevandamisel ja analüüsimisel.

iii) kiirus – Mõiste 'kiirus' viitab andmete genereerimise kiirusele. See, kui kiiresti andmeid genereeritakse ja töödeldakse nõudluse rahuldamiseks, määrab andmete tegeliku potentsiaali.

Suurandmete kiirus on seotud kiirusega, millega andmed voolavad sisse sellistest allikatest nagu äriprotsessid, rakenduste logid, võrgud, sotsiaalmeedia saidid, andurid, liikuv seadmed jne. Andmevoog on tohutu ja pidev.

(iv) varieeruvus – See viitab ebajärjekindlusele, mida andmed mõnikord võivad näidata, takistades seega andmete tõhusat käsitlemist ja haldamist.

Tänapäeval lisatakse sellele loendile tavaliselt veel kaks omadust, mis moodustavad laialdaselt tsiteeritud „viis V-d”:

  • tõepärasus – kui usaldusväärsed ja täpsed andmed on. Topeltkirjed, andurite triiv ja puuduvad väljad vähendavad kõik tõesust ning ükski andmemaht seda ei kompenseeri.
  • Väärtus – kui palju andmed pärast analüüsimist tegelikult väärt on. Andmed, millest otsust ei tehta, lisavad ainult salvestuskulusid.

Suurandmete töötlemise eelised

Suurandmete töötlemise võimalus andmebaasihaldussüsteemis pakub mitmeid eeliseid, näiteks:

Ettevõtted saavad otsuste tegemisel kasutada välist luureteavet

Juurdepääs sotsiaalandmetele aadressilt otsingumootorid ja sellised saidid nagu Facebook ja X (endine Twitter) võimaldavad organisatsioonidel oma äristrateegiaid täiustada.

Täiustatud klienditeenindus

Traditsioonilisi klientide tagasiside süsteeme asendavad uued süsteemid, mis on loodud suurandmete tehnoloogiate abil. Nendes uutes süsteemides kasutatakse suurandmete ja loomuliku keele töötlemise tehnoloogiaid tarbijate vastuste lugemiseks ja hindamiseks.

Toodete ja teenuste riski varajane tuvastamine

Tehingukirjete, andurite näitude ja tugiteenuse piletite pidev analüüs toob esile väikesed vead, pettusemustrid ja teenuse tõrked, selle asemel, et oodata igakuist aruannet.

Parem Operarahvusvaheline efektiivsus

Suurandmete tehnoloogiaid saab kasutada uute andmete jaoks ettevalmistava ala või sihtkoha loomiseks enne, kui tehakse kindlaks, mis sinna teisaldada tuleks. andmekogusLisaks aitab suurandmete tehnoloogiate ja andmelao selline integreerimine organisatsioonil harva kasutatavate andmete koormuse vähendamisest vabaneda.

KKK

Praeguste hinnangute kohaselt umbes 402 miljonit terabaiti päevas, mis asetab 2026. aasta aastase kogumahu üle 200 zettabaidi. See arv kasvab pidevalt, kuna video-, andurite telemeetria- ja rakenduste logid kasvavad kiiremini kui tehingute andmed.

Algorithms leida mustreid miljonite kirjete hulgast, mida ükski analüütik ei suudaks käsitsi üle vaadata, ja seejärel hinnata nende mustrite põhjal uusi kirjeid. Suuremad ja mitmekesisemad treeningkomplektid parandavad tavaliselt täpsust, mistõttu need kaks valdkonda kokku kasvasid.

See koostab rutiinse töö hästi: Spark teisendused, skeemidefinitsioonid, SQL-liitmised ja konnektorite konfigureerimine. RevVaadake väljundit hoolikalt, sest genereeritud torujuhtmed ignoreerivad sageli partitsioonimist, andmetüüpe ja maksumust, mis on koht, kus päris torujuhtmed ebaõnnestuvad.

Hajutatud salvestusruum, näiteks HDFS või pilveobjektide salvestusruumid, töötlemismootorid, näiteks Spark ja Flink, voogedastussüsteemid nagu Kafka ja päringukihid nagu MesilaspereHallatud pilveladud hõlmavad nüüd paljusid samu töid.

Halb andmete kvaliteet, ebaselged omandiõiguse, salvestus- ja arvutuskulud ning hajutatud süsteemide haldamiseks võimeliste inseneride puudus. Enamik ebaõnnestunud projekte takerdub pigem juhtimise ja ebaselgete äriküsimuste kui tehnoloogia tõttu.

Sellised reeglid nagu isikuandmete kaitse üldmäärus piiravad seda, milliseid isikuandmeid võib koguda, kui kaua neid võib säilitada ja kus neid võib säilitada. Meeskonnad vastavad nõusolekuga. trackuningas, säilituspoliitikad, pseudonümiseerimine ja auditilogid, mis on torujuhtmesse sisse ehitatud.

Andmejärv salvestab mis tahes vormingus toorfaile ja rakendab struktuuri andmete lugemisel. Andmeladu salvestab puhastatud ja modelleeritud tabeleid ning rakendab struktuuri andmete kirjutamisel, mis muudab päringud kiiremaks, kuid laadimise aeglasemaks.

Esmalt SQL, seejärel programmeerimiskeel, näiteks Python või Scala, hajutatud töötlemine koos Spark, pilveplatvorm ja piisavalt andmemodelleerimist tabelite mõistlikuks kujundamiseks. Suhtlus on sama oluline, sest tulemused peavad veenma mitte-tehnilisi lugejaid.

Võta see postitus kokku järgmiselt: