Mitä on Big Data? Tyypit, ominaisuudet ja esimerkit
⚡ Älykäs yhteenveto
Big data kuvaa niin suuria, vaihtelevia ja nopeasti liikkuvia tietokokoelmia, että tavalliset tietokantatyökalut eivät pysty tallentamaan tai käsittelemään niitä, minkä vuoksi hajautetut alustat ja uudet analyysimenetelmät tulivat välttämättömiksi.
Ennen kuin siirryt Big Datan johdantoon, sinun on ensin tiedettävä, mitä data itsessään on.
Mikä on Data?
Data on määriä, merkkejä tai symboleja, joille tietokone suorittaa toimintoja ja jotka voidaan tallentaa ja transmitsähköisten signaalien muodossa ja tallennettuna magneettiselle, optiselle tai mekaaniselle tallennusvälineelle.
Katsotaanpa nyt Big Datan määritelmää.
Mikä on Big Data?
Big Data on valtavan kokoinen kokoelma dataa, joka kasvaa eksponentiaalisesti ajan myötä. Se on niin suurta ja monimutkaista dataa, ettei mikään perinteinen tiedonhallintatyökalu pysty tallentamaan tai käsittelemään sitä tehokkaasti. Big Data on edelleen dataa, mutta kooltaan se ylittää tavanomaisten työkalujen rajat.
Alla oleva kaavio vertaa tätä määritelmää organisaation jo käsittelemään tavanomaiseen dataan, joten mittakaavan muutos on helppo nähdä.
Mikä on Big Data?
Mikä on esimerkki Big Datasta?
Seuraavassa on joitain esimerkkejä Big Datasta -
Pörssitiedot
New York Stock Exchange on esimerkki Big Datasta, joka tuottaa noin yksi teratavu uutta kauppadataa päivässä.
Sosiaalinen media
Tilasto osoittaa sen 500+ teratavua uudesta tiedosta pääsee sosiaalisen median tietokantoihin Facebook, joka päivä. Nämä tiedot syntyvät pääasiassa kuvien ja videoiden latauksista, viestien vaihdosta, kommenteista jne.
Suihkumoottorit
Yksi Suihkumoottori voi tuottaa 10+ teratavua tiedoista sisään 30 minuuttia lentoajasta. Monilla tuhansilla lentoilla päivässä tiedon tuottaminen ulottuu jopa moniin Petabyyttiä.
Nämä kolme lukua ovat lähdekohtaisia otoksia ajalta, jolloin esimerkit julkaistiin ensimmäisen kerran, ja ne ovat vain kasvaneet siitä lähtien. Nykyisen mittakaavan mukaan maailma kokonaisuudessaan luo nyt suunnilleen 402 miljoonaa teratavua dataa joka päivä, jolloin vuoden 2026 vuotuinen kokonaissumma on track yli 200 zettatavua.
Big Datan tyypit
Seuraavat ovat Big Datan tyypit:
- Strukturoidut
- Rakentamaton
- Puolirakenteinen
Strukturoidut
Kaikkia tietoja, joita voidaan tallentaa, käyttää ja käsitellä kiinteässä muodossa, kutsutaan 'strukturoiduksi' tiedoksi. Ajan myötä tietojenkäsittelytiede on saavuttanut suurta menestystä kehitystyössä.ping tekniikoita tällaisen datan käsittelyyn, kun muoto on etukäteen hyvin tiedossa, ja siitä hyödyn saamiseen. Nyt kohtaamme kuitenkin ongelmia, kun tällaisen datan koko kasvaa valtavasti, tyypillisen koon ollessa useita zettatavuja.
Tiedätkö? Yksi zettatavu on 1021 tavua, Joka on miljardi teratavua.
Näitä lukuja tarkastelemalla on helppo ymmärtää, miksi Big Dataa kutsutaan nimellä Big Data, ja kuvitella sen tallentamiseen ja käsittelyyn liittyvät haasteet.
Tiedätkö? Relaatiotietokannan hallintajärjestelmään tallennettu data on yksi esimerkki 'rakenteinen' tietoja.
Esimerkkejä strukturoiduista tiedoista
Tietokannan 'Työntekijä'-taulukko on esimerkki jäsennellystä datasta. Jokaisella rivillä on samat viisi saraketta, ja jokaisella sarakkeella on tunnettu tyyppi, mikä tekee datasta helposti haettavan.
| Henkilöstökortti | Työntekijän nimi | Sukupuoli | osasto | Palkka_lakeissa |
|---|---|---|---|---|
| 2365 | Rajesh Kulkarni | Mies | Rahoittaa | 650000 |
| 3398 | Pratibha Joshi | Nainen | admin | 650000 |
| 7465 | Shushil Roy | Mies | admin | 500000 |
| 7500 | Shubhojit Das | Mies | Rahoittaa | 500000 |
| 7699 | Priya Sane | Nainen | Rahoittaa | 550000 |
Rakentamaton
Kaikki data, jolla on tuntematon muoto tai rakenne, luokitellaan strukturoimattomaksi dataksi. Valtavan koon lisäksi strukturoimaton data aiheuttaa useita haasteita sen käsittelyssä arvon saamiseksi. Tyypillinen esimerkki strukturoimattomasta datasta on heterogeeninen tietolähde, joka sisältää yhdistelmän yksinkertaisia tekstitiedostoja, kuvia, videoita jne. Nykyään organisaatioilla on käytettävissään runsaasti dataa, mutta valitettavasti ne eivät tiedä, miten siitä saadaan irti arvoa, koska tämä data on raaka- eli strukturoimattomassa muodossa.
Esimerkkejä strukturoimattomasta datasta
Lähtö, jonka palauttaa 'Google Haku on jäsentämätön: sama kysely palauttaa sivuja, kuvia, katkelmia ja linkkejä, joilla ei ole yhteistä kaavaa taustalla.
Esimerkki strukturoimattomasta datasta
Puolirakenteinen
Puolistrukturoitu data voi sisältää molemmat yllä mainitut muodot. Se näyttää strukturoidulta, mutta sitä ei ole määritelty muodollisella skeemalla, kuten relaatiotiedon taulukkomääritelmällä. DBMSYleinen esimerkki puolistrukturoidusta datasta on XML-tiedostossa esitetty data. JSON-dokumentit ja avain-arvo-pareja sisältävät lokirivit kuuluvat samaan kategoriaan.
Esimerkkejä puolistrukturoidusta datasta
XML-tiedostoon tallennetut henkilötiedot
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
Datan kasvu vuosien varrella
Alla oleva kaavio tracmiten strukturoidun ja strukturoimattoman datan yhdistelmä on muuttunut kokonaismäärän kasvaessa.
Datan kasvu vuosien varrella
Huomaa, että Web-sovellus Rakenteeton data koostuu lokitiedostoista, tapahtumahistoriatiedostoista jne. OLTP-järjestelmät on rakennettu toimimaan strukturoidun datan kanssa, jossa data tallennetaan relaatioihin (taulukoihin).
Big Datan ominaisuudet
Big Dataa voidaan kuvata seuraavilla ominaisuuksilla:
- tilavuus
- lajike
- Nopeus
- vaihtelevuus
(i) määrä – Nimi Big Data itsessään liittyy valtavaan kokoon. Datan koolla on erittäin tärkeä rooli siitä saatavan arvon määrittämisessä. Myös se, voidaanko tiettyä datajoukkoa pitää Big Datana vai ei, riippuu sen määrästä. Näin ollen 'Äänenvoimakkuus' on yksi ominaisuus, joka on otettava huomioon käsiteltäessä Big Data -ratkaisuja.
(ii) lajike – Big Datan seuraava puoli on sen lajike.
Monimuotoisuus viittaa heterogeenisiin lähteisiin ja datan luonteeseen, sekä strukturoituun että strukturoimattomaan. Aikaisemmin laskentataulukot ja tietokannat olivat ainoat datalähteet, joita useimmat sovellukset ottivat huomioon. Nykyään analyysisovelluksissa otetaan huomioon myös sähköpostien, valokuvien, videoiden, valvontalaitteiden, PDF-tiedostojen, äänitiedostojen jne. muodossa oleva data. Tämä strukturoimattoman datan monimuotoisuus aiheuttaa tiettyjä ongelmia datan tallentamiseen, louhintaan ja analysointiin.
(iii) Nopeus – Termi 'nopeus' viittaa datan generoinnin nopeuteen. Se, kuinka nopeasti data generoidaan ja käsitellään kysynnän tyydyttämiseksi, määrittää datan todellisen potentiaalin.
Big Datan nopeus käsittelee nopeutta, jolla data virtaa lähteistä, kuten liiketoimintaprosesseista, sovelluslokeista, verkostoista, sosiaalisen median sivustoilta, sensoreista, mobile laitteet jne. Tietovirta on massiivinen ja jatkuva.
(iv) Vaihtuvuus – Tämä viittaa epäjohdonmukaisuuteen, jonka tiedot voivat toisinaan osoittaa, mikä vaikeuttaa tietojen tehokasta käsittelyä ja hallintaa.
Nykyään tuohon luetteloon lisätään yleisesti kaksi muuta ominaisuutta, jotka muodostavat laajalti siteeratun viisi V:tä:
- totuudenmukaisuus – kuinka luotettavaa ja tarkkaa data on. Kaksoiskappaleet, anturien poikkeamat ja puuttuvat kentät heikentävät todenmukaisuutta, eikä mikään tietomäärä korvaa tätä.
- Arvo – mitä data todellisuudessa on arvoa analysoinnin jälkeen. Data, josta ei koskaan tehdä päätöstä, lisää vain tallennuskustannuksia.
Big Datan käsittelyn edut
Mahdollisuus käsitellä Big Dataa tietokannan hallintajärjestelmässä tuo useita etuja, kuten
Yritykset voivat hyödyntää ulkopuolista tiedustelutietoa päätöksenteossa
Pääsy sosiaalisiin tietoihin osoitteesta Hakukoneet ja sivustot, kuten Facebook ja X (entinen Twitter), antavat organisaatioille mahdollisuuden hienosäätää liiketoimintastrategioitaan.
Parempi asiakaspalvelu
Perinteiset asiakaspalautejärjestelmät korvautuvat uusilla järjestelmillä, jotka on suunniteltu Big Data -teknologioilla. Näissä uusissa järjestelmissä Big Dataa ja luonnollisen kielen käsittelyteknologioita käytetään kuluttajavastausten lukemiseen ja arviointiin.
Tuotteisiin ja palveluihin kohdistuvien riskien varhainen tunnistaminen
Jatkuvasti analysoimalla tapahtumatietoja, anturilukemia ja tukipyyntöjä, havaitaan virheitä, petosmalleja ja palveluhäiriöitä jo niiden ollessa vielä pieniä sen sijaan, että odotettaisiin kuukausittaista raporttia niiden paljastamiseksi.
Paremmin Operanational Efficiency
Big Data -teknologioita voidaan käyttää luomaan uuden datan valmistelualue tai laskeutumisvyöhyke ennen kuin tunnistetaan, mitä sinne siirretään. tietovarastoLisäksi Big Data -teknologioiden ja tietovaraston integrointi auttaa organisaatiota siirtämään harvoin käytettyä dataa.






