Mitä on Big Data? Tyypit, ominaisuudet ja esimerkit

⚡ Älykäs yhteenveto

Big data kuvaa niin suuria, vaihtelevia ja nopeasti liikkuvia tietokokoelmia, että tavalliset tietokantatyökalut eivät pysty tallentamaan tai käsittelemään niitä, minkä vuoksi hajautetut alustat ja uudet analyysimenetelmät tulivat välttämättömiksi.

  • 🔘 Määritelmä: Pelkkä datamäärä ei tee siitä suurta; monimutkaisuus ja kasvuvauhti ovat aivan yhtä tärkeitä.
  • ☑️ Kolme tyyppiä: Strukturoidulla datalla on kiinteä muoto, strukturoimattomalla datalla ei ole muotoa, ja puolistrukturoitu data sijaitsee näiden kahden välissä.
  • Toimivia esimerkkejä: Pörssit, sosiaalisen median alustat ja suihkumoottorit tuottavat kukin teratavuittain uusia ennätyksiä päivittäin.
  • 🧪 Ominaisuudet: Määrä, monipuolisuus, nopeus ja vaihtelevuus ovat klassisia neljää, joihin usein lisätään totuudenmukaisuus ja arvo.
  • 🛠️ Yritysarvo: Ulkoinen tiedustelu, nopeampi asiakaspalautteen analysointi, riskien varhempi havaitseminen ja halvempi varastopurku.
  • ⚠️ Skaala tänään: Maailmassa tuotetaan nykyään noin 402 miljoonaa teratavua tietoa päivittäin. track yli 200 zettatavua vuonna 2026.

Big Data -tyypit ja ominaisuudet selitettynä esimerkein

Ennen kuin siirryt Big Datan johdantoon, sinun on ensin tiedettävä, mitä data itsessään on.

Mikä on Data?

Data on määriä, merkkejä tai symboleja, joille tietokone suorittaa toimintoja ja jotka voidaan tallentaa ja transmitsähköisten signaalien muodossa ja tallennettuna magneettiselle, optiselle tai mekaaniselle tallennusvälineelle.

Katsotaanpa nyt Big Datan määritelmää.

Mikä on Big Data?

Big Data on valtavan kokoinen kokoelma dataa, joka kasvaa eksponentiaalisesti ajan myötä. Se on niin suurta ja monimutkaista dataa, ettei mikään perinteinen tiedonhallintatyökalu pysty tallentamaan tai käsittelemään sitä tehokkaasti. Big Data on edelleen dataa, mutta kooltaan se ylittää tavanomaisten työkalujen rajat.

Alla oleva kaavio vertaa tätä määritelmää organisaation jo käsittelemään tavanomaiseen dataan, joten mittakaavan muutos on helppo nähdä.

Kaavio, joka määrittelee Big Datan ja miten se eroaa perinteisten hallintatyökalujen käsittelemästä datasta

Mikä on Big Data?

Mikä on esimerkki Big Datasta?

Seuraavassa on joitain esimerkkejä Big Datasta -

Pörssitiedot

New York Stock Exchange on esimerkki Big Datasta, joka tuottaa noin yksi teratavu uutta kauppadataa päivässä.

Pörssin kaupankäyntisali tuottaa noin teratavun verran kaupankäyntidataa päivässä

Sosiaalinen media

Tilasto osoittaa sen 500+ teratavua uudesta tiedosta pääsee sosiaalisen median tietokantoihin Facebook, joka päivä. Nämä tiedot syntyvät pääasiassa kuvien ja videoiden latauksista, viestien vaihdosta, kommenteista jne.

Sosiaalisen median kuvakkeet, jotka kuvaavat päivittäistä valokuva-, video- ja viestidatan määrää

Suihkumoottorit

Yksi Suihkumoottori voi tuottaa 10+ teratavua tiedoista sisään 30 minuuttia lentoajasta. Monilla tuhansilla lentoilla päivässä tiedon tuottaminen ulottuu jopa moniin Petabyyttiä.

Suihkumoottorin anturit tuottavat yli kymmenen teratavua telemetriaa 30 minuutin lennon aikana

Nämä kolme lukua ovat lähdekohtaisia ​​​​otoksia ajalta, jolloin esimerkit julkaistiin ensimmäisen kerran, ja ne ovat vain kasvaneet siitä lähtien. Nykyisen mittakaavan mukaan maailma kokonaisuudessaan luo nyt suunnilleen 402 miljoonaa teratavua dataa joka päivä, jolloin vuoden 2026 vuotuinen kokonaissumma on track yli 200 zettatavua.

Big Datan tyypit

Seuraavat ovat Big Datan tyypit:

  1. Strukturoidut
  2. Rakentamaton
  3. Puolirakenteinen

Strukturoidut

Kaikkia tietoja, joita voidaan tallentaa, käyttää ja käsitellä kiinteässä muodossa, kutsutaan 'strukturoiduksi' tiedoksi. Ajan myötä tietojenkäsittelytiede on saavuttanut suurta menestystä kehitystyössä.ping tekniikoita tällaisen datan käsittelyyn, kun muoto on etukäteen hyvin tiedossa, ja siitä hyödyn saamiseen. Nyt kohtaamme kuitenkin ongelmia, kun tällaisen datan koko kasvaa valtavasti, tyypillisen koon ollessa useita zettatavuja.

Tiedätkö? Yksi zettatavu on 1021 tavua, Joka on miljardi teratavua.

Näitä lukuja tarkastelemalla on helppo ymmärtää, miksi Big Dataa kutsutaan nimellä Big Data, ja kuvitella sen tallentamiseen ja käsittelyyn liittyvät haasteet.

Tiedätkö? Relaatiotietokannan hallintajärjestelmään tallennettu data on yksi esimerkki 'rakenteinen' tietoja.

Esimerkkejä strukturoiduista tiedoista

Tietokannan 'Työntekijä'-taulukko on esimerkki jäsennellystä datasta. Jokaisella rivillä on samat viisi saraketta, ja jokaisella sarakkeella on tunnettu tyyppi, mikä tekee datasta helposti haettavan.

Henkilöstökortti Työntekijän nimi Sukupuoli osasto Palkka_lakeissa
2365 Rajesh Kulkarni Mies Rahoittaa 650000
3398 Pratibha Joshi Nainen admin 650000
7465 Shushil Roy Mies admin 500000
7500 Shubhojit Das Mies Rahoittaa 500000
7699 Priya Sane Nainen Rahoittaa 550000

Rakentamaton

Kaikki data, jolla on tuntematon muoto tai rakenne, luokitellaan strukturoimattomaksi dataksi. Valtavan koon lisäksi strukturoimaton data aiheuttaa useita haasteita sen käsittelyssä arvon saamiseksi. Tyypillinen esimerkki strukturoimattomasta datasta on heterogeeninen tietolähde, joka sisältää yhdistelmän yksinkertaisia ​​tekstitiedostoja, kuvia, videoita jne. Nykyään organisaatioilla on käytettävissään runsaasti dataa, mutta valitettavasti ne eivät tiedä, miten siitä saadaan irti arvoa, koska tämä data on raaka- eli strukturoimattomassa muodossa.

Esimerkkejä strukturoimattomasta datasta

Lähtö, jonka palauttaa 'Google Haku on jäsentämätön: sama kysely palauttaa sivuja, kuvia, katkelmia ja linkkejä, joilla ei ole yhteistä kaavaa taustalla.

Google hakutulossivu esimerkkinä strukturoimattomasta datasta, jossa on sekoitettua tekstiä, linkkejä ja kuvia

Esimerkki strukturoimattomasta datasta

Puolirakenteinen

Puolistrukturoitu data voi sisältää molemmat yllä mainitut muodot. Se näyttää strukturoidulta, mutta sitä ei ole määritelty muodollisella skeemalla, kuten relaatiotiedon taulukkomääritelmällä. DBMSYleinen esimerkki puolistrukturoidusta datasta on XML-tiedostossa esitetty data. JSON-dokumentit ja avain-arvo-pareja sisältävät lokirivit kuuluvat samaan kategoriaan.

Esimerkkejä puolistrukturoidusta datasta

XML-tiedostoon tallennetut henkilötiedot

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Datan kasvu vuosien varrella

Alla oleva kaavio tracmiten strukturoidun ja strukturoimattoman datan yhdistelmä on muuttunut kokonaismäärän kasvaessa.

Kaavio datan kasvusta vuosien varrella, joka osoittaa, että strukturoimattoman datan määrä ylittää strukturoidun datan määrän

Datan kasvu vuosien varrella

Huomaa, että Web-sovellus Rakenteeton data koostuu lokitiedostoista, tapahtumahistoriatiedostoista jne. OLTP-järjestelmät on rakennettu toimimaan strukturoidun datan kanssa, jossa data tallennetaan relaatioihin (taulukoihin).

Big Datan ominaisuudet

Big Dataa voidaan kuvata seuraavilla ominaisuuksilla:

  • tilavuus
  • lajike
  • Nopeus
  • vaihtelevuus

(i) määrä – Nimi Big Data itsessään liittyy valtavaan kokoon. Datan koolla on erittäin tärkeä rooli siitä saatavan arvon määrittämisessä. Myös se, voidaanko tiettyä datajoukkoa pitää Big Datana vai ei, riippuu sen määrästä. Näin ollen 'Äänenvoimakkuus' on yksi ominaisuus, joka on otettava huomioon käsiteltäessä Big Data -ratkaisuja.

(ii) lajike – Big Datan seuraava puoli on sen lajike.

Monimuotoisuus viittaa heterogeenisiin lähteisiin ja datan luonteeseen, sekä strukturoituun että strukturoimattomaan. Aikaisemmin laskentataulukot ja tietokannat olivat ainoat datalähteet, joita useimmat sovellukset ottivat huomioon. Nykyään analyysisovelluksissa otetaan huomioon myös sähköpostien, valokuvien, videoiden, valvontalaitteiden, PDF-tiedostojen, äänitiedostojen jne. muodossa oleva data. Tämä strukturoimattoman datan monimuotoisuus aiheuttaa tiettyjä ongelmia datan tallentamiseen, louhintaan ja analysointiin.

(iii) Nopeus – Termi 'nopeus' viittaa datan generoinnin nopeuteen. Se, kuinka nopeasti data generoidaan ja käsitellään kysynnän tyydyttämiseksi, määrittää datan todellisen potentiaalin.

Big Datan nopeus käsittelee nopeutta, jolla data virtaa lähteistä, kuten liiketoimintaprosesseista, sovelluslokeista, verkostoista, sosiaalisen median sivustoilta, sensoreista, mobile laitteet jne. Tietovirta on massiivinen ja jatkuva.

(iv) Vaihtuvuus – Tämä viittaa epäjohdonmukaisuuteen, jonka tiedot voivat toisinaan osoittaa, mikä vaikeuttaa tietojen tehokasta käsittelyä ja hallintaa.

Nykyään tuohon luetteloon lisätään yleisesti kaksi muuta ominaisuutta, jotka muodostavat laajalti siteeratun viisi V:tä:

  • totuudenmukaisuus – kuinka luotettavaa ja tarkkaa data on. Kaksoiskappaleet, anturien poikkeamat ja puuttuvat kentät heikentävät todenmukaisuutta, eikä mikään tietomäärä korvaa tätä.
  • Arvo – mitä data todellisuudessa on arvoa analysoinnin jälkeen. Data, josta ei koskaan tehdä päätöstä, lisää vain tallennuskustannuksia.

Big Datan käsittelyn edut

Mahdollisuus käsitellä Big Dataa tietokannan hallintajärjestelmässä tuo useita etuja, kuten

Yritykset voivat hyödyntää ulkopuolista tiedustelutietoa päätöksenteossa

Pääsy sosiaalisiin tietoihin osoitteesta Hakukoneet ja sivustot, kuten Facebook ja X (entinen Twitter), antavat organisaatioille mahdollisuuden hienosäätää liiketoimintastrategioitaan.

Parempi asiakaspalvelu

Perinteiset asiakaspalautejärjestelmät korvautuvat uusilla järjestelmillä, jotka on suunniteltu Big Data -teknologioilla. Näissä uusissa järjestelmissä Big Dataa ja luonnollisen kielen käsittelyteknologioita käytetään kuluttajavastausten lukemiseen ja arviointiin.

Tuotteisiin ja palveluihin kohdistuvien riskien varhainen tunnistaminen

Jatkuvasti analysoimalla tapahtumatietoja, anturilukemia ja tukipyyntöjä, havaitaan virheitä, petosmalleja ja palveluhäiriöitä jo niiden ollessa vielä pieniä sen sijaan, että odotettaisiin kuukausittaista raporttia niiden paljastamiseksi.

Paremmin Operanational Efficiency

Big Data -teknologioita voidaan käyttää luomaan uuden datan valmistelualue tai laskeutumisvyöhyke ennen kuin tunnistetaan, mitä sinne siirretään. tietovarastoLisäksi Big Data -teknologioiden ja tietovaraston integrointi auttaa organisaatiota siirtämään harvoin käytettyä dataa.

UKK

Nykyisten arvioiden mukaan noin 402 miljoonaa teratavua päivässä, mikä nostaa vuoden 2026 vuosittaisen kokonaismäärän yli 200 zettatavua. Luku kasvaa jatkuvasti, koska video-, anturitelemetria- ja sovelluslokit kasvavat nopeammin kuin tapahtumatiedot.

Algorithms löytää miljoonien tietueiden joukosta kaavoja, joita kukaan analyytikko ei pystyisi tarkastelemaan käsin, ja pisteyttää sitten uusia tietueita näitä kaavoja vasten. Suuremmat ja monipuolisemmat harjoitusjoukot parantavat yleensä tarkkuutta, minkä vuoksi nämä kaksi alaa kasvoivat yhteen.

Se luonnostelee rutiinityöt hyvin: Spark muunnokset, skeemamäärittelyt, SQL-liitokset ja liittimien konfigurointi. RevTarkastele tulostetta huolellisesti, koska luodut putket jättävät usein huomiotta osioinnin, tietotyypit ja kustannukset, ja tässä kohtaa todelliset putket epäonnistuvat.

Hajautettu tallennustila, kuten HDFS tai pilviobjektien tallennustilat, prosessointimoottorit, kuten Spark ja Flink, suoratoistojärjestelmät, kuten Kafka, ja kyselykerrokset, kuten HiveHallitut pilvivarastot kattavat nyt monia samoja tehtäviä.

Huono datan laatu, epäselvät omistajuus-, tallennus- ja laskentakustannukset sekä pula hajautettujen järjestelmien operoinnista vastaavista insinööreistä. Useimmat epäonnistuneet projektit pysähtyvät hallintotapaan ja epäselviin liiketoimintakysymyksiin teknologian sijaan.

Säännöt, kuten GDPR, rajoittavat sitä, mitä henkilötietoja voidaan kerätä, kuinka kauan niitä voidaan säilyttää ja missä niitä voidaan säilyttää. Tiimit vastaavat suostumuksella. trackuningas, säilytyskäytännöt, pseudonymisointi ja tarkastuslokit, jotka on sisäänrakennettu prosessiin.

Tietoallas tallentaa raakatiedostoja missä tahansa muodossa ja lisää niihin rakenteen, kun dataa luetaan. Tietovarasto tallentaa puhdistettuja, mallinnettuja taulukoita ja lisää niihin rakenteen, kun dataa kirjoitetaan, mikä nopeuttaa kyselyitä, mutta hidastaa latautumista.

Ensin SQL ja sitten ohjelmointikieli, esim. Python tai Scala, hajautettu prosessointi Spark, pilvialusta ja riittävästi datamallinnusta taulukoiden järkevään suunnitteluun. Viestintä on yhtä tärkeää, koska tulosten on vakuutettava myös ei-tekniset lukijat.

Tiivistä tämä viesti seuraavasti: