Hvad er Big Data? Introduktion, Typer, Karakteristika, Eksempler

Fรธr vi gรฅr til introduktion til Big Data, skal du fรธrst vide det

Hvad er data?

De mรฆngder, tegn eller symboler, som en computer udfรธrer operationer pรฅ, og som kan lagres og transmiti form af elektriske signaler og optaget pรฅ magnetiske, optiske eller mekaniske optagemedier.

Lad os nu lรฆre Big Data definition

Hvad er Big Data?

Big data er en samling af data, der er enorm i volumen, men alligevel vokser eksponentielt med tiden. Det er en data med sรฅ stor stรธrrelse og kompleksitet, at ingen af โ€‹โ€‹de traditionelle datahรฅndteringsvรฆrktรธjer kan gemme dem eller behandle dem effektivt. Big data er ogsรฅ en data, men med enorm stรธrrelse.

Big data
Hvad er Big Data?

Hvad er et eksempel pรฅ Big Data?

Fรธlgende er nogle af Big Data-eksemplerne-

New York Stock Exchange er et eksempel pรฅ Big Data, der genererer ca en terabyte af nye handelsdata pr. dag.

Eksempel pรฅ Big Data

Sociale medier

Det viser statistikken 500+terabyte af nye data bliver optaget i databaserne pรฅ sociale medier Facebook, hver dag. Disse data genereres hovedsageligt i form af foto- og videouploads, beskedudvekslinger, kommentarer osv.

Eksempel pรฅ Big Data

En enkelt Flymotor kan generere 10+terabyte af data i 30 minutter af flyvetid. Med mange tusinde flyvninger om dagen nรฅr genereringen af โ€‹โ€‹data op til mange Petabytes.

Eksempel pรฅ Big Data

Typer af big data

Fรธlgende er typerne af Big Data:

  1. Struktureret
  2. Ustruktureret
  3. Halvstruktureret

Struktureret

Alle data, der kan lagres, tilgรฅs og behandles i et fast format, betegnes som 'strukturerede' data. I tidens lรธb har talenter inden for datalogi opnรฅet stรธrre succes med udviklingen.ping teknikker til at arbejde med den slags data (hvor formatet er velkendt pรฅ forhรฅnd) og ogsรฅ til at udlede vรฆrdi af det. I dag forudser vi dog problemer, nรฅr stรธrrelsen af โ€‹โ€‹sรฅdanne data vokser enormt, typiske stรธrrelser er pรฅ op mod flere zettabyte.

Kender du? 1021 bytes svarende til 1 zettabyte or en milliard terabyte formularer en zettabyte.

Nรฅr man ser pรฅ disse tal, kan man let forstรฅ, hvorfor navnet Big Data er givet, og forestille sig de udfordringer, der er forbundet med lagring og behandling.

Kender du? Data, der er gemt i et relationelt databasestyringssystem, er et eksempel pรฅ en 'struktureret' data.

Eksempler pรฅ strukturerede data

En 'Medarbejder'-tabel i en database er et eksempel pรฅ strukturerede data

Medarbejder-ID Ansattes navn Kรธn Afdeling Lรธn_I_lacs
2365 Rajesh Kulkarni Mand Finance 650000
3398 Pratibha Joshi Kvinde Admin 650000
7465 Shushil Roy Mand Admin 500000
7500 Shubhojit Das Mand Finance 500000
7699 Priya Sane Kvinde Finance 550000

Ustruktureret

Alle data med ukendt form eller struktur klassificeres som ustrukturerede data. Ud over at stรธrrelsen er enorm, udgรธr ustrukturerede data adskillige udfordringer i forhold til dens behandling for at fรฅ vรฆrdi ud af dem. Et typisk eksempel pรฅ ustrukturerede data er en heterogen datakilde, der indeholder en kombination af simple tekstfiler, billeder, videoer osv. I dag har organisationer et vรฆld af data til rรฅdighed med sig, men desvรฆrre ved de ikke, hvordan de skal hente vรฆrdi ud af det, siden disse data er i deres rรฅ form eller ustrukturerede format.

Eksempler pรฅ ustrukturerede data

Outputtet returneret af 'Google Sรธge'

Eksempel pรฅ ustrukturerede data
Eksempel pรฅ ustrukturerede data

Halvstruktureret

Semistrukturerede data kan indeholde begge former for data. Vi kan se semi-strukturerede data som en struktureret i form, men det er faktisk ikke defineret med fx en tabeldefinition i relationel DBMS. Eksempel pรฅ semistrukturerede data er data reprรฆsenteret i en XML-fil.

Eksempler pรฅ semistrukturerede data

Personlige data gemt i en XML-fil-

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Datavรฆkst gennem รฅrene

Datavรฆkst gennem รฅrene
Datavรฆkst gennem รฅrene

Bemรฆrk, at webapplikation data, som er ustruktureret, bestรฅr af logfiler, transaktionshistorikfiler osv. OLTP-systemer er bygget til at arbejde med strukturerede data, hvor data er lagret i relationer (tabeller).

Karakteristika af Big Data

Big data kan beskrives ved fรธlgende karakteristika:

  • Bind
  • Variation
  • Velocity
  • variabilitet

(i) Volumen โ€“ Selve navnet Big Data hรฆnger sammen med en stรธrrelse, som er enorm. Stรธrrelsen af โ€‹โ€‹data spiller en meget afgรธrende rolle i at bestemme vรฆrdien ud af data. Om en bestemt data faktisk kan betragtes som en Big Data eller ej, afhรฆnger ogsรฅ af mรฆngden af โ€‹โ€‹data. Derfor, 'Bind' er en egenskab, som skal overvejes, nรฅr man hรฅndterer Big Data-lรธsninger.

(ii) Sort โ€“ Det nรฆste aspekt af Big Data er dens rรฆkke.

Variation refererer til heterogene kilder og arten af โ€‹โ€‹data, bรฅde strukturerede og ustrukturerede. I tidligere dage var regneark og databaser de eneste datakilder, der blev taget i betragtning af de fleste applikationer. I dag overvejes data i form af e-mails, fotos, videoer, overvรฅgningsenheder, PDF'er, lyd osv. ogsรฅ i analyseapplikationerne. Denne rรฆkke af ustrukturerede data giver visse problemer for lagring, minedrift og analyse af data.

(iii) Hastighed โ€“ Udtrykket 'hastighed' refererer til hastigheden af โ€‹โ€‹generering af data. Hvor hurtigt dataene genereres og behandles for at opfylde kravene, bestemmer det reelle potentiale i dataene.

Big Data Velocity omhandler den hastighed, hvormed data strรธmmer ind fra kilder som forretningsprocesser, applikationslogfiler, netvรฆrk og sociale medier, sensorer, Mobil enheder osv. Datastrรธmmen er massiv og kontinuerlig.

(iv) Variabilitet โ€“ Dette refererer til den inkonsistens, som data til tider kan vise, og dermed hรฆmmer processen med at kunne hรฅndtere og administrere dataene effektivt.

Fordele ved Big Data Processing

Evnen til at behandle Big Data i DBMS giver flere fordele, som f.eks.

  • Virksomheder kan bruge ekstern intelligens, mens de trรฆffer beslutninger

Adgang til sociale data fra sรธgemaskiner og websteder som Facebook, Twitter gรธr det muligt for organisationer at finjustere deres forretningsstrategier.

  • Forbedret kundeservice

Traditionelle kundefeedback-systemer bliver erstattet af nye systemer designet med Big Data-teknologier. I disse nye systemer bliver Big Data og naturlige sprogbehandlingsteknologier brugt til at lรฆse og evaluere forbrugernes svar.

  • Tidlig identifikation af risiko for produktet/tjenesterne, hvis nogen
  • Bedre driftseffektivitet

Big Data-teknologier kan bruges til at skabe et iscenesรฆttelsesomrรฅde eller landingszone for nye data, fรธr det identificeres, hvilke data der skal flyttes til datalager. Derudover hjรฆlper en sรฅdan integration af Big Data-teknologier og datavarehus en organisation med at aflaste sjรฆldent tilgรฅede data.

Resumรฉ

  • Big Data definition: Big Data betyder en data, der er enorm i stรธrrelse. Bigdata er et udtryk, der bruges til at beskrive en samling af data, der er enorm i stรธrrelse og alligevel vokser eksponentielt med tiden.
  • Eksempler pรฅ Big Data-analyse omfatter bรธrser, sociale medier, jetmotorer osv.
  • Big Data kunne vรฆre 1) struktureret, 2) ustruktureret, 3) semi-struktureret
  • Volumen, variation, hastighed og variation er fรฅ Big Data-karakteristika
  • Forbedret kundeservice, bedre driftseffektivitet, bedre beslutningstagning er fรฅ fordele ved Bigdata

Opsummer dette indlรฆg med: