Hvad er Big Data? Introduktion, Typer, Karakteristika, Eksempler
Hvad er data?
De mรฆngder, tegn eller symboler, som en computer udfรธrer operationer pรฅ, og som kan lagres og transmiti form af elektriske signaler og optaget pรฅ magnetiske, optiske eller mekaniske optagemedier.
Lad os nu lรฆre Big Data definition
Hvad er Big Data?
Big data er en samling af data, der er enorm i volumen, men alligevel vokser eksponentielt med tiden. Det er en data med sรฅ stor stรธrrelse og kompleksitet, at ingen af โโde traditionelle datahรฅndteringsvรฆrktรธjer kan gemme dem eller behandle dem effektivt. Big data er ogsรฅ en data, men med enorm stรธrrelse.

Hvad er et eksempel pรฅ Big Data?
Fรธlgende er nogle af Big Data-eksemplerne-
New York Stock Exchange er et eksempel pรฅ Big Data, der genererer ca en terabyte af nye handelsdata pr. dag.
Sociale medier
Det viser statistikken 500+terabyte af nye data bliver optaget i databaserne pรฅ sociale medier Facebook, hver dag. Disse data genereres hovedsageligt i form af foto- og videouploads, beskedudvekslinger, kommentarer osv.
En enkelt Flymotor kan generere 10+terabyte af data i 30 minutter af flyvetid. Med mange tusinde flyvninger om dagen nรฅr genereringen af โโdata op til mange Petabytes.
Typer af big data
Fรธlgende er typerne af Big Data:
- Struktureret
- Ustruktureret
- Halvstruktureret
Struktureret
Alle data, der kan lagres, tilgรฅs og behandles i et fast format, betegnes som 'strukturerede' data. I tidens lรธb har talenter inden for datalogi opnรฅet stรธrre succes med udviklingen.ping teknikker til at arbejde med den slags data (hvor formatet er velkendt pรฅ forhรฅnd) og ogsรฅ til at udlede vรฆrdi af det. I dag forudser vi dog problemer, nรฅr stรธrrelsen af โโsรฅdanne data vokser enormt, typiske stรธrrelser er pรฅ op mod flere zettabyte.
Kender du? 1021 bytes svarende til 1 zettabyte or en milliard terabyte formularer en zettabyte.
Nรฅr man ser pรฅ disse tal, kan man let forstรฅ, hvorfor navnet Big Data er givet, og forestille sig de udfordringer, der er forbundet med lagring og behandling.
Kender du? Data, der er gemt i et relationelt databasestyringssystem, er et eksempel pรฅ en 'struktureret' data.
Eksempler pรฅ strukturerede data
En 'Medarbejder'-tabel i en database er et eksempel pรฅ strukturerede data
| Medarbejder-ID | Ansattes navn | Kรธn | Afdeling | Lรธn_I_lacs |
|---|---|---|---|---|
| 2365 | Rajesh Kulkarni | Mand | Finance | 650000 |
| 3398 | Pratibha Joshi | Kvinde | Admin | 650000 |
| 7465 | Shushil Roy | Mand | Admin | 500000 |
| 7500 | Shubhojit Das | Mand | Finance | 500000 |
| 7699 | Priya Sane | Kvinde | Finance | 550000 |
Ustruktureret
Alle data med ukendt form eller struktur klassificeres som ustrukturerede data. Ud over at stรธrrelsen er enorm, udgรธr ustrukturerede data adskillige udfordringer i forhold til dens behandling for at fรฅ vรฆrdi ud af dem. Et typisk eksempel pรฅ ustrukturerede data er en heterogen datakilde, der indeholder en kombination af simple tekstfiler, billeder, videoer osv. I dag har organisationer et vรฆld af data til rรฅdighed med sig, men desvรฆrre ved de ikke, hvordan de skal hente vรฆrdi ud af det, siden disse data er i deres rรฅ form eller ustrukturerede format.
Eksempler pรฅ ustrukturerede data
Outputtet returneret af 'Google Sรธge'

Halvstruktureret
Semistrukturerede data kan indeholde begge former for data. Vi kan se semi-strukturerede data som en struktureret i form, men det er faktisk ikke defineret med fx en tabeldefinition i relationel DBMS. Eksempel pรฅ semistrukturerede data er data reprรฆsenteret i en XML-fil.
Eksempler pรฅ semistrukturerede data
Personlige data gemt i en XML-fil-
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
Datavรฆkst gennem รฅrene

Bemรฆrk, at webapplikation data, som er ustruktureret, bestรฅr af logfiler, transaktionshistorikfiler osv. OLTP-systemer er bygget til at arbejde med strukturerede data, hvor data er lagret i relationer (tabeller).
Karakteristika af Big Data
Big data kan beskrives ved fรธlgende karakteristika:
- Bind
- Variation
- Velocity
- variabilitet
(i) Volumen โ Selve navnet Big Data hรฆnger sammen med en stรธrrelse, som er enorm. Stรธrrelsen af โโdata spiller en meget afgรธrende rolle i at bestemme vรฆrdien ud af data. Om en bestemt data faktisk kan betragtes som en Big Data eller ej, afhรฆnger ogsรฅ af mรฆngden af โโdata. Derfor, 'Bind' er en egenskab, som skal overvejes, nรฅr man hรฅndterer Big Data-lรธsninger.
(ii) Sort โ Det nรฆste aspekt af Big Data er dens rรฆkke.
Variation refererer til heterogene kilder og arten af โโdata, bรฅde strukturerede og ustrukturerede. I tidligere dage var regneark og databaser de eneste datakilder, der blev taget i betragtning af de fleste applikationer. I dag overvejes data i form af e-mails, fotos, videoer, overvรฅgningsenheder, PDF'er, lyd osv. ogsรฅ i analyseapplikationerne. Denne rรฆkke af ustrukturerede data giver visse problemer for lagring, minedrift og analyse af data.
(iii) Hastighed โ Udtrykket 'hastighed' refererer til hastigheden af โโgenerering af data. Hvor hurtigt dataene genereres og behandles for at opfylde kravene, bestemmer det reelle potentiale i dataene.
Big Data Velocity omhandler den hastighed, hvormed data strรธmmer ind fra kilder som forretningsprocesser, applikationslogfiler, netvรฆrk og sociale medier, sensorer, Mobil enheder osv. Datastrรธmmen er massiv og kontinuerlig.
(iv) Variabilitet โ Dette refererer til den inkonsistens, som data til tider kan vise, og dermed hรฆmmer processen med at kunne hรฅndtere og administrere dataene effektivt.
Fordele ved Big Data Processing
Evnen til at behandle Big Data i DBMS giver flere fordele, som f.eks.
- Virksomheder kan bruge ekstern intelligens, mens de trรฆffer beslutninger
Adgang til sociale data fra sรธgemaskiner og websteder som Facebook, Twitter gรธr det muligt for organisationer at finjustere deres forretningsstrategier.
- Forbedret kundeservice
Traditionelle kundefeedback-systemer bliver erstattet af nye systemer designet med Big Data-teknologier. I disse nye systemer bliver Big Data og naturlige sprogbehandlingsteknologier brugt til at lรฆse og evaluere forbrugernes svar.
- Tidlig identifikation af risiko for produktet/tjenesterne, hvis nogen
- Bedre driftseffektivitet
Big Data-teknologier kan bruges til at skabe et iscenesรฆttelsesomrรฅde eller landingszone for nye data, fรธr det identificeres, hvilke data der skal flyttes til datalager. Derudover hjรฆlper en sรฅdan integration af Big Data-teknologier og datavarehus en organisation med at aflaste sjรฆldent tilgรฅede data.
Resumรฉ
- Big Data definition: Big Data betyder en data, der er enorm i stรธrrelse. Bigdata er et udtryk, der bruges til at beskrive en samling af data, der er enorm i stรธrrelse og alligevel vokser eksponentielt med tiden.
- Eksempler pรฅ Big Data-analyse omfatter bรธrser, sociale medier, jetmotorer osv.
- Big Data kunne vรฆre 1) struktureret, 2) ustruktureret, 3) semi-struktureret
- Volumen, variation, hastighed og variation er fรฅ Big Data-karakteristika
- Forbedret kundeservice, bedre driftseffektivitet, bedre beslutningstagning er fรฅ fordele ved Bigdata



