Hva er Big Data? Introduksjon, typer, kjennetegn, eksempler
Hva er data?
Mengdene, tegnene eller symbolene som en datamaskin utfรธrer operasjoner pรฅ, som kan lagres og transmiti form av elektriske signaler og tatt opp pรฅ magnetiske, optiske eller mekaniske opptaksmedier.
La oss nรฅ lรฆre Big Data-definisjonen
Hva er store data?
Store data er en samling av data som er enormt i volum, men som likevel vokser eksponentielt med tiden. Det er en data med sรฅ stor stรธrrelse og kompleksitet at ingen av tradisjonelle databehandlingsverktรธy kan lagre dem eller behandle dem effektivt. Big data er ogsรฅ en data, men med enorm stรธrrelse.

Hva er et eksempel pรฅ Big Data?
Fรธlgende er noen av Big Data-eksemplene-
Ocuco New York Stock Exchange er et eksempel pรฅ Big Data som genererer ca รฉn terabyte av nye handelsdata per dag.
Sosiale medier
Statistikken viser det 500+terabyte av nye data blir tatt inn i databasene til sosiale medier Facebook , hver dag. Disse dataene genereres hovedsakelig i form av foto- og videoopplastinger, meldingsutvekslinger, kommentarer osv.
En enkelt Jetmotor kan generere 10+terabyte av data i 30 minutter av flytid. Med mange tusen flyvninger per dag, nรฅr generering av data opp til mange Petabyte.
Typer Big Data
Fรธlgende er typene Big Data:
- Strukturert
- Ustrukturert
- Halvstrukturert
Strukturert
Alle data som kan lagres, nรฅs og behandles i et fast format kalles ยซstrukturerteยป data. Over tid har talenter innen informatikk oppnรฅdd stรธrre suksess i utviklingen.ping teknikker for รฅ jobbe med slike datatyper (der formatet er godt kjent pรฅ forhรฅnd) og ogsรฅ for รฅ utvinne verdi fra dem. I dag ser vi imidlertid for oss problemer nรฅr stรธrrelsen pรฅ slike data vokser enormt, typiske stรธrrelser er pรฅ opptil flere zettabyte.
Vet du? 1021 bytes lik 1 zettabyte or en milliard terabyte skjemaer en zettabyte.
Nรฅr man ser pรฅ disse tallene, kan man lett forstรฅ hvorfor navnet Big Data er gitt og forestille seg utfordringene knyttet til lagring og prosessering.
Vet du? Data lagret i et relasjonsdatabasestyringssystem er ett eksempel pรฅ en "strukturert" data.
Eksempler pรฅ strukturerte data
En 'Ansatt'-tabell i en database er et eksempel pรฅ strukturerte data
| Ansatt ID | Employee_Name | Kjรธnn | Avdeling | Lรธnn_I_lacs |
|---|---|---|---|---|
| 2365 | Rajesh Kulkarni | mann | Finans | 650000 |
| 3398 | Pratibha Joshi | Hunn | admin | 650000 |
| 7465 | Shushil Roy | mann | admin | 500000 |
| 7500 | Shubhojit Das | mann | Finans | 500000 |
| 7699 | Priya Sane | Hunn | Finans | 550000 |
Ustrukturert
Alle data med ukjent form eller struktur klassifiseres som ustrukturerte data. I tillegg til at stรธrrelsen er enorm, utgjรธr ustrukturerte data flere utfordringer nรฅr det gjelder behandlingen for รฅ hente verdi ut av dem. Et typisk eksempel pรฅ ustrukturerte data er en heterogen datakilde som inneholder en kombinasjon av enkle tekstfiler, bilder, videoer osv. I dag har organisasjoner et vell av data tilgjengelig med seg, men dessverre vet de ikke hvordan de skal hente verdi ut av det siden disse dataene er i rรฅ form eller ustrukturert format.
Eksempler pรฅ ustrukturerte data
Utdataene som returneres av 'Google Sรธk'

Halvstrukturert
Semistrukturerte data kan inneholde begge dataformene. Vi kan se semistrukturerte data som en strukturert form, men de er faktisk ikke definert med f.eks. en tabelldefinisjon i relasjonell DBMS. Eksempel pรฅ semistrukturerte data er data representert i en XML-fil.
Eksempler pรฅ semistrukturerte data
Personopplysninger lagret i en XML-fil-
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
Datavekst gjennom รฅrene

Vรฆr oppmerksom pรฅ at webapplikasjon data, som er ustrukturert, bestรฅr av loggfiler, transaksjonshistorikkfiler etc. OLTP-systemer er bygget for รฅ fungere med strukturerte data der data lagres i relasjoner (tabeller).
Kjennetegn pรฅ Big Data
Big data kan beskrives med fรธlgende egenskaper:
- Volum
- Variasjon
- Velocity
- variasjon
(i) Volum โ Selve navnet Big Data er knyttet til en stรธrrelse som er enorm. Stรธrrelsen pรฅ data spiller en svรฆrt avgjรธrende rolle for รฅ bestemme verdien ut av data. Om en bestemt data faktisk kan betraktes som en Big Data eller ikke, er ogsรฅ avhengig av datavolumet. Derfor, 'Volum' er en egenskap som mรฅ vurderes nรฅr du arbeider med Big Data-lรธsninger.
(ii) Variasjon โ Det neste aspektet av Big Data er dens variasjon.
Variasjon refererer til heterogene kilder og arten av data, bรฅde strukturerte og ustrukturerte. I lรธpet av tidligere dager var regneark og databaser de eneste datakildene som ble vurdert av de fleste applikasjonene. I dag vurderes ogsรฅ data i form av e-poster, bilder, videoer, overvรฅkingsenheter, PDF-er, lyd osv. i analyseapplikasjonene. Denne variasjonen av ustrukturerte data utgjรธr visse problemer for lagring, gruvedrift og analyse av data.
(iii) Hastighet โ Begrepet 'hastighet' refererer til hastigheten pรฅ generering av data. Hvor raskt dataene genereres og behandles for รฅ mรธte kravene, bestemmer det reelle potensialet i dataene.
Big Data Velocity omhandler hastigheten som data strรธmmer inn med fra kilder som forretningsprosesser, applikasjonslogger, nettverk og sosiale medier, sensorer, Mobil enheter osv. Dataflyten er massiv og kontinuerlig.
(iv) Variabilitet โ Dette refererer til inkonsekvensen som kan vises av dataene til tider, og dermed hindrer prosessen med รฅ kunne hรฅndtere og administrere dataene effektivt.
Fordeler med Big Data Processing
Evnen til รฅ behandle Big Data i DBMS gir flere fordeler, som f.
- Bedrifter kan bruke ekstern intelligens mens de tar beslutninger
Tilgang til sosiale data fra sรธkemotorer og nettsteder som Facebook, Twitter gjรธr det mulig for organisasjoner รฅ finjustere forretningsstrategiene sine.
- Forbedret kundeservice
Tradisjonelle tilbakemeldingssystemer fra kunder blir erstattet av nye systemer designet med Big Data-teknologier. I disse nye systemene brukes Big Data og naturlig sprรฅkbehandlingsteknologi for รฅ lese og evaluere forbrukersvar.
- Tidlig identifisering av risiko for produktet/tjenestene, hvis noen
- Bedre driftseffektivitet
Big Data-teknologier kan brukes til รฅ lage et oppsamlingsomrรฅde eller landingssone for nye data fรธr man identifiserer hvilke data som skal flyttes til datalager. I tillegg hjelper en slik integrasjon av Big Data-teknologier og datavarehus en organisasjon med รฅ avlaste sjelden tilgang til data.
Sammendrag
- Big Data-definisjon: Big Data betyr data som er enorm i stรธrrelse. Bigdata er et begrep som brukes for รฅ beskrive en samling av data som er enorm i stรธrrelse og som likevel vokser eksponentielt med tiden.
- Eksempler pรฅ Big Data-analyse inkluderer bรธrser, sosiale medier, jetmotorer, etc.
- Big Data kan vรฆre 1) strukturert, 2) ustrukturert, 3) semi-strukturert
- Volum, variasjon, hastighet og variasjon er fรฅ Big Data-egenskaper
- Forbedret kundeservice, bedre driftseffektivitet, bedre beslutningstaking er fรฅ fordeler med Bigdata



