Co jsou to velká data? Typy, charakteristiky a příklady
⚡ Chytré shrnutí
Velká data popisují soubory informací, které jsou tak rozsáhlé, tak rozmanité a tak rychle se vyvíjející, že je běžné databázové nástroje nemohou ukládat ani zpracovávat, a proto se staly nezbytnými distribuované platformy a nové analytické metody.
Než se pustíme do úvodu do Big Data, je třeba si nejprve ujasnit, co data samotná jsou.
Co je to Data?
Data jsou množství, znaky nebo symboly, s nimiž počítač provádí operace a které lze ukládat a transmitve formě elektrických signálů a zaznamenané na magnetické, optické nebo mechanické záznamové médium.
Nyní se podívejme na definici velkých dat (Big Data).
Co je Big Data?
Big dat je sbírka dat, která má obrovský objem, ale s časem exponenciálně roste. Jsou to data tak velké velikosti a složitosti, že je žádný z tradičních nástrojů pro správu dat nedokáže efektivně ukládat ani zpracovávat. Big Data jsou stále data, ale o velikosti, která překonává běžné nástroje.
Níže uvedený diagram porovnává tuto definici s běžnými daty, která organizace již zpracovává, takže je snadno vidět skok v rozsahu.
Co je Big Data?
Co je příkladem velkých dat?
Níže jsou uvedeny některé příklady velkých dat –
Burzovní data
Jedno New York Stock Exchange je příkladem Big Data, která generuje o jeden terabajt nových obchodních údajů za den.
Sociální média
Statistika to ukazuje 500+ terabajtů nová data se zpracovávají do databází webu sociálních médií facebook, každý den. Tato data se generují hlavně z hlediska nahrávání fotografií a videí, výměny zpráv, vkládání komentářů atd.
proudové motory
Single Tryskový motor může generovat 10+ terabajtů dat v 30 minut letového času. S mnoha tisíci lety za den dosáhne generování dat až mnoha Petabajty.
Tyto tři údaje jsou momentkami pro každý zdroj z období, kdy byly příklady poprvé publikovány, a od té doby se pouze rozrostly. Pro současnou představu o měřítku svět jako celek nyní vytváří zhruba 402 milionů terabajtů dat denně, čímž se roční součet za rok 2026 track pro více než 200 zettabajtů.
Typy velkých dat
Níže jsou uvedeny typy velkých dat:
- Strukturované
- Nestrukturované
- Polostrukturované
Strukturované
Jakákoli data, která lze ukládat, zpracovávat a používat k nim přístup v pevném formátu, se nazývají „strukturovaná“ data. Postupem času dosáhla informatika velkého úspěchu ve vývojiping techniky pro práci s tímto druhem dat, kde je formát předem dobře známý, a pro získávání hodnoty z něj. Nyní však čelíme problémům, když velikost takových dat enormně naroste, přičemž typické velikosti dosahují několika zettabajtů.
Víte, že? Jeden zettabajt je 1021 bajtů, který je jednu miliardu terabajtů.
Při pohledu na tato čísla lze snadno pochopit, proč se nazývá velká data, a představit si problémy spojené s jejich ukládáním a zpracováním.
Víte, že? Data uložená v relačním databázovém systému jsou jedním z příkladů 'strukturovaný' data.
Příklady strukturovaných dat
Tabulka „Zaměstnanec“ v databázi je příkladem strukturovaných dat. Každý řádek má stejných pět sloupců a každý sloupec má známý typ, což je přesně to, co usnadňuje dotazování dat.
| Employee_ID | Jméno zaměstnance | Rod | oddělení | Plat_v_lacích |
|---|---|---|---|---|
| 2365 | Rajesh Kulkarni | Muž | Finance | 650000 |
| 3398 | Pratibha Joshi | Žena | administrátor | 650000 |
| 7465 | Shushil Roy | Muž | administrátor | 500000 |
| 7500 | Shubhojit Das | Muž | Finance | 500000 |
| 7699 | Priya Sane | Žena | Finance | 550000 |
Nestrukturované
Jakákoli data s neznámou formou nebo strukturou jsou klasifikována jako nestrukturovaná data. Kromě obrovské velikosti představují nestrukturovaná data řadu výzev, pokud jde o jejich zpracování za účelem získání hodnoty. Typickým příkladem nestrukturovaných dat je heterogenní zdroj dat obsahující kombinaci jednoduchých textových souborů, obrázků, videí atd. V dnešní době mají organizace k dispozici velké množství dat, ale bohužel nevědí, jak z nich vytěžit hodnotu, protože tato data jsou v nezpracovaném nebo nestrukturovaném formátu.
Příklady nestrukturovaných dat
Výstup vrácený funkcí 'Google Vyhledávání je nestrukturované: stejný dotaz vrací stránky, obrázky, úryvky a odkazy bez společného schématu.
Příklad nestrukturovaných dat
Polostrukturované
Polostrukturovaná data mohou obsahovat obě výše uvedené formy. Vypadají strukturovaně, ale nejsou definována formálním schématem, jako je definice tabulky v relačním prostředí. DBMSBěžným příkladem polostrukturovaných dat jsou data reprezentovaná v souboru XML. Do stejné kategorie spadají dokumenty JSON a řádky protokolu s páry klíč-hodnota.
Příklady polostrukturovaných dat
Osobní údaje uložené v souboru XML -
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
Růst dat v průběhu let
Níže uvedený graf tracukazuje, jak se s růstem celkového objemu změnil poměr strukturovaných a nestrukturovaných dat.
Růst dat v průběhu let
Vezměte prosím na vědomí, že webové aplikace Nestrukturovaná data se skládají z protokolových souborů, souborů historie transakcí atd. Systémy OLTP jsou navrženy pro práci se strukturovanými daty, přičemž data jsou uložena v relacích (tabulkách).
Charakteristika velkých dat
Velká data lze popsat následujícími charakteristikami:
- Objem nádrží
- Různorodost
- Rychlost
- Variabilita
(i) Objem – Samotný název Big Data (velká data) je spojen s obrovskou velikostí. Velikost dat hraje velmi zásadní roli při určování hodnoty, kterou z nich lze získat. Také to, zda lze konkrétní soubor dat skutečně považovat za Big Data, závisí na jeho objemu. Proto 'Objem' je jedna charakteristika, kterou je třeba vzít v úvahu při řešení Big Data.
(ii) Rozmanitost – Dalším aspektem Big Data je jeho odrůda.
Rozmanitost se vztahuje k heterogenním zdrojům a povaze dat, a to jak strukturovaných, tak nestrukturovaných. V minulosti byly tabulky a databáze jedinými zdroji dat, které většina aplikací zvažovala. V dnešní době se v analytických aplikacích berou v úvahu také data ve formě e-mailů, fotografií, videí, monitorovacích zařízení, PDF souborů, zvuku atd. Tato rozmanitost nestrukturovaných dat představuje určité problémy pro ukládání, dolování a analýzu dat.
(iii) Rychlost – termín 'rychlost' vztahuje se k rychlosti generování dat. Rychlost generování a zpracování dat pro uspokojení poptávky určuje skutečný potenciál dat.
Rychlost velkých dat se týká rychlosti, s jakou data proudí ze zdrojů, jako jsou obchodní procesy, aplikační protokoly, sítě, stránky sociálních médií, senzory atd. mobilní zařízení atd. Tok dat je masivní a nepřetržitý.
(iv) Variabilita – Týká se to nekonzistence, kterou mohou data občas vykazovat, a tak brzdí proces schopnosti efektivně nakládat a spravovat data.
K tomuto seznamu se dnes běžně přidávají další dvě charakteristiky, které dávají často citovaných „pět V“:
- Pravdivost – jak důvěryhodná a přesná jsou data. Duplicitní záznamy, posun senzorů a chybějící pole snižují pravdivost a žádný objem dat to nevynahradí.
- Hodnota – jakou mají data skutečnou hodnotu po analýze. Data, která se nikdy nepromění v rozhodnutí, pouze zvyšují náklady na úložiště.
Výhody zpracování velkých dat
Schopnost zpracovávat velká data v systému DBMS přináší řadu výhod, jako například:
Firmy mohou při rozhodování využívat externí zpravodajské informace
Přístup k sociálním datům z vyhledávače a stránky jako Facebook a X (dříve Twitter) umožňují organizacím doladit jejich obchodní strategie.
Vylepšený zákaznický servis
Tradiční systémy zpětné vazby od zákazníků jsou nahrazovány novými systémy navrženými s využitím technologií Big Data. V těchto nových systémech se k čtení a vyhodnocování reakcí spotřebitelů používají technologie Big Data a procesování přirozeného jazyka.
Včasná identifikace rizik pro produkty a služby
Neustálá analýza záznamů transakcí, údajů ze senzorů a tiketů podpory odhaluje vady, vzorce podvodů a selhání služeb, dokud jsou ještě malé, namísto čekání na odhalení měsíční zprávy.
Lepší Operaúčinnost
Technologie velkých dat (Big Data) lze využít k vytvoření pracovní oblasti nebo úložné zóny pro nová data před identifikací toho, co by mělo být přesunuto do datový skladKromě toho taková integrace technologií velkých dat a datového skladu pomáhá organizaci odlehčit se od dat, ke kterým se používá jen zřídka.






