Co je Hadoop? Úvod, Architektura, Ekosystém, Komponenty

Co je Hadoop?

Apache Hadoop je open source softwarový rámec používaný k vývoji aplikací pro zpracování dat, které jsou spouštěny v distribuovaném výpočetním prostředí.

Aplikace vytvořené pomocí HADOOP běží na velkých souborech dat distribuovaných napříč clustery komoditních počítačů. Komoditní počítače jsou levné a široce dostupné. Ty jsou užitečné hlavně pro dosažení většího výpočetního výkonu při nízkých nákladech.

Podobně jako data uložená v lokálním souborovém systému osobního počítačového systému jsou v Hadoopu data uložena v distribuovaném souborovém systému, který se nazývá Systém distribuovaných souborů Hadoop. Model zpracování je založen na 'Lokalita dat' koncept, ve kterém je výpočetní logika odesílána do uzlů clusteru (serveru) obsahujících data. Tato výpočetní logika není nic jiného než zkompilovaná verze programu napsaná v jazyce na vysoké úrovni, jako je např Java. Takový program zpracovává data uložená v Hadoop HDFS.

Víte, že? Počítačový cluster se skládá ze sady více procesorových jednotek (úložný disk + procesor), které jsou vzájemně propojeny a fungují jako jeden systém.

Hadoop EcoSystem a komponenty

Níže uvedený diagram ukazuje různé komponenty v ekosystému Hadoop-

Hadoop EcoSystem a komponenty

Apache Hadoop se skládá ze dvou dílčích projektů –

  1. Hadoop MapReduce: MapReduce je výpočetní model a softwarový framework pro psaní aplikací, které běží na Hadoop. Tyto programy MapReduce jsou schopny paralelně zpracovávat obrovská data na velkých shlucích výpočetních uzlů.
  2. HDFS (Distribuovaný souborový systém Hadoop): HDFS se stará o úložnou část aplikací Hadoop. Aplikace MapReduce spotřebovávají data z HDFS. HDFS vytváří více replik datových bloků a distribuuje je na výpočetních uzlech v clusteru. Tato distribuce umožňuje spolehlivé a extrémně rychlé výpočty.

Ačkoli je Hadoop nejlépe známý pro MapReduce a jeho distribuovaný souborový systém HDFS, tento termín se také používá pro rodinu souvisejících projektů, které spadají pod deštník distribuovaného počítání a zpracování dat ve velkém měřítku. Další projekty související s Hadoopem na Apache zahrnují jsou Hive, HBase, Mahout, Sqoop, Flume a ZooKeeper.

Hadoop Architecture

Hadoop Architecture
Hadoop vysoké úrovně Architecture

Hadoop má Master-Slave Architecture pro ukládání dat a distribuované zpracování dat pomocí MapReduce a HDFS metody.

NameNode:

NameNode reprezentoval všechny soubory a adresáře, které se používají ve jmenném prostoru

DataNode:

DataNode vám pomáhá spravovat stav uzlu HDFS a umožňuje interakci s bloky

MasterNode:

Hlavní uzel vám umožňuje provádět paralelní zpracování dat pomocí Hadoop MapReduce.

Slave uzel:

Podřízené uzly jsou další počítače v clusteru Hadoop, které umožňují ukládat data pro provádění složitých výpočtů. Navíc všechny podřízené uzly obsahují Task... Tracker a datový uzel. To umožňuje synchronizovat procesy s uzlem NameNode a úlohou. Tracker respektive.

V Hadoopu lze hlavní nebo podřízený systém nastavit v cloudu nebo on-premise

Vlastnosti 'Hadoop'

• Vhodné pro analýzu velkých dat

Vzhledem k tomu, že velká data mají tendenci být distribuovaná a nestrukturovaná, clustery HADOOP jsou nejvhodnější pro analýzu velkých dat. Protože do výpočetních uzlů proudí logika zpracování (nikoli skutečná data), spotřebovává se menší šířka pásma sítě. Tento koncept se nazývá jako datová lokalita koncept což pomáhá zvýšit efektivitu aplikací založených na Hadoopu.

• Škálovatelnost

Klastry HADOOP lze snadno škálovat v libovolném rozsahu přidáním dalších uzlů clusteru, což umožňuje růst velkých dat. Také škálování nevyžaduje úpravy aplikační logiky.

• Odolnost proti chybám

Ekosystém HADOOP má ustanovení pro replikaci vstupních dat na jiné uzly clusteru. V případě selhání uzlu clusteru tak může zpracování dat stále pokračovat pomocí dat uložených v jiném uzlu clusteru.

Topologie Sítě V Hadoopu

Topologie (uspořádání) sítě ovlivňuje výkon clusteru Hadoop, když velikost clusteru Hadoop roste. Kromě výkonu je třeba dbát také na vysokou dostupnost a zvládnutí poruch. K dosažení tohoto Hadoopu využívá tvorba clusteru topologii sítě.

Topologie Sítě V Hadoopu

Typicky je šířka pásma sítě důležitým faktorem, který je třeba vzít v úvahu při vytváření jakékoli sítě. Protože však měření šířky pásma může být obtížné, v Hadoopu je síť reprezentována jako strom a vzdálenost mezi uzly tohoto stromu (počet skoků) je považována za důležitý faktor při vytváření shluku Hadoop. Zde je vzdálenost mezi dvěma uzly rovna součtu jejich vzdálenosti od jejich nejbližšího společného předka.

Hadoop cluster se skládá z datového centra, racku a uzlu, který ve skutečnosti provádí úlohy. Zde se datové centrum skládá z racků a rack se skládá z uzlů. Šířka pásma sítě dostupná pro procesy se liší v závislosti na umístění procesů. To znamená, že dostupná šířka pásma se zmenšuje, když odcházíme od-

  • Procesy na stejném uzlu
  • Různé uzly na stejném stojanu
  • Uzly na různých stojanech stejného datového centra
  • Uzly v různých datových centrech

Shrňte tento příspěvek takto: