Što je Hadoop? Architekstura, ekosustav i komponente

⚡ Pametni sažetak

Apache Hadoop je okvir otvorenog koda koji pohranjuje ogromne skupove podataka na klastere standardnih računala i premješta logiku obrade na podatke, tako da se analiza skalira dodavanjem jeftinih čvorova umjesto većih poslužitelja.

  • 🔘 Osnovni moduli: HDFS pohranjuje blokove, MapReduce ih obrađuje, a YARN raspoređuje resurse klastera od Hadoop 2.x nadalje.
  • ☑️ Lokalitet podataka: Kompilirana logika obrade putuje do čvora koji sadrži blok, pa se troši znatno manje mrežne propusnosti.
  • Ekosustav: Hive, HBase, Mahout, Sqoop, Flume i ZooKeeper proširuju jezgru sa SQL-om, NoSQL-om, unosom podataka i koordinacijom.
  • 🧪 Raspored glavnog i podređenog uređaja: NameNode tracmetapodatke imenskog prostora ks dok DataNodes drže blokove i izvještavaju o njihovom stanju.
  • 🛠️ Tolerancija kvarova: Svaki blok se replicira na više čvorova, tako da jedan kvar na računalu nikada ne zaustavlja izvršavanje posla.
  • ⚠️ Topologija mreže: Hadoop modelira klaster kao stablo podatkovnih centara, rackova i čvorova kako bi promet ostao lokalan.

Što je Hadoop arhitektura, ekosustav i komponente

Što je Hadoop?

Apache Hadoop je softverski okvir otvorenog koda koji se koristi za razvoj aplikacija za obradu podataka koje se izvode u distribuiranom računalnom okruženju.

Aplikacije izgrađene pomoću Hadoop-a izvode se na velikim skupovima podataka raspoređenim po klasterima standardnih računala. Standardna računala su jeftina i široko dostupna. Uglavnom su korisna za postizanje veće računalne snage uz nisku cijenu.

Slično podacima koji se nalaze u lokalnom datotečnom sustavu osobnog računala, u Hadoopu se podaci nalaze u distribuiranom datotečnom sustavu koji se naziva Hadoop distribuirani datotečni sustavModel obrade temelji se na 'Lokalitet podataka' koncept, u ​​kojem se računalna logika šalje čvorovima klastera (poslužiteljima) koji sadrže podatke. Ova računalna logika je jednostavno kompilirana verzija programa napisanog u programskom jeziku visoke razine kao što je JavaTakav program obrađuje podatke pohranjene u Hadoop HDFS.

Znate li? Računalni klaster sastoji se od skupa više procesorskih jedinica (disk za pohranu + procesor) koje su međusobno povezane i djeluju kao jedinstveni sustav.

Verzija 3.5.0, objavljena 2. travnja 2026., trenutno je stabilno izdanje; linija 3.4 još uvijek prima ažuriranja za održavanje.

Hadoop ekosustav i komponente

Donji dijagram prikazuje različite komponente u Hadoop ekosustavu, grupirane prema poslu koji svaka od njih obavlja - pohrana, obrada te alati za upite, unos i koordinaciju oko njih.

Dijagram Hadoop ekosustava koji prikazuje HDFS, MapReduce i okolne Apache projekte

Apache Hadoop sastoji se od dva potprojekta –

  1. Hadoop MapReduce: MapReduce je računalni model i softverski okvir za pisanje aplikacija koje se pokreću na Hadoopu. Ovi MapReduce programi sposobni su za paralelnu obradu ogromnih podataka na velikim klasterima računalnih čvorova.
  2. HDFS (Hadoop distribuirani datotečni sustav): HDFS brine o dijelu za pohranu Hadoop aplikacija. MapReduce aplikacije troše podatke iz HDFS-a. HDFS stvara višestruke replike podatkovnih blokova i distribuira ih na računalne čvorove u klasteru. Ova distribucija omogućuje pouzdana i iznimno brza izračunavanja.

Trenutna izdanja isporučuju dva dodatna osnovna modula. Hadoop PREĐA, dodan u Hadoop 2.x, zakazuje rad na klasteru i Hadoop Common drži dijeljeno Java biblioteke o kojima ovisi svaki modul. YARN je ono što omogućuje engine-ima kao što su Spark, Tez i Flink rade uz MapReduce.

Iako je Hadoop najpoznatiji po MapReduceu i njegovom distribuiranom datotečnom sustavu HDFS, taj se izraz koristi i za obitelj srodnih projekata koji spadaju pod okrilje distribuiranog računarstva i obrade podataka velikih razmjera. Ostali projekti povezani s Hadoopom na Apacheu uključuju Košnica, HBase, Mahout, Sqoop, Flumei ZooKeeper.

Hadoop Architektura

Hadoop ima master-slave arhitekturu za pohranu podataka i distribuiranu obradu podataka koristeći MapReduce i HDFS metode. Dijagram u nastavku postavlja te uloge jednu pored druge, sa slojem za pohranu na jednoj strani i slojem za obradu na drugoj.

Dijagram Hadoop arhitekture visoke razine koji prikazuje NameNode, DataNode, glavni čvor i podređene čvorove

Hadoop visoke razine Architektura

NameNode

NameNode pohranjuje metapodatke za svaku datoteku i direktorij korišten u imenskom prostoru, uključujući koji blokovi čine svaku datoteku i gdje se ti blokovi nalaze.

Čvor podataka

DataNode upravlja stanjem HDFS čvora i omogućuje vam interakciju s blokovima koje pohranjuje, izvještavajući NameNode s periodičnim izvješćima o blokovima i otkucajima srca.

Glavni čvor

Glavni čvor vam omogućuje provođenje paralelne obrade podataka pomoću Hadoop MapReduce.

Podređeni čvor

Podređeni čvorovi su dodatni strojevi u Hadoop klasteru koji vam omogućuju pohranu podataka i izvođenje složenih izračuna. Štoviše, svaki podređeni čvor izvršava zadatak.Tracker i DataNode. To vam omogućuje sinkronizaciju procesa s NameNodeom i JobomTracker respektivno.

U Hadoopu, glavni ili podređeni sustavi mogu se postaviti u oblaku ili lokalno.

Jedna napomena o imenovanju: PosaoTracker i ZadatakTracker pripadaju prvoj generaciji MapReduce runtimea (MRv1). Od Hadoop 2.x nadalje, YARN dijeli svoje dužnosti između klastera na razini cijelog klastera Upravitelj resursaA Upravitelj čvorova po radniku i jedan Glavni programer aplikacija po poslu. NameNode i DataNode ostaju nepromijenjeni.

Značajke Hadoop-a

Pogodno za analizu velikih podataka

As Big Podaci Budući da su po prirodi distribuirani i nestrukturirani, Hadoop klasteri su najprikladniji za analizu velikih podataka. Budući da je logika obrade (ne stvarni podaci) ta koja teče do računalnih čvorova, troši se manje mrežne propusnosti. To se naziva koncept lokaliteta podataka, i pomaže povećati učinkovitost aplikacija temeljenih na Hadoopu.

skalabilnost

Hadoop klasteri se mogu lako skalirati do bilo koje mjere dodavanjem dodatnih čvorova klastera, te tako omogućiti rast velikih podataka (Big Data). Također, skaliranje ne zahtijeva modifikacije logike aplikacije.

Tolerancija kvarova

Hadoop ekosustav ima mogućnost repliciranja ulaznih podataka na druge čvorove klastera. Na taj način, u slučaju kvara čvora klastera, obrada podataka i dalje se može nastaviti korištenjem podataka pohranjenih na drugom čvoru klastera. HDFS prema zadanim postavkama čuva tri kopije svakog bloka, vrijednost koju postavlja dfs.replikacija svojstvo, a NameNode ponovno replicira svaki blok koji padne ispod tog broja.

Topologija mreže u Hadoopu

Topologija (raspored) mreže utječe na performanse Hadoop klastera kako veličina klastera raste. Osim performansi, potrebno je voditi računa i o visokoj dostupnosti i rukovanju kvarovima. Da bi se to postiglo, formiranje Hadoop klastera koristi topologiju mreže.

Donje stablo prikazuje kako je taj raspored modeliran, od podatkovnog centra do čvorova unutar svakog stalka.

Stablo topologije Hadoop mreže s podatkovnim centrom, regalima i čvorovima koji se koriste za mjerenje udaljenosti između čvorova

Obično je propusnost mreže važan faktor koji treba uzeti u obzir pri formiranju bilo koje mreže. Međutim, budući da mjerenje propusnosti može biti teško, u Hadoopu se mreža predstavlja kao stablo, a udaljenost između čvorova tog stabla (broj skokova) smatra se važnim faktorom u formiranju Hadoop klastera. Ovdje je udaljenost između dva čvora jednaka zbroju njihovih udaljenosti do njihovog najbližeg zajedničkog pretka.

Hadoop klaster sastoji se od podatkovnog centra, racka i čvora koji zapravo izvršava zadatke. Ovdje se podatkovni centar sastoji od rackova, a rack se sastoji od čvorova. Propusnost mreže dostupna procesima varira ovisno o lokaciji procesa. To jest, dostupna propusnost postaje manja kako se udaljavamo od-

  • Procesi na istom čvoru
  • Različiti čvorovi na istom nosaču
  • Čvorovi na različitim policama istog podatkovnog centra
  • Čvorovi u različitim podatkovnim centrima

Svijest o stalku koristi isto stablo: HDFS smješta replike na više od jednog stalka, tako da gubitak prekidača za stalak ne odnosi svaku kopiju podataka sa sobom.

Pitanja i odgovori

Verzija 3.5.0, objavljena 2. travnja 2026., prvo je stabilno izdanje linije 3.5 i uobičajeni izbor za nove klastere. Linija 3.4 se i dalje održava ako vam je potrebna grana s duljim stažom.

Da. Hadoop podržava samostalni način rada, koji se izvršava kao jedan Java proces bez demona i pseudodistribuirani način rada, gdje se svaki demon izvršava zasebno na jednom hostu. Oba su namijenjena učenju i testiranju, a ne produkciji.

Modeli obučeni na povijesti poslova predviđaju vrijeme izvođenja, preporučuju veličine spremnika i označavaju iskrivljenje podataka prije završetka posla. Slični modeli skeniraju zapisnike NameNode i DataNode kako bi uočili neispravne diskove i vruće police ranije nego što to učine upozorenja o pragu.

Ubrzava standardne verzije: mapper i reducer, konfiguraciju upravljačkih programa za zadatke i blokove XML svojstava. Uvijek provjerite generirani kod u odnosu na verziju API-ja koju pokrećete, jer Copilot miješa stare mapred i novije mapreduce pakete.

Tri prema zadanim postavkama, kontrolira ih dfs.replication. Jedna replika ostaje na čvoru za pisanje, druga ide u drugi stalak, a treća se pridružuje drugom stalku. NameNode vraća svaki blok koji padne ispod cilja.

I dalje je uobičajeno da se paketna pohrana petabajtne skale mora nalaziti na vlastitom hardveru. Većina novih obrada napisana je za Spark ili Flink, koji rade na YARN-u, pa HDFS često opstaje kao sloj za pohranu nakon što se MapReduce ukine.

YARN je upravitelj resursa uveden u Hadoopu 2.x. Odvaja raspoređivanje klastera od programskog modela MapReduce, koji je uklonio JobTracusko grlo kera i neka motori kao što su Spark, Tez i Flink dijele jedan klaster.

Java je izvorni. Hadoop Streaming omogućuje da bilo koja izvršna datoteka koja čita standardni ulaz radi kao mapper ili reducer, tako da Python, Ruby, Perl i C++ svi su upotrebljivi, a Hive dodaje SQL-sličan sloj preko istih podataka.

Sažmite ovu objavu uz: