Hadoop क्या है? परिचय, Archiटेक्चर, पारिस्थितिकी तंत्र, घटक

हडूप क्या है?

अपाचे हाडोप एक ओपन सोर्स सॉफ्टवेयर फ्रेमवर्क है जिसका उपयोग डेटा प्रोसेसिंग अनुप्रयोगों को विकसित करने के लिए किया जाता है जिन्हें वितरित कंप्यूटिंग वातावरण में निष्पादित किया जाता है।

HADOOP का उपयोग करके बनाए गए एप्लिकेशन कमोडिटी कंप्यूटर के क्लस्टर में वितरित बड़े डेटा सेट पर चलाए जाते हैं। कमोडिटी कंप्यूटर सस्ते और व्यापक रूप से उपलब्ध हैं। ये मुख्य रूप से कम लागत पर अधिक कम्प्यूटेशनल शक्ति प्राप्त करने के लिए उपयोगी हैं।

एक पर्सनल कंप्यूटर सिस्टम के स्थानीय फ़ाइल सिस्टम में रहने वाले डेटा के समान, Hadoop में, डेटा एक वितरित फ़ाइल सिस्टम में रहता है जिसे कहा जाता है Hadoop वितरित फ़ाइल सिस्टमप्रसंस्करण मॉडल पर आधारित है 'डेटा लोकेलिटी' अवधारणा जिसमें कम्प्यूटेशनल लॉजिक को डेटा युक्त क्लस्टर नोड्स (सर्वर) पर भेजा जाता है। यह कम्प्यूटेशनल लॉजिक कुछ और नहीं बल्कि एक उच्च स्तरीय भाषा में लिखे गए प्रोग्राम का संकलित संस्करण है जैसे Javaऐसा प्रोग्राम, में संग्रहीत डेटा को संसाधित करता है Hadoop HDFS.

जानती हो? कंप्यूटर क्लस्टर में कई प्रोसेसिंग यूनिट (स्टोरेज डिस्क + प्रोसेसर) का एक सेट होता है जो एक दूसरे से जुड़े होते हैं और एकल सिस्टम के रूप में कार्य करते हैं।

हाडोप इकोसिस्टम और घटक

नीचे दिया गया चित्र Hadoop पारिस्थितिकी तंत्र में विभिन्न घटकों को दर्शाता है-

हाडोप इकोसिस्टम और घटक

अपाचे हाडोप में दो उप-परियोजनाएं शामिल हैं –

  1. हाडोप मैपरिड्यूस: मैपरेड्यूस एक कम्प्यूटेशनल मॉडल और सॉफ्टवेयर फ्रेमवर्क है जो Hadoop पर चलने वाले एप्लीकेशन लिखने के लिए है। ये मैपरेड्यूस प्रोग्राम कम्प्यूटेशन नोड्स के बड़े क्लस्टर पर समानांतर रूप से विशाल डेटा को प्रोसेस करने में सक्षम हैं।
  2. एचडीएफएस (हडूप वितरित फाइल सिस्टम): HDFS Hadoop अनुप्रयोगों के भंडारण भाग का ख्याल रखता है। MapReduce अनुप्रयोग HDFS से डेटा का उपभोग करते हैं। HDFS डेटा ब्लॉक की कई प्रतिकृतियां बनाता है और उन्हें क्लस्टर में कंप्यूट नोड्स पर वितरित करता है। यह वितरण विश्वसनीय और अत्यंत तेज़ गणनाओं को सक्षम बनाता है।

हालाँकि Hadoop को MapReduce और इसके वितरित फ़ाइल सिस्टम- HDFS के लिए सबसे ज़्यादा जाना जाता है, लेकिन इस शब्द का इस्तेमाल संबंधित प्रोजेक्ट्स के परिवार के लिए भी किया जाता है जो वितरित कंप्यूटिंग और बड़े पैमाने पर डेटा प्रोसेसिंग के अंतर्गत आते हैं। अपाचे इसमें शामिल हैं हाइव, एचबेस, महौत, स्कूप, फ्लूम और ज़ूकीपर।

Hadoop Archiटेक्चर

Hadoop Archiटेक्चर
उच्च स्तरीय हाडोप Archiटेक्चर

हाडोप में एक मास्टर-स्लेव होता है Archiडेटा भंडारण और वितरित डेटा प्रसंस्करण के लिए तकनीक का उपयोग करना मानचित्र छोटा करना और एचडीएफएस विधियाँ।

नामनोड:

नेमनोड नेमस्पेस में उपयोग की जाने वाली प्रत्येक फाइल और निर्देशिका का प्रतिनिधित्व करता है

डेटानोड:

डेटानोड आपको एचडीएफएस नोड की स्थिति का प्रबंधन करने में मदद करता है और आपको ब्लॉक के साथ बातचीत करने की अनुमति देता है

मास्टर नोड:

मास्टर नोड आपको Hadoop MapReduce का उपयोग करके डेटा का समानांतर प्रसंस्करण करने की अनुमति देता है।

स्लेव नोड:

स्लेव नोड्स हैडूप क्लस्टर में अतिरिक्त मशीनें होती हैं जो जटिल गणनाएँ करने के लिए डेटा स्टोर करने की सुविधा प्रदान करती हैं। इसके अलावा, सभी स्लेव नोड्स टास्क के साथ आते हैं। Tracker और DataNode का उपयोग करके आप प्रक्रियाओं को NameNode और Job के साथ सिंक्रनाइज़ कर सकते हैं। Tracक्रमशः।

Hadoop में, मास्टर या स्लेव सिस्टम को क्लाउड या ऑन-प्रिमाइसेस में स्थापित किया जा सकता है

'Hadoop' की विशेषताएं

• बड़े डेटा विश्लेषण के लिए उपयुक्त

चूंकि बिग डेटा प्रकृति में वितरित और असंरचित होता है, इसलिए HADOOP क्लस्टर बिग डेटा के विश्लेषण के लिए सबसे उपयुक्त हैं। चूंकि यह प्रोसेसिंग लॉजिक (वास्तविक डेटा नहीं) है जो कंप्यूटिंग नोड्स में प्रवाहित होता है, इसलिए कम नेटवर्क बैंडविड्थ की खपत होती है। इस अवधारणा को कहा जाता है डेटा लोकेलिटी अवधारणा जो Hadoop आधारित अनुप्रयोगों की दक्षता बढ़ाने में मदद करता है।

• मापनीयता

HADOOP क्लस्टर को अतिरिक्त क्लस्टर नोड्स जोड़कर आसानी से किसी भी सीमा तक बढ़ाया जा सकता है और इस प्रकार बिग डेटा के विकास की अनुमति मिलती है। इसके अलावा, स्केलिंग के लिए एप्लिकेशन लॉजिक में संशोधन की आवश्यकता नहीं होती है।

• दोष सहिष्णुता

HADOOP इकोसिस्टम में इनपुट डेटा को दूसरे क्लस्टर नोड्स पर दोहराने का प्रावधान है। इस तरह, क्लस्टर नोड की विफलता की स्थिति में, डेटा प्रोसेसिंग अभी भी दूसरे क्लस्टर नोड पर संग्रहीत डेटा का उपयोग करके आगे बढ़ सकती है।

Hadoop में नेटवर्क टोपोलॉजी

नेटवर्क की टोपोलॉजी (व्यवस्था), Hadoop क्लस्टर के आकार के बढ़ने पर उसके प्रदर्शन को प्रभावित करती है। प्रदर्शन के अलावा, किसी को उच्च उपलब्धता और विफलताओं से निपटने के बारे में भी ध्यान रखना चाहिए। इस Hadoop को प्राप्त करने के लिए, क्लस्टर निर्माण नेटवर्क टोपोलॉजी का उपयोग करता है।

Hadoop में नेटवर्क टोपोलॉजी

आमतौर पर, नेटवर्क बैंडविड्थ किसी भी नेटवर्क को बनाते समय विचार करने के लिए एक महत्वपूर्ण कारक है। हालाँकि, बैंडविड्थ को मापना मुश्किल हो सकता है, इसलिए Hadoop में, एक नेटवर्क को एक पेड़ के रूप में दर्शाया जाता है और इस पेड़ के नोड्स (हॉप्स की संख्या) के बीच की दूरी को Hadoop क्लस्टर के निर्माण में एक महत्वपूर्ण कारक माना जाता है। यहाँ, दो नोड्स के बीच की दूरी उनके निकटतम सामान्य पूर्वज से उनकी दूरी के योग के बराबर है।

हाडोप क्लस्टर में डेटा सेंटर, रैक और नोड होते हैं जो वास्तव में जॉब निष्पादित करते हैं। यहाँ, डेटा सेंटर में रैक होते हैं और रैक में नोड्स होते हैं। प्रक्रियाओं के लिए उपलब्ध नेटवर्क बैंडविड्थ प्रक्रियाओं के स्थान के आधार पर भिन्न होता है। यानी, जैसे-जैसे हम दूर जाते हैं, उपलब्ध बैंडविड्थ कम होता जाता है-

  • एक ही नोड पर प्रक्रियाएँ
  • एक ही रैक पर विभिन्न नोड्स
  • एक ही डेटा सेंटर के विभिन्न रैक पर नोड्स
  • विभिन्न डेटा केंद्रों में नोड्स

इस पोस्ट को संक्षेप में इस प्रकार लिखें: