डेटा वेयरहाउस मॉडलिंग में स्टार स्कीमा क्या है?

⚡ स्मार्ट सारांश

डेटा वेयरहाउस मॉडलिंग में स्टार स्कीमा एक केंद्रीय तथ्य तालिका को आसपास की आयाम तालिकाओं के मूल में रखता है, जिससे एक गैर-सामान्यीकृत, तारा-आकार का डिज़ाइन बनता है जो विश्लेषणात्मक प्रश्नों को सरल बनाता है, रिपोर्टिंग को गति देता है और व्यावसायिक बुद्धिमत्ता प्लेटफार्मों में OLAP क्यूब्स को शक्ति प्रदान करता है।

  • 🌟 कोर संरचना: एक केंद्रीय तथ्य तालिका सीधे डीनोर्मलाइज़्ड आयाम तालिकाओं से जुड़ती है, जिससे तारे के आकार का निर्माण होता है जो स्कीमा को नाम देता है।
  • 📊 तथ्य तालिकाएँ: फैक्ट टेबल में बेची गई इकाइयों और राजस्व जैसे मापों के साथ-साथ प्रत्येक आसपास के आयाम से जुड़ने वाली विदेशी कुंजियाँ भी संग्रहीत होती हैं।
  • ️ आयाम सारणी: डाइमेंशन टेबल में उत्पाद, डीलर, शाखा और तिथि जैसे वर्णनात्मक गुण होते हैं जो विश्लेषकों को तथ्यों को विभाजित और फ़िल्टर करने की अनुमति देते हैं।
  • ⚡ क्वेरी प्रदर्शन: डिनॉर्मलाइज़्ड डाइमेंशन का मतलब है कम जॉइन, इसलिए स्टार स्कीमा बड़े डेटा सेट पर सरल SQL और तेज़ रिपोर्टिंग प्रदान करता है।
  • ❄️ तारा बनाम हिमखंड: स्टार स्कीमा प्रत्येक आयाम को एक ही तालिका में रखता है, जबकि स्नोफ्लेक स्कीमा आयामों को आपस में जुड़ी उप-आयाम तालिकाओं में सामान्यीकृत करता है।
  • ️ डिजाइन के चरण: स्टार स्कीमा का निर्माण किम्बल प्रवाह का अनुसरण करता है: व्यावसायिक प्रक्रिया का चयन करें, आधार निर्धारित करें, आयाम चुनें, और फिर तथ्यों को परिभाषित करें।
  • 🧊 ओएलएपी और बीआई: स्टार स्कीमा OLAP क्यूब्स को डेटा प्रदान करते हैं और BI टूल्स द्वारा व्यापक रूप से समर्थित हैं, हालांकि भारी डीनॉर्मलाइज़ेशन डेटा की अखंडता को कमजोर करता है।

डेटा वेयरहाउस मॉडलिंग में स्टार स्कीमा, जिसमें एक केंद्रीय तथ्य तालिका और उसके चारों ओर आयाम तालिकाएँ शामिल हैं।

स्टार स्कीमा क्या है?

A स्टार स्कीमा डेटा वेयरहाउस में मॉडलिंग संरचना वह होती है जिसमें एक केंद्रीय तथ्य तालिका कई संबंधित आयाम तालिकाओं से जुड़ी होती है। इसे स्टार स्कीमा कहा जाता है क्योंकि इसका लेआउट एक तारे जैसा होता है, जिसमें तथ्य तालिका केंद्र में होती है और आयाम तालिकाएँ बिंदुओं की तरह बाहर की ओर फैली होती हैं।

स्टार स्कीमा डेटा वेयरहाउस स्कीमा का सबसे सरल प्रकार है, और इसे स्टार जॉइन स्कीमा के नाम से भी जाना जाता है। क्योंकि इसकी आयाम तालिकाएँ डीनॉर्मलाइज़्ड होती हैं, इसलिए यह मॉडल बहुत बड़े डेटा सेटों को क्वेरी करने के लिए अनुकूलित है, जो इसे एक सामान्य विकल्प बनाता है। आयामी मॉडलिंग और रिपोर्टिंग.

बहुआयामी स्कीमा क्या है?

A बहुआयामी योजना इसे विशेष रूप से डेटा वेयरहाउस सिस्टम को मॉडल करने के लिए डिज़ाइन किया गया है। ये स्कीमा उन बहुत बड़े डेटाबेस की अनूठी ज़रूरतों को पूरा करते हैं जो विश्लेषणात्मक उद्देश्यों के लिए बनाए गए हैं। OLAP नियमित लेनदेन प्रसंस्करण के बजाय।

डेटा वेयरहाउस स्कीमा के प्रकार: बहुआयामी योजनाओं के तीन मुख्य प्रकार हैं, और प्रत्येक की अपनी-अपनी खूबियां हैं।

  • स्टार स्कीमा – एक केंद्रीय तथ्य तालिका जो सीधे डीनोर्मलाइज़्ड आयाम तालिकाओं से जुड़ी होती है।
  • स्नोफ्लेक स्कीमा – स्टार स्कीमा का एक विस्तार जिसमें आयामों को अतिरिक्त उप-आयाम तालिकाओं में सामान्यीकृत किया जाता है।
  • आकाशगंगा योजना इसे फैक्ट कॉन्स्टेलेशन भी कहा जाता है, इसमें कई फैक्ट टेबल का उपयोग किया जाता है जो कॉमन डायमेंशन टेबल साझा करते हैं।

क्योंकि स्नोफ्लेक स्कीमा सीधे स्टार स्कीमा पर आधारित है, इसलिए विस्तृत स्टार स्कीमा उदाहरण पर काम करने से पहले दोनों मॉडलों की तुलना करना सहायक होता है।

स्टार स्कीमा बनाम स्नोफ्लेक स्कीमा

तारा योजना और स्नोफ्लेक स्कीमा दोनों ही डेटा को फैक्ट और डाइमेंशन टेबल के आधार पर व्यवस्थित करते हैं, लेकिन डाइमेंशन को स्टोर करने के तरीके में अंतर होता है। स्टार स्कीमा प्रत्येक डाइमेंशन को एक ही डीनॉर्मलाइज़्ड टेबल में रखता है, जबकि स्नोफ्लेक स्कीमा उन डाइमेंशन को कई संबंधित टेबल में नॉर्मलाइज़ करता है।

  • संरचना: तारा संरचना सपाट और सरल होती है; जबकि हिमखंड संरचना आयामों को उप-आयामों में विभाजित करती है।
  • क्वेरी गति: स्टार स्कीमा में कम जॉइन की आवश्यकता होती है, इसलिए क्वेरी आमतौर पर तेजी से चलती हैं और SQL सरल रहता है।
  • भंडारण: स्नोफ्लेक स्कीमा अनावश्यकता को दूर करते हैं, इसलिए वे कम जगह का उपयोग करते हैं लेकिन डिजाइन की जटिलता को बढ़ाते हैं।
  • आंकड़ा शुचिता: सामान्यीकृत स्नोफ्लेक आयाम अखंडता को बेहतर ढंग से लागू करते हैं, जबकि गैर-सामान्यीकृत स्टार आयाम प्रदर्शन को प्राथमिकता देते हैं।
  • उपयोग में आसानी: विश्लेषकों के लिए स्टार स्कीमा को समझना आसान होता है और इसे बनाए रखना भी तेज़ होता है, जबकि स्नोफ्लेक स्कीमा के लिए अधिक सावधानीपूर्वक डिजाइन की आवश्यकता होती है।

व्यवहार में, टीमें अक्सर डेटा मार्ट और डैशबोर्ड के लिए स्टार स्कीमा का चयन करती हैं, जिन्हें तेज़ और सरल रिपोर्टिंग की आवश्यकता होती है, और स्नोफ्लेक स्कीमा का चयन तब करती हैं जब स्टोरेज की बचत और सख्त स्थिरता अधिक मायने रखती है।

स्टार स्कीमा का उदाहरण

निम्नलिखित स्टार स्कीमा उदाहरण में, फैक्ट टेबल केंद्र में स्थित है और इसमें प्रत्येक आयाम तालिका की कुंजी होती है, जैसे कि Dealer_ID, Model_ID, Date_ID, Product_ID और Branch_ID, साथ ही इकाइयों की बिक्री और राजस्व जैसे मापने योग्य विशेषताएँ भी होती हैं।

उत्पाद, डीलर, शाखा, तिथि और मॉडल आयाम तालिकाओं से जुड़ी एक केंद्रीय बिक्री तथ्य तालिका के साथ स्टार स्कीमा डेटा मॉडलिंग का उदाहरण।
स्टार स्कीमा आरेख का उदाहरण

प्रत्येक संबंधित आयाम तालिका उन मापों में वर्णनात्मक संदर्भ जोड़ती है, इसलिए एक ही क्वेरी किसी अन्य तालिका को जोड़े बिना डीलर, मॉडल, तिथि, उत्पाद या शाखा के आधार पर बिक्री तथ्यों को समूहित या फ़िल्टर कर सकती है।

तथ्य तालिकाएँ

स्टार स्कीमा में एक फैक्ट टेबल में फैक्ट्स होते हैं और यह डाइमेंशन से जुड़ी होती है। एक फैक्ट टेबल में दो प्रकार के कॉलम होते हैं:

  • एक कॉलम जिसमें तथ्य या माप संग्रहीत होते हैं।
  • प्रत्येक आयाम तालिका से जुड़ने वाली विदेशी कुंजियाँ।

सामान्यतः, किसी फैक्ट टेबल की प्राइमरी की एक कंपोजिट की होती है जो टेबल को बनाने वाली सभी फॉरेन कीज़ से मिलकर बनी होती है।

तथ्य तालिकाओं में विस्तृत तथ्य या एकत्रित तथ्य शामिल हो सकते हैं। एकत्रित तथ्यों वाली तथ्य तालिकाओं को अक्सर सारांश तालिकाएँ कहा जाता है, और इनमें आमतौर पर ऐसे तथ्य होते हैं जिन्हें पहले ही किसी स्तर तक एकत्रित किया जा चुका होता है।

आयाम सारणी

डाइमेंशन एक ऐसी संरचना है जो डेटा को एक पदानुक्रम में वर्गीकृत करती है। पदानुक्रम और स्तरों के बिना डाइमेंशन को फ्लैट डाइमेंशन या सूची कहा जाता है। प्रत्येक डाइमेंशन टेबल की प्राथमिक कुंजी, फैक्ट टेबल की समग्र प्राथमिक कुंजी का हिस्सा होती है।

डाइमेंशन एट्रिब्यूट एक वर्णनात्मक, पाठ्य एट्रिब्यूट है जो किसी डाइमेंशनल वैल्यू, जैसे कि उत्पाद का नाम या शहर, का वर्णन करने में सहायक होता है। चूंकि डाइमेंशन टेबल ट्रांजैक्शनल इवेंट्स के बजाय इस वर्णनात्मक संदर्भ को स्टोर करती हैं, इसलिए फैक्ट टेबल आमतौर पर डाइमेंशन टेबल से कहीं बड़ी होती हैं।

स्टार स्कीमा कैसे डिज़ाइन करें

स्टार स्कीमा का डिज़ाइन राल्फ किम्बल द्वारा लोकप्रिय किए गए आयामी मॉडलिंग दृष्टिकोण का अनुसरण करता है। इसका लक्ष्य स्पष्ट, पुन: प्रयोज्य आयामों के आधार पर व्यावसायिक मापों को व्यवस्थित करना है ताकि तैयार मॉडल को क्वेरी करना आसान हो और उस पर त्वरित रिपोर्ट तैयार की जा सके। नीचे दिए गए पाँच चरण उस प्रक्रिया की रूपरेखा प्रस्तुत करते हैं जिसका पालन अधिकांश आयामी मॉडलिंग परियोजनाएँ करती हैं, जो उच्चतम स्तर के व्यावसायिक प्रश्न से शुरू होकर भौतिक तथ्य और आयाम तालिकाओं तक जाती हैं।

  1. व्यावसायिक प्रक्रिया की पहचान करें: आप जिस गतिविधि का विश्लेषण करना चाहते हैं, उसे चुनें, जैसे बिक्री, शिपमेंट आदि।pingया इन्वेंट्री। यह निर्णय परिभाषित करता है कि तथ्य तालिका क्या मापेगी।
  2. अनाज की घोषणा करें: प्रत्येक तथ्य पंक्ति में दी गई जानकारी का स्तर निर्धारित करें, उदाहरण के लिए प्रति पंक्ति, प्रति लेन-देन या प्रति दिन। स्पष्ट संरचना मॉडल को सुसंगत बनाए रखती है।
  3. आयामों की पहचान करें: तथ्यों को अलग-अलग भागों में बांटने के लिए आवश्यक वर्णनात्मक संदर्भ सूचीबद्ध करें, जैसे कि उत्पाद, ग्राहक, डीलर, शाखा और तिथि। इनमें से प्रत्येक एक विशेषता का आयाम सारणी बन जाता है।
  4. तथ्यों की पहचान करें: व्यवसाय द्वारा वांछित संख्यात्मक मापों का निर्धारण करें। track, जैसे बेची गई इकाइयाँ, राजस्व या लागत, को केंद्रीय तथ्य तालिका में रखें।
  5. तारा बनाएं: फ़ॉरेन कीज़ के माध्यम से फ़ैक्ट टेबल को प्रत्येक आयाम से कनेक्ट करें।ping आयामों को इस प्रकार से विसामान्यीकृत किया जाता है कि आरेख अपने आयामों से घिरी एक एकल केंद्रीय तथ्य तालिका का रूप ले लेता है।

स्टार स्कीमा बन जाने के बाद, प्रत्येक आयाम में एक सरोगेट कुंजी जोड़ें, सुनिश्चित करें कि प्रत्येक तथ्य तालिका में एक संबंधित दिनांक आयाम हो, और पुष्टि करें कि सभी तथ्य एक ही स्तर पर हों। यह भी एक अच्छी प्रक्रिया है कि सबसे पहले एटॉमिक, निम्नतम स्तर का डेटा लोड किया जाए, क्योंकि सारांश तालिकाएँ बाद में प्राप्त की जा सकती हैं। इन नियमों का पालन करने से स्कीमा उच्च प्रदर्शन और सरलता के लिए अनुकूलित रहता है। डाटा गोदाम रिपोर्टिंग।

स्टार स्कीमा की विशेषताएँ

  • स्टार स्कीमा में प्रत्येक आयाम को केवल एक आयाम तालिका द्वारा दर्शाया जाता है।
  • प्रत्येक आयाम तालिका में विशेषताओं का अपना एक समूह होता है।
  • डिमिशन टेबल को फैक्ट टेबल से फॉरेन की का उपयोग करके जोड़ा जाता है।
  • आयाम सारणी एक दूसरे से जुड़ी हुई नहीं हैं।
  • तथ्य तालिका में कुंजी और माप शामिल हैं।
  • स्टार स्कीमा को समझना आसान है और यह डिस्क का इष्टतम उपयोग प्रदान करता है।
  • डाइमेंशन टेबल नॉर्मलाइज़्ड नहीं हैं। उदाहरण के लिए, ऊपर दिए गए उदाहरण में, Country_ID में एक अलग कंट्री लुकअप टेबल नहीं है, जैसा कि एक अन्य टेबल में होता है। OLTP डिजाइन ऐसा होगा।
  • यह योजना बीआई टूल्स द्वारा व्यापक रूप से समर्थित है।

स्टार स्कीमा के लाभ

स्टार स्कीमा कई लाभ प्रदान करता है जो इसे डेटा वेयरहाउस डिजाइन के लिए एक लोकप्रिय प्रारंभिक बिंदु बनाता है:

  • स्टार स्कीमा, अत्यधिक मानकीकृत लेनदेन स्रोतों से डेटा प्राप्त करते समय अन्य स्कीमाओं की तुलना में सरल जॉइन लॉजिक का उपयोग करते हैं।
  • स्टार स्कीमा सामान्य व्यावसायिक रिपोर्टिंग तर्क को सरल बनाता है, जैसे कि अवधि-दर-अवधि और दिनांक-वार रिपोर्टिंग।
  • स्टार स्कीमा का उपयोग OLAP सिस्टम द्वारा क्यूब्स को कुशलतापूर्वक बनाने के लिए व्यापक रूप से किया जाता है, और अधिकांश प्रमुख OLAP सिस्टम में क्यूब संरचना को डिजाइन किए बिना स्टार स्कीमा एक स्रोत के रूप में कार्य कर सकता है।
  • क्वेरी पर लागू की जा सकने वाली विशिष्ट प्रदर्शन ट्यूनिंग को सक्षम करके, क्वेरी प्रोसेसर बेहतर निष्पादन योजनाएँ प्रदान कर सकता है।

स्टार स्कीमा के नुकसान

  • क्योंकि स्कीमा अत्यधिक डीनॉर्मलाइज़्ड है, इसलिए डेटा अखंडता को सख्ती से लागू नहीं किया जाता है।
  • यह उन्नत विश्लेषणात्मक आवश्यकताओं के मामले में लचीला नहीं है।
  • स्टार स्कीमा व्यावसायिक संस्थाओं के बीच अनेक-से-अनेक संबंधों को सुदृढ़ नहीं करते हैं।

स्टार स्कीमा का उपयोग कब करें

जब स्टोरेज स्पेस बचाने की तुलना में तेज़ और अनुमानित क्वेरी प्रदर्शन अधिक महत्वपूर्ण हो, तो स्टार स्कीमा सही विकल्प है। चूंकि यह मॉडल अपने डाइमेंशन टेबल को डीनॉर्मलाइज़्ड रखता है और जॉइन की संख्या कम रखता है, इसलिए यह उन विश्लेषणात्मक वर्कलोड के लिए उपयुक्त है जहां व्यावसायिक उपयोगकर्ता ऐतिहासिक डेटा की बड़ी मात्रा पर बार-बार समान रिपोर्ट, डैशबोर्ड और एग्रीगेशन चलाते हैं।

स्टार स्कीमा के उपयुक्त होने की विशिष्ट स्थितियों में निम्नलिखित शामिल हैं:

  • डेटा मार्ट्स: विभागीय डेटा मार्ट्स सरल और सुस्पष्ट संबंधों वाले उदाहरण पठनीय संरचना से लाभान्वित होते हैं।
  • बीआई डैशबोर्ड: व्यापारिक सूचना टूल्स को स्टार स्कीमा पर आसानी से मैप किया जा सकता है, इसलिए रिपोर्ट और विजुअल्स को जल्दी से बनाया जा सकता है।
  • ओएलएपी क्यूब्स: स्टार स्कीमा OLAP क्यूब्स, एग्रीगेशन और स्लाइस-एंड-डाइस विश्लेषण के लिए एक स्वाभाविक स्रोत हैं।

यदि प्राथमिकता न्यूनतम स्टोरेज, सख्त डेटा अखंडता, या गहन, परिवर्तनशील पदानुक्रमों की ओर स्थानांतरित होती है, तो स्नोफ्लेक स्कीमा या अधिक मानकीकृत डिज़ाइन बेहतर साबित हो सकता है। कई टीमें तो इन दोनों को मिलाकर भी काम करती हैं, स्टार स्कीमा से शुरुआत करती हैं और केवल उन्हीं आयामों को मानकीकृत करती हैं जिनकी वास्तव में आवश्यकता होती है।

अक्सर पूछे जाने वाले प्रश्न

फ़ैक्ट टेबल में मापनीय, संख्यात्मक व्यावसायिक घटनाएँ, जैसे बेची गई इकाइयाँ या राजस्व, और फ़ॉरेन कीज़ संग्रहित होती हैं। डाइमेंशन टेबल में वर्णनात्मक विशेषताएँ, जैसे उत्पाद, तिथि या शाखा, संग्रहित होती हैं जो इन तथ्यों को संदर्भ प्रदान करती हैं। फ़ैक्ट टेबल आमतौर पर डाइमेंशन टेबल से कहीं अधिक बड़ी होती हैं।

स्टार स्कीमा को डीनॉर्मलाइज़ किया जाता है। प्रत्येक आयाम को बिना लुकअप सब-टेबल के एक ही टेबल में संग्रहित किया जाता है, जिससे जॉइन की संख्या कम हो जाती है और क्वेरी की गति बढ़ जाती है। हालांकि, नॉर्मलाइज़्ड स्नोफ्लेक स्कीमा की तुलना में इसमें कुछ डेटा रिडंडेंसी और डेटा इंटीग्रिटी का कमज़ोर प्रवर्तन होता है।

गैलेक्सी स्कीमा, जिसे फैक्ट कॉन्स्टेलेशन भी कहा जाता है, में कई फैक्ट टेबल होते हैं जो कॉमन डायमेंशन टेबल साझा करते हैं। यह जटिल डेटा वेयरहाउस के लिए उपयुक्त है। tracयह एक साथ कई व्यावसायिक प्रक्रियाओं को संभाल सकता है, लेकिन इसे डिजाइन करना और क्वेरी करना सिंगल-फैक्ट स्टार स्कीमा की तुलना में अधिक कठिन है।

एक क्लासिक स्टार स्कीमा में एक केंद्रीय फैक्ट टेबल का उपयोग होता है। जब किसी वेयरहाउस को कई फैक्ट टेबल की आवश्यकता होती है जो आयामों को साझा करती हैं, तो डिज़ाइन गैलेक्सी या फैक्ट कॉन्स्टेलेशन स्कीमा बन जाता है।ping प्रत्येक तारे के लिए एक तथ्य तालिका होने से प्रश्न सरल रहते हैं और मॉडल को समझना आसान हो जाता है।

सरोगेट कुंजी एक सिस्टम-जनरेटेड पहचानकर्ता है, जो आमतौर पर एक पूर्णांक होता है, और इसका उपयोग व्यावसायिक कुंजी के बजाय आयाम तालिका की प्राथमिक कुंजी के रूप में किया जाता है। यह जॉइन को तेज़ रखता है, स्रोत कुंजियों में परिवर्तन होने पर भी स्थिर रहता है, और समर्थन करता है। tracआयामों में ऐतिहासिक परिवर्तन हुए।

हां. बिजली बीआई यह स्टार स्कीमा के लिए अनुकूलित है, इसलिए आयामों से घिरी एक तथ्य तालिका के रूप में डेटा को मॉडल करने से प्रदर्शन में सुधार होता है, DAX माप सरल हो जाते हैं, और स्नोफ्लेक या फ्लैट डिज़ाइन की तुलना में संबंधों को प्रबंधित करना आसान हो जाता है।

एआई सहायक स्कीमा विवरण से तथ्य और आयाम तालिकाओं का सुझाव दे सकते हैं, एक ग्रेन की अनुशंसा कर सकते हैं, और गुम तिथि आयामों या सरोगेट कुंजियों को चिह्नित कर सकते हैं। वे मॉडलिंग को गति देते हैं, लेकिन उत्पादन में इसे लागू करने से पहले एक डेटा इंजीनियर को प्रस्तावित डिज़ाइन की समीक्षा करनी चाहिए।

हां. ChatGPT और गिटहब कोपिलॉट एक संक्षिप्त संकेत के आधार पर फैक्ट और डायमेंशन टेबल के लिए CREATE TABLE और जॉइन क्वेरी तैयार कर सकता है। RevSQL चलाने से पहले जनरेट की गई कुंजियों, डेटा प्रकारों और ग्रेन की जांच कर लें, क्योंकि AI आवश्यकताओं को गलत समझ सकता है।

इस पोस्ट को संक्षेप में इस प्रकार लिखें: