डेटा माइनिंग ट्यूटोरियल: डेटा माइनिंग क्या है? तकनीक, प्रक्रिया
⚡ स्मार्ट सारांश
डेटा माइनिंग एक ऐसी प्रक्रिया है जिसके द्वारा बड़े डेटा सेट में संभावित रूप से उपयोगी पैटर्न खोजे जाते हैं। यह पृष्ठ छह चरणों वाली कार्यान्वयन प्रक्रिया, सात प्रमुख तकनीकों, उन्हें समर्थन देने वाले उपकरणों, वास्तविक व्यावसायिक उदाहरणों और प्रत्येक दृष्टिकोण के लाभों और सीमाओं के बारे में बताता है।
डाटा माइनिंग क्या है?
आँकड़ा खनन विशाल डेटा सेट से संभावित रूप से उपयोगी पैटर्न खोजने की एक प्रक्रिया है। यह एक बहु-विषयक कौशल है जो यंत्र अधिगमसांख्यिकी और एआई का उपयोग करकेtracडेटा माइनिंग से प्राप्त जानकारी का उपयोग भविष्य की घटनाओं की संभावना का आकलन करने के लिए किया जाता है। इससे प्राप्त जानकारियों का उपयोग मार्केटिंग, धोखाधड़ी का पता लगाने, वैज्ञानिक खोज आदि के लिए किया जाता है।
डेटा माइनिंग का मतलब है डेटा के बीच छिपे हुए, अनपेक्षित और पहले से अज्ञात लेकिन मान्य संबंधों को खोजना। डेटा माइनिंग को नॉलेज डिस्कवरी इन डेटा (केडीडी) या नॉलेज एक्सट्रैक्शन भी कहा जाता है।tracडेटा/पैटर्न विश्लेषण, सूचना संकलन आदि।
डेटा के प्रकार
डेटा माइनिंग निम्न प्रकार के डेटा पर किया जा सकता है
- रिलेशनल डेटाबेस
- डेटा वेयरहाउस
- उन्नत डेटाबेस और सूचना भंडार
- ऑब्जेक्ट-ओरिएंटेड और ऑब्जेक्ट-रिलेशनल डेटाबेस
- लेन-देन संबंधी और स्थानिक डेटाबेस
- विषम और विरासत डेटाबेस
- मल्टीमीडिया और स्ट्रीमिंग डेटाबेस
- पाठ डेटाबेस
- टेक्स्ट माइनिंग और वेब माइनिंग
स्रोत चाहे जो भी हो, चरणों का वही अनुशासित क्रम उस कच्चे डेटा को एक उपयोगी मॉडल में बदल देता है।
डेटा माइनिंग की कार्यान्वयन प्रक्रिया

आइए डेटा माइनिंग कार्यान्वयन प्रक्रिया का विस्तार से अध्ययन करें
व्यावसायिक समझ
इस चरण में, व्यवसाय और डेटा-माइनिंग लक्ष्य निर्धारित किए जाते हैं।
- सबसे पहले, आपको व्यवसाय और क्लाइंट के उद्देश्यों को समझना होगा। आपको यह परिभाषित करना होगा कि आपका क्लाइंट क्या चाहता है (जिसे कई बार वे खुद भी नहीं जानते हैं)
- वर्तमान डेटा माइनिंग परिदृश्य का जायजा लें। अपने मूल्यांकन में संसाधनों, धारणा, बाधाओं और अन्य महत्वपूर्ण कारकों को शामिल करें।
- व्यावसायिक उद्देश्यों और वर्तमान परिदृश्य का उपयोग करते हुए, अपने डेटा खनन लक्ष्यों को परिभाषित करें।
- एक अच्छी डेटा माइनिंग योजना बहुत विस्तृत होती है और इसे व्यवसाय और डेटा माइनिंग दोनों लक्ष्यों को पूरा करने के लिए विकसित किया जाना चाहिए।
डेटा समझ
इस चरण में, डेटा की उपयुक्तता की जांच की जाती है ताकि यह सुनिश्चित किया जा सके कि यह डेटा माइनिंग के लक्ष्यों के लिए उपयुक्त है या नहीं।
- सबसे पहले, संगठन में उपलब्ध विभिन्न डेटा स्रोतों से डेटा एकत्र किया जाता है।
- इन डेटा स्रोतों में कई डेटाबेस, फ्लैट फाइलें या डेटा क्यूब शामिल हो सकते हैं। डेटा एकीकरण प्रक्रिया के दौरान ऑब्जेक्ट मिलान और स्कीमा एकीकरण जैसी समस्याएं उत्पन्न हो सकती हैं। यह एक जटिल और पेचीदा प्रक्रिया है क्योंकि विभिन्न स्रोतों से प्राप्त डेटा का आसानी से मिलान होना मुश्किल होता है। उदाहरण के लिए, तालिका A में cust_no नामक एक इकाई है, जबकि दूसरी तालिका B में cust-id नामक एक इकाई है।
- इसलिए, यह सुनिश्चित करना काफी मुश्किल है कि ये दोनों दिए गए ऑब्जेक्ट एक ही मान को संदर्भित करते हैं या नहीं। यहाँ, डेटा एकीकरण प्रक्रिया में त्रुटियों को कम करने के लिए डेटा का उपयोग किया जाना चाहिए।
- अगला चरण है प्राप्त डेटा के गुणों की खोज करना। डेटा का पता लगाने का एक अच्छा तरीका क्वेरी, रिपोर्टिंग और विज़ुअलाइज़ेशन टूल का उपयोग करके डेटा माइनिंग प्रश्नों (व्यावसायिक चरण में तय) का उत्तर देना है।
- जांच के परिणामों के आधार पर, डेटा की गुणवत्ता सुनिश्चित की जानी चाहिए। यदि कोई डेटा अनुपलब्ध है, तो उसे प्राप्त किया जाना चाहिए।
डेटा तैयारी
इस चरण में, डेटा को उत्पादन के लिए तैयार किया जाता है।
डेटा तैयार करना आमतौर पर सबसे लंबा चरण होता है, जिसे आमतौर पर कुल प्रयास का 60% से 80% माना जाता है।
विभिन्न स्रोतों से प्राप्त डेटा का चयन, शुद्धिकरण, रूपांतरण, स्वरूपण, अनामकरण और निर्माण (यदि आवश्यक हो) किया जाना चाहिए।
डेटा क्लीनिंग, शोर वाले डेटा को सुचारू करके और लुप्त मानों को भरकर डेटा को “साफ़” करने की एक प्रक्रिया है।
उदाहरण के लिए, ग्राहक जनसांख्यिकी प्रोफ़ाइल के लिए, आयु डेटा गायब है। डेटा अधूरा है और इसे भरना चाहिए। कुछ मामलों में, डेटा आउटलेयर हो सकता है। उदाहरण के लिए, आयु का मान 300 है। डेटा असंगत हो सकता है। उदाहरण के लिए, ग्राहक का नाम अलग-अलग तालिकाओं में अलग-अलग है।
डेटा रूपांतरण प्रक्रियाओं के माध्यम से डेटा को इस प्रकार बदला जाता है जिससे वह डेटा माइनिंग में उपयोगी हो सके। निम्नलिखित रूपांतरण लागू किए जा सकते हैं।
डेटा परिवर्तन
डेटा रूपांतरण कार्य खनन प्रक्रिया की सफलता में योगदान देगा।
चौरसाई: यह डेटा से शोर को हटाने में मदद करता है।
एकत्रीकरण: डेटा पर सारांश या एकत्रीकरण ऑपरेशन लागू किए जाते हैं। यानी, साप्ताहिक बिक्री डेटा को मासिक और वार्षिक कुल की गणना करने के लिए एकत्र किया जाता है।
सामान्यीकरण: इस चरण में, अवधारणा पदानुक्रम की सहायता से निम्न-स्तरीय डेटा को उच्च-स्तरीय अवधारणाओं से प्रतिस्थापित किया जाता है। उदाहरण के लिए, शहर को राज्य या देश से प्रतिस्थापित किया जाता है।
सामान्यीकरण: जब एट्रिब्यूट डेटा को बढ़ाया या घटाया जाता है, तब नॉर्मलाइज़ेशन किया जाता है। उदाहरण: नॉर्मलाइज़ेशन के बाद डेटा -2.0 से 2.0 की सीमा में होना चाहिए।
विशेषता निर्माणये विशेषताएँ निर्मित की जाती हैं और डेटा माइनिंग के लिए उपयोगी विशेषताओं के दिए गए सेट में शामिल की जाती हैं।
इस प्रक्रिया का परिणाम एक अंतिम डेटा सेट है जिसका उपयोग मॉडलिंग में किया जा सकता है।
मोडलिंग
इस चरण में, डेटा पैटर्न निर्धारित करने के लिए गणितीय मॉडल का उपयोग किया जाता है।
- व्यावसायिक उद्देश्यों के आधार पर, तैयार डेटासेट के लिए उपयुक्त मॉडलिंग तकनीकों का चयन किया जाना चाहिए।
- मॉडल की गुणवत्ता और वैधता की जांच करने के लिए एक परिदृश्य बनाएं।
- तैयार डेटासेट पर मॉडल चलाएँ.
- सभी हितधारकों द्वारा परिणामों का मूल्यांकन किया जाना चाहिए ताकि यह सुनिश्चित किया जा सके कि मॉडल डेटा माइनिंग उद्देश्यों को पूरा कर सकता है।
मूल्यांकन
इस चरण में, पहचाने गए पैटर्न का व्यावसायिक उद्देश्यों के आधार पर मूल्यांकन किया जाता है।
- डेटा माइनिंग मॉडल द्वारा उत्पन्न परिणामों का मूल्यांकन व्यावसायिक उद्देश्यों के आधार पर किया जाना चाहिए।
- व्यवसाय की समझ हासिल करना एक पुनरावृत्तीय प्रक्रिया है। वास्तव में, समझने के दौरान, डेटा माइनिंग के कारण नई व्यावसायिक आवश्यकताएँ उत्पन्न हो सकती हैं।
- मॉडल को परिनियोजन चरण में स्थानांतरित करने के लिए आगे बढ़ने या न बढ़ने का निर्णय लिया जाता है।
तैनाती
परिनियोजन चरण में, आप अपने डेटा खनन खोजों को रोजमर्रा के व्यावसायिक कार्यों में भेजते हैं।
- डेटा माइनिंग प्रक्रिया के दौरान प्राप्त ज्ञान या सूचना को गैर-तकनीकी हितधारकों के लिए समझना आसान बनाया जाना चाहिए।
- जहाज के लिए एक विस्तृत तैनाती योजनाpingडेटा माइनिंग से प्राप्त निष्कर्षों का रखरखाव और निगरानी की जाती है।
- परियोजना के दौरान सीखे गए सबक और प्रमुख अनुभवों के साथ एक अंतिम परियोजना रिपोर्ट तैयार की जाती है। इससे संगठन की व्यावसायिक नीति को बेहतर बनाने में मदद मिलती है।
ऊपर वर्णित मॉडलिंग चरण तकनीकों के एक परिभाषित समूह पर आधारित है, जिनमें से प्रत्येक अलग-अलग प्रकार के प्रश्न के लिए उपयुक्त है।
डाटा माइनिंग तकनीक
1. वर्गीकरण
इस विश्लेषण का उपयोग डेटा और मेटाडेटा के बारे में महत्वपूर्ण और प्रासंगिक जानकारी प्राप्त करने के लिए किया जाता है। यह डेटा माइनिंग विधि डेटा को विभिन्न वर्गों में वर्गीकृत करने में मदद करती है।
2. Clusterआईएनजी
Clusterडेटा विश्लेषण एक डेटा माइनिंग तकनीक है जो एक दूसरे के समान डेटा की पहचान करती है। यह प्रक्रिया डेटा के बीच अंतर और समानता को समझने में मदद करती है।
3. रिग्रेशन
प्रतिगमन विश्लेषण चरों के बीच संबंधों की पहचान करने और उनका विश्लेषण करने की डेटा माइनिंग विधि है। इसका उपयोग अन्य चरों की उपस्थिति को देखते हुए, किसी विशिष्ट चर की संभावना की पहचान करने के लिए किया जाता है।
4. एसोसिएशन के नियम
यह डेटा माइनिंग तकनीक दो या अधिक आइटम के बीच संबंध खोजने में मदद करती है। यह डेटा सेट में छिपे पैटर्न की खोज करती है।
5. आउटलायर डिटेक्शन
इस प्रकार की डेटा माइनिंग तकनीक में डेटासेट में उन डेटा आइटमों का अवलोकन किया जाता है जो अपेक्षित पैटर्न या व्यवहार से मेल नहीं खाते। इस तकनीक का उपयोग घुसपैठ का पता लगाने, धोखाधड़ी या त्रुटि का पता लगाने आदि जैसे विभिन्न क्षेत्रों में किया जा सकता है। आउटलायर डिटेक्शन को आउटलायर एनालिसिस या आउटलायर माइनिंग भी कहा जाता है।
6. अनुक्रमिक पैटर्न
यह डेटा माइनिंग तकनीक निश्चित अवधि के लिए लेनदेन डेटा में समान पैटर्न या प्रवृत्तियों को खोजने या पहचानने में मदद करती है।
7. भविष्यवाणी
पूर्वानुमान में डेटा माइनिंग की अन्य तकनीकों जैसे रुझान, अनुक्रमिक पैटर्न, क्लस्टरिंग, वर्गीकरण आदि के संयोजन का उपयोग किया गया है। यह भविष्य की घटना की भविष्यवाणी करने के लिए पिछले घटनाओं या उदाहरणों का सही क्रम में विश्लेषण करता है।
Descriptलाइव बनाम प्रेडिक्टिव डेटा माइनिंग
ऊपर बताई गई सात तकनीकें दो श्रेणियों में आती हैं, और यह जानना कि कोई प्रश्न किस श्रेणी में आता है, यह निर्धारित करता है कि परिणाम को कैसे पढ़ा जाना चाहिए।
Descriptलाइव डेटा माइनिंग यह पहले से घटित घटनाओं का सारांश प्रस्तुत करता है। यह बिना किसी लक्ष्य के मौजूदा डेटा के भीतर संरचना की खोज करता है, इसीलिए इसे कभी-कभी अनसुपरवाइज्ड भी कहा जाता है। Clusterसहसंबंध नियम और अनुक्रमिक पैटर्न यहाँ लागू होते हैं। एक सुपरमार्केट को यह पता चलता है कि डायपर और बीयर अक्सर एक साथ खरीदे जाते हैं, यह एक वर्णनात्मक खोज है: यह अतीत की व्याख्या करती है, और एक इंसान तय करता है कि इसके बारे में क्या करना है।
भविष्यसूचक डेटा खनन यह आगे क्या होगा इसका अनुमान लगाता है। यह उन ऐतिहासिक रिकॉर्डों से सीखता है जहाँ उत्तर पहले से ही ज्ञात होता है, फिर उस सीख को नए रिकॉर्डों पर लागू करता है, इसीलिए इसे पर्यवेक्षित प्रणाली कहा जाता है। वर्गीकरण, प्रतिगमन और पूर्वानुमान इसी श्रेणी में आते हैं। ऋण आवेदक के डिफ़ॉल्ट होने की संभावना या असंभावना का आकलन करना एक पूर्वानुमानित निष्कर्ष है।
इस भेद से दो व्यावहारिक परिणाम निकलते हैं।
- सत्यापन अलग-अलग होता है: एक पूर्वानुमान मॉडल की सटीकता का मूल्यांकन ज्ञात परिणामों के आधार पर किया जा सकता है। एक वर्णनात्मक परिणाम का मूल्यांकन इस आधार पर किया जाता है कि वह कितना रोचक और उपयोगी है।
- डेटा संबंधी आवश्यकताएं भिन्न-भिन्न होती हैं: पूर्वानुमान संबंधी कार्यों के लिए एक लेबलयुक्त ऐतिहासिक परिणाम स्तंभ की आवश्यकता होती है। Descriptलाइव वर्क ऐसा नहीं करता है, इसलिए जब किसी व्यवसाय के पास डेटा तो होता है लेकिन अभी तक कोई स्पष्ट लक्ष्य नहीं होता है, तो यह आमतौर पर शुरुआती बिंदु होता है।
डेटा माइनिंग को लागू करने की चुनौतियाँ
- डेटा माइनिंग प्रश्नों को तैयार करने के लिए कुशल विशेषज्ञों की आवश्यकता है।
- ओवरफिटिंग: छोटे आकार के प्रशिक्षण डेटाबेस के कारण, मॉडल भविष्य की स्थितियों के अनुरूप नहीं हो सकता है।
- डेटा माइनिंग के लिए बड़े डेटाबेस की आवश्यकता होती है, जिसे कभी-कभी प्रबंधित करना मुश्किल होता है
- उजागर की गई जानकारी का उपयोग करने के लिए व्यावसायिक प्रथाओं को संशोधित करने की आवश्यकता हो सकती है।
- यदि डेटा सेट विविध नहीं है, तो डेटा माइनिंग परिणाम सटीक नहीं हो सकते हैं।
- विषम डेटाबेस और वैश्विक सूचना प्रणालियों से आवश्यक एकीकरण जानकारी जटिल हो सकती है
डेटा माइनिंग के उदाहरण
अब इस डेटा माइनिंग कोर्स में, आइए उदाहरणों के साथ डेटा माइनिंग के बारे में जानें:
उदाहरण 1:
मान लीजिए कि एक टेलीकॉम सेवा प्रदाता कंपनी का मार्केटिंग हेड लंबी दूरी की सेवाओं से होने वाली आय बढ़ाना चाहता है। बिक्री और मार्केटिंग प्रयासों पर उच्च ROI (निवेश पर लाभ) के लिए ग्राहक प्रोफाइलिंग महत्वपूर्ण है। उसके पास ग्राहकों की जानकारी का विशाल डेटाबेस है, जिसमें उम्र, लिंग, आय, क्रेडिट इतिहास आदि शामिल हैं। लेकिन मैन्युअल विश्लेषण से उन लोगों की विशेषताओं का पता लगाना असंभव है जो लंबी दूरी की कॉल को प्राथमिकता देते हैं। डेटा माइनिंग तकनीकों का उपयोग करके, वह लंबी दूरी की कॉल का अधिक उपयोग करने वाले ग्राहकों और उनकी विशेषताओं के बीच के पैटर्न का पता लगा सकता है।
उदाहरण के लिए, उसे पता चल सकता है कि उसके सबसे अच्छे ग्राहक 45 से 54 वर्ष की आयु की विवाहित महिलाएँ हैं, जो प्रति वर्ष 80,000 डॉलर से अधिक कमाती हैं। मार्केटिंग प्रयासों को ऐसे जनसांख्यिकीय पर लक्षित किया जा सकता है।
उदाहरण 2:
एक बैंक अपने क्रेडिट कार्ड संचालन से राजस्व बढ़ाने के नए तरीके तलाशना चाहता है। वे यह जांचना चाहते हैं कि शुल्क आधा करने पर क्रेडिट कार्ड का उपयोग दोगुना हो जाएगा या नहीं।
बैंक के पास क्रेडिट कार्ड के औसत बैलेंस, भुगतान राशि, क्रेडिट लिमिट के उपयोग और अन्य महत्वपूर्ण मापदंडों से संबंधित कई वर्षों का रिकॉर्ड है। उन्होंने प्रस्तावित नई व्यावसायिक नीति के प्रभाव की जांच करने के लिए एक मॉडल तैयार किया। आंकड़ों से पता चलता है कि लक्षित ग्राहक वर्ग के लिए शुल्क को आधा करने से राजस्व में 10 मिलियन डॉलर की वृद्धि हो सकती है।
डेटा माइनिंग बनाम मशीन लर्निंग
ये दोनों शब्द काफी हद तक एक-दूसरे से मिलते-जुलते हैं और अक्सर एक दूसरे के स्थान पर प्रयोग किए जाते हैं, लेकिन ये अलग-अलग सवालों के जवाब देते हैं। डेटा माइनिंग का उद्देश्य ऐसे पैटर्न का पता लगाना है जिसके बारे में किसी व्यक्ति को पहले से जानकारी नहीं थी। मशीन लर्निंग का उद्देश्य एक ऐसी प्रणाली विकसित करना है जो अधिक डेटा प्राप्त होने पर अपनी भविष्यवाणियों में सुधार करती है।
| अंतर का बिंदु | आँकड़ा खनन | मशीन लर्निंग |
|---|---|---|
| मुख्य लक्ष्य | मौजूदा डेटा में छिपे अज्ञात पैटर्न का पता लगाएं | एक ऐसा मॉडल बनाएं जो नए डेटा पर भविष्यवाणी कर सके। |
| मानवीय भागीदारी | विश्लेषक निष्कर्षों की व्याख्या करता है और उन पर कार्रवाई करता है। | यह एल्गोरिदम नियम को स्वचालित रूप से लागू करता है। |
| डेटा की मात्रा | यह एक परिभाषित, ऐतिहासिक डेटा सेट पर काम करता है। | समय के साथ अधिक डेटा उपलब्ध होने पर इसमें सुधार होता है। |
| विशिष्ट आउटपुट | एक नियम, समूह या संगठन जिसे कोई व्यक्ति पढ़ सकता है | एक प्रशिक्षित मॉडल जो स्कोर या क्लास लौटाता है |
| रिश्ता | डेटा माइनिंग में अक्सर मशीन लर्निंग एल्गोरिदम का उपयोग इंजन के रूप में किया जाता है। | |
संक्षेप में, मशीन लर्निंग उन टूलसेट में से एक है जिनका उपयोग डेटा माइनिंग में किया जाता है, और सरल डेटा माइनिंग केवल सांख्यिकी के माध्यम से भी की जा सकती है।
डेटा माइनिंग उपकरण
निम्नलिखित 2 लोकप्रिय हैं डेटा माइनिंग उपकरण उद्योग में व्यापक रूप से उपयोग किया जाता है
आर-भाषा:
आर भाषा सांख्यिकीय कंप्यूटिंग और ग्राफिक्स के लिए एक ओपन सोर्स टूल है। आर में सांख्यिकीय, शास्त्रीय सांख्यिकीय परीक्षण, समय-श्रृंखला विश्लेषण, वर्गीकरण और ग्राफिकल तकनीकों की एक विस्तृत विविधता है। यह प्रभावी डेटा हैंडलिंग और भंडारण सुविधा प्रदान करता है।
Oracle डेटा खनन:
Oracle आँकड़ा खननजिसे लोकप्रिय रूप से ओडीएम के नाम से जाना जाता है, एक मॉड्यूल है। Oracle एडवांस्ड एनालिटिक्स डेटाबेस अब इसके हिस्से के रूप में उपलब्ध कराया जाता है। Oracle मशीन लर्निंग। यह डेटा माइनिंग टूल डेटा विश्लेषकों को विस्तृत जानकारी प्राप्त करने और पूर्वानुमान लगाने में सक्षम बनाता है। यह ग्राहकों के व्यवहार का अनुमान लगाने, ग्राहक प्रोफाइल विकसित करने और क्रॉस-सेलिंग के अवसरों की पहचान करने में सहायक होता है।
डेटा माइनिंग के लाभ
- डेटा माइनिंग तकनीक कंपनियों को ज्ञान-आधारित जानकारी प्राप्त करने में मदद करती है।
- डेटा माइनिंग संगठनों को परिचालन और उत्पादन में लाभदायक समायोजन करने में मदद करता है।
- अन्य सांख्यिकीय डेटा अनुप्रयोगों की तुलना में डेटा माइनिंग एक लागत प्रभावी और कुशल समाधान है।
- डेटा माइनिंग निर्णय लेने की प्रक्रिया में मदद करता है।
- प्रवृत्तियों और व्यवहारों की स्वचालित भविष्यवाणी के साथ-साथ छिपे हुए पैटर्न की स्वचालित खोज की सुविधा प्रदान करता है।
- इसे नई प्रणालियों के साथ-साथ मौजूदा प्लेटफार्मों में भी लागू किया जा सकता है
- यह एक तीव्र प्रक्रिया है जो उपयोगकर्ताओं के लिए कम समय में बड़ी मात्रा में डेटा का विश्लेषण करना आसान बनाती है।
डेटा माइनिंग के नुकसान
- इस बात का खतरा है कि कंपनियां अपने ग्राहकों के बारे में उपयोगी जानकारी अन्य संगठनों को बेच सकती हैं, जिससे गोपनीयता संबंधी गंभीर चिंताएं उत्पन्न होती हैं।
- कई डेटा माइनिंग एनालिटिक्स सॉफ्टवेयर को संचालित करना कठिन होता है और उन पर काम करने के लिए उन्नत प्रशिक्षण की आवश्यकता होती है।
- अलग-अलग डेटा माइनिंग टूल अलग-अलग तरीके से काम करते हैं क्योंकि उनके डिज़ाइन में अलग-अलग एल्गोरिदम का इस्तेमाल किया जाता है। इसलिए, सही डेटा माइनिंग टूल का चयन करना बहुत मुश्किल काम है।
- डेटा माइनिंग तकनीक सटीक नहीं है, और इसलिए यह कुछ स्थितियों में गंभीर परिणाम पैदा कर सकती है।
डेटा माइनिंग अनुप्रयोग
| अनुप्रयोगों | प्रयोग |
|---|---|
| संचार | संचार क्षेत्र में डेटा माइनिंग तकनीकों का उपयोग ग्राहकों के व्यवहार की भविष्यवाणी करने के लिए किया जाता है ताकि अत्यधिक लक्षित और प्रासंगिक अभियान पेश किए जा सकें। |
| बीमा | डेटा माइनिंग से बीमा कंपनियों को अपने उत्पादों की कीमत लाभदायक रखने तथा अपने नए या मौजूदा ग्राहकों को नए ऑफरों का प्रचार करने में मदद मिलती है। |
| शिक्षा | डेटा माइनिंग से शिक्षकों को छात्रों के डेटा तक पहुंचने, उपलब्धि के स्तर का अनुमान लगाने और उन छात्रों या छात्रों के समूहों को खोजने में मदद मिलती है जिन पर अतिरिक्त ध्यान देने की आवश्यकता है। उदाहरण के लिए, जो छात्र गणित विषय में कमज़ोर हैं। |
| विनिर्माण | डेटा माइनिंग की मदद से निर्माता उत्पादन उपकरणों की टूट-फूट का अनुमान लगा सकते हैं। वे रखरखाव का पूर्वानुमान लगा सकते हैं, जिससे उन्हें डाउनटाइम को कम करने में मदद मिलती है। |
| बैंकिंग | डेटा माइनिंग से वित्त क्षेत्र को बाजार के जोखिमों का अंदाजा लगाने और विनियामक अनुपालन का प्रबंधन करने में मदद मिलती है। इससे बैंकों को संभावित डिफॉल्टरों की पहचान करने में मदद मिलती है ताकि वे यह तय कर सकें कि उन्हें क्रेडिट कार्ड, ऋण आदि जारी करना है या नहीं। |
| खुदरा | डेटा माइनिंग तकनीकें रिटेल मॉल और किराना स्टोरों को सबसे अधिक बिकने वाली वस्तुओं की पहचान करने और उन्हें सबसे आकर्षक स्थानों पर व्यवस्थित करने में मदद करती हैं। इससे स्टोर मालिकों को ऐसे ऑफर तैयार करने में मदद मिलती है जो ग्राहकों को अधिक खर्च करने के लिए प्रोत्साहित करते हैं। |
| सेवा प्रदाता | मोबाइल फोन और यूटिलिटी उद्योग जैसे सेवा प्रदाता डेटा माइनिंग का उपयोग यह अनुमान लगाने के लिए करते हैं कि ग्राहक उनकी कंपनी को क्यों छोड़ता है। वे बिलिंग विवरण, ग्राहक सेवा बातचीत, कंपनी को की गई शिकायतों का विश्लेषण करते हैं ताकि प्रत्येक ग्राहक को एक संभाव्यता स्कोर दिया जा सके और प्रोत्साहन प्रदान किया जा सके। |
| ई वाणिज्य | ई-कॉमर्स वेबसाइटें अपनी वेबसाइट के ज़रिए क्रॉस-सेल और अप-सेल ऑफ़र करने के लिए डेटा माइनिंग का इस्तेमाल करती हैं। सबसे मशहूर नामों में से एक है Amazon, जो अपने ई-कॉमर्स स्टोर में अधिक ग्राहकों को लाने के लिए डेटा माइनिंग तकनीक का उपयोग करते हैं। |
| सुपर बाजार | डेटा माइनिंग की मदद से सुपरमार्केट ऐसे नियम विकसित कर सकते हैं जिनसे यह अनुमान लगाया जा सके कि उनके ग्राहक गर्भवती हैं या नहीं। खरीदारी के पैटर्न का विश्लेषण करके वे उन महिला ग्राहकों की पहचान कर सकते हैं जिनके गर्भवती होने की संभावना सबसे अधिक है। वे बेबी पाउडर, बेबी सोप, डायपर आदि जैसे उत्पादों को लक्षित करके ग्राहकों को आकर्षित करना शुरू कर सकते हैं। |
| अपराध जांच | डेटा माइनिंग से अपराध जांच एजेंसियों को पुलिस कार्यबल तैनात करने (अपराध की सबसे अधिक संभावना कहां और कब होती है?), सीमा पार करते समय किसकी तलाशी लेनी है आदि में मदद मिलती है। |
| जैव सूचना विज्ञान | डेटा माइनिंग जीव विज्ञान और चिकित्सा में एकत्रित विशाल डेटासेट से जैविक डेटा निकालने में मदद करता है। |

