🎧 Listen to this article: English
🌍 Read this in your language: हिंदी · தமிழ் · తెలుగు · ಕನ್ನಡ · മലയാളം · ଓଡ଼ିଆ · 日本語 · 中文
आज की डेटा-संचालित दुनिया में, प्रभावी व्यावसायिक निर्णयों के लिए कच्चे डेटा को समझना महत्वपूर्ण है। यह विषय अब विशेष रूप से प्रासंगिक है क्योंकि व्यवसाय अपनी रणनीतियों को निर्देशित करने के लिए डेटा एनालिटिक्स पर तेजी से निर्भर हैं।
डेटासेट को समझना
हम जिस डेटासेट पर चर्चा कर रहे हैं वह JCars Logistics से आता है, जो केन्या भर में वाहनों का आयात और बिक्री करने वाली एक कंपनी है। इसमें 276 पंक्तियाँ और 32 कॉलम हैं, जिसमें प्रत्येक पंक्ति एक वाहन बिक्री आदेश का प्रतिनिधित्व करती है। इसमें ग्राहक, वाहन और लेनदेन की तारीख के विवरण सहित अन्य चीजें शामिल हैं।
डेटा में वास्तव में क्या गलत था
प्रारंभिक निरीक्षण पर, डेटासेट ने कई समस्याओं को प्रकट किया:
- Order ID: विभिन्न प्रारूप और डुप्लिकेट।
- Date Fields: टेक्स्ट और Excel सीरियल नंबर सहित मिश्रित प्रारूप।
- Categorical Columns: असंगत कैपिटलाइज़ेशन, संक्षिप्ताक्षर और वर्तनी की त्रुटियां।
- Numeric Fields: संख्याओं और असंभव मानों के साथ मिश्रित टेक्स्ट।
- Currency Fields: KSh, KES और USD सहित विभिन्न प्रारूप।
इन समस्याओं ने विश्लेषण के लिए डेटा को अविश्वसनीय बना दिया।
डेटा को साफ़ करना
चरण 1: डेटा लोड करें
सबसे पहले, मैंने Power Query में कच्चे डेटासेट को एक स्टेजिंग क्वेरी के रूप में लोड किया जिसे कहा जाता है Sales_Raw. मैंने फिर इसे एक वर्किंग क्वेरी में डुप्लिकेट किया जिसका नाम है Sales मूल डेटा को सुरक्षित रखने के लिए।
चरण 2: Order ID को ठीक करें
Order ID के लिए, मैंने प्रारूपों को मानकीकृत किया और किसी भी डुप्लिकेट को हल किया। यह महत्वपूर्ण था क्योंकि प्रत्येक लेनदेन के लिए Order ID अद्वितीय होना आवश्यक है।
चरण 3: दिनांकों को साफ़ करें
इसके बाद, मैंने दिनांक फ़ील्ड को साफ़ करने पर ध्यान केंद्रित किया। इसमें शामिल था:
- Excel सीरियल नंबरों को पठनीय दिनांकों में परिवर्तित करना।
- प्रारूपों को एक ही शैली में मानकीकृत करना।
- अवैध दिनांकों को संभालना, जैसे कि 2026-13-04 जैसे असंभव दिनांक।
चरण 4: श्रेणीबद्ध डेटा को मानकीकृत करें
श्रेणीबद्ध कॉलम के लिए, मैंने विसंगतियों को ठीक करने के लिए एक मैपिंग सूत्र बनाया। उदाहरण के लिए, मैंने विभिन्न वर्तनी और संक्षिप्ताक्षरों को एक एकल मानक शब्द में मिला दिया। इसने सुनिश्चित किया कि समान प्रविष्टियों को सही ढंग से समूहीकृत किया गया था।
चरण 5: संख्यात्मक फ़ील्ड को सामान्य करें
मैंने संख्याओं के टेक्स्ट अभ्यावेदन को वास्तविक संख्यात्मक मानों में परिवर्तित किया। इसमें Units Sold फ़ील्ड के लिए "two" और "3 cars" जैसी प्रविष्टियों को संभालना शामिल था।
चरण 6: मुद्रा प्रारूपों को मानकीकृत करें
सभी मौद्रिक मानों को एक ही मुद्रा प्रारूप (KES) में परिवर्तित किया गया था। मैंने विभिन्न प्रारूपों को संभालने के लिए एक तर्क स्थापित किया, यह सुनिश्चित करते हुए कि तुलना और गणना सटीक रूप से की जा सकती है।
डेटा मॉडलिंग
डेटा साफ़ करने के बाद, मैंने एक स्टार स्कीमा बनाया। इसमें बिक्री के लिए एक केंद्रीय तथ्य तालिका और ग्राहकों, वाहनों और लेनदेन के लिए संबंधित आयाम तालिकाओं का निर्माण शामिल था। यह संरचना कुशल डेटा विश्लेषण में मदद करती है।
DAX मेज़र्स
मैंने फिर प्रमुख मेट्रिक्स की गणना करने के लिए कई DAX (डेटा एनालिसिस एक्सप्रेशंस) मेज़र्स बनाए:
- कुल राजस्व
- कुल बेची गई इकाइयाँ
- सकल लाभ ये मेज़र्स व्यावसायिक प्रदर्शन में विश्वसनीय अंतर्दृष्टि प्रदान करते हैं।
अब तक का डैशबोर्ड
साफ़ किए गए डेटा और DAX मेज़र्स के साथ, मैंने Power BI में एक प्रारंभिक डैशबोर्ड विकसित किया। यहाँ कुछ प्रमुख निष्कर्ष दिए गए हैं:
- 452 बेची गई इकाइयों से कुल राजस्व 1.31 बिलियन KES तक पहुँच गया।
- सकल लाभ लगभग 430.37 मिलियन KES रहा।
- बाजार की प्रवृत्ति को उजागर करते हुए, कुल बिक्री राजस्व में SUV की हिस्सेदारी 59% थी।
- Toyota ने बिक्री में नेतृत्व किया, अन्य ब्रांडों से काफी बेहतर प्रदर्शन किया।
अभी क्या बचा है
हालांकि सफाई और प्रारंभिक डैशबोर्ड पूरा हो गया है, आगे और काम की आवश्यकता है। इसमें विशिष्ट व्यावसायिक प्रश्नों का उत्तर देने के लिए अधिक इंटरएक्टिविटी, विस्तृत रिपोर्ट पृष्ठ और अतिरिक्त DAX मेज़र्स जोड़ना शामिल है।
निष्कर्ष
सूचित व्यावसायिक निर्णय लेने के लिए कच्चे डेटा को एक साफ़ और उपयोग करने योग्य प्रारूप में बदलना आवश्यक है। इस प्रक्रिया में यह सुनिश्चित करने के लिए सावधानीपूर्वक सफाई, मॉडलिंग और विज़ुअलाइज़ेशन शामिल है कि डेटा एक स्पष्ट कहानी बताता है।
गुण
- बेहतर डेटा सटीकता और विश्वसनीयता।
- स्पष्ट अंतर्दृष्टि के माध्यम से निर्णय लेने की क्षमताओं में वृद्धि।
- एक संरचित मॉडल का उपयोग करके कुशल डेटा विश्लेषण।
दोष
- डेटा को साफ़ और मानकीकृत करने की समय लेने वाली प्रक्रिया।
- Power BI और DAX जैसे टूल से परिचित होने की आवश्यकता है।
- यदि सावधानीपूर्वक प्रबंधित नहीं किया गया तो चूक की संभावना है।
सावधानी
यह लेख शैक्षिक उद्देश्यों के लिए है। किसी भी प्लेसहोल्डर मान को वास्तविक डेटा से बदला जाना चाहिए, और पाठकों को इस पर भरोसा करने से पहले मूल स्रोत से जानकारी को सत्यापित करना चाहिए।
अक्सर पूछे जाने वाले प्रश्न
- Power BI क्या है? — Power BI एक व्यावसायिक एनालिटिक्स टूल है जो डेटा की कल्पना करने और संगठन में अंतर्दृष्टि साझा करने में मदद करता है।
- डेटा साफ़ करना क्यों महत्वपूर्ण है? — डेटा साफ़ करना विश्लेषण में सटीकता और विश्वसनीयता सुनिश्चित करता है, जिससे बेहतर व्यावसायिक निर्णय होते हैं।
- DAX मेज़र्स क्या हैं? — DAX मेज़र्स Power BI में गतिशील रूप से डेटा का विश्लेषण करने के लिए उपयोग की जाने वाली गणनाएँ हैं।
- मैं डेटा प्रारूपों को कैसे मानकीकृत कर सकता हूँ? — आप Power Query में मैपिंग सूत्रों और फ़ंक्शंस का उपयोग करके डेटा प्रारूपों को मानकीकृत कर सकते हैं।
- स्टार स्कीमा क्या है? — एक स्टार स्कीमा एक प्रकार की डेटाबेस संरचना है जो कुशल क्वेरी के लिए डेटा को तथ्य और आयाम तालिकाओं में व्यवस्थित करती है।
- डेटा साफ़ करने में मुझे किन चुनौतियों का सामना करना पड़ सकता है? — आम चुनौतियों में असंगत प्रारूप, डुप्लिकेट और गायब मान शामिल हैं।
टैग
#data #powerbi #analytics #datacleaning #businessintelligence #DAX #datamodeling #dashboard #dataanalysis #datascience
Kubernetes Security Checklist
Harden cluster access, workload identity, pod security, network boundaries, software supply chain, secrets, and operational monitoring.
Free. No spam — unsubscribe in one click.


Responses
Sign in to leave a response.