दो फॉर्मूले, एक छोटा लेकिन महत्वपूर्ण अंतर
मानक विचलन के दोनों फॉर्मूले एक जैसे शुरू होते हैं: डेटा का माध्य निकालें, हर मान में से उसे घटाएं, प्रत्येक विचलन का वर्ग करें, और वर्गों को जोड़ दें। अंतर अंतिम विभाजन चरण में आता है। जनसंख्या मानक विचलन, जिसे ग्रीक अक्षर सिग्मा से दर्शाया जाता है, इस वर्ग विचलनों के योग को n, यानी कुल मानों की संख्या, से विभाजित करता है, फिर वर्गमूल निकालता है। नमूना मानक विचलन, जिसे s से दर्शाया जाता है, उसी योग को इसके बजाय n - 1 से विभाजित करता है, फिर वर्गमूल निकालता है -- इस बदलाव को बेसेल करेक्शन कहा जाता है।
चूंकि n - 1 हमेशा n से छोटा भाजक होता है (n के 1 से बड़े होने पर), नमूना मानक विचलन उन्हीं संख्याओं से गणना किए गए जनसंख्या मानक विचलन से हमेशा थोड़ा बड़ा होता है। दोनों फॉर्मूले एक ही सवाल के प्रतिस्पर्धी तरीके नहीं हैं; वे एक ही डेटा के बारे में दो अलग-अलग सवालों के जवाब देते हैं, और गलत फॉर्मूला चुनने से उस सवाल का व्यवस्थित रूप से पक्षपाती उत्तर मिलता है जिसे आप वास्तव में पूछना चाहते थे।
वर्कड उदाहरण: वही आठ संख्याएं, दो उत्तर
डेटा सेट 2, 4, 4, 4, 5, 5, 7, 9 (n = 8) लें। चरण 1: माध्य (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5 है। चरण 2: माध्य से विचलन -3, -1, -1, -1, 0, 0, 2, 4 हैं, और प्रत्येक का वर्ग करने पर 9, 1, 1, 1, 0, 0, 4, 16 मिलते हैं, जिनका योग 32 होता है। वर्ग विचलनों के इसी एक योग से, दोनों फॉर्मूले केवल अंतिम विभाजन में अलग होते हैं।
जनसंख्या मानक विचलन: 32 को n = 8 से विभाजित करें, जिससे जनसंख्या विचरण 4 मिलता है, और 4 का वर्गमूल ठीक 2 है। नमूना मानक विचलन: उसी 32 को n - 1 = 7 से विभाजित करें, जिससे नमूना विचरण 32 / 7 = 4.571429 (छह दशमलव स्थानों तक) मिलता है, और 4.571429 का वर्गमूल लगभग 2.13809 है। नीचे दी गई तालिका दोनों गणनाओं को एक ही प्रारंभिक योग से साथ-साथ दिखाती है।
| चरण | जनसंख्या रूप (n से विभाजित) | नमूना रूप (n - 1 से विभाजित) |
|---|---|---|
| वर्ग विचलनों का योग | 32 | 32 |
| भाजक | n = 8 | n - 1 = 7 |
| विचरण | 32 / 8 = 4 | 32 / 7 = 4.571429 |
| मानक विचलन | sqrt(4) = 2 | sqrt(4.571429) = 2.13809 |
n - 1 से क्यों विभाजित करें? बेसेल करेक्शन की व्याख्या
विचलन गणना में उपयोग किया गया नमूना माध्य स्वयं उसी डेटा से निकाला जाता है जिसका फैलाव मापा जा रहा है, और यह गणितीय रूप से तय होता है कि यही वह मान है जो उस विशिष्ट नमूने के लिए वर्ग विचलनों के योग को न्यूनतम करता है। इसका मतलब है कि नमूना माध्य के इर्द-गिर्द मापे गए वर्ग विचलन, औसतन, वास्तविक अज्ञात जनसंख्या माध्य के इर्द-गिर्द मापे जाने वाले वर्ग विचलनों से थोड़े छोटे होते हैं -- इसलिए केवल n से विभाजित करने पर, नमूने से काम करते समय जनसंख्या विचरण व्यवस्थित रूप से कम आंका जाता है।
n के बजाय n - 1 से विभाजित करने पर परिणाम इतना बढ़ जाता है कि यह नीचे की ओर के इस पक्षपात को औसतन ठीक कर देता है, जिससे बार-बार नमूनाकरण में नमूना विचरण जनसंख्या विचरण का एक निष्पक्ष आकलक बन जाता है। इस करेक्शन का नाम 19वीं सदी के खगोलशास्त्री और गणितज्ञ फ्रीड्रिष बेसेल के नाम पर बेसेल करेक्शन रखा गया है। इसका प्रभाव छोटे नमूनों में सबसे अधिक होता है -- n = 8 के लिए भाजक 8 और 7 में 12.5% का अंतर होता है -- और जैसे-जैसे n सैकड़ों या हजारों तक बढ़ता है, यह नगण्य होता जाता है, क्योंकि n और n - 1 आनुपातिक रूप से करीब आते जाते हैं।
आपके पास जनसंख्या है या नमूना?
जनसंख्या मानक विचलन (n से विभाजित) का उपयोग केवल तभी करें जब आपका डेटा सेट वह पूरा समूह हो जिसकी आपको परवाह है, और आगे किसी सामान्यीकरण का इरादा न हो -- उदाहरण के लिए, किसी एक विशिष्ट खेल टीम के हर मौजूदा खिलाड़ी की उम्र, या किसी एक विशिष्ट कक्षा के हर छात्र के परीक्षा अंक, जब सवाल केवल उसी टीम या कक्षा के बारे में हो, किसी व्यापक चीज़ के बारे में नहीं।
नमूना मानक विचलन (n - 1 से विभाजित) का उपयोग तब करें जब आपका डेटा किसी बड़ी जनसंख्या से लिया गया एक सबसेट हो, या उसका प्रतिनिधित्व करने के इरादे से हो, जिसके बारे में आप निष्कर्ष निकालना चाहते हैं -- उदाहरण के लिए, सभी ग्राहकों में संतुष्टि का अनुमान लगाने के लिए 500 ग्राहकों का सर्वेक्षण, व्यापक रोगी जनसंख्या में प्रभाव का अनुमान लगाने के लिए किसी क्लिनिकल ट्रायल के प्रतिभागी, या पूरी उत्पादन लाइन को दर्शाने के लिए गुणवत्ता-नियंत्रण मापों का एक बैच। यह लागू सांख्यिकी में कहीं अधिक सामान्य स्थिति है, इसीलिए अधिकांश सांख्यिकीय सॉफ्टवेयर बिना कुछ अलग बताए नमूना (n - 1) फॉर्मूले को डिफ़ॉल्ट रूप से उपयोग करते हैं।
यह चुनाव वास्तव में कितना मायने रखता है?
बहुत छोटे नमूनों के लिए, दोनों फॉर्मूलों के बीच का अंतर आनुपातिक रूप से बड़ा होता है, और गलत चुनाव करने से मानक विचलन पर सीधे आधारित डाउनस्ट्रीम परिणाम -- जैसे विश्वास अंतराल और z-स्कोर -- काफी हद तक विकृत हो सकते हैं। ऊपर दिए गए n = 8 उदाहरण के लिए, नमूना मान (2.13809) जनसंख्या मान (2) से लगभग 6.9% बड़ा है, जो विश्वास अंतराल की चौड़ाई को इसी अनुपात में बदलने के लिए पर्याप्त अंतर है।
जैसे-जैसे नमूना आकार बढ़ता है, n और n - 1 आनुपातिक रूप से करीब आते जाते हैं, और दोनों मानक विचलन एक-दूसरे के करीब पहुंचते जाते हैं: 1,000 के नमूने के लिए, 1,000 के बजाय 999 से विभाजित करने पर परिणाम केवल लगभग 0.05% बदलता है। बड़े नमूनों की स्थितियों में यह चुनाव शायद ही व्यावहारिक निष्कर्षों को बदलता है, लेकिन सही परंपरा को फिर भी लागू किया जाना चाहिए, दोनों मानक सांख्यिकीय अभ्यास के साथ स्थिरता के लिए और इसलिए भी क्योंकि छोटे नमूने के मामले -- जहां अंतर सबसे अधिक मायने रखता है -- ठीक वही समय होते हैं जब सही करना सबसे ज्यादा महत्वपूर्ण होता है।
अक्सर पूछे जाने वाले सवाल
नमूना और जनसंख्या मानक विचलन में क्या अंतर है?
जनसंख्या मानक विचलन माध्य से वर्ग विचलनों के योग को n (मानों की संख्या) से विभाजित करता है और यह तब सही होता है जब डेटा सेट पूरी अध्ययन-योग्य जनसंख्या हो। नमूना मानक विचलन उसी योग को इसके बजाय n - 1 से विभाजित करता है और यह तब सही होता है जब डेटा किसी बड़ी जनसंख्या का अनुमान लगाने के लिए उपयोग किया गया नमूना हो। समान डेटा के लिए, नमूना मान हमेशा जनसंख्या मान से थोड़ा बड़ा होता है, क्योंकि यह एक छोटी संख्या से विभाजित करता है।
नमूने के लिए n - 1 से क्यों विभाजित करते हैं?
क्योंकि नमूना माध्य उसी डेटा से निकाला जाता है जिसका फैलाव मापा जा रहा है, यह गणितीय रूप से वह मान होता है जो उस नमूने के लिए वर्ग विचलनों के योग को न्यूनतम करता है, जिससे ये विचलन वास्तविक जनसंख्या माध्य के इर्द-गिर्द के विचलनों से व्यवस्थित रूप से थोड़े छोटे हो जाते हैं। n के बजाय n - 1 से विभाजित करना, जिसे बेसेल करेक्शन कहा जाता है, इसकी भरपाई करता है और नमूना विचरण को जनसंख्या विचरण का एक निष्पक्ष आकलक बनाता है।
सर्वेक्षण या प्रयोग के लिए कौन-सा उपयोग करना चाहिए?
जब भी आपका डेटा किसी बड़ी जनसंख्या का प्रतिनिधित्व करने वाला सबसेट हो -- जो अधिकांश सर्वेक्षणों, प्रयोगों और गुणवत्ता-नियंत्रण नमूनों को कवर करता है -- तब नमूना मानक विचलन (n - 1) का उपयोग करें। जनसंख्या मानक विचलन (n) का उपयोग केवल तब करें जब आपका डेटा सेट अध्ययन किया जा रहा पूरा समूह हो, और इससे आगे किसी सामान्यीकरण का कोई इरादा न हो।
व्यवहार में दोनों उत्तर कितने अलग होते हैं?
वर्कड उदाहरण (2, 4, 4, 4, 5, 5, 7, 9; n = 8) के लिए, जनसंख्या मानक विचलन ठीक 2 है और नमूना मानक विचलन लगभग 2.13809 है, यानी लगभग 6.9% का अंतर। नमूना आकार बढ़ने पर यह अंतर घटता जाता है: n = 1,000 के लिए, 1,000 के बजाय 999 से विभाजित करने पर परिणाम केवल लगभग 0.05% बदलता है, जिससे बड़े नमूनों के लिए यह चुनाव काफी कम महत्वपूर्ण हो जाता है।
क्या n - 1 करेक्शन माध्य को भी प्रभावित करता है?
नहीं। माध्य हमेशा मानों के सरल योग को n, यानी कुल गिनती, से विभाजित करके निकाला जाता है, चाहे डेटा नमूना हो या जनसंख्या; बेसेल करेक्शन केवल मानक विचलन और विचरण की गणनाओं पर लागू होता है, माध्य पर नहीं।
संदर्भ
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.6: Measures of Scale. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (sample vs population standard deviation).
- Weisstein, Eric W. "Standard Deviation" and "Bessel's Correction." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.