چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموعهای حاشیهای تقسیم بر مجموع کل به دست میآید
تحت این فرض ریاضی که دو متغیر طبقهای کاملاً مستقل هستند، مقدار مورد انتظار برای هر سلول در یک جدول تقاطعی، با ضرب مجموع سطر و ستون آن و سپس تقسیم بر اندازه کل نمونه محاسبه میشود.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- آمارشناسان فراوانیگرا
- فراوانیهای مورد انتظار را بهعنوان بازنمایی ریاضی حیاتی از فرض صفر میبینند که خط پایهای را برای آزمایش دادههای مشاهدهشده فراهم میکند.
- دانشمندان داده
- از فراوانیهای مورد انتظار در الگوریتمهای انتخاب ویژگی استفاده میکنند تا تشخیص دهند کدام متغیرهای طبقهای بیشترین قدرت پیشبینی را برای مدلهای یادگیری ماشین دارند.
- مهندسان کنترل کیفیت
- این محاسبات را در جداول توافقی تولید به کار میگیرند تا تعیین کنند آیا نرخ نقصها از خطوط تولید یا شیفتهای خاص مستقل است یا خیر.
دیدگاههایی که این گزارش پوشش نداده
- آمارشناسان بیزی
- روششناسان پیمایش
- ≥ 5
- حداقل مقدار مورد انتظار سلول برای یک آزمون کای-دو معتبر
- 1
- درجه آزادی در یک جدول توافقی استاندارد ۲ در ۲
- 0
- انحراف مورد انتظار زمانی که متغیرها کاملاً مستقل هستند
نکات کلیدی
- فراوانیهای مورد انتظار نشان میدهند که اگر دو متغیر کاملاً بیارتباط بودند، دادهها چگونه به نظر میرسیدند.
- در این محاسبه، مجموع سطر یک سلول در مجموع ستون آن ضرب شده و سپس بر مجموع کل تقسیم میشود.
- این فرمول، سادهسازی جبری قانون ضرب برای احتمالهای مستقل است.
- آزمون کای-دو این خطوط پایه مورد انتظار را با دادههای واقعی مشاهدهشده مقایسه میکند.
- اگر مقادیر مورد انتظار به زیر ۵ برسند، تقریب استاندارد کای-دو اعتبار ریاضی خود را از دست میدهد.
محدودیت الزامآور برای محاسبه یک فراوانی مورد انتظار، فرض استقلال مطلق آماری است. برای اینکه مکانیسم ریاضی بهدرستی کار کند، احتمال قرار گرفتن یک مشاهده در یک سطر خاص باید کاملاً از اینکه به کدام ستون تعلق دارد، مستقل و بیتأثیر باشد. اگر این شرط برقرار باشد، مقدار مورد انتظار در هر سلول از یک جدول توافقی، بهسادگی حاصلضرب مجموعهای حاشیهای آن تقسیم بر مجموع کل است.[1][6]
این محاسبه، موتور محرک آزمون استقلال کای-دو (Chi-square) را تشکیل میدهد؛ یک روش آماری که توسط کارل پیرسون (Karl Pearson) در سال ۱۹۰۰ توسعه یافت و در رشتههای مختلف از همهگیرشناسی گرفته تا بازاریابی استفاده میشود. پیش از آنکه پژوهشگران بتوانند تعیین کنند آیا رابطهای بین دو متغیر طبقهای - مانند گروه درمانی یک بیمار و وضعیت بهبودی او - وجود دارد یا خیر، ابتدا باید دقیقاً مشخص کنند که اگر هیچ رابطهای وجود نداشت، دادهها چگونه به نظر میرسیدند.[1][2]
یک جدول توافقی یا جدول تقاطعی، دادهها را در یک شبکه سازماندهی میکند. در یک جدول استاندارد ۲ در ۲، دقیقاً ۴ سلول مجزا وجود دارد. «مجموعهای حاشیهای» در واقع حاصلجمع هر سطر و ستون هستند که در حاشیههای جدول ظاهر میشوند، در حالی که «مجموع کل» همان اندازه کلی نمونه در مجموعه داده است.[3][4]
برای یافتن فراوانی مورد انتظار یک سلول خاص، پژوهشگران مجموع سطر آن سلول را در مجموع ستون آن ضرب کرده و سپس بر مجموع کل تقسیم میکنند. برای مثال، اگر یک کارآزمایی بالینی شامل ۱۰۰ بیمار باشد که ۵۰ نفر داروی جدیدی دریافت کردهاند و ۴۰ نفر عارضه جانبی خاصی را تجربه کردهاند، فراوانی مورد انتظار بیمارانی که هم دارو را دریافت کردهاند و هم عارضه جانبی را تجربه کردهاند - تحت فرض استقلال - برابر است با (۵۰ × ۴۰) / ۱۰۰، یا دقیقاً ۲۰ بیمار.[4][5]
مکانیسم نهفته در این فرمول، بر قانون بنیادین ضرب در احتمالات استوار است. زمانی که دو رویداد مستقل هستند، احتمال وقوع همزمان هر دو، برابر با حاصلضرب احتمالهای فردی آنهاست.[2][3]
احتمال اینکه یک مشاهده در یک سطر خاص قرار گیرد، برابر است با مجموع سطر تقسیم بر مجموع کل. به همین ترتیب، احتمال قرار گرفتن آن در یک ستون خاص، برابر است با مجموع ستون تقسیم بر مجموع کل.[3]
ضرب این دو احتمال حاشیهای، احتمال توأم را برای آن سلول خاص به دست میدهد. برای تبدیل دوباره این احتمال نظری به یک مقدار مورد انتظار، باید آن را در مجموع کل ضرب کرد.[1][6]
ضرب این دو احتمال حاشیهای، احتمال توأم را برای آن سلول خاص به دست میدهد.
از نظر ریاضی، این فرآیند به این شکل بیان میشود: (مجموع سطر / مجموع کل) × (مجموع ستون / مجموع کل) × مجموع کل. وقتی این عبارت ساده میشود، یکی از مجموعهای کل در مخرج با مجموع کل در صورت خط میخورد و همان فرمول استاندارد باقی میماند.[5][6]
این سادهسازی جبری ظریف همان دلیلی است که پژوهشگران نیازی به محاسبه احتمالهای فردی برای هر سلول ندارند. همانطور که مستندات مؤسسه ملی استاندارد و فناوری اشاره میکند: «فراوانی مورد انتظار برای هر سلول، بهعنوان حاصلضرب مجموعهای حاشیهای سطر و ستون تقسیم بر مجموع کل محاسبه میشود.»[2]
پس از آنکه فراوانیهای مورد انتظار برای هر سلول در جدول محاسبه شدند، با فراوانیهای واقعی مشاهدهشده مقایسه میشوند. تفاوت میان مقادیر مشاهدهشده و مورد انتظار، پایه و اساس آماره کای-دو را شکل میدهد؛ آمارهای که این تفاوتها را به توان ۲ میرساند و بر مقادیر مورد انتظار تقسیم میکند تا واریانس را استانداردسازی کند.[1][2]
اگر مقادیر مشاهدهشده تطابق نزدیکی با مقادیر مورد انتظار داشته باشند، انحراف کوچک است، که نشان میدهد متغیرها واقعاً مستقل هستند. اما اگر مقادیر مشاهدهشده بهطور قابلتوجهی از خط پایه مورد انتظار فاصله بگیرند، نشاندهنده یک رابطه آماری است که بعید است تصادفی رخ داده باشد.[1][3]
با این حال، این چارچوب ریاضی محدودیتهای سختگیرانهای دارد. این محاسبه فرض میکند که نمونه بهطور تصادفی استخراج شده و مشاهدات مانعةالجمع هستند؛ به این معنی که هیچ سوژهای نمیتواند در بیش از یک سلول شمرده شود.[3][5]
علاوه بر این، اگر فراوانیهای مورد انتظار بیش از حد کوچک باشند، اعتبار آزمون کای-دو متعاقب آن کاهش مییابد. یک قاعده سرانگشتیِ پذیرفتهشده حکم میکند که فراوانی مورد انتظار در هر سلول باید حداقل ۵ باشد تا اطمینان حاصل شود که آماره آزمون، توزیع کای-دو را بهدقت تقریب میزند.[1][5]
زمانی که مقادیر مورد انتظار به زیر این آستانه میرسند، پژوهشگران باید یا دستهها را ترکیب کنند تا مجموعهای حاشیهای افزایش یابد، یا آزمون کای-دو را کنار گذاشته و به سراغ جایگزینهایی مانند آزمون دقیق فیشر (Fisher's exact test) بروند که در سال ۱۹۲۲ منتشر شد و بهجای تکیه بر تقریبها، احتمالهای دقیق را محاسبه میکند.[2][3]
ابعاد جدول همچنین درجات آزادی را دیکته میکند که بهصورت (تعداد سطرها منهای ۱) ضربدر (تعداد ستونها منهای ۱) محاسبه میشود. برای یک جدول ۳ در ۴، این محاسبه ۶ درجه آزادی به دست میدهد که شکل دقیق توزیع کای-دو را برای ارزیابی اینکه آیا انحرافات از فراوانیهای مورد انتظار از نظر آماری معنادار هستند یا خیر، تعیین میکند.[4][5]
آنچه نمیدانیم
- آیا قانون سنتی که نیازمند فراوانیهای مورد انتظار حداقل ۵ است، برای روشهای محاسباتی مدرن بیش از حد محافظهکارانه است یا خیر.
- چگونه میتوان فراوانیهای مورد انتظار را در مواجهه با طرحهای پیمایشی پیچیدهای که مفروضات نمونهگیری تصادفی ساده را نقض میکنند، بهطور بینقصی تعدیل کرد.
منابع
[1]PMCآمارشناسان فراوانیگراThe Chi-square test of independence
مطالعه در PMC →
[2]NISTمهندسان کنترل کیفیتCHI-SQUARE INDEPENDENCE TEST
مطالعه در NIST →
[3]University of Vermontآمارشناسان فراوانیگراCHI-SQUARE TEST - ANALYSIS OF CONTINGENCY TABLES
مطالعه در University of Vermont →
[4]Statistics How Toدانشمندان دادهExpected Frequency: Definition, Formula, Calculation
مطالعه در Statistics How To →
[5]bookdown.orgدانشمندان دادهChapter 27 Contingency tables
مطالعه در bookdown.org →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
بازارهای انرژی
دادههای آژانس بینالمللی انرژی: عرضه جهانی نفت همچنان ۹.۴ میلیون بشکه کمتر از سطح پیش از جنگ است
4 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





