چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموعهای حاشیهای تقسیم بر مجموع کل به دست میآید
تحت این فرض ریاضی که دو متغیر طبقهای کاملاً مستقل هستند، مقدار مورد انتظار برای هر سلول در یک جدول تقاطعی، با ضرب مجموع سطر و ستون آن و سپس تقسیم بر اندازه کل نمونه محاسبه میشود.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- فراوانیهای مورد انتظار نشان میدهند که اگر دو متغیر کاملاً بیارتباط بودند، دادهها چگونه به نظر میرسیدند.
- در این محاسبه، مجموع سطر یک سلول در مجموع ستون آن ضرب شده و سپس بر مجموع کل تقسیم میشود.
- این فرمول، سادهسازی جبری قانون ضرب برای احتمالهای مستقل است.
محدودیت الزامآور برای محاسبه یک فراوانی مورد انتظار، فرض استقلال مطلق آماری است. برای اینکه مکانیسم ریاضی بهدرستی کار کند، احتمال قرار گرفتن یک مشاهده در یک سطر خاص باید کاملاً از اینکه به کدام ستون تعلق دارد، مستقل و بیتأثیر باشد. اگر این شرط برقرار باشد، مقدار مورد انتظار در هر سلول از یک جدول توافقی، بهسادگی حاصلضرب مجموعهای حاشیهای آن تقسیم بر مجموع کل است.[1][6]
این محاسبه، موتور محرک آزمون استقلال کای-دو (Chi-square) را تشکیل میدهد؛ یک روش آماری که توسط کارل پیرسون (Karl Pearson) در سال ۱۹۰۰ توسعه یافت و در رشتههای مختلف از همهگیرشناسی گرفته تا بازاریابی استفاده میشود. پیش از آنکه پژوهشگران بتوانند تعیین کنند آیا رابطهای بین دو متغیر طبقهای - مانند گروه درمانی یک بیمار و وضعیت بهبودی او - وجود دارد یا خیر، ابتدا باید دقیقاً مشخص کنند که اگر هیچ رابطهای وجود نداشت، دادهها چگونه به نظر میرسیدند.[1][2]
یک جدول توافقی یا جدول تقاطعی، دادهها را در یک شبکه سازماندهی میکند. در یک جدول استاندارد ۲ در ۲، دقیقاً ۴ سلول مجزا وجود دارد. «مجموعهای حاشیهای» در واقع حاصلجمع هر سطر و ستون هستند که در حاشیههای جدول ظاهر میشوند، در حالی که «مجموع کل» همان اندازه کلی نمونه در مجموعه داده است.[3][4]
برای یافتن فراوانی مورد انتظار یک سلول خاص، پژوهشگران مجموع سطر آن سلول را در مجموع ستون آن ضرب کرده و سپس بر مجموع کل تقسیم میکنند. برای مثال، اگر یک کارآزمایی بالینی شامل ۱۰۰ بیمار باشد که ۵۰ نفر داروی جدیدی دریافت کردهاند و ۴۰ نفر عارضه جانبی خاصی را تجربه کردهاند، فراوانی مورد انتظار بیمارانی که هم دارو را دریافت کردهاند و هم عارضه جانبی را تجربه کردهاند - تحت فرض استقلال - برابر است با (۵۰ × ۴۰) / ۱۰۰، یا دقیقاً ۲۰ بیمار.[4][5]
مکانیسم نهفته در این فرمول، بر قانون بنیادین ضرب در احتمالات استوار است. زمانی که دو رویداد مستقل هستند، احتمال وقوع همزمان هر دو، برابر با حاصلضرب احتمالهای فردی آنهاست.[2][3]
احتمال اینکه یک مشاهده در یک سطر خاص قرار گیرد، برابر است با مجموع سطر تقسیم بر مجموع کل. به همین ترتیب، احتمال قرار گرفتن آن در یک ستون خاص، برابر است با مجموع ستون تقسیم بر مجموع کل.[3]
ضرب این دو احتمال حاشیهای، احتمال توأم را برای آن سلول خاص به دست میدهد. برای تبدیل دوباره این احتمال نظری به یک مقدار مورد انتظار، باید آن را در مجموع کل ضرب کرد.[1][6]
از نظر ریاضی، این فرآیند به این شکل بیان میشود: (مجموع سطر / مجموع کل) × (مجموع ستون / مجموع کل) × مجموع کل. وقتی این عبارت ساده میشود، یکی از مجموعهای کل در مخرج با مجموع کل در صورت خط میخورد و همان فرمول استاندارد باقی میماند.[5][6]
این سادهسازی جبری ظریف همان دلیلی است که پژوهشگران نیازی به محاسبه احتمالهای فردی برای هر سلول ندارند. همانطور که مستندات مؤسسه ملی استاندارد و فناوری اشاره میکند: «فراوانی مورد انتظار برای هر سلول، بهعنوان حاصلضرب مجموعهای حاشیهای سطر و ستون تقسیم بر مجموع کل محاسبه میشود.»[2]
پس از آنکه فراوانیهای مورد انتظار برای هر سلول در جدول محاسبه شدند، با فراوانیهای واقعی مشاهدهشده مقایسه میشوند. تفاوت میان مقادیر مشاهدهشده و مورد انتظار، پایه و اساس آماره کای-دو را شکل میدهد؛ آمارهای که این تفاوتها را به توان ۲ میرساند و بر مقادیر مورد انتظار تقسیم میکند تا واریانس را استانداردسازی کند.[1][2]
اگر مقادیر مشاهدهشده تطابق نزدیکی با مقادیر مورد انتظار داشته باشند، انحراف کوچک است، که نشان میدهد متغیرها واقعاً مستقل هستند. اما اگر مقادیر مشاهدهشده بهطور قابلتوجهی از خط پایه مورد انتظار فاصله بگیرند، نشاندهنده یک رابطه آماری است که بعید است تصادفی رخ داده باشد.[1][3]
با این حال، این چارچوب ریاضی محدودیتهای سختگیرانهای دارد. این محاسبه فرض میکند که نمونه بهطور تصادفی استخراج شده و مشاهدات مانعةالجمع هستند؛ به این معنی که هیچ سوژهای نمیتواند در بیش از یک سلول شمرده شود.[3][5]
علاوه بر این، اگر فراوانیهای مورد انتظار بیش از حد کوچک باشند، اعتبار آزمون کای-دو متعاقب آن کاهش مییابد. یک قاعده سرانگشتیِ پذیرفتهشده حکم میکند که فراوانی مورد انتظار در هر سلول باید حداقل ۵ باشد تا اطمینان حاصل شود که آماره آزمون، توزیع کای-دو را بهدقت تقریب میزند.[1][5]
زمانی که مقادیر مورد انتظار به زیر این آستانه میرسند، پژوهشگران باید یا دستهها را ترکیب کنند تا مجموعهای حاشیهای افزایش یابد، یا آزمون کای-دو را کنار گذاشته و به سراغ جایگزینهایی مانند آزمون دقیق فیشر (Fisher's exact test) بروند که در سال ۱۹۲۲ منتشر شد و بهجای تکیه بر تقریبها، احتمالهای دقیق را محاسبه میکند.[2][3]
ابعاد جدول همچنین درجات آزادی را دیکته میکند که بهصورت (تعداد سطرها منهای ۱) ضربدر (تعداد ستونها منهای ۱) محاسبه میشود. برای یک جدول ۳ در ۴، این محاسبه ۶ درجه آزادی به دست میدهد که شکل دقیق توزیع کای-دو را برای ارزیابی اینکه آیا انحرافات از فراوانیهای مورد انتظار از نظر آماری معنادار هستند یا خیر، تعیین میکند.[4][5]
اصطلاحات کلیدی
- جدول توافقی
- شبکهای که در آمار برای خلاصهسازی رابطه بین دو یا چند متغیر طبقهای استفاده میشود.
- مجموع حاشیهای
- حاصلجمع مقادیر برای یک سطر یا ستون خاص که در حاشیههای یک جدول توافقی یافت میشود.
- مجموع کل
- اندازه کلی نمونه که نشاندهنده مجموع تمام مشاهدات در کل جدول است.
- فرض صفر
- فرض پایه مبنی بر اینکه هیچ رابطه یا تعاملی بین متغیرهای مورد مطالعه وجود ندارد.
بررسی عمیق دیدگاهها
آمارشناسان فراوانیگرا
فراوانیهای مورد انتظار را بهعنوان بازنمایی ریاضی حیاتی از فرض صفر میبینند.
در چارچوب فراوانیگرایی، فراوانیهای مورد انتظار صرفاً یک گام محاسباتی نیستند؛ بلکه تجلی فیزیکی فرض صفر محسوب میشوند. آمارشناسان با محاسبه دقیق اینکه اگر تنها شانس توزیع را دیکته میکرد دادهها چگونه به نظر میرسیدند، یک خط پایه ریاضی سفتوسخت ایجاد میکنند. سپس هرگونه انحراف از این خط پایه کمّیسازی میشود تا مشخص شود آیا واقعیت مشاهدهشده آنقدر افراطی است که نتواند در جهانی که متغیرها مستقل هستند رخ دهد.
دانشمندان داده
از فراوانیهای مورد انتظار در الگوریتمهای انتخاب ویژگی برای شناسایی متغیرهای پیشبینیکننده استفاده میکنند.
برای متخصصان مدرن یادگیری ماشین، جداول توافقی و فراوانیهای مورد انتظار اغلب در الگوریتمهای انتخاب ویژگی خودکارسازی میشوند. هنگام ساخت مدلهای طبقهبندی، دانشمندان داده از آزمونهای کای-دو برای فیلتر کردن ویژگیهای طبقهای که از متغیر هدف مستقل هستند، استفاده میکنند. اگر فراوانیهای مشاهدهشده یک ویژگی تطابق نزدیکی با فراوانیهای مورد انتظار آن در کلاسهای هدف داشته باشد، آن ویژگی هیچ سیگنال پیشبینیکنندهای ارائه نمیدهد و برای کاهش ابعاد از مدل حذف میشود.
- آمارشناسان فراوانیگرا
- فراوانیهای مورد انتظار را بهعنوان بازنمایی ریاضی حیاتی از فرض صفر میبینند که خط پایهای را برای آزمایش دادههای مشاهدهشده فراهم میکند.
- دانشمندان داده
- از فراوانیهای مورد انتظار در الگوریتمهای انتخاب ویژگی استفاده میکنند تا تشخیص دهند کدام متغیرهای طبقهای بیشترین قدرت پیشبینی را برای مدلهای یادگیری ماشین دارند.
- مهندسان کنترل کیفیت
- این محاسبات را در جداول توافقی تولید به کار میگیرند تا تعیین کنند آیا نرخ نقصها از خطوط تولید یا شیفتهای خاص مستقل است یا خیر.
دیدگاههایی که این گزارش پوشش نداده
- آمارشناسان بیزی
- روششناسان پیمایش
منابع
[1]PMCآمارشناسان فراوانیگراThe Chi-square test of independence
مطالعه در PMC →
[2]NISTمهندسان کنترل کیفیتCHI-SQUARE INDEPENDENCE TEST
مطالعه در NIST →
[3]University of Vermontآمارشناسان فراوانیگراCHI-SQUARE TEST - ANALYSIS OF CONTINGENCY TABLES
مطالعه در University of Vermont →
[4]Statistics How Toدانشمندان دادهExpected Frequency: Definition, Formula, Calculation
مطالعه در Statistics How To →
[5]bookdown.orgدانشمندان دادهChapter 27 Contingency tables
مطالعه در bookdown.org →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →پارادوکسهای آماری
چگونه ناترازی نقطه آغاز اثر مداخله را میان آنکوا و تفاضل در تفاضل معکوس میکند
7 منبع
دادههای خطرات اقلیمی
دادههای یونیسف: ۳۴۷ میلیون کودک در معرض خطرات اقلیمی شدید پدیده النینو قرار دارند
8 منبع
سلامت دیجیتال
مرور فراگیر لنست بر ۹ میلیون جوان، آسیبهای سلامت ناشی از مصرف مشکلساز رسانههای دیجیتال را اندازهگیری کرد
4 منبع
بازار نفت
رسیدن صادرات نفت خاورمیانه به بالاترین سطح از زمان آغاز جنگ
3 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





