رفتن به محتوای اصلی
Koohestun
توضیح کوهستانجداول توافقیگزارش تشریحی· 4 دقیقه مطالعه· در تحلیل داده

چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموع‌های حاشیه‌ای تقسیم بر مجموع کل به دست می‌آید

تحت این فرض ریاضی که دو متغیر طبقه‌ای کاملاً مستقل هستند، مقدار مورد انتظار برای هر سلول در یک جدول تقاطعی، با ضرب مجموع سطر و ستون آن و سپس تقسیم بر اندازه کل نمونه محاسبه می‌شود.

به قلم اِلا فرجاد

آمارشناسان فراوانی‌گرا 40%دانشمندان داده 30%مهندسان کنترل کیفیت 30%
آمارشناسان فراوانی‌گرا
فراوانی‌های مورد انتظار را به‌عنوان بازنمایی ریاضی حیاتی از فرض صفر می‌بینند که خط پایه‌ای را برای آزمایش داده‌های مشاهده‌شده فراهم می‌کند.
دانشمندان داده
از فراوانی‌های مورد انتظار در الگوریتم‌های انتخاب ویژگی استفاده می‌کنند تا تشخیص دهند کدام متغیرهای طبقه‌ای بیشترین قدرت پیش‌بینی را برای مدل‌های یادگیری ماشین دارند.
مهندسان کنترل کیفیت
این محاسبات را در جداول توافقی تولید به کار می‌گیرند تا تعیین کنند آیا نرخ نقص‌ها از خطوط تولید یا شیفت‌های خاص مستقل است یا خیر.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آمارشناسان بیزی
  • روش‌شناسان پیمایش
≥ 5
حداقل مقدار مورد انتظار سلول برای یک آزمون کای-دو معتبر
1
درجه آزادی در یک جدول توافقی استاندارد ۲ در ۲
0
انحراف مورد انتظار زمانی که متغیرها کاملاً مستقل هستند

نکات کلیدی

  1. فراوانی‌های مورد انتظار نشان می‌دهند که اگر دو متغیر کاملاً بی‌ارتباط بودند، داده‌ها چگونه به نظر می‌رسیدند.
  2. در این محاسبه، مجموع سطر یک سلول در مجموع ستون آن ضرب شده و سپس بر مجموع کل تقسیم می‌شود.
  3. این فرمول، ساده‌سازی جبری قانون ضرب برای احتمال‌های مستقل است.
  4. آزمون کای-دو این خطوط پایه مورد انتظار را با داده‌های واقعی مشاهده‌شده مقایسه می‌کند.
  5. اگر مقادیر مورد انتظار به زیر ۵ برسند، تقریب استاندارد کای-دو اعتبار ریاضی خود را از دست می‌دهد.

محدودیت الزام‌آور برای محاسبه یک فراوانی مورد انتظار، فرض استقلال مطلق آماری است. برای اینکه مکانیسم ریاضی به‌درستی کار کند، احتمال قرار گرفتن یک مشاهده در یک سطر خاص باید کاملاً از اینکه به کدام ستون تعلق دارد، مستقل و بی‌تأثیر باشد. اگر این شرط برقرار باشد، مقدار مورد انتظار در هر سلول از یک جدول توافقی، به‌سادگی حاصل‌ضرب مجموع‌های حاشیه‌ای آن تقسیم بر مجموع کل است.[1][6]

این محاسبه، موتور محرک آزمون استقلال کای-دو (Chi-square) را تشکیل می‌دهد؛ یک روش آماری که توسط کارل پیرسون (Karl Pearson) در سال ۱۹۰۰ توسعه یافت و در رشته‌های مختلف از همه‌گیرشناسی گرفته تا بازاریابی استفاده می‌شود. پیش از آنکه پژوهشگران بتوانند تعیین کنند آیا رابطه‌ای بین دو متغیر طبقه‌ای - مانند گروه درمانی یک بیمار و وضعیت بهبودی او - وجود دارد یا خیر، ابتدا باید دقیقاً مشخص کنند که اگر هیچ رابطه‌ای وجود نداشت، داده‌ها چگونه به نظر می‌رسیدند.[1][2]

یک جدول توافقی یا جدول تقاطعی، داده‌ها را در یک شبکه سازماندهی می‌کند. در یک جدول استاندارد ۲ در ۲، دقیقاً ۴ سلول مجزا وجود دارد. «مجموع‌های حاشیه‌ای» در واقع حاصل‌جمع هر سطر و ستون هستند که در حاشیه‌های جدول ظاهر می‌شوند، در حالی که «مجموع کل» همان اندازه کلی نمونه در مجموعه داده است.[3][4]

برای یافتن فراوانی مورد انتظار یک سلول خاص، پژوهشگران مجموع سطر آن سلول را در مجموع ستون آن ضرب کرده و سپس بر مجموع کل تقسیم می‌کنند. برای مثال، اگر یک کارآزمایی بالینی شامل ۱۰۰ بیمار باشد که ۵۰ نفر داروی جدیدی دریافت کرده‌اند و ۴۰ نفر عارضه جانبی خاصی را تجربه کرده‌اند، فراوانی مورد انتظار بیمارانی که هم دارو را دریافت کرده‌اند و هم عارضه جانبی را تجربه کرده‌اند - تحت فرض استقلال - برابر است با (۵۰ × ۴۰) / ۱۰۰، یا دقیقاً ۲۰ بیمار.[4][5]

فرمول فراوانی مورد انتظار، احتمال توأم دو رویداد مستقل را ساده‌سازی می‌کند.

مکانیسم نهفته در این فرمول، بر قانون بنیادین ضرب در احتمالات استوار است. زمانی که دو رویداد مستقل هستند، احتمال وقوع همزمان هر دو، برابر با حاصل‌ضرب احتمال‌های فردی آن‌هاست.[2][3]

احتمال اینکه یک مشاهده در یک سطر خاص قرار گیرد، برابر است با مجموع سطر تقسیم بر مجموع کل. به همین ترتیب، احتمال قرار گرفتن آن در یک ستون خاص، برابر است با مجموع ستون تقسیم بر مجموع کل.[3]

ضرب این دو احتمال حاشیه‌ای، احتمال توأم را برای آن سلول خاص به دست می‌دهد. برای تبدیل دوباره این احتمال نظری به یک مقدار مورد انتظار، باید آن را در مجموع کل ضرب کرد.[1][6]

ضرب این دو احتمال حاشیه‌ای، احتمال توأم را برای آن سلول خاص به دست می‌دهد.

از نظر ریاضی، این فرآیند به این شکل بیان می‌شود: (مجموع سطر / مجموع کل) × (مجموع ستون / مجموع کل) × مجموع کل. وقتی این عبارت ساده می‌شود، یکی از مجموع‌های کل در مخرج با مجموع کل در صورت خط می‌خورد و همان فرمول استاندارد باقی می‌ماند.[5][6]

این ساده‌سازی جبری ظریف همان دلیلی است که پژوهشگران نیازی به محاسبه احتمال‌های فردی برای هر سلول ندارند. همان‌طور که مستندات مؤسسه ملی استاندارد و فناوری اشاره می‌کند: «فراوانی مورد انتظار برای هر سلول، به‌عنوان حاصل‌ضرب مجموع‌های حاشیه‌ای سطر و ستون تقسیم بر مجموع کل محاسبه می‌شود.»[2]

پس از آنکه فراوانی‌های مورد انتظار برای هر سلول در جدول محاسبه شدند، با فراوانی‌های واقعی مشاهده‌شده مقایسه می‌شوند. تفاوت میان مقادیر مشاهده‌شده و مورد انتظار، پایه و اساس آماره کای-دو را شکل می‌دهد؛ آماره‌ای که این تفاوت‌ها را به توان ۲ می‌رساند و بر مقادیر مورد انتظار تقسیم می‌کند تا واریانس را استانداردسازی کند.[1][2]

آزمون کای-دو اندازه می‌گیرد که داده‌های مشاهده‌شده چقدر از خط پایه مورد انتظار انحراف دارند.

اگر مقادیر مشاهده‌شده تطابق نزدیکی با مقادیر مورد انتظار داشته باشند، انحراف کوچک است، که نشان می‌دهد متغیرها واقعاً مستقل هستند. اما اگر مقادیر مشاهده‌شده به‌طور قابل‌توجهی از خط پایه مورد انتظار فاصله بگیرند، نشان‌دهنده یک رابطه آماری است که بعید است تصادفی رخ داده باشد.[1][3]

با این حال، این چارچوب ریاضی محدودیت‌های سخت‌گیرانه‌ای دارد. این محاسبه فرض می‌کند که نمونه به‌طور تصادفی استخراج شده و مشاهدات مانعة‌الجمع هستند؛ به این معنی که هیچ سوژه‌ای نمی‌تواند در بیش از یک سلول شمرده شود.[3][5]

علاوه بر این، اگر فراوانی‌های مورد انتظار بیش از حد کوچک باشند، اعتبار آزمون کای-دو متعاقب آن کاهش می‌یابد. یک قاعده سرانگشتیِ پذیرفته‌شده حکم می‌کند که فراوانی مورد انتظار در هر سلول باید حداقل ۵ باشد تا اطمینان حاصل شود که آماره آزمون، توزیع کای-دو را به‌دقت تقریب می‌زند.[1][5]

زمانی که مقادیر مورد انتظار به زیر این آستانه می‌رسند، پژوهشگران باید یا دسته‌ها را ترکیب کنند تا مجموع‌های حاشیه‌ای افزایش یابد، یا آزمون کای-دو را کنار گذاشته و به سراغ جایگزین‌هایی مانند آزمون دقیق فیشر (Fisher's exact test) بروند که در سال ۱۹۲۲ منتشر شد و به‌جای تکیه بر تقریب‌ها، احتمال‌های دقیق را محاسبه می‌کند.[2][3]

ابعاد جدول همچنین درجات آزادی را دیکته می‌کند که به‌صورت (تعداد سطرها منهای ۱) ضربدر (تعداد ستون‌ها منهای ۱) محاسبه می‌شود. برای یک جدول ۳ در ۴، این محاسبه ۶ درجه آزادی به دست می‌دهد که شکل دقیق توزیع کای-دو را برای ارزیابی اینکه آیا انحرافات از فراوانی‌های مورد انتظار از نظر آماری معنادار هستند یا خیر، تعیین می‌کند.[4][5]

آنچه نمی‌دانیم

  • آیا قانون سنتی که نیازمند فراوانی‌های مورد انتظار حداقل ۵ است، برای روش‌های محاسباتی مدرن بیش از حد محافظه‌کارانه است یا خیر.
  • چگونه می‌توان فراوانی‌های مورد انتظار را در مواجهه با طرح‌های پیمایشی پیچیده‌ای که مفروضات نمونه‌گیری تصادفی ساده را نقض می‌کنند، به‌طور بی‌نقصی تعدیل کرد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان فراوانی‌گرا 40%دانشمندان داده 30%مهندسان کنترل کیفیت 30%
  1. [1]PMCآمارشناسان فراوانی‌گرا

    The Chi-square test of independence

    مطالعه در PMC
  2. [2]NISTمهندسان کنترل کیفیت

    CHI-SQUARE INDEPENDENCE TEST

    مطالعه در NIST
  3. [3]University of Vermontآمارشناسان فراوانی‌گرا

    CHI-SQUARE TEST - ANALYSIS OF CONTINGENCY TABLES

    مطالعه در University of Vermont
  4. [4]Statistics How Toدانشمندان داده

    Expected Frequency: Definition, Formula, Calculation

    مطالعه در Statistics How To
  5. [5]bookdown.orgدانشمندان داده

    Chapter 27 Contingency tables

    مطالعه در bookdown.org
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.