رفتن به محتوای اصلی
کوهستان
توضیح کوهستانجداول توافقیگزارش تشریحی· 4 دقیقه مطالعه· در تحلیل داده

چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموع‌های حاشیه‌ای تقسیم بر مجموع کل به دست می‌آید

تحت این فرض ریاضی که دو متغیر طبقه‌ای کاملاً مستقل هستند، مقدار مورد انتظار برای هر سلول در یک جدول تقاطعی، با ضرب مجموع سطر و ستون آن و سپس تقسیم بر اندازه کل نمونه محاسبه می‌شود.

به قلم اِلا فرجاد

به‌طور خلاصه

  1. فراوانی‌های مورد انتظار نشان می‌دهند که اگر دو متغیر کاملاً بی‌ارتباط بودند، داده‌ها چگونه به نظر می‌رسیدند.
  2. در این محاسبه، مجموع سطر یک سلول در مجموع ستون آن ضرب شده و سپس بر مجموع کل تقسیم می‌شود.
  3. این فرمول، ساده‌سازی جبری قانون ضرب برای احتمال‌های مستقل است.

محدودیت الزام‌آور برای محاسبه یک فراوانی مورد انتظار، فرض استقلال مطلق آماری است. برای اینکه مکانیسم ریاضی به‌درستی کار کند، احتمال قرار گرفتن یک مشاهده در یک سطر خاص باید کاملاً از اینکه به کدام ستون تعلق دارد، مستقل و بی‌تأثیر باشد. اگر این شرط برقرار باشد، مقدار مورد انتظار در هر سلول از یک جدول توافقی، به‌سادگی حاصل‌ضرب مجموع‌های حاشیه‌ای آن تقسیم بر مجموع کل است.[1][6]

این محاسبه، موتور محرک آزمون استقلال کای-دو (Chi-square) را تشکیل می‌دهد؛ یک روش آماری که توسط کارل پیرسون (Karl Pearson) در سال ۱۹۰۰ توسعه یافت و در رشته‌های مختلف از همه‌گیرشناسی گرفته تا بازاریابی استفاده می‌شود. پیش از آنکه پژوهشگران بتوانند تعیین کنند آیا رابطه‌ای بین دو متغیر طبقه‌ای - مانند گروه درمانی یک بیمار و وضعیت بهبودی او - وجود دارد یا خیر، ابتدا باید دقیقاً مشخص کنند که اگر هیچ رابطه‌ای وجود نداشت، داده‌ها چگونه به نظر می‌رسیدند.[1][2]

یک جدول توافقی یا جدول تقاطعی، داده‌ها را در یک شبکه سازماندهی می‌کند. در یک جدول استاندارد ۲ در ۲، دقیقاً ۴ سلول مجزا وجود دارد. «مجموع‌های حاشیه‌ای» در واقع حاصل‌جمع هر سطر و ستون هستند که در حاشیه‌های جدول ظاهر می‌شوند، در حالی که «مجموع کل» همان اندازه کلی نمونه در مجموعه داده است.[3][4]

برای یافتن فراوانی مورد انتظار یک سلول خاص، پژوهشگران مجموع سطر آن سلول را در مجموع ستون آن ضرب کرده و سپس بر مجموع کل تقسیم می‌کنند. برای مثال، اگر یک کارآزمایی بالینی شامل ۱۰۰ بیمار باشد که ۵۰ نفر داروی جدیدی دریافت کرده‌اند و ۴۰ نفر عارضه جانبی خاصی را تجربه کرده‌اند، فراوانی مورد انتظار بیمارانی که هم دارو را دریافت کرده‌اند و هم عارضه جانبی را تجربه کرده‌اند - تحت فرض استقلال - برابر است با (۵۰ × ۴۰) / ۱۰۰، یا دقیقاً ۲۰ بیمار.[4][5]

فرمول فراوانی مورد انتظار، احتمال توأم دو رویداد مستقل را ساده‌سازی می‌کند.

مکانیسم نهفته در این فرمول، بر قانون بنیادین ضرب در احتمالات استوار است. زمانی که دو رویداد مستقل هستند، احتمال وقوع همزمان هر دو، برابر با حاصل‌ضرب احتمال‌های فردی آن‌هاست.[2][3]

احتمال اینکه یک مشاهده در یک سطر خاص قرار گیرد، برابر است با مجموع سطر تقسیم بر مجموع کل. به همین ترتیب، احتمال قرار گرفتن آن در یک ستون خاص، برابر است با مجموع ستون تقسیم بر مجموع کل.[3]

ضرب این دو احتمال حاشیه‌ای، احتمال توأم را برای آن سلول خاص به دست می‌دهد. برای تبدیل دوباره این احتمال نظری به یک مقدار مورد انتظار، باید آن را در مجموع کل ضرب کرد.[1][6]

از نظر ریاضی، این فرآیند به این شکل بیان می‌شود: (مجموع سطر / مجموع کل) × (مجموع ستون / مجموع کل) × مجموع کل. وقتی این عبارت ساده می‌شود، یکی از مجموع‌های کل در مخرج با مجموع کل در صورت خط می‌خورد و همان فرمول استاندارد باقی می‌ماند.[5][6]

این ساده‌سازی جبری ظریف همان دلیلی است که پژوهشگران نیازی به محاسبه احتمال‌های فردی برای هر سلول ندارند. همان‌طور که مستندات مؤسسه ملی استاندارد و فناوری اشاره می‌کند: «فراوانی مورد انتظار برای هر سلول، به‌عنوان حاصل‌ضرب مجموع‌های حاشیه‌ای سطر و ستون تقسیم بر مجموع کل محاسبه می‌شود.»[2]

پس از آنکه فراوانی‌های مورد انتظار برای هر سلول در جدول محاسبه شدند، با فراوانی‌های واقعی مشاهده‌شده مقایسه می‌شوند. تفاوت میان مقادیر مشاهده‌شده و مورد انتظار، پایه و اساس آماره کای-دو را شکل می‌دهد؛ آماره‌ای که این تفاوت‌ها را به توان ۲ می‌رساند و بر مقادیر مورد انتظار تقسیم می‌کند تا واریانس را استانداردسازی کند.[1][2]

آزمون کای-دو اندازه می‌گیرد که داده‌های مشاهده‌شده چقدر از خط پایه مورد انتظار انحراف دارند.

اگر مقادیر مشاهده‌شده تطابق نزدیکی با مقادیر مورد انتظار داشته باشند، انحراف کوچک است، که نشان می‌دهد متغیرها واقعاً مستقل هستند. اما اگر مقادیر مشاهده‌شده به‌طور قابل‌توجهی از خط پایه مورد انتظار فاصله بگیرند، نشان‌دهنده یک رابطه آماری است که بعید است تصادفی رخ داده باشد.[1][3]

با این حال، این چارچوب ریاضی محدودیت‌های سخت‌گیرانه‌ای دارد. این محاسبه فرض می‌کند که نمونه به‌طور تصادفی استخراج شده و مشاهدات مانعة‌الجمع هستند؛ به این معنی که هیچ سوژه‌ای نمی‌تواند در بیش از یک سلول شمرده شود.[3][5]

علاوه بر این، اگر فراوانی‌های مورد انتظار بیش از حد کوچک باشند، اعتبار آزمون کای-دو متعاقب آن کاهش می‌یابد. یک قاعده سرانگشتیِ پذیرفته‌شده حکم می‌کند که فراوانی مورد انتظار در هر سلول باید حداقل ۵ باشد تا اطمینان حاصل شود که آماره آزمون، توزیع کای-دو را به‌دقت تقریب می‌زند.[1][5]

زمانی که مقادیر مورد انتظار به زیر این آستانه می‌رسند، پژوهشگران باید یا دسته‌ها را ترکیب کنند تا مجموع‌های حاشیه‌ای افزایش یابد، یا آزمون کای-دو را کنار گذاشته و به سراغ جایگزین‌هایی مانند آزمون دقیق فیشر (Fisher's exact test) بروند که در سال ۱۹۲۲ منتشر شد و به‌جای تکیه بر تقریب‌ها، احتمال‌های دقیق را محاسبه می‌کند.[2][3]

ابعاد جدول همچنین درجات آزادی را دیکته می‌کند که به‌صورت (تعداد سطرها منهای ۱) ضربدر (تعداد ستون‌ها منهای ۱) محاسبه می‌شود. برای یک جدول ۳ در ۴، این محاسبه ۶ درجه آزادی به دست می‌دهد که شکل دقیق توزیع کای-دو را برای ارزیابی اینکه آیا انحرافات از فراوانی‌های مورد انتظار از نظر آماری معنادار هستند یا خیر، تعیین می‌کند.[4][5]

اصطلاحات کلیدی

جدول توافقی
شبکه‌ای که در آمار برای خلاصه‌سازی رابطه بین دو یا چند متغیر طبقه‌ای استفاده می‌شود.
مجموع حاشیه‌ای
حاصل‌جمع مقادیر برای یک سطر یا ستون خاص که در حاشیه‌های یک جدول توافقی یافت می‌شود.
مجموع کل
اندازه کلی نمونه که نشان‌دهنده مجموع تمام مشاهدات در کل جدول است.
فرض صفر
فرض پایه مبنی بر اینکه هیچ رابطه یا تعاملی بین متغیرهای مورد مطالعه وجود ندارد.

بررسی عمیق دیدگاه‌ها

آمارشناسان فراوانی‌گرا

فراوانی‌های مورد انتظار را به‌عنوان بازنمایی ریاضی حیاتی از فرض صفر می‌بینند.

در چارچوب فراوانی‌گرایی، فراوانی‌های مورد انتظار صرفاً یک گام محاسباتی نیستند؛ بلکه تجلی فیزیکی فرض صفر محسوب می‌شوند. آمارشناسان با محاسبه دقیق اینکه اگر تنها شانس توزیع را دیکته می‌کرد داده‌ها چگونه به نظر می‌رسیدند، یک خط پایه ریاضی سفت‌وسخت ایجاد می‌کنند. سپس هرگونه انحراف از این خط پایه کمّی‌سازی می‌شود تا مشخص شود آیا واقعیت مشاهده‌شده آن‌قدر افراطی است که نتواند در جهانی که متغیرها مستقل هستند رخ دهد.

دانشمندان داده

از فراوانی‌های مورد انتظار در الگوریتم‌های انتخاب ویژگی برای شناسایی متغیرهای پیش‌بینی‌کننده استفاده می‌کنند.

برای متخصصان مدرن یادگیری ماشین، جداول توافقی و فراوانی‌های مورد انتظار اغلب در الگوریتم‌های انتخاب ویژگی خودکارسازی می‌شوند. هنگام ساخت مدل‌های طبقه‌بندی، دانشمندان داده از آزمون‌های کای-دو برای فیلتر کردن ویژگی‌های طبقه‌ای که از متغیر هدف مستقل هستند، استفاده می‌کنند. اگر فراوانی‌های مشاهده‌شده یک ویژگی تطابق نزدیکی با فراوانی‌های مورد انتظار آن در کلاس‌های هدف داشته باشد، آن ویژگی هیچ سیگنال پیش‌بینی‌کننده‌ای ارائه نمی‌دهد و برای کاهش ابعاد از مدل حذف می‌شود.

آمارشناسان فراوانی‌گرا 40%دانشمندان داده 30%مهندسان کنترل کیفیت 30%
آمارشناسان فراوانی‌گرا
فراوانی‌های مورد انتظار را به‌عنوان بازنمایی ریاضی حیاتی از فرض صفر می‌بینند که خط پایه‌ای را برای آزمایش داده‌های مشاهده‌شده فراهم می‌کند.
دانشمندان داده
از فراوانی‌های مورد انتظار در الگوریتم‌های انتخاب ویژگی استفاده می‌کنند تا تشخیص دهند کدام متغیرهای طبقه‌ای بیشترین قدرت پیش‌بینی را برای مدل‌های یادگیری ماشین دارند.
مهندسان کنترل کیفیت
این محاسبات را در جداول توافقی تولید به کار می‌گیرند تا تعیین کنند آیا نرخ نقص‌ها از خطوط تولید یا شیفت‌های خاص مستقل است یا خیر.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آمارشناسان بیزی
  • روش‌شناسان پیمایش

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان فراوانی‌گرا 40%دانشمندان داده 30%مهندسان کنترل کیفیت 30%
  1. [1]PMCآمارشناسان فراوانی‌گرا

    The Chi-square test of independence

    مطالعه در PMC →
  2. [2]NISTمهندسان کنترل کیفیت

    CHI-SQUARE INDEPENDENCE TEST

    مطالعه در NIST →
  3. [3]University of Vermontآمارشناسان فراوانی‌گرا

    CHI-SQUARE TEST - ANALYSIS OF CONTINGENCY TABLES

    مطالعه در University of Vermont →
  4. [4]Statistics How Toدانشمندان داده

    Expected Frequency: Definition, Formula, Calculation

    مطالعه در Statistics How To →
  5. [5]bookdown.orgدانشمندان داده

    Chapter 27 Contingency tables

    مطالعه در bookdown.org →
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.