سازوکار اهمیت آماری: مقایسه مقدار پی، فاصله اطمینان و اندازه اثر
در حالی که مقدار پی (p-value) مدتها به عنوان دروازهبان کشف علمی عمل کرده است، تحقیقات مدرن به طور فزایندهای به اندازههای اثر و فواصل اطمینان تکیه میکنند تا مشخص کنند آیا یک یافته واقعاً در دنیای واقعی اهمیت دارد یا خیر.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- اصلاحطلبان تکرارپذیری
- استدلال میکنند که مقادیر پی به راحتی دستکاری میشوند و برای اطمینان از قوی و تکرارپذیر بودن یافتهها، اندازههای اثر و فواصل اطمینان را ضروری میدانند.
- متخصصان بالینی
- تمرکز کامل بر اهمیت بالینی (اندازه اثر) دارند، زیرا یک اثر با اهمیت آماری اما کوچک، مراقبت از بیمار را تغییر نمیدهد.
- فراوانیگرایان سنتی
- برای جلوگیری از مثبتهای کاذب و حفظ یک مانع استاندارد برای ادعاهای علمی، برای آستانه دودویی سختگیرانه مقادیر پی ارزش قائل هستند.
هر روز، تیترها اعلام میکنند که یک مطالعه جدید ارتباطی "با اهمیت آماری" بین یک غذای خاص و طول عمر، یا یک داروی جدید و کاهش وزن پیدا کرده است. برای دههها، این عبارت به عنوان مهر تأیید نهایی علمی عمل کرده است. اما در پشت صحنه، دانشمندان داده و محققانی که این مطالعات را طراحی میکنند، به طور فزایندهای هشدار میدهند که این مهر دودویی گمراهکننده است. برای درک واقعی آنچه یک مطالعه ثابت میکند، باید فراتر از آزمون ساده قبولی یا رد اهمیت آماری نگاه کنیم.[8]
اساس تحقیقات علمی سنتی، آزمون فرضیه است و ابزار اصلی آن مقدار پی (p-value). مقدار پی که در دهه ۱۹۲۰ معرفی شد، احتمال به دست آمدن نتایج مشاهده شده را در صورتی که در واقع هیچ اثر واقعی وجود نداشته باشد (سناریویی که به عنوان فرضیه صفر شناخته میشود) اندازهگیری میکند. اگر این احتمال بسیار پایین باشد، محققان نتیجه میگیرند که یافته آنها احتمالاً واقعی است و صرفاً محصول شانس تصادفی نیست.[5]
بر اساس یک توافق، جامعه علمی بر آستانه ۰٫۰۵ برای مقدار پی به توافق رسید. اگر احتمال وقوع یک نتیجه تحت فرضیه صفر کمتر از ۵ درصد باشد، آن نتیجه "با اهمیت آماری" تلقی میشود. این خط مرزی قراردادی، به دروازهبان انتشار دانشگاهی، تأمین مالی و توجه رسانهها تبدیل شد و مسیر علم مدرن را شکل داد.[1]
با این حال، مقدار پی یک محدودیت اساسی دارد: فقط به شما میگوید که آیا احتمالاً اثری وجود دارد یا خیر، نه اینکه آیا آن اثر واقعاً مهم است. مقدار پی نمیتواند اندازه تفاوت یا قدرت یک رابطه را اندازهگیری کند. این معیار صرفاً نشان میدهد که دادهها به اندازه کافی غیرعادی هستند که توجه را جلب کنند، اما بزرگی واقعی کشف را کاملاً تعریف نشده باقی میگذارد.[1][8]
اینجاست که "اندازه اثر" حیاتی میشود. اگر مقدار پی میپرسد: "آیا تفاوتی وجود دارد؟"، اندازه اثر پاسخ میدهد: "این تفاوت چقدر بزرگ است؟" این یک معیار کمی برای بزرگی یک پدیده است. بدون آن، یک یافته با اهمیت آماری ممکن است در دنیای واقعی عملاً بیمعنی باشد.[7]
یک کارآزمایی بالینی فرضی برای یک داروی جدید کاهش وزن را در نظر بگیرید که شامل ۱۰۰,۰۰۰ شرکتکننده است. از آنجا که حجم نمونه بسیار زیاد است، حتی یک تفاوت میکروسکوپی در کاهش وزن بین گروههای درمانی و دارونما، یک مقدار پی با اهمیت آماری را به همراه خواهد داشت. اما اگر اندازه اثر واقعی، کاهش وزن متوسط ۰٫۱ پوند در طول یک سال باشد، این دارو با وجود برچسب "با اهمیت"، از نظر بالینی بیفایده است.[2][7]
این تمایز بین اهمیت آماری و اهمیت بالینی، باعث ایجاد یک تغییر عمده در تحقیقات پزشکی و روانشناختی شده است. متخصصان باید بدانند که آیا یک درمان به طور معناداری زندگی بیمار را بهبود میبخشد یا خیر؛ سؤالی که مقادیر پی به تنهایی از نظر ریاضی قادر به پاسخگویی به آن نیستند.[2]
این تمایز بین اهمیت آماری و اهمیت بالینی، باعث ایجاد یک تغییر عمده در تحقیقات پزشکی و روانشناختی شده است.
برای پر کردن شکاف بین آزمونهای دودویی و کاربرد در دنیای واقعی، محققان به معیار سومی تکیه میکنند: فاصله اطمینان (CI). فاصله اطمینان به جای ارائه یک برآورد نقطهای واحد، دامنهای از مقادیر محتمل را برای اثر واقعی در کل جامعه ارائه میدهد و عدم قطعیت ذاتی موجود در هر نمونهگیری را تصدیق میکند.[6]
یک فاصله اطمینان استاندارد ۹۵ درصدی به این معنی است که اگر محققان آزمایش را ۱۰۰ بار تکرار کنند، ۹۵ مورد از آن فواصل محاسبه شده، اثر واقعی زیربنایی را در بر خواهند داشت. این معیار تمرکز را از یک "بله یا خیر" ساده به سمت تخمینی دقیقتر از واقعیت تغییر میدهد و پنجرهای شفاف به قابلیت اطمینان دادهها برای خوانندگان باز میکند.[3][6]
نکته مهم این است که عرض فاصله اطمینان، دقت دادهها را آشکار میسازد. یک فاصله باریک نشاندهنده قطعیت بالا در مورد اندازه اثر است، در حالی که یک فاصله پهن، عدم قطعیت عمیق را نشان میدهد. ممکن است یک مطالعه دارای مقدار پی با اهمیت آماری باشد، اما اگر فاصله اطمینان آن از یک اثر ناچیز تا یک اثر بسیار بزرگ متغیر باشد، یافتهها برای اقدام کردن بسیار مبهم هستند.[3]
اتکای بیش از حد به مقادیر پی در سال ۲۰۱۶ به نقطه اوج خود رسید، زمانی که انجمن آمار آمریکا (ASA) گامی بیسابقه برداشت و بیانیهای رسمی در این خصوص صادر کرد. ASA هشدار داد که سوءاستفاده گسترده از مقادیر پی در حال تحریف فرآیند علمی و کمک به بحران تکرارپذیری در رشتههای مختلف است.[1]
انجمن آمار آمریکا به صراحت اشاره کرد که مقدار پی نه احتمال درست بودن فرضیه مورد مطالعه را اندازهگیری میکند و نه اهمیت یک نتیجه را. آنها از جامعه علمی خواستند که از آستانههای قطعی فاصله بگیرند و دیدگاهی جامعتر نسبت به تحلیل دادهها داشته باشند که شامل زمینه، طراحی مطالعه و بزرگی اثر باشد.[1]
در پاسخ به این هشدارها، مجلات علمی بزرگ استانداردهای گزارشدهی خود را بازنگری کردهاند. بسیاری از آنها اکنون به صراحت از نویسندگان میخواهند که اندازههای اثر و فواصل اطمینان را در کنار، یا حتی به جای، مقادیر پی سنتی گزارش دهند. هدف این است که محققان مجبور شوند بزرگی و عدم قطعیت یافتههای خود را تخمین بزنند، نه اینکه فقط وجود آنها را آزمایش کنند.[4]
امروزه هنگام ارزیابی یک تحقیق جدید، سواد دادهای مستلزم جستجوی سهگانه کامل است. مقدار پی ثابت میکند که یافته احتمالاً تصادفی نیست. اندازه اثر تعیین میکند که آیا یافته به اندازه کافی بزرگ است که اهمیت داشته باشد. فاصله اطمینان نشان میدهد که آن یافته با چه دقتی اندازهگیری شده است.[4][5]
این تکامل روششناختی نشاندهنده بلوغ فرآیند علمی است. محققان با فراتر رفتن از تکیهگاه دودویی اهمیت آماری، تصویری شفافتر، دقیقتر و در نهایت مفیدتر از نحوه عملکرد واقعی جهان ارائه میدهند و سیاستگذاران و عموم مردم را قادر میسازند تا تصمیمات مبتنی بر شواهد بهتری بگیرند.[9]
نکات کلیدی
- مقدار پی تنها نشان میدهد که آیا اثری وجود دارد یا خیر، نه اینکه چقدر بزرگ یا مهم است.
- اندازه اثر، بزرگی واقعی یک یافته را اندازهگیری میکند و تفاوت بین خطاهای آماری و تأثیرات دنیای واقعی را مشخص میسازد.
- فواصل اطمینان، دامنهای از مقادیر محتمل را ارائه میدهند و دقت و عدم قطعیت دادهها را آشکار میسازند.
- حجم نمونههای بزرگ میتواند اهمیت آماری را به صورت مصنوعی افزایش دهد، بدون اینکه تأثیر عملی را تغییر دهد.
- اجماع علمی مدرن برای ارزیابی دقیق ادعاهای تحقیقاتی، هر سه معیار را ضروری میداند.
چرا مهم است
درک نحوه اعتبارسنجی دادهها، شما را در برابر تیترهای گمراهکننده محافظت میکند. وقتی تفاوت بین یک نتیجه با اهمیت آماری و یک نتیجه با معنای عملی را بدانید، میتوانید همه چیز را از درمانهای پزشکی جدید گرفته تا سیاستهای اقتصادی بهتر ارزیابی کنید.
آنچه نمیدانیم
- اینکه آیا جامعه علمی گستردهتر، علیرغم هشدارهای نهادی، آستانه ۰٫۰۵ برای مقدار پی را به طور کامل کنار خواهد گذاشت یا خیر.
- چگونه ظهور یادگیری ماشینی و مجموعهدادههای عظیم، چارچوبهای سنتی آزمون فرضیه را تغییر خواهد داد.
منابع
[1]The American Statisticianاصلاحطلبان تکرارپذیریThe ASA's Statement on p-Values: Context, Process, and Purpose
مطالعه در The American Statistician →
[2]Anesthesia and Analgesiaمتخصصان بالینیStatistical Significance Versus Clinical Importance of Observed Effect Sizes: What Do P Values and Confidence Intervals Really Represent?
مطالعه در Anesthesia and Analgesia →
[3]Korean Journal of Anesthesiologyمتخصصان بالینیAlternatives to P value: confidence interval and effect size
مطالعه در Korean Journal of Anesthesiology →
[4]Transplant Internationalمتخصصان بالینیTo test or to estimate? P-values versus effect sizes
مطالعه در Transplant International →
[5]StatPearlsHypothesis Testing, P Values, Confidence Intervals, and Significance
مطالعه در StatPearls →
[6]MetricGateConfidence Intervals and P-Values in Regression
مطالعه در MetricGate →
[7]MetricGateEffect Size vs. P-Values
مطالعه در MetricGate →
[8]Simply Psychologyاصلاحطلبان تکرارپذیریUnderstanding P-Values and Statistical Significance
مطالعه در Simply Psychology →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

