فاکتور بیز: چگونه نسبت درستنماییهای حاشیهای شواهد فرضیههای رقیب را کمیتسنجی میکند
برخلاف مقادیر پی (p-values) سنتی که تنها یک فرضیه صفر را آزمایش میکنند، فاکتور بیز موفقیت پیشبینیکننده نسبی دو مدل رقیب را میسنجد. با محاسبه نسبت درستنماییهای حاشیهای، این روش به محققان اجازه میدهد تا شواهد دقیق برای فرضیه صفر را کمیتسنجی کنند، نه اینکه صرفاً در رد آن ناکام بمانند.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- بیزگرایان عینی
- استدلال میکنند که توزیعهای پیشین پیشفرض برای استانداردسازی فاکتورهای بیز ضروری هستند تا بتوانند جایگزین مقادیر پی در انتشارات علمی معمول شوند.
- بیزگرایان ذهنی
- معتقدند که توزیعهای پیشین باید به جای پیشفرضهای ریاضی، منعکسکننده دانش پیشین واقعی و خاص آن حوزه باشند، حتی اگر رسیدن به اجماع را دشوارتر کند.
- مدافعان فراوانیگرا
- هشدار میدهند که درستنماییهای حاشیهای به شدت نسبت به مفروضات غیرقابل آزمایش درباره توزیع پیشین حساس هستند و کنترل دقیق خطای بلندمدت را ترجیح میدهند.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان یادگیری ماشین
- تنظیمکنندگان مقررات کارآزماییهای بالینی
نکات کلیدی
- فاکتور بیز موفقیت پیشبینیکننده نسبی دو فرضیه رقیب را با محاسبه نسبت درستنماییهای حاشیهای آنها میسنجد.
- برخلاف مقادیر پی، فاکتورهای بیز میتوانند شواهد دقیق به نفع فرضیه صفر را کمیتسنجی کنند و اثرهای صفر واقعی را از مطالعات با توان آماری پایین متمایز سازند.
- محاسبه فاکتور بیز نیازمند مشخص کردن یک توزیع پیشین (prior distribution) است که محققان را مجبور میکند پیشبینیهای خود را قبل از جمعآوری دادهها به صورت ریاضی تعریف کنند.
- استفاده از یک توزیع پیشین بیش از حد گسترده، قدرت پیشبینی فرضیه جایگزین را رقیق میکند و به طور متناقضی باعث میشود فاکتور بیز از فرضیه صفر حمایت کند.
- تحلیل طراحی فاکتور بیز (BFDA) به محققان اجازه میدهد تا دادههای ورودی را به طور پیوسته نظارت کنند و آزمایشها را به محض رسیدن به آستانه شواهد قاطع متوقف کنند.
برای کمیتسنجی وزن دقیق شواهد یک ادعای علمی، محقق باید پیش از جمعآوری حتی یک نقطه داده، به صورت ریاضی تعریف کند که آن ادعا چه چیزی را پیشبینی میکند. این محدودیت الزامآور فاکتور بیز است. اگر یک فرضیه آنقدر مبهم باشد که بتواند هر مشاهده ممکنی را در خود جای دهد، درستنمایی حاشیهای آن فرو میپاشد. این سیستم تنها زمانی کار میکند که نظریههای رقیب مجبور شوند از پیش روی نتایج مشخصی شرطبندی کنند.[8]
در بیشتر طول قرن بیستم، استنتاج آماری به طور کامل از این محدودیت عبور کرد. رویکرد غالب فراوانیگرا (frequentist) که بر پایه مقدار پی (p-value) استوار است، تنها یک فرضیه را ارزیابی میکند—معمولاً فرض «صفر» مبنی بر اینکه هیچ اثری وجود ندارد. اگر دادهها تحت فرضیه صفر به اندازه کافی غیرعادی به نظر برسند، فرضیه صفر رد میشود. در این حالت، فرضیه جایگزین بدون اینکه هرگز مجبور به اثبات دقت پیشبینی خود باشد، به طور پیشفرض برنده میشود.[4]
اما همانطور که الکساندر اتز (Alexander Etz) در تحلیل خود از شواهد آماری اشاره میکند، رد کردن فرضیه صفر به معنای اثبات فرضیه جایگزین نیست. اتز با تمایز قائل شدن بین وزن شواهد و نتیجهگیری نهایی مینویسد: «فاکتور بیز به ما میگوید که باورهای ما چقدر باید تغییر کنند.» یک مقدار پی نمیتواند شواهد فرضیه صفر را بسنجد؛ بلکه تنها میتواند در رد آن ناکام بماند و محققان را در تشخیص بین یک اثر واقعاً صفر و مطالعهای که صرفاً برای یافتن آن اثر بیش از حد کوچک بوده، ناتوان بگذارد.[6]
فاکتور بیز این عدم تقارن را با در نظر گرفتن فرضیهها به عنوان مدلهای پیشبینیکننده و مقایسه سوابق آنها حل میکند. از نظر ریاضی، این فاکتور نسبت دو درستنمایی حاشیهای است: احتمال دادههای مشاهدهشده به شرط فرضیه ۱، تقسیم بر احتمال دادهها به شرط فرضیه ۰. این روش یک سوال ساده میپرسد: کدام نظریه در پیشبینی دادههایی که واقعاً جمعآوری کردهایم، عملکرد بهتری داشته است؟[3][5]
اگر فاکتور بیز (که با BF10 نشان داده میشود) ۵٫۰ باشد، احتمال دادهها تحت فرضیه جایگزین دقیقاً پنج برابر بیشتر از فرضیه صفر است. اگر این نسبت ۰٫۲ باشد، احتمال دادهها تحت فرضیه صفر پنج برابر بیشتر است. این تقارن به محققان اجازه میدهد تا به طور فعالانه عدم وجود یک اثر را اثبات کنند؛ الزامی حیاتی در زمینههایی مانند پزشکی و روانشناسی که در آنها دانستن اینکه یک درمان کار نمیکند به اندازه دانستن اثربخشی آن ارزشمند است.[4][5]
محاسبه یک درستنمایی حاشیهای نیازمند انتگرالگیری روی یک توزیع «پیشین» (prior) است—یک نمایش ریاضی از اندازههای اثر مورد انتظار تحت آن فرضیه. در مقالهای در سال ۲۰۱۲ در نشریه Journal of Problem Solving، جفری راودر (Jeffrey Rouder) و همکارانش نشان دادند که چگونه میتوان این فاکتورها را برای طرحهای استانداردی مانند آزمونهای تی (t-tests) محاسبه کرد و شکاف بین نظریه انتزاعی بیزی و رویه روزمره آزمایشگاهی را پر کرد.[7]
تیم راودر استفاده از توزیعهای پیشین «پیشفرض»، مانند توزیع پیشین جفریز-زلنر-سیو (JZS) را رواج داد که اندازه اثر مورد انتظار را روی یک توزیع کوشی (Cauchy) پخش میکند. این امر به محققان اجازه میدهد تا فاکتورهای بیز را بدون نیاز به تعیین ذهنی و دقیق اندازه اثری که انتظار دارند بیابند، محاسبه کنند و این معیار را برای انتشار گسترده علمی استانداردسازی کنند.[7]
تیم راودر استفاده از توزیعهای پیشین «پیشفرض»، مانند توزیع پیشین جفریز-زلنر-سیو (JZS) را رواج داد که اندازه اثر مورد انتظار را روی یک توزیع کوشی (Cauchy) پخش میکند.
با این حال، انتخاب توزیع پیشین یک آسیبپذیری به نام پارادوکس لیندلی (Lindley's paradox) ایجاد میکند. اگر محققی یک توزیع پیشین بیش از حد گسترده را مشخص کند—با این ادعا که فرضیه جایگزین میتواند تقریباً هر اندازه اثری از صفر تا بینهایت تولید کند—احتمال دادههای خاص مشاهدهشده در سراسر آن دامنه وسیع از احتمالات رقیق میشود.[2]
در نتیجه، درستنمایی حاشیهای فرضیه جایگزین کاهش مییابد و فاکتور بیز به طور متناقضی حمایت خود را به سمت فرضیه صفر معطوف میکند. فرضیه صفر که اندازه اثر دقیقاً صفر را پیشبینی میکند، تمام قدرت پیشبینی خود را روی یک نقطه متمرکز میسازد. نظریهای که همهچیز را پیشبینی کند، در واقع هیچچیز را پیشبینی نمیکند و نسبت درستنمایی حاشیهای از نظر ریاضی این ابهام را جریمه میکند.[2]
برای تفسیر نسبت بهدستآمده، دانشمندان به مقیاسهای دستهبندیشده تکیه میکنند. در سال ۱۹۳۹، هارولد جفریز (Harold Jeffreys) فیزیکدان، یک مقیاس بنیادی پیشنهاد کرد که در آن فاکتور بیز بین ۳٫۰ تا ۱۰٫۰ شواهد «قابلتوجه» و هر چیزی بالاتر از ۱۰٫۰ شواهد «قوی» محسوب میشود.[2][3]
در سال ۱۹۹۵، آماردانان رابرت کاس (Robert Kass) و آدریان رافتری (Adrian Raftery) یک بررسی بسیار ارجاعدادهشده منتشر کردند که این آستانهها را تعدیل میکرد. آنها استدلال کردند که فاکتور بیز ۱۰ برای شواهد قوی بیش از حد ملایم است و آستانه ۲۰ را پیشنهاد دادند تا پیچیدگی مجموعه دادههای مدرن را در نظر بگیرند و محافظت قویتری در برابر نتایج مثبت کاذب ارائه دهند.[2]
فراتر از آستانههای ایستا، فاکتور بیز یک رویکرد پویا برای جمعآوری دادهها را امکانپذیر میسازد که به عنوان تحلیل طراحی فاکتور بیز (BFDA) شناخته میشود. یک آموزش در سال ۲۰۱۹ در PMC توضیح میدهد که چگونه محققان میتوانند به طور پیوسته دادههای خود را همزمان با ورودشان نظارت کنند و آزمایش را در لحظهای که فاکتور بیز از یک آستانه از پیش تعریفشده شواهد عبور میکند متوقف کنند، مانند فاکتور بیز بیشتر از ۱۰ برای فرضیه جایگزین یا فاکتور بیز کمتر از ۰٫۱ برای فرضیه صفر.[1]
این نظارت پیوسته در آمار فراوانیگرای سنتی، جایی که بررسی زودهنگام دادهها نرخ مثبت کاذب را متورم میکند، اکیداً ممنوع است. از آنجا که فاکتورهای بیز به جای نرخ خطاهای بلندمدت، درستنمایی نسبی دادهها را میسنجند، شواهد به سادگی تا رسیدن به یک نسبت قاطع انباشته میشوند و در زمان و منابع صرفهجویی میکنند.[1][7]
پذیرش فاکتورهای بیز در واکنش به بحران تکرارپذیری در علوم اجتماعی شتاب گرفته است. با اجازه دادن به محققان برای تمایز قائل شدن بین «شواهد فقدان» (فاکتور بیزی که به شدت از فرضیه صفر حمایت میکند) و «فقدان شواهد» (فاکتور بیز نزدیک به ۱٫۰)، این معیار واژگانی برای عدم قطعیت فراهم میکند که مقادیر پی فاقد آن هستند.[4][6]
این گذار نیازمند یک تغییر بنیادین در نحوه فرمولبندی ادعاهای علمی است. یک نظریه دیگر نمیتواند صرفاً پیشبینی کند که دو گروه «متفاوت» خواهند بود. برای جان سالم به در بردن از نسبت درستنماییهای حاشیهای، یک نظریه باید دقیقاً مشخص کند که آنها چقدر متفاوت خواهند بود، و خطر جریمه شدن در صورت شرطبندی بیش از حد گسترده را بپذیرد.[8]
چرا مهم است
اتکا به مقادیر پی (p-values) با وادار کردن محققان به در نظر گرفتن «فقدان شواهد» به عنوان «شواهد فقدان»، به بحران تکرارپذیری در سراسر علوم دامن زده است. فاکتور بیز سازوکار ریاضی لازم را برای اثبات صریح بیاثر بودن یک مداخله فراهم میکند و از هدر رفتن میلیاردها دلار بودجه تحقیقاتی در مسیرهای اشتباه جلوگیری میکند.
منابع
[1]PMCبیزگرایان ذهنیA tutorial on Bayes Factor Design Analysis using an informed prior
مطالعه در PMC →
[2]University of Washington Department of Statisticsمدافعان فراوانیگراBayes Factors
مطالعه در University of Washington Department of Statistics →
[3]Statistics How ToBayes Factor: Simple Definition
مطالعه در Statistics How To →
[4]Nicotine and Tobacco ResearchBayesian Inference: An Introduction to Hypothesis Testing Using Bayes Factors
مطالعه در Nicotine and Tobacco Research →
[5]International Neuromodulation SocietyHow to Interpret a Bayes Factor
مطالعه در International Neuromodulation Society →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[7]Journal of Problem Solvingبیزگرایان عینیWhat Are the Odds? A Practical Guide to Computing and Reporting Bayes Factors
مطالعه در Journal of Problem Solving →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →گزارش حقوق بشر
عفو بینالملل سرکوب اعتراضات «زن، زندگی، آزادی» را جنایت علیه بشریت خواند؛ درخواست پیگرد ۸۷ مقام ایرانی
8 منبع
مصورسازی دادهها
تبدیل ریشه دوم: چرا شعاع در نمودارهای حبابی باید با جذر دادهها متناسب باشد؟
8 منبع
توابع زیان
بدهبستان ریاضیاتی میان میانگین و میانه در بهینهسازی تابع زیان
4 منبع
دادههای فقر
دادههای جدید MPI: ۸۰ درصد فقیرترین افراد جهان (۸۸۷ میلیون نفر) در معرض خطرات همزمان اقلیمی قرار دارند
3 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





