چگونه اندازه اثر، آلفا و توان آماری برای تعیین حجم نمونه آزمایش در هم قفل میشوند
پیش از جمعآوری حتی یک داده، پژوهشگران با ایجاد تعادل میان کوچکترین اثر قابلتوجه و میزان تحملشان در برابر نتایج مثبت و منفی کاذب، حجم نمونه مطالعه خود را قطعی میکنند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- متدولوژیستهای بالینی
- استدلال میکنند که برای جلوگیری از قرار دادن غیراخلاقی بیماران در معرض مطالعات با توان آماری پایین، باید تحلیلهای توان آماری دقیق و از پیش ثبتشده انجام شود.
- دانشمندان داده فراوانیگرا
- برای استانداردسازی تستهای A/B و کنترل کیفیت صنعتی، به آستانههای ثابت آلفا و توان آماری متکی هستند.
- منتقدان بیزی
- اتکا به آستانههای ثابت را نقد کرده و از بهروزرسانی مداوم احتمالات همزمان با دریافت دادهها حمایت میکنند.
دیدگاههایی که این گزارش پوشش نداده
- تامینکنندگان مالی پژوهشها که محدودیتهای بودجه را دیکته میکنند
- سردبیران مجلات که آستانههای انتشار را اعمال میکنند
نکات کلیدی
- حجم نمونه با ایجاد تعادل میان اندازه اثر، آلفا (خطر مثبت کاذب) و توان آماری (نرخ مثبت واقعی) تعیین میشود.
- نصف کردن حداقل اندازه اثر قابلتشخیص، حجم نمونه مورد نیاز را چهار برابر میکند که به معنای هزینه تصاعدی برای دادههاست.
- عرف علمی معمولاً آلفا را روی ۰.۰۵ و توان را روی ۰.۸۰ تنظیم میکند، هرچند این آستانهها قراردادی هستند.
- اگر برآوردهای اولیه از واریانس اشتباه باشد، حجم نمونه محاسبهشده در تشخیص اثر واقعی ناکام خواهد ماند.
سرنوشت یک آزمایش در طول تحلیل توان آماری رقم میخورد؛ یک محاسبه ریاضی که پیش از ثبت حتی یک مشاهده انجام میشود. پژوهشگران با تعیین حداقل حجم نمونه مورد نیاز، محدودیتهای فیزیکی مطالعه خود را قطعی میکنند. اگر این عدد خیلی کم باشد، آزمایش حساسیت لازم برای تشخیص یک اثر واقعی را نخواهد داشت؛ و اگر خیلی زیاد باشد، منابع برای جمعآوری دادههای غیرضروری هدر میرود. این آستانه تصادفی نیست، بلکه محصول ریاضی و دقیق سه متغیر در هم تنیده است: اندازه اثر، آلفا و توان آماری.[1][4]
برای درک چگونگی تعامل این متغیرها، ابتدا باید «اندازه اثر» را مجزا کرد. این متغیر، بزرگی تفاوتی است که یک پژوهشگر انتظار دارد بین گروه کنترل و گروه آزمایش پیدا کند. در پزشکی بالینی، این مقدار ممکن است افت ۱۰ میلیمتری فشار خون باشد؛ در مهندسی نرمافزار، افزایش ۲ درصدی در نرخ تبدیل. هرچه اندازه اثری که یک تیم میخواهد تشخیص دهد کوچکتر باشد، دادههای بیشتری باید جمعآوری کنند تا بتوانند آن سیگنال را از نویزهای تصادفی متمایز سازند. همانطور که در مستندات آزمایشگاه فناوری اطلاعات (Information Technology Laboratory) آمده است، حجم نمونه مورد نیاز «به اندازه اثری بستگی دارد که پژوهشگر میخواهد قادر به تشخیص آن باشد»، و این موضوع پایه و اساس تمام محاسبات بعدی است.[1][2][5]
رابطه میان اندازه اثر و حجم نمونه به شدت غیرخطی است. نصف کردن حداقل اثر قابلتشخیص، حجم نمونه مورد نیاز را دو برابر نمیکند؛ بلکه آن را چهار برابر میکند. این جریمه تصاعدی، یک بدهبستان بیرحمانه را در طراحی آزمایش تحمیل میکند. یک کارآزمایی دارویی که به دنبال یک درمان عظیم و آشکار است، ممکن است تنها به ۵۰ بیمار نیاز داشته باشد، در حالی که یک شرکت فناوری که به دنبال یک بهینهسازی میکروسکوپی است، شاید به ۵۰۰,۰۰۰ کاربر نیاز داشته باشد تا ثابت کند تغییر واقعی است. از زمانی که جیکوب کوهن (Jacob Cohen) این قراردادهای توان آماری را در سال ۱۹۸۸ استانداردسازی کرد، این واقعیت ریاضی بر پژوهشهای دانشگاهی و تستهای A/B تجاری حاکم بوده است.[2][3][5]
متغیر دوم، یعنی آلفا، نشاندهنده میزان تحمل پژوهشگر در برابر مثبت کاذب است؛ یعنی ادعای وجود یک اثر در حالی که واقعاً وجود ندارد. طبق عرف علمی، آلفا تقریباً در همهجا روی ۰.۰۵ تنظیم میشود، به این معنی که تیم میپذیرد ۵ درصد احتمال دارد شانس و تصادف نتایج آنها را ایجاد کرده باشد. سختگیرانهتر کردن این آستانه به ۰.۰۱ برای دستیابی به قطعیت بیشتر، نیازمند حجم نمونه بسیار بزرگتری است تا همان سطح از اطمینان حاصل شود. هرچه خطر قابلقبول برای یک هشدار کاذب کمتر باشد، هزینه دادهها بیشتر خواهد بود.[1][4][5]
متغیر دوم، یعنی آلفا، نشاندهنده میزان تحمل پژوهشگر در برابر مثبت کاذب است؛ یعنی ادعای وجود یک اثر در حالی که واقعاً وجود ندارد.
متغیر نهایی توان آماری است که توانایی آزمایش را در جلوگیری از منفی کاذب میسنجد. توان آماری، احتمال این است که وقتی یک اثر واقعی وجود دارد، آزمون به درستی فرضیه صفر را رد کند. آستانه استاندارد توان آماری ۰.۸۰ است، به این معنی که پژوهشگر ۲۰ درصد خطر از دست دادن یک کشف واقعی را میپذیرد. افزایش توان به ۰.۹۰ یا ۰.۹۵، تعداد مشاهدات مورد نیاز را به شدت افزایش میدهد، زیرا آزمون باید بسیار حساس شود تا از نادیده گرفتن سیگنالهای ظریف جلوگیری کند.[1][3][4]
این سه پارامتر (اندازه اثر، آلفا و توان آماری) یک مثلث ریاضی گریزناپذیر را تشکیل میدهند. اگر یک تیم پژوهشی با بودجهای ثابت محدود شده باشد و تنها بتواند از ۲۰۰ شرکتکننده نمونهگیری کند، نمیتواند در حالی که به دنبال یک اثر کوچک است، به طور دلخواه توان ۹۵ درصدی و آلفای ۰.۰۱ را طلب کند. آنها باید در یکی از رئوس این مثلث کوتاه بیایند: یا خطر بالاتر مثبت کاذب را بپذیرند، یا خطر بیشتر از دست دادن اثر را به جان بخرند، و یا جستجوی خود را تنها به تفاوتهای عظیم و آشکار محدود کنند.[3][5]
این محاسبه همچنین بسته به ماهیت دادههایی که اندازهگیری میشوند، تغییر میکند. متغیرهای پیوسته، مانند قد یا درآمد، معمولاً به حجم نمونه کمتری نسبت به متغیرهای باینری (دودویی) مانند نرخ کلیک یا پیامدهای بقا نیاز دارند، زیرا دادههای پیوسته حاوی اطلاعات دقیقتری از واریانس هستند. پلتفرمهای نرمافزاری که تستهای A/B پیوسته را اجرا میکنند، اغلب به جای تکیه کامل بر برآوردهای پیش از تست، به محاسبهگرهای خودکار توان آماری متکی هستند تا تخصیص ترافیک را به صورت پویا و بر اساس واریانس مشاهدهشده در چند روز اول تست تنظیم کنند.[2]
با وجود دقت فرمولها، تحلیل توان آماری به شدت به برآوردها وابسته است. از آنجا که اندازه اثر واقعی و واریانس جامعه پیش از شروع آزمایش ناشناخته هستند، پژوهشگران باید این مقادیر را با استفاده از دادههای تاریخی، مطالعات پایلوت یا مرور پیشینه پژوهش حدس بزنند. اگر دادههای پایلوت واریانس واقعی را کمتر از حد برآورد کنند، حجم نمونه محاسبهشده بسیار کوچک خواهد بود و در نتیجه کل آزمایش فاقد توان آماری کافی شده و نتیجهگیریهای آن از نظر ریاضی بیاعتبار میگردد. یکپارچگی و صحت یافته نهایی، کاملاً به دقت مفروضات اولیه بستگی دارد.[1][4]
چرا مهم است
پیش از شروع جمعآوری دادهها، این محاسبه ریاضی تعیین میکند که آیا یک کارآزمایی بالینی یا تست نرمافزار واقعاً قادر به تشخیص یک کشف واقعی خواهد بود یا خیر؛ و از هدر رفتن میلیونها دلار در پژوهشهای فاقد توان آماری کافی جلوگیری میکند.
منابع
[1]PubMedمتدولوژیستهای بالینیClinician's Guide to Understanding Effect Size, Alpha Level, Power, and Sample Size
مطالعه در PubMed →
[2]Statsigدانشمندان داده فراوانیگراHow to do a power analysis to determine sample size
مطالعه در Statsig →
[3]Real Statistics Using Excelدانشمندان داده فراوانیگراStatistical Power and Sample Size
مطالعه در Real Statistics Using Excel →
[4]PMCمتدولوژیستهای بالینیA Step-by-Step Process on Sample Size Determination for Medical Research
مطالعه در PMC →
[5]Information Technology Laboratoryدانشمندان داده فراوانیگرا7.2.2.2. Sample sizes required
مطالعه در Information Technology Laboratory →
[6]تیم سردبیری کوهستانمنتقدان بیزیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.


