چگونه حداقل اثر قابلتشخیص، توان آماری و آلفا، حجم نمونه مورد نیاز برای تست A/B را تعیین میکنند
حجم نمونه مورد نیاز برای یک تست A/B، یک خروجی دقیق ریاضی است که توسط سه محدودیت درهمتنیده دیکته میشود. تنظیم حداقل اثر قابلتشخیص، توان آماری یا آلفا، مستلزم یک بدهبستان مستقیم با میزان ترافیک مورد نیاز برای رسیدن به یک نتیجهگیری معتبر است.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- طرفداران قطعیت بالا
- آلفای سختگیرانه و توان بالا را در اولویت قرار میدهند تا از مثبتها و منفیهای کاذب پرهزینه جلوگیری کنند.
- طرفداران سرعت بالا
- MDE بزرگتر را ترجیح میدهند تا نیازمندیهای حجم نمونه را به حداقل رسانده و چرخههای تست را تسریع کنند.
- طرفداران حساسیت بالا
- از MDE پایین دفاع میکنند تا دستاوردهای حاشیهای مرکب را در محصولات بالغ ثبت کنند.
دیدگاههایی که این گزارش پوشش نداده
- آمارشناسان بیزی
- مدیران محصول
آنچه نمیدانیم
- اینکه منحنیهای جریمه حجم نمونه دقیقاً چگونه تغییر میکنند وقتی نرخهای تبدیل پایه به مرزهای افراطی مانند ۰.۱٪ یا ۹۹.۹٪ نزدیک میشوند.
- میزان دقیقی که تکنیکهای پیشرفته کاهش واریانس مانند CUPED میتوانند در عمل جریمه حجم نمونه ناشی از MDE پایین را جبران کنند.
مدیران محصول و بازاریابان اغلب ادعا میکنند که اجرای یک تست A/B صرفاً نیازمند صبر کردن است تا داشبورد یک نتیجه از نظر آماری معنادار را نشان دهد، و با حجم نمونه به عنوان یک مسئله ثانویه و انعطافپذیر برخورد میکنند. با این حال، واقعیت ریاضی طراحی آزمایش با این رویکرد در تضاد است. حجم نمونه مورد نیاز، یک خروجی قطعی ریاضی است که حتی پیش از آغاز تست تعیین میشود و توسط سه محدودیت درهمتنیده دیکته میگردد: حداقل اثر قابلتشخیص (MDE)، توان آماری، و سطح معناداری (آلفا).
اگر یک آزمایشگر تستی را بدون تنظیم قبلی این سه اهرم آغاز کند، خطر اجرای یک تست کمتوان را به جان میخرد که نتایج منفی کاذب یا برندههای توهمی تولید میکند؛ برندههایی که پس از استقرار کامل ناپدید میشوند. همانطور که مستندات آماری ویکیپدیا اشاره میکند، توان تابعی از نوع تست استفادهشده، حجم نمونه و اندازه اثر است [۵].[5]
اولین و حساسترین اهرم، حداقل اثر قابلتشخیص است. MDE نشاندهنده کوچکترین اندازه اثر واقعی است که یک مطالعه میتواند با احتمالی مشخص و با توجه به حجم نمونه در دسترس، تشخیص دهد [۱]. این مفهوم در واقع یک تصمیم تجاری است که به زبان ریاضیات ترجمه شده است: کوچکترین تغییر در نرخ تبدیل که هزینه مهندسی پیادهسازی نسخه برنده را توجیه کند، چقدر است؟[1]
بسیاری از تیمها اندازه اثری را که انتظار دارند مشاهده کنند، بیش از حد برآورد میکنند که این امر یکی از دلایل اصلی تستهای کمتوان است. از آنجا که MDE با معکوس ریشه دوم حجم نمونه مقیاس میشود، جریمه جستجو برای اثرهای کوچکتر بسیار سنگین است [۱]. بر اساس مستندات تست MetricGate، نصف کردن MDE نیازمند چهار برابر شدن حجم نمونه است [۱].[1]
اهرم دوم توان آماری است که به عنوان خط دفاعی آزمایش در برابر نتایج منفی کاذب یا خطاهای نوع دوم عمل میکند. توان، احتمال یافتن تفاوت بین عملکرد نسخه کنترل و نسخه جایگزین است، با این فرض که یک تفاوت واقعی واقعاً وجود داشته باشد [۳].[3]
اهرم دوم توان آماری است که به عنوان خط دفاعی آزمایش در برابر نتایج منفی کاذب یا خطاهای نوع دوم عمل میکند.
شرکت SplitMetrics در راهنمای تست سال ۲۰۲۳ خود خاطرنشان میکند که سطح توان ۰.۸۰ به عنوان بهترین رویه استاندارد در سراسر صنعت در نظر گرفته میشود [۳]. این بدان معناست که اگر تفاوت معناداری وجود داشته باشد، تست ۸۰٪ شانس شناسایی آن را دارد و یک ریسک ۲۰ درصدی باقی میماند که یک بهبود واقعی تشخیص داده نشود.[3]
برخی از تیمهای علم داده زمانی که از دست دادن یک اثر واقعی از نظر مالی پرهزینه باشد، برای توان ۹۰٪ پافشاری میکنند، اگرچه این امر نیازمند حجم نمونه بسیار بزرگتری است [۴]. انتخاب بین توان ۸۰٪ و ۹۰٪ مستقیماً بر مدت زمان آزمایش و تخصیص ترافیک مورد نیاز تأثیر میگذارد.[4]
اهرم سوم سطح معناداری است که معمولاً با نام آلفا شناخته میشود و نرخ مثبت کاذب یا خطاهای نوع اول را کنترل میکند. آلفا همان شواهد آماری مورد نیاز پیش از اعلام معنادار بودن یک نتیجه است که معمولاً روی ۵٪ تنظیم میشود [۲]. این بدان معناست که آزمایشگر یک ریسک ۵ درصدی را میپذیرد که اثری را تشخیص دهد که کاملاً ناشی از واریانس تصادفی است.[2]
سختگیرانهتر کردن آلفا از ۵٪ به ۱٪، مثبتهای کاذب را کاهش میدهد اما همزمان توان آماری را نیز پایین میآورد، مگر اینکه آزمایشگر با افزودن دادههای بسیار بیشتر آن را جبران کند [۴]. این سه اهرم یعنی MDE، توان و آلفا یک محدودیت ریاضی چهارگانه را با حجم نمونه تشکیل میدهند؛ ثابت کردن هر سه مورد، به طور خودکار مورد چهارم را تعیین میکند [۱].[1][4]
پلتفرم MetricGate یک مثال ملموس در سال ۲۰۲۶ از عملکرد این محدودیت ارائه میدهد: فرض کنید نرخ تبدیل پایه شما ۵٪ است، ۱۰,۰۰۰ کاربر در هر گروه دارید، آلفا مساوی ۰.۰۵ و توان مساوی ۰.۸۰ است. با استفاده از تقریب نرمال برای نسبتها، MDE حدود ۰.۶ واحد درصد خواهد بود [۱].[1]
در آن سناریو، تست میتواند با اطمینان تغییری از ۵.۰٪ به ۵.۶٪ را تشخیص دهد. اگر کوچکترین بهبودی که راهاندازی ویژگی جدید را توجیه میکند ۰.۳ واحد درصد باشد، آزمایشی که به این شکل طراحی شده است به سادگی نمیتواند آن را تشخیص دهد [۱]. ریاضیات این اجازه را نمیدهد، صرفنظر از اینکه داشبورد چه مدت در حال اجرا باشد.[1]
برای حل این بنبست ریاضی، تیمها باید یا کاربران بیشتری جمعآوری کنند، تست را طولانیتر اجرا کنند، به یک متریک هدف حساستر روی بیاورند، یا واریانس را از طریق تکنیکهای پیشرفته آماری مانند CUPED کاهش دهند [۱]. حجم نمونه همچنان به عنوان عوارض اجتنابناپذیری باقی میماند که برای پیمایش بدهبستانهای میان ریسک از دست دادن یک برنده و هزینه عملیاتی انتظار برای دادهها پرداخت میشود.[1]
نکات کلیدی
- حجم نمونه در تست A/B یک خروجی قطعی ریاضی است که توسط MDE، توان آماری و آلفا تعیین میشود.
- نصف کردن حداقل اثر قابلتشخیص، حجم نمونه مورد نیاز را چهار برابر میکند و آن را به پرهزینهترین متغیر تست تبدیل میسازد.
- استاندارد توان آماری در صنعت ۸۰٪ است که ریسک ۲۰ درصدی برای از دست دادن یک بهبود واقعی را باقی میگذارد.
- سختگیرانهتر کردن آلفا برای کاهش مثبتهای کاذب، از نظر ریاضی نیازمند حجم نمونه بزرگتر یا MDE بالاتر است.
چرا مهم است
درک محدودیتهای ریاضی تست A/B، تیمها را از اجرای آزمایشهای کمتوانی که منجر به نتایج منفی کاذب یا برندههای توهمی میشوند، بازمیدارد. با تسلط بر بدهبستانهای میان MDE، توان آماری و آلفا، تیمهای محصول میتوانند هدر دادن ترافیک روی اثرهای غیرقابلتشخیص را متوقف کرده و تصمیماتی بر پایه اصول ریاضی بگیرند.
بررسی عمیق دیدگاهها
استراتژی حساسیت بالا (MDE پایین)
اولویت دادن به تشخیص بهبودهای جزئی به قیمت نیاز به حجم نمونههای عظیم.
**موافق:** دستاوردهای ظریف و مرکب (مثلاً ۱٪ رشد نسبی) را که برای محصولات بالغ با ترافیک پایه بالا حیاتی هستند، ثبت میکند. **مخالف:** نصف کردن MDE حجم نمونه مورد نیاز را چهار برابر میکند و تستها را برای اکثر تیمها به شدت کند میسازد. **شواهد:** تستی که به دنبال ۰.۳ واحد درصد رشد مطلق روی پایه ۵٪ است، به ترافیک بسیار بیشتری نسبت به تستی که به دنبال ۰.۶ واحد رشد است نیاز دارد. **مناسب است وقتی:** محصول میلیونها کاربر فعال روزانه دارد و رشدهای نسبی کوچک به درآمد عظیمی تبدیل میشوند. **نامناسب است وقتی:** استارتاپ در مراحل اولیه است و به جای اندازهگیری دقیق، به بازخورد جهتدار سریع نیاز دارد.
استراتژی قطعیت بالا (توان بالا و آلفای پایین)
به حداقل رساندن مثبتهای کاذب و منفیهای کاذب از طریق سختگیرانهتر کردن آستانههای آماری.
**موافق:** با کاهش آلفا به ۱٪، از تجربه کاربری در برابر مثبتهای کاذب (خطاهای نوع اول) محافظت میکند و با افزایش توان به ۹۰٪، از فرصتهای از دست رفته (خطاهای نوع دوم) جلوگیری میکند. **مخالف:** هر دو تنظیم نیازمند دادههای بسیار بیشتری هستند که زمان رسیدن به بینش را به تأخیر میاندازد. **شواهد:** در حالی که توان ۸۰٪ و آلفای ۵٪ استاندارد هستند، تغییرات پرخطر مانند بازنگری در مدل قیمتگذاری، جریمه دادهای آستانههای سختگیرانهتر را توجیه میکنند. **مناسب است وقتی:** هزینه پیادهسازی یک برنده کاذب فاجعهبار است، یا بازگرداندن تغییر دشوار است. **نامناسب است وقتی:** تیم در حال تست تغییرات کمخطر رابط کاربری است که در آن سرعت عرضه به بازار از ریسک یک مثبت کاذب مهمتر است.
استراتژی سرعت بالا (MDE بالا و توان استاندارد)
پذیرش حداقل اثر قابلتشخیص بزرگتر برای رسیدن سریع به معناداری آماری.
**موافق:** به تیمها اجازه میدهد تا به سرعت تکرار کنند و به جای تغییرات جزئی رنگ دکمه، بازطراحیهای جسورانه را تست کنند. **مخالف:** تست نسبت به بهبودهای متوسط کور خواهد بود و به طور معمول در رسیدن به معناداری برای اثرهای واقعی زیر آستانه MDE شکست میخورد. **شواهد:** با تنظیم MDE بالاتر، حجم نمونه مورد نیاز به صورت نمایی کاهش مییابد و اجازه میدهد تست به جای چند هفته، در چند روز به پایان برسد. **مناسب است وقتی:** تیم در حال تست افزودن ویژگیهای عمده یا بازطراحیهایی است که در آنها تنها تغییرات رفتاری بزرگ اهمیت دارند. **نامناسب است وقتی:** محصول به شدت بهینهسازی شده است و تغییرات رفتاری بزرگ از نظر ریاضی بعید هستند.
منابع
[1]MetricGateطرفداران حساسیت بالاMinimum Detectable Effect Explained
مطالعه در MetricGate →
[2]Statsigطرفداران قطعیت بالاUnderstanding statistical power in A/B testing
مطالعه در Statsig →
[3]SplitMetricsطرفداران سرعت بالاCalculating Sample Size for A/B Testing: Formulas, Examples & Errors
مطالعه در SplitMetrics →
[4]DRIPطرفداران قطعیت بالاStatistical Power in A/B Testing: Why 80% Isn't Always Enough
مطالعه در DRIP →
[5]Wikipediaطرفداران سرعت بالاStatistical power
مطالعه در Wikipedia →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →روشهای تجمعی
پرونده شواهد: چگونه در مدلهای تجمعی، «بگینگ» واریانس را کاهش میدهد و «بوستینگ» سوگیری را
7 منبع
استنتاج علی
پرونده شواهد: دقت و محدودیتهای تطبیق نمره گرایش در تحقیقات مشاهدهای
6 منبع
حریم خصوصی تفاضلی
بسته شواهد: بدهبستانهای دقت و کارایی در حریم خصوصی تفاضلی
5 منبع
استنتاج علی
چگونه الگوریتمهای کنترل ساختگی با ایجاد سناریوهای جایگزین، نتایج سیاستگذاریها را میسنجند
5 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





