چگونه تنظیمات بونفرونی و نرخ کشف کاذب از مثبتهای کاذب در مجموعهدادههای عظیم جلوگیری میکنند
هنگامی که محققان هزاران فرضیه را به طور همزمان آزمایش میکنند، آستانههای آماری استاندارد به طور ریاضی صدها کشف کاِذب را تضمین میکنند. دو اصلاح متمایز تعیین میکنند که آیا این سیگنالهای کاذب به عنوان دستاوردهای بزرگ منتشر شوند یا به درستی فیلتر گردند.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- کنترلکنندگان سختگیر خطا
- اولویت دادن به نرخ خطای خانوادگی (FWER) برای تضمین صفر مثبت کاذب، با این استدلال که این امر برای تأیید داروها و ادعاهای قطعی الزامی است.
- محققان اکتشافی
- حمایت از نرخ کشف کاذب (FDR) برای به حداکثر رساندن قدرت آماری، با پذیرش درصد کمی از مثبتهای کاذب برای کشف شبکههای بیولوژیکی گسترده.
- اصلاحطلبان روششناسی
- استدلال میکنند که هر دو اصلاح فراوانیگرا دادههای همبسته را بیش از حد جریمه میکنند و برای مدیریت چندگانگی، مدلسازی سلسله مراتبی بیزی را پیشنهاد میدهند.
دیدگاههایی که این گزارش پوشش نداده
- آمارشناسان بیزی
- مهندسان یادگیری ماشین
چرا مهم است
هر درمان پزشکی، ارتباط ژنتیکی، و آزمون A/B الگوریتمی برای اثبات کارایی خود به معنیداری آماری متکی است. بدون اصلاحات چندگانگی، حجم صرف دادههای مدرن، ادبیات علمی و تأییدیههای نظارتی را با ادعاهای کاذب پر خواهد کرد.
لحظهای که یک محقق آستانه معنیداری را در مجموعهای از آزمونهای آماری تعیین میکند، نتیجه آزمایش به طور ریاضی قفل میشود. اگر یک کارآزمایی دارویی یا یک بررسی ژنومیک ۱۰۰ متغیر مستقل را در سطح معنیداری استاندارد ۵٪ بدون تنظیم ارزیابی کند، ریاضیات احتمال، پنج کشف کاذب را تضمین میکند. روش تنظیمی که دقیقاً در این مرحله انتخاب میشود، تعیین میکند که آیا یک سیگنال بیولوژیکی واقعی توسط ریاضیات سختگیرانه مدفون شود یا یک سیگنال کاذب به عنوان یک دستاورد بزرگ منتشر گردد.[6]
این پدیده به عنوان تورم خطای نوع اول یا مشکل مقایسههای چندگانه شناخته میشود. یک آزمون آماری واحد با آستانه پی-مقدار ۰.۰۵، خطر ۵٪ مثبت کاذب را به همراه دارد. اما همانطور که مجله بیماریهای قفسه سینه در بررسی شواهد خود تشریح میکند، انجام تنها ۲۰ آزمون مستقل، احتمال تولید حداقل یک مثبت کاذب را به ۶۴.۱٪ میرساند.[2]
در عصر بیوانفورماتیک مدرن، که در آن یک ریزآرایه میتواند ۱۰٬۰۰۰ ژن را به طور همزمان آزمایش کند، آمار تنظیمنشده به طور کامل از کار میافتد. در این مقیاس، نرخ خطای ۵٪، ۵۰۰ ارتباط بیولوژیکی معنیدار آماری اما کاملاً کاذب تولید میکند و پی-مقدارهای خام را بیمعنی میسازد.[6]
برای جلوگیری از این فروپاشی دادهها، آمارشناسان اصلاحات چندگانگی را اعمال میکنند که مشهورترین آنها اصلاح بونفرونی است. این روش که به نام کارلو امیلیو بونفرونی، ریاضیدان ایتالیایی نامگذاری شده، به طرز وحشیانهای ساده است: سطح آلفای هدف را بر تعداد کل آزمونهای انجام شده تقسیم کنید.[3]
برای یک مطالعه ۱۰٬۰۰۰ ژنی که هدف آن سطح معنیداری ۰.۰۵ است، اصلاح بونفرونی برای اینکه هر ژنی معنیدار اعلام شود، به پی-مقدار ۰.۰۰۰۰۰۵ نیاز دارد. این رویکرد نرخ خطای خانوادگی (FWER) – احتمال انجام حتی یک کشف کاذب در کل آزمایش – را به شدت کنترل میکند.[3]
با این حال، این سختگیری به قیمت گزافی برای قدرت آماری تمام میشود. همانطور که MetricGate در تحلیل مقایسهای خود شرح میدهد، بونفرونی آنقدر محافظهکار است که اغلب محققان را مجبور میکند اثرات بیولوژیکی واقعی را صرفاً به این دلیل که نمیتوانند از آستانه میکروسکوپی پی-مقدار مورد نیاز مجموعهدادههای عظیم عبور کنند، کنار بگذارند.[3]
این محدودیت، تغییر پارادایم را در سال ۱۹۹۵ اجباری کرد، زمانی که آمارشناسان یوآو بنجامینی و یوسف هاچبرگ مقالهای برجسته را در مجله انجمن سلطنتی آمار، سری B، منتشر کردند. آنها به جای تلاش برای جلوگیری از یک مثبت کاذب در کل آزمایش، کنترل نرخ کشف کاذب (FDR) را پیشنهاد کردند.[1]
این محدودیت، تغییر پارادایم را در سال ۱۹۹۵ اجباری کرد، زمانی که آمارشناسان یوآو بنجامینی و یوسف هاچبرگ مقالهای برجسته را در مجله انجمن سلطنتی آمار، سری B، منتشر کردند.
بنجامینی و هاچبرگ نرخ کشف کاذب (FDR) را به عنوان «نسبت مورد انتظار فرضیههای صفر رد شده که در واقع درست هستند» تعریف کردند. اگر محققی نرخ کشف کاذب ۵٪ را بپذیرد، صراحتاً میپذیرد که ۵٪ از کشفهای اعلام شده آنها کاذب خواهند بود، به شرطی که ۹۵٪ باقیمانده سیگنالهای واقعی باشند.[1]
رویه بنجامینی-هاچبرگ (BH) با رتبهبندی تمام پی-مقدارهای به دست آمده از کوچکترین تا بزرگترین کار میکند. سپس هر پی-مقدار رتبهبندی شده را با یک آستانه متحرک مقایسه میکند که با ضرب نرخ کشف کاذب (FDR) هدف در رتبه، تقسیم بر تعداد کل آزمونها محاسبه میشود.[1]
این مقیاس متحرک، قدرت آماری را نجات میدهد. Nature Methods اشاره میکند که کنترل نرخ کشف کاذب (FDR) اکنون استاندارد زیستشناسی با توان عملیاتی بالا، مانند توالییابی RNA و fMRI است، جایی که کشف یک شبکه گسترده از سیگنالهای واقعی بسیار ارزشمندتر از تضمین صفر مثبت کاذب است.[4]
انتخاب بین نرخ خطای خانوادگی (FWER) و نرخ کشف کاذب (FDR) صرفاً آکادمیک نیست؛ بلکه واقعیت نظارتی و بالینی را دیکته میکند. سازمان غذا و داروی ایالات متحده (FDA) در سال ۲۰۲۲ دستورالعملهای بهروزرسانی شدهای را صادر کرد که صراحتاً به نحوه مدیریت این انتخاب توسط شرکتهای دارویی در کارآزماییهای بالینی میپردازد.[5]
سازمان غذا و دارو (FDA) در دستورالعمل ۲۰۲۲ خود هشدار میدهد که «عدم توجه به چندگانگی میتواند منجر به نتیجهگیریهای مثبت کاذب در مورد اثربخشی یک دارو شود.» برای کارآزماییهای محوری فاز III که نقاط پایانی اصلی یک دارو را ارزیابی میکنند، نهادهای نظارتی عموماً کنترل سختگیرانه نرخ خطای خانوادگی (FWER) را طلب میکنند که اغلب از بونفرونی یا رویه گام به گام هولم که کمی قدرتمندتر است، استفاده میشود.[5]
در مقابل، نقاط پایانی اکتشافی و بررسیهای ژنومی عظیم تقریباً منحصراً به نرخ کشف کاذب (FDR) متکی هستند. بسته شواهد پیرامون این روشها یک دوشاخگی واضح را نشان میدهد: بونفرونی از مردم در برابر داروهای بیاثر محافظت میکند، در حالی که نرخ کشف کاذب (FDR) به دانشمندان اجازه میدهد تا ژنوم را بدون کنار گذاشتن اکثریت یافتههای خود نقشهبرداری کنند.[4][5]
محدودیت هر دو روش در مفروضات آنها در مورد استقلال دادهها نهفته است. بونفرونی فرض میکند که تمام آزمونها کاملاً مستقل هستند، که به ندرت در شبکههای بیولوژیکی همبسته صادق است و منجر به جریمه بیش از حد شدید میشود، زمانی که متغیرها به طور طبیعی با هم حرکت میکنند.[2]
مرز بین یک مصنوع آماری و یک کشف برنده جایزه نوبل اغلب نه توسط دادههای خامی که در آزمایشگاه جمعآوری شدهاند، بلکه توسط معادلهای که محققان برای ترسیم خط از آن استفاده کردهاند، تعیین میشود. یک کارآزمایی بالینی تنها به اندازه تنظیم چندگانگی که خروجی نهایی آن را هدایت میکند، قابل اعتماد است.[6]
بررسی عمیق دیدگاهها
نهادهای نظارتی کارآزمایی بالینی
آژانسهایی مانند سازمان غذا و دارو (FDA) برای حفاظت از سلامت عمومی، کنترل سختگیرانه نرخ خطای خانوادگی را الزامی میدانند.
برای نهادهای نظارتی که داروهای جدید را تأیید میکنند، یک مثبت کاذب میتواند منجر به ورود یک داروی بیاثر یا خطرناک به بازار شود. به دلیل این ریسک نامتقارن، نهادهای نظارتی کنترل سختگیرانه نرخ خطای خانوادگی (FWER) – معمولاً رویههای بونفرونی یا هولم – را برای کارآزماییهای محوری فاز III الزامی میکنند. آنها استدلال میکنند که حفظ قدرت آماری در درجه دوم اهمیت قرار دارد و اطمینان از اثربخشی واقعی نقطه پایانی اصلی یک کارآزمایی دارویی اولویت است.
زیستشناسان با توان عملیاتی بالا
محققان ژنومیک برای نقشهبرداری از شبکههای بیولوژیکی پیچیده بدون کنار گذاشتن دادههای معتبر، به نرخ کشف کاذب متکی هستند.
در زمینههایی مانند ترانسکریپتومیکس و تصویربرداری تشدید مغناطیسی عملکردی (fMRI)، محققان یک داروی واحد را آزمایش نمیکنند؛ آنها دهها هزار متغیر را برای یافتن شبکهای از سیگنالها اسکن میکنند. اعمال بونفرونی بر ۱۰٬۰۰۰ ژن، به پی-مقداری چنان میکروسکوپی نیاز دارد که تقریباً تمام سیگنالهای بیولوژیکی واقعی کنار گذاشته میشوند. با پذیرش نرخ کشف کاذب ۵٪، این دانشمندان میتوانند صدها هدف واقعی را برای تحقیقات آینده شناسایی کنند، در حالی که میپذیرند کسر کوچک و شناخته شدهای از آنها سرنخهای کاذب خواهند بود.
منتقدان روششناسی
آمارشناسان استدلال میکنند که هر دو روش فراوانیگرا در نظر گرفتن ساختارهای دادهای با همبستگی بالا شکست میخورند.
منتقدان اصلاحات چندگانگی استاندارد اشاره میکنند که هم بونفرونی و هم نرخ کشف کاذب (FDR) پایه فرض میکنند که آزمونهای انجام شده مستقل هستند. در واقعیت، دادههای بیولوژیکی به شدت همبسته هستند – ژنها در مسیرها عمل میکنند و مناطق مغزی با هم فعال میشوند. اعمال اصلاحات استاندارد بر دادههای همبسته منجر به جریمه بیش از حد میشود، که اصلاحطلبان روششناسی را به سمت حمایت از مدلهای سلسله مراتبی بیزی سوق میدهد که اطلاعات را در بین آزمونها به اشتراک میگذارند به جای اینکه آنها را به صورت مجزا در نظر بگیرند.
نکات کلیدی
- اجرای همزمان چندین آزمون آماری، خطر مثبتهای کاذب را به صورت تصاعدی افزایش میدهد.
- اصلاح بونفرونی آستانه معنیداری را بر تعداد آزمونها تقسیم میکند، خطاها را به شدت کنترل میکند اما قدرت آماری را به شدت کاهش میدهد.
- نرخ کشف کاذب (FDR) درصد مشخصی از مثبتهای کاذب را مجاز میداند تا کشف سیگنالهای واقعی به حداکثر برسد.
- کارآزماییهای بالینی عموماً به کنترل سختگیرانه به سبک بونفرونی نیاز دارند، در حالی که ژنومیک و دادههای بزرگ به نرخ کشف کاذب (FDR) متکی هستند.
منابع
[1]Journal of the Royal Statistical Society Series Bمحققان اکتشافیControlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing
مطالعه در Journal of the Royal Statistical Society Series B →
[2]Journal of Thoracic Diseaseاصلاحطلبان روششناسیA general introduction to adjustment for multiple comparisons
مطالعه در Journal of Thoracic Disease →
[3]MetricGateکنترلکنندگان سختگیر خطاBonferroni vs. Holm vs. FDR Compared
مطالعه در MetricGate →
[4]Nature Methodsمحققان اکتشافیPoints of Significance: Multiple comparisons
مطالعه در Nature Methods →
[5]U.S. Food and Drug Administrationکنترلکنندگان سختگیر خطاMultiple Endpoints in Clinical Trials Guidance for Industry
مطالعه در U.S. Food and Drug Administration →
[6]تیم سردبیری کوهستاناصلاحطلبان روششناسیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →تنگه هرمز
تحلیل دادههای ترافیک دریایی: چگونه نوسانات عبور کشتیها از تنگه هرمز اندازهگیری میشود
5 منبع
نوسانات ارزی
تحلیل دادههای نوسان نرخ ارز: عملکرد ۱۲ ماهه ریال در برابر دلار و یورو
4 منبع
معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





