رفتن به محتوای اصلی
Koohestun
توضیح کوهستانتنظیمات چندگانگیبسته شواهد· 5 دقیقه مطالعه· در تحلیل داده

چگونه تنظیمات بونفرونی و نرخ کشف کاذب از مثبت‌های کاذب در مجموعه‌داده‌های عظیم جلوگیری می‌کنند

هنگامی که محققان هزاران فرضیه را به طور همزمان آزمایش می‌کنند، آستانه‌های آماری استاندارد به طور ریاضی صدها کشف کاِذب را تضمین می‌کنند. دو اصلاح متمایز تعیین می‌کنند که آیا این سیگنال‌های کاذب به عنوان دستاوردهای بزرگ منتشر شوند یا به درستی فیلتر گردند.

به قلم آزاده ابراهیمی

کنترل‌کنندگان سختگیر خطا 40%محققان اکتشافی 40%اصلاح‌طلبان روش‌شناسی 20%
کنترل‌کنندگان سختگیر خطا
اولویت دادن به نرخ خطای خانوادگی (FWER) برای تضمین صفر مثبت کاذب، با این استدلال که این امر برای تأیید داروها و ادعاهای قطعی الزامی است.
محققان اکتشافی
حمایت از نرخ کشف کاذب (FDR) برای به حداکثر رساندن قدرت آماری، با پذیرش درصد کمی از مثبت‌های کاذب برای کشف شبکه‌های بیولوژیکی گسترده.
اصلاح‌طلبان روش‌شناسی
استدلال می‌کنند که هر دو اصلاح فراوانی‌گرا داده‌های همبسته را بیش از حد جریمه می‌کنند و برای مدیریت چندگانگی، مدل‌سازی سلسله مراتبی بیزی را پیشنهاد می‌دهند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آمارشناسان بیزی
  • مهندسان یادگیری ماشین

چرا مهم است

هر درمان پزشکی، ارتباط ژنتیکی، و آزمون A/B الگوریتمی برای اثبات کارایی خود به معنی‌داری آماری متکی است. بدون اصلاحات چندگانگی، حجم صرف داده‌های مدرن، ادبیات علمی و تأییدیه‌های نظارتی را با ادعاهای کاذب پر خواهد کرد.

لحظه‌ای که یک محقق آستانه معنی‌داری را در مجموعه‌ای از آزمون‌های آماری تعیین می‌کند، نتیجه آزمایش به طور ریاضی قفل می‌شود. اگر یک کارآزمایی دارویی یا یک بررسی ژنومیک ۱۰۰ متغیر مستقل را در سطح معنی‌داری استاندارد ۵٪ بدون تنظیم ارزیابی کند، ریاضیات احتمال، پنج کشف کاذب را تضمین می‌کند. روش تنظیمی که دقیقاً در این مرحله انتخاب می‌شود، تعیین می‌کند که آیا یک سیگنال بیولوژیکی واقعی توسط ریاضیات سختگیرانه مدفون شود یا یک سیگنال کاذب به عنوان یک دستاورد بزرگ منتشر گردد.[6]

این پدیده به عنوان تورم خطای نوع اول یا مشکل مقایسه‌های چندگانه شناخته می‌شود. یک آزمون آماری واحد با آستانه پی-مقدار ۰.۰۵، خطر ۵٪ مثبت کاذب را به همراه دارد. اما همانطور که مجله بیماری‌های قفسه سینه در بررسی شواهد خود تشریح می‌کند، انجام تنها ۲۰ آزمون مستقل، احتمال تولید حداقل یک مثبت کاذب را به ۶۴.۱٪ می‌رساند.[2]

در عصر بیوانفورماتیک مدرن، که در آن یک ریزآرایه می‌تواند ۱۰٬۰۰۰ ژن را به طور همزمان آزمایش کند، آمار تنظیم‌نشده به طور کامل از کار می‌افتد. در این مقیاس، نرخ خطای ۵٪، ۵۰۰ ارتباط بیولوژیکی معنی‌دار آماری اما کاملاً کاذب تولید می‌کند و پی-مقدارهای خام را بی‌معنی می‌سازد.[6]

بدون تنظیم، احتمال مثبت کاذب با هر آزمون اضافی به صورت تصاعدی افزایش می‌یابد.

برای جلوگیری از این فروپاشی داده‌ها، آمارشناسان اصلاحات چندگانگی را اعمال می‌کنند که مشهورترین آن‌ها اصلاح بونفرونی است. این روش که به نام کارلو امیلیو بونفرونی، ریاضیدان ایتالیایی نامگذاری شده، به طرز وحشیانه‌ای ساده است: سطح آلفای هدف را بر تعداد کل آزمون‌های انجام شده تقسیم کنید.[3]

برای یک مطالعه ۱۰٬۰۰۰ ژنی که هدف آن سطح معنی‌داری ۰.۰۵ است، اصلاح بونفرونی برای اینکه هر ژنی معنی‌دار اعلام شود، به پی-مقدار ۰.۰۰۰۰۰۵ نیاز دارد. این رویکرد نرخ خطای خانوادگی (FWER) – احتمال انجام حتی یک کشف کاذب در کل آزمایش – را به شدت کنترل می‌کند.[3]

با این حال، این سختگیری به قیمت گزافی برای قدرت آماری تمام می‌شود. همانطور که MetricGate در تحلیل مقایسه‌ای خود شرح می‌دهد، بونفرونی آنقدر محافظه‌کار است که اغلب محققان را مجبور می‌کند اثرات بیولوژیکی واقعی را صرفاً به این دلیل که نمی‌توانند از آستانه میکروسکوپی پی-مقدار مورد نیاز مجموعه‌داده‌های عظیم عبور کنند، کنار بگذارند.[3]

اصلاح بونفرونی آستانه معنی‌داری را به شدت کاهش می‌دهد تا نرخ خطای خانوادگی ۵٪ حفظ شود.

این محدودیت، تغییر پارادایم را در سال ۱۹۹۵ اجباری کرد، زمانی که آمارشناسان یوآو بنجامینی و یوسف هاچبرگ مقاله‌ای برجسته را در مجله انجمن سلطنتی آمار، سری B، منتشر کردند. آن‌ها به جای تلاش برای جلوگیری از یک مثبت کاذب در کل آزمایش، کنترل نرخ کشف کاذب (FDR) را پیشنهاد کردند.[1]

این محدودیت، تغییر پارادایم را در سال ۱۹۹۵ اجباری کرد، زمانی که آمارشناسان یوآو بنجامینی و یوسف هاچبرگ مقاله‌ای برجسته را در مجله انجمن سلطنتی آمار، سری B، منتشر کردند.

بنجامینی و هاچبرگ نرخ کشف کاذب (FDR) را به عنوان «نسبت مورد انتظار فرضیه‌های صفر رد شده که در واقع درست هستند» تعریف کردند. اگر محققی نرخ کشف کاذب ۵٪ را بپذیرد، صراحتاً می‌پذیرد که ۵٪ از کشف‌های اعلام شده آن‌ها کاذب خواهند بود، به شرطی که ۹۵٪ باقیمانده سیگنال‌های واقعی باشند.[1]

رویه بنجامینی-هاچبرگ (BH) با رتبه‌بندی تمام پی-مقدارهای به دست آمده از کوچکترین تا بزرگترین کار می‌کند. سپس هر پی-مقدار رتبه‌بندی شده را با یک آستانه متحرک مقایسه می‌کند که با ضرب نرخ کشف کاذب (FDR) هدف در رتبه، تقسیم بر تعداد کل آزمون‌ها محاسبه می‌شود.[1]

روش نرخ کشف کاذب (FDR) از یک آستانه متحرک بر اساس رتبه پی-مقدار استفاده می‌کند و قدرت آماری را حفظ می‌نماید.

این مقیاس متحرک، قدرت آماری را نجات می‌دهد. Nature Methods اشاره می‌کند که کنترل نرخ کشف کاذب (FDR) اکنون استاندارد زیست‌شناسی با توان عملیاتی بالا، مانند توالی‌یابی RNA و fMRI است، جایی که کشف یک شبکه گسترده از سیگنال‌های واقعی بسیار ارزشمندتر از تضمین صفر مثبت کاذب است.[4]

انتخاب بین نرخ خطای خانوادگی (FWER) و نرخ کشف کاذب (FDR) صرفاً آکادمیک نیست؛ بلکه واقعیت نظارتی و بالینی را دیکته می‌کند. سازمان غذا و داروی ایالات متحده (FDA) در سال ۲۰۲۲ دستورالعمل‌های به‌روزرسانی شده‌ای را صادر کرد که صراحتاً به نحوه مدیریت این انتخاب توسط شرکت‌های دارویی در کارآزمایی‌های بالینی می‌پردازد.[5]

سازمان غذا و دارو (FDA) در دستورالعمل ۲۰۲۲ خود هشدار می‌دهد که «عدم توجه به چندگانگی می‌تواند منجر به نتیجه‌گیری‌های مثبت کاذب در مورد اثربخشی یک دارو شود.» برای کارآزمایی‌های محوری فاز III که نقاط پایانی اصلی یک دارو را ارزیابی می‌کنند، نهادهای نظارتی عموماً کنترل سختگیرانه نرخ خطای خانوادگی (FWER) را طلب می‌کنند که اغلب از بونفرونی یا رویه گام به گام هولم که کمی قدرتمندتر است، استفاده می‌شود.[5]

نهادهای نظارتی برای تأیید داروها نرخ خطای خانوادگی (FWER) سختگیرانه را طلب می‌کنند، در حالی که علوم اکتشافی به نرخ کشف کاذب (FDR) متکی هستند.

در مقابل، نقاط پایانی اکتشافی و بررسی‌های ژنومی عظیم تقریباً منحصراً به نرخ کشف کاذب (FDR) متکی هستند. بسته شواهد پیرامون این روش‌ها یک دوشاخگی واضح را نشان می‌دهد: بونفرونی از مردم در برابر داروهای بی‌اثر محافظت می‌کند، در حالی که نرخ کشف کاذب (FDR) به دانشمندان اجازه می‌دهد تا ژنوم را بدون کنار گذاشتن اکثریت یافته‌های خود نقشه‌برداری کنند.[4][5]

محدودیت هر دو روش در مفروضات آن‌ها در مورد استقلال داده‌ها نهفته است. بونفرونی فرض می‌کند که تمام آزمون‌ها کاملاً مستقل هستند، که به ندرت در شبکه‌های بیولوژیکی همبسته صادق است و منجر به جریمه بیش از حد شدید می‌شود، زمانی که متغیرها به طور طبیعی با هم حرکت می‌کنند.[2]

مرز بین یک مصنوع آماری و یک کشف برنده جایزه نوبل اغلب نه توسط داده‌های خامی که در آزمایشگاه جمع‌آوری شده‌اند، بلکه توسط معادله‌ای که محققان برای ترسیم خط از آن استفاده کرده‌اند، تعیین می‌شود. یک کارآزمایی بالینی تنها به اندازه تنظیم چندگانگی که خروجی نهایی آن را هدایت می‌کند، قابل اعتماد است.[6]

بررسی عمیق دیدگاه‌ها

نهادهای نظارتی کارآزمایی بالینی

آژانس‌هایی مانند سازمان غذا و دارو (FDA) برای حفاظت از سلامت عمومی، کنترل سختگیرانه نرخ خطای خانوادگی را الزامی می‌دانند.

برای نهادهای نظارتی که داروهای جدید را تأیید می‌کنند، یک مثبت کاذب می‌تواند منجر به ورود یک داروی بی‌اثر یا خطرناک به بازار شود. به دلیل این ریسک نامتقارن، نهادهای نظارتی کنترل سختگیرانه نرخ خطای خانوادگی (FWER) – معمولاً رویه‌های بونفرونی یا هولم – را برای کارآزمایی‌های محوری فاز III الزامی می‌کنند. آن‌ها استدلال می‌کنند که حفظ قدرت آماری در درجه دوم اهمیت قرار دارد و اطمینان از اثربخشی واقعی نقطه پایانی اصلی یک کارآزمایی دارویی اولویت است.

زیست‌شناسان با توان عملیاتی بالا

محققان ژنومیک برای نقشه‌برداری از شبکه‌های بیولوژیکی پیچیده بدون کنار گذاشتن داده‌های معتبر، به نرخ کشف کاذب متکی هستند.

در زمینه‌هایی مانند ترانسکریپتومیکس و تصویربرداری تشدید مغناطیسی عملکردی (fMRI)، محققان یک داروی واحد را آزمایش نمی‌کنند؛ آن‌ها ده‌ها هزار متغیر را برای یافتن شبکه‌ای از سیگنال‌ها اسکن می‌کنند. اعمال بونفرونی بر ۱۰٬۰۰۰ ژن، به پی-مقداری چنان میکروسکوپی نیاز دارد که تقریباً تمام سیگنال‌های بیولوژیکی واقعی کنار گذاشته می‌شوند. با پذیرش نرخ کشف کاذب ۵٪، این دانشمندان می‌توانند صدها هدف واقعی را برای تحقیقات آینده شناسایی کنند، در حالی که می‌پذیرند کسر کوچک و شناخته شده‌ای از آن‌ها سرنخ‌های کاذب خواهند بود.

منتقدان روش‌شناسی

آمارشناسان استدلال می‌کنند که هر دو روش فراوانی‌گرا در نظر گرفتن ساختارهای داده‌ای با همبستگی بالا شکست می‌خورند.

منتقدان اصلاحات چندگانگی استاندارد اشاره می‌کنند که هم بونفرونی و هم نرخ کشف کاذب (FDR) پایه فرض می‌کنند که آزمون‌های انجام شده مستقل هستند. در واقعیت، داده‌های بیولوژیکی به شدت همبسته هستند – ژن‌ها در مسیرها عمل می‌کنند و مناطق مغزی با هم فعال می‌شوند. اعمال اصلاحات استاندارد بر داده‌های همبسته منجر به جریمه بیش از حد می‌شود، که اصلاح‌طلبان روش‌شناسی را به سمت حمایت از مدل‌های سلسله مراتبی بیزی سوق می‌دهد که اطلاعات را در بین آزمون‌ها به اشتراک می‌گذارند به جای اینکه آن‌ها را به صورت مجزا در نظر بگیرند.

نکات کلیدی

  1. اجرای همزمان چندین آزمون آماری، خطر مثبت‌های کاذب را به صورت تصاعدی افزایش می‌دهد.
  2. اصلاح بونفرونی آستانه معنی‌داری را بر تعداد آزمون‌ها تقسیم می‌کند، خطاها را به شدت کنترل می‌کند اما قدرت آماری را به شدت کاهش می‌دهد.
  3. نرخ کشف کاذب (FDR) درصد مشخصی از مثبت‌های کاذب را مجاز می‌داند تا کشف سیگنال‌های واقعی به حداکثر برسد.
  4. کارآزمایی‌های بالینی عموماً به کنترل سختگیرانه به سبک بونفرونی نیاز دارند، در حالی که ژنومیک و داده‌های بزرگ به نرخ کشف کاذب (FDR) متکی هستند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

کنترل‌کنندگان سختگیر خطا 40%محققان اکتشافی 40%اصلاح‌طلبان روش‌شناسی 20%
  1. [1]Journal of the Royal Statistical Society Series Bمحققان اکتشافی

    Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing

    مطالعه در Journal of the Royal Statistical Society Series B
  2. [2]Journal of Thoracic Diseaseاصلاح‌طلبان روش‌شناسی

    A general introduction to adjustment for multiple comparisons

    مطالعه در Journal of Thoracic Disease
  3. [3]MetricGateکنترل‌کنندگان سختگیر خطا

    Bonferroni vs. Holm vs. FDR Compared

    مطالعه در MetricGate
  4. [4]Nature Methodsمحققان اکتشافی

    Points of Significance: Multiple comparisons

    مطالعه در Nature Methods
  5. [5]U.S. Food and Drug Administrationکنترل‌کنندگان سختگیر خطا

    Multiple Endpoints in Clinical Trials Guidance for Industry

    مطالعه در U.S. Food and Drug Administration
  6. [6]تیم سردبیری کوهستاناصلاح‌طلبان روش‌شناسی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.