اوج مرور سیستماتیک و متاآنالیز: سلسلهمراتب شواهد چگونه کیفیت پژوهشها را رتبهبندی میکند
هرم شواهد، طرحهای پژوهشی را بر اساس میزان آسیبپذیریشان در برابر سوگیری دستهبندی میکند؛ مرورهای سیستماتیک در بالاترین سطح و نظرات کارشناسی در پایینترین سطح قرار میگیرند. با این حال، چارچوبهای مدرنی مانند GRADE تاکید دارند که نحوه اجرای مطالعه اغلب از نوع طراحی آن مهمتر است.
به قلم شیرین کریمی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- سلسلهمراتب شواهد، طرحهای پژوهشی را بر اساس تواناییشان در به حداقل رساندن سوگیری سیستماتیک رتبهبندی میکند.
- مرورهای سیستماتیک و متاآنالیزها با تجمیع دادههای چندین کارآزمایی مستقل، در رأس این هرم قرار دارند.
- کارآزماییهای تصادفیسازی و کنترلشده (RCT) با جداسازی متغیرها از طریق تخصیص تصادفی، قویترین شواهد اولیه را ارائه میدهند.
روششناسان سختگیر استدلال میکنند که تنها یک مرور سیستماتیک از کارآزماییهای تصادفیسازی و کنترلشده (RCT) میتواند به طور قطعی اثربخشی یک مداخله را ثابت کند و دادههای مشاهدهای را به دلیل مخدوش بودن رد میکنند. در مقابل، پزشکان بالینی خط مقدم میگویند که انتظار برای یک متاآنالیز بینقص، روند درمان را مختل میکند؛ آنها معتقدند که مطالعات کوهورت با طراحی خوب و دادههای دنیای واقعی، اغلب تنها پاسخهای اخلاقی یا عملی برای بیماران با شرایط پیچیده هستند.[4][5]
نکته کاربردی این است که سلسلهمراتب شواهد به عنوان یک راهنمای تجربی عمل میکند، نه یک قانون مطلق. برای ارزیابی میزان اعتبار یک ادعای پزشکی، مداخله آموزشی یا تغییر سیاست، پژوهشگران به این هرم تکیه میکنند تا طرحهای پژوهشی را بر اساس میزان آسیبپذیریشان در برابر سوگیری رتبهبندی کنند. تاکنون بیش از ۸۰ سلسلهمراتب مختلف شواهد در سطح جهانی برای استانداردسازی این فرآیند پیشنهاد شده است.[6][8]
در رأس این هرم، مرور سیستماتیک و متاآنالیز قرار دارد که در همه جا به عنوان شواهد سطح ۱ طبقهبندی میشود. یک مرور سیستماتیک تمام مقالات منتشر شده درباره یک سوال مشخص را جمعآوری میکند، در حالی که یک متاآنالیز نتایج آنها را به صورت ریاضی ترکیب میکند. اگر ۱۰ کارآزمایی مجزا هر کدام یک دارو را روی ۱۰۰ بیمار آزمایش کنند، یک متاآنالیز گروهی متشکل از ۱۰۰۰ بیمار را ارزیابی کرده، نویزهای آماری را هموار میکند و الگوهایی را شناسایی میکند که در نمونههای کوچکتر نامرئی هستند.[1][5]
درست در زیر این رأس، کارآزماییهای تصادفیسازی و کنترلشده (RCT) فردی قرار دارند که سطح ۲ را اشغال میکنند. پژوهشگران با تخصیص تصادفی شرکتکنندگان به گروه درمان یا کنترل، اثر مداخله را از متغیرهای مخدوشکننده جدا میکنند و اطمینان میدهند که هرگونه تفاوت در نتایج، واقعاً ناشی از درمان است نه ویژگیهای جمعیتشناختی زمینهای بیماران.[5]
مطالعات مشاهدهای در سطوح میانی قرار میگیرند و معمولاً به عنوان سطوح ۳ و ۴ طبقهبندی میشوند. این موارد شامل مطالعات کوهورت است که گروهها را در طول زمان ردیابی میکند، و مطالعات مورد-شاهدی که برای شناسایی عوامل خطر به گذشته نگاه میکنند. اگرچه این مطالعات نمیتوانند به طور قطعی رابطه علت و معلولی را ثابت کنند، اما زمانی که تخصیص تصادفی بیماران به مواجهههای مضر مانند سیگار کشیدن یا مواد شیمیایی سمی ناقض استانداردهای اخلاقی باشد، ضروری هستند.[1][5]
پایه هرم، یعنی سطح ۵، شامل گزارشهای موردی، نظرات کارشناسی و تجربیات شخصی است. در حالی که این موارد فرضیههای اولیه را ایجاد کرده و پدیدههای جدید را شناسایی میکنند، بالاترین خطر سوگیری را به همراه دارند و نمیتوانند به تنهایی برای تدوین دستورالعملهای بالینی یا سیاستهای عمومی استفاده شوند.[1][5]
این هرم ساختاری اکنون به سیستمهای ارزیابی دقیقتری تکامل یافته است. چارچوب نظام درجهبندی کیفیت شواهد و قدرت توصیهها (GRADE) که در سال ۲۰۰۰ معرفی شد، تمرکز را از طراحی مطالعه به اجرای مطالعه تغییر داد و پذیرفت که یک سلسلهمراتب خشک اغلب قابلیت اطمینان در دنیای واقعی را به درستی نشان نمیدهد.[2][3]
چارچوب GRADE اذعان میکند که یک RCT با اجرای ضعیف، دادههای بدتری نسبت به یک گروه مشاهدهای که با دقت پیگیری شده است، ارائه میدهد. این چارچوب، بدون توجه به جایگاه طراحی مطالعه در هرم سنتی، رتبه شواهد را به دلیل خطر سوگیری، تناقض، عدم دقت یا سوگیری انتشار کاهش میدهد.[2][7]
مراکز کنترل و پیشگیری از بیماریها (CDC) به شدت به GRADE متکی هستند. کمیته مشورتی رویههای ایمنسازی (ACIP) از این چارچوب برای ارزیابی دادههای اثربخشی واکسن پیش از صدور توصیههای ملی استفاده میکند تا اطمینان حاصل شود که الزامات بهداشت عمومی به جای یافتههای پراکنده، بر شواهدی با قطعیت بالا استوار هستند.[2]
تعریف خود این سلسلهمراتب بر کاهش خطا متمرکز است. همانطور که جیکوب استگنگا، فیلسوف علم، در سال ۲۰۱۴ اشاره کرد، سلسلهمراتب شواهد اساساً رتبهبندی روشها بر اساس پتانسیل آن روش برای ابتلا به سوگیری سیستماتیک است.
رأس این هرم بدون نقصهای لجستیکی نیست. تکمیل یک مرور سیستماتیک دقیق به طور متوسط بین ۶ تا ۱۸ ماه زمان میبرد. تا زمانی که دادهها منتشر شوند، عملکرد بالینی یا سویههای بیماریزای زمینهای ممکن است تغییر کرده باشند و نتیجهگیریها پیش از رسیدن به دست پزشکان خط مقدم، منسوخ شوند.
اصل ورودی بیارزش، خروجی بیارزش نیز متاآنالیزها را محدود میکند. اگر RCTهای زیربنایی از نقصهای روششناختی جدی رنج ببرند، ترکیب ریاضی آنها تنها تخمین دقیقتری از یک نتیجه سوگیرانه تولید میکند و حس کاذبی از قطعیت به وجود میآورد.[7]
برای رفع مشکل سرعت، موسسات پژوهشی به طور فزایندهای در حال اتخاذ مرورهای سیستماتیک پویا (living) هستند. این پروتکلها با انتشار دادههای کارآزماییهای جدید، متاآنالیز را به طور مداوم بهروزرسانی میکنند، زمانبندی را از چند سال به چند هفته کاهش میدهند و رأس شواهد را با عملکردهای فعلی مرتبط نگه میدارند.[8]
معیار واقعی کیفیت شواهد این است که آیا یک یافته در جمعیتهای مختلف قابل تکرار است یا خیر. تا زمانی که یک مداخله اثربخشی ثابتی را در چندین کارآزمایی مستقل نشان ندهد، جایگاه آن در سلسلهمراتب موقتی باقی میماند و در انتظار موج بعدی دادهها خواهد بود.[8]
اصطلاحات کلیدی
- مرور سیستماتیک
- یک روششناسی دقیق که تمام شواهد تجربی موجود را که با معیارهای واجد شرایط بودن از پیش تعیینشده مطابقت دارند، برای پاسخ به یک سوال پژوهشی خاص جمعآوری، ارزیابی و ترکیب میکند.
- متاآنالیز
- رویه آماری که برای ترکیب دادههای چندین مطالعه مستقل به منظور تولید یک تخمین واحد و دقیقتر از اثر یک مداخله استفاده میشود.
- کارآزمایی تصادفیسازی و کنترلشده (RCT)
- آزمایشی که در آن شرکتکنندگان به طور تصادفی برای دریافت مداخله مورد آزمایش یا شرایط کنترل تخصیص مییابند تا سوگیری انتخاب به حداقل برسد.
- چارچوب GRADE
- یک رویکرد سیستماتیک برای رتبهبندی قطعیت شواهد و قدرت توصیههای مراقبتهای بهداشتی، با تمرکز بر اجرای مطالعه و خطر سوگیری.
- مطالعه کوهورت
- یک طراحی مطالعه مشاهدهای که گروهی از افراد را در طول زمان دنبال میکند تا مشخص شود چگونه مواجهههای خاص بر پیامدهای سلامتی آینده آنها تأثیر میگذارد.
بررسی عمیق دیدگاهها
روششناسان سختگیر
استدلال میکنند که تنها مرورهای سیستماتیک از کارآزماییهای تصادفیسازی و کنترلشده، قطعیت کافی برای تغییر عملکرد بالینی را فراهم میکنند.
این گروه بر این باورند که دادههای مشاهدهای ذاتاً به دلیل متغیرهای مخدوشکنندهای که پژوهشگران نمیتوانند به طور کامل کنترل یا اندازهگیری کنند، دارای نقص هستند. آنها استدلال میکنند که تاریخ پزشکی پر از مداخلاتی است که در مطالعات کوهورت موثر به نظر میرسیدند، اما زمانی که تحت کارآزماییهای تصادفیسازی و کنترلشده دقیق قرار گرفتند، با شکست مواجه شدند یا آسیب رساندند. برای سختگیران، رأس هرم تنها استاندارد قابلقبول برای تدوین دستورالعملهای بالینی است و هرگونه اتکا به شواهد سطوح پایینتر، ایمنی بیمار را به خطر میاندازد.
پزشکان عملگرا
تاکید میکنند که انتظار برای متاآنالیزهای بینقص اغلب غیرعملی است و زمانی که RCTها غیراخلاقی یا در دسترس نیستند، دادههای مشاهدهای با کیفیت بالا باید راهنمای درمان باشند.
پزشکان خط مقدم استدلال میکنند که سلسلهمراتب سختگیرانه، تصمیمگیری را برای شرایط پیچیده یا نادری که در آنها RCTهای مقیاسبزرگ هرگز تامین مالی یا از نظر اخلاقی تایید نمیشوند، مختل میکند. آنها اشاره میکنند که ما برای دانستن اینکه چتر نجات از مرگ ناشی از سقوط جلوگیری میکند، نیازی به کارآزمایی تصادفی نداریم. عملگرایان مدافع رویکردی انعطافپذیرتر هستند که در آن مطالعات مشاهدهای با طراحی خوب و دادههای بالینی دنیای واقعی به عنوان شواهد قابلاجرا در نظر گرفته شوند، نه اینکه به عنوان شواهد نامعتبر رد شوند.
مدافعان شواهد پویا
تمرکز بر تسریع فرآیند سنتز از طریق بهروزرسانیهای مداوم و کمک هوش مصنوعی برای مرتبط نگه داشتن رأس شواهد.
این گروه نوظهور بر نقص کشنده مرورهای سیستماتیک سنتی تاکید میکنند: سرعت آنها. از آنجا که تکمیل یک متاآنالیز دقیق تا ۱۸ ماه طول میکشد، یافتههای آن اغلب در زمان انتشار منسوخ شدهاند. مدافعان بر مرورهای سیستماتیک «پویا» تاکید دارند که دادههای کارآزماییهای جدید را در زمان واقعی ادغام میکنند و با بهرهگیری از یادگیری ماشین برای بررسی متون و بهروزرسانی مداوم مدلهای آماری، اطمینان حاصل میکنند که بالاترین سطح شواهد بازتابدهنده وضعیت فعلی علم است.
- روششناسان سختگیر
- استدلال میکنند که تنها مرورهای سیستماتیک از کارآزماییهای تصادفیسازی و کنترلشده، قطعیت کافی برای تغییر عملکرد بالینی را فراهم میکنند.
- پزشکان عملگرا
- تاکید میکنند که انتظار برای متاآنالیزهای بینقص اغلب غیرعملی است و زمانی که RCTها غیراخلاقی یا در دسترس نیستند، دادههای مشاهدهای با کیفیت بالا باید راهنمای درمان باشند.
- ارزیابان چارچوب
- به جای طراحی مطالعات، بر اجرای آنها تمرکز میکنند و از سیستمهایی مانند GRADE برای کاهش رتبه RCTهای ضعیف و افزایش رتبه مطالعات کوهورت دقیق استفاده میکنند.
دیدگاههایی که این گزارش پوشش نداده
- گروههای حمایت از حقوق بیماران
- توسعهدهندگان سیستمهای سنتز هوش مصنوعی
منابع
[1]AAP Publicationsپزشکان عملگراHierarchy of Evidence Within the Medical Literature
مطالعه در AAP Publications →
[2]Centers for Disease Control and Preventionارزیابان چارچوبEvidence-Based Recommendations for ACIP
مطالعه در Centers for Disease Control and Prevention →
[3]PMCروششناسان سختگیرA pragmatic approach to selecting a grading system for clinical practice recommendations in palliative care
مطالعه در PMC →
[4]PMCروششناسان سختگیرEvidence-Based Medicine: History, Review, Criticisms, and Pitfalls
مطالعه در PMC →
[5]PMCروششناسان سختگیرThe Levels of Evidence and their role in Evidence-Based Medicine
مطالعه در PMC →
[6]Colorado.govپزشکان عملگراThe Hierarchy of Evidence
مطالعه در Colorado.gov →
[7]Consensusارزیابان چارچوبThe Hierarchy of Evidence
مطالعه در Consensus →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در آموزش
مشاهده همه →واکسن آبزیان
محققان ایرانی به دانشفنی تولید واکسنهای آبزیان دست یافتند؛ گامی به سوی خودکفایی
2 منبع
علوم شناختی
اثر پیشآزمون: چگونه مردود شدن در امتحان قبل از مطالعه، ماندگاری حافظه را دو برابر میکند
7 منبع
روشهای تحقیق
آستانه معناداری ۵ درصدی: منحنی پی-مقدار (P-Value) چگونه دستکاری دادهها را در مقالات علمی لو میدهد؟
5 منبع
نشر دانشگاهی
چگونه «گزارشهای ثبتشده» سوگیری ۹۶ درصدی نتایج مثبت در نشر دانشگاهی را معکوس میکنند
5 منبع
نظرات
هر زاویه. هر روز.
اخبار آموزش با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





