توافق داوران در همتاداوری مقالات علمی تنها ۰٫۱۷ کاپا است؛ تصمیم نهایی به سلیقه دبیر مجله واگذار میشود
ارزیابیهای آماری نشان میدهد داوران مستقل بهندرت درباره کیفیت مقالات علمی همنظر میشوند. این میزان ناچیز از پایایی ارزیابی بدین معناست که پذیرش یا رد اثر عملاً بر اساس سلیقه شخصی دبیر پرونده تعیین میشود.
به قلم شیرین کریمی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- بررسیهای آماری نشان میدهد توافق داوران همتا درباره کیفیت یک مقاله دانشگاهی تفاوت چندانی با شانس ندارد و میانگین شاخص کاپای کوهن در آن به ۰٫۱۷ میرسد.
- به دلیل نبود اتفاقنظر میان داوران، رد یا قبولی نهایی پژوهش عملاً تابع تشخیص و سلیقه فردی دبیر پرونده است.
- آزمایشهای میدانی نشان میدهد با ارسال دوباره مقالات منتشرشده قبلی با اسامی غیرواقعی، داوران جدید در اغلب موارد خواستار رد همان مقالات میشوند.
سامانه نشر مقالات علمی بر پایهای مشخص استوار است: اگر دو متخصص مستقل یک دستنوشته را ارزیابی کنند، باید درباره اعتبار علمی آن به نتیجهای همسان برسند. برهم خوردن این توافق پایه نشان میدهد سازوکار ارزیابی علم کارکرد عینی و استاندارد خود را از دست داده است.
شواهد تجربی این اصل بنیادی را تأیید نمیکنند. ارزیابیهای آماری پیاپی نشان دادهاند همپوشانی نظر داوران در سنجش شایستگی علمی مقالات تفاوت چندانی با احتمال تصادفی ندارد؛ در نتیجه سامانه نشر برای خروج از بنبست ناچار به قضاوتهای فردی متکی میشود.[1][2]
هنگام بروز اختلاف نظر میان داوران، کل فرایند به تصمیم یک شخص متکی میشود. دبیر رسیدگیکننده پرونده باید اختلاف را برطرف کند؛ امری که فیلتر جمعی و معتبر علمی را عملاً به سلیقه و برداشت فردی برای ورود آثار به متون پژوهشی تبدیل میکند.[5]
این ناهماهنگی رویدادی نادر در نشریات کماهمیت نیست، بلکه قاعده آماری رایج در میان ناشران بزرگ، ژورنالهای معتبر پزشکی و کارگروههای تخصصی اعطای گرنتهای پژوهشی است؛ واقعیتی که سازوکار پژوهشگران برای دریافت بودجه و ارتقای شغلی را دگرگون میکند.[3][6]
سنجش میزان توافق داوران
پژوهشگران برای سنجش کمی همپوشانی داوران از شاخص آماری «کاپای کوهن» بهره میگیرند. این سنجه پایایی میانارزیابها را در بازه صفر (توافق کاملاً تصادفی) تا ۱٫۰ (اجماع کامل میان ارزیابان) اندازهگیری میکند.[1]
بررسی آماری نشریات علوم اعصاب بالینی در سال ۲۰۰۰ نشان داد میانگین شاخص کاپای کوهن برای نظر داوران تنها ۰٫۱۷ بوده است. در علم آمار، نمره کمتر از ۰٫۲۰ نشاندهنده «توافق جزئی و ضعیف» است؛ یعنی داورانی که دادههای یکسانی را خواندهاند، به خروجیهای کاملاً متضاد رسیدهاند.[1]
این عدم توافق در سایر رشتههای دانشگاهی نیز مشاهده میشود. تحقیقی بنیادین در نشریه ساینس سازوکار داوری همتا را بررسی کرد و دریافت توافق میان ارزیابان بیش از آنکه حاصل کیفیت واقعی پژوهش باشد، از عامل شانس تأثیر میپذیرد.[2]
این مسئله به ارزیابی درخواستهای بودجههای تحقیقاتی نیز سرایت کرده است. پژوهشی در سال ۲۰۱۸ در مجموعه مقالات فرهنگستان ملی علوم آمریکا (PNAS) نشان داد بررسی درخواستهای پژوهشی یکسان توسط گروههای داوری متفاوت در مؤسسه ملی بهداشت آمریکا (NIH)، تفاوت و عدم توافق شدیدی به همراه دارد.[6]
ریچارد اسمیت، سردبیر پیشین نشریه بیامجی، در سال ۲۰۰۶ در یادداشتی در ژورنال انجمن سلطنتی پزشکی این وضعیت را نقد کرد و نوشت: «داوری همتا فرایندی پراشکال و سرشار از معایب آشکار است که کارآمدی آن پشتوانه تجربی چندانی ندارد» و این سازوکار را به گردونه شانس تشبیه کرد.[5]
انتقال قدرت تصمیمگیری به دبیران
از آنجا که ارجاع مقاله به دو یا سه داور بهندرت به اجماع میرسد، اختیار تصمیمگیری نهایی عملاً به دبیر نشریه سپرده میشود. اوست که باید گزارشهای متناقض را سبکسنگین کند و تشخیص دهد کدام نقد اعتبار علمی بالاتری دارد.[3]
این ساختار موجب میشود سرنوشت دستنوشته وابسته به این باشد که کدام دبیر رسیدگی به پرونده را بپذیرد. دبیری که رویکرد مثبتی به روششناسی جدید دارد گزارش مثبت را برجسته میکند و دبیری با دیدگاه سنتی، نقد منفی را مبنای رد اثر قرار میدهد.[5]
مرورهای نظاممند بر فرایند داوری این گلوگاه ساختاری را آشکار کردهاند. یک مطالعه مرور نظاممند کاکرین در سال ۲۰۰۷ نشان داد شواهد تجربی کافی وجود ندارد که ثابت کند فرایند مرسوم داوری همتا کیفیت گزارشهای زیستپزشکی را بهبود میبخشد یا مانع ورود خطاهای روششناختی به ادبیات علمی میشود.[4]
در نتیجه، نویسندگان بهجای برآورده کردن معیاری نامتغیر و عینی از سختگیری علمی، ناچارند رضایت همان دبیر مشخص را به عنوان تصمیمگیرنده نهایی جلب کنند و نظرات داوران صرفاً توصیههایی مشورتی برای تصمیم نهایی او محسوب میشوند.[3][5]
همین الگو توضیح میدهد چرا مقالهای که در یک ژورنال تراز اول رد شده، چند هفته بعد در نشریهای رقیب با سطحی مشابه منتشر میشود. مبانی علمی اثر تغییری نکرده، بلکه مقاله صرفاً به دست دبیری دیگر رسیده که ملاکهای سلیقهای متفاوتی داشته است.[2]
ارسال دوباره مقالات پیشتر منتشرشده
روشنترین شواهد این ارزیابیهای سلیقهای از پژوهشهای میدانی آزمایشی به دست آمده است؛ مطالعاتی که در آنها مقالاتی که قبلاً در نشریات چاپ شده بودند با تغییر نام نویسندگان و وابستگی سازمانی دوباره به همان نشریات فرستاده شدند.[8]
در آزمایشی معروف در سال ۱۹۸۲ که در نشریه علوم رفتاری و مغزی منتشر شد، پژوهشگران ۱۲ مقاله منتشرشده در مجلات معتبر روانشناسی را انتخاب کردند و آنها را با نامهای ناشناس و وابستگیهای دانشگاهی کماعتبار بازنشر دادند. نتایج این آزمایش تزلزل جدی فیلترهای ارزیابی را عیان کرد.[8]
بیشتر این نشریات متوجه نشدند که مقاله را پیشتر در صفحات خود چاپ کردهاند. افزون بر این، داوران جدید در ۸۹ درصد موارد توصیه کردند مقالاتی که خود نشریه قبلاً آنها را معتبر دانسته بود، این بار به دلیل ایرادهای علمی رد شوند.[8]
این دگرگونی نظر نشان میدهد متغیرهای بیرونی مانند اعتبار دانشگاه نویسنده یا وضعیت ذهنی داور تا چه میزان ارزیابی را منحرف میکنند. با حذف اعتبار صوری دانشگاههای نامدار، ادراک داوران از استحکام روششناختی اثر فرومیپاشد.[8]
چنین آزمایشهایی آشکار میکنند که داوری همتا کیفیت ذاتی و پایدار یک دستنوشته را اندازه نمیگیرد، بلکه واکنش مقطعی یک خواننده مشخص در زمانی خاص است که بهشدت تحت تأثیر بستر پیرامونی قرار دارد.[5][8]
آزمون داوری همتا بهشیوه شفاف
در واکنش به این کاستیهای ساختاری، ناشران الگوهای متفاوتی را برای افزایش پاسخگویی آزمودهاند. یکی از راهکارهای مهم، داوری باز و شفاف است که در آن هویت داوران برای نویسندگان آشکار میشود و گاهی متن نقدها همراه مقاله انتشار مییابد.[7]
نشریه بیامجی در سال ۱۹۹۹ کارآزمایی تصادفیسازیشدهای انجام داد تا بررسی کند آیا مشخص شدن نام داوران، کیفیت نقدها را بهتر میکند یا خیر. هدف این بود که مشخص شود پاسخگویی عمومی، بررسیها را دقیقتر، بیطرفانهتر و همسوتر میسازد یا نه.[7]
خروجی کارآزمایی تغییر محسوسی نشان نداد. این پژوهش دریافت که داوری باز هیچ اثر آماری معناداری بر ارتقای کیفیت نقدها، لحن گزارشها یا تصمیمگیری نهایی درباره پذیرش یا رد دستنوشته ندارد.[7]
شفافیت نهتنها مسئله پایایی را حل نکرد، بلکه دشواریهای اجرایی ایجاد کرد؛ داوران در ارزیابی باز با نرخ بسیار بیشتری دعوت به داوری را رد کردند، زیرا نگران تلافی حرفهای و تبعات دانشگاهی از سوی نویسندگان بودند.[7]
این وضعیت جامعه علمی را با انتخابی سخت روبهرو کرده است. الگوی دوسوکور سنتی به لحاظ آماری ناپایدار است و اصلاحات مبتنی بر شفافیت نیز پراکندگی قضاوتهای فردی را کاهش نداده و اجماع علمی پایداری ایجاد نکرده است.[4][7]
انطباق با سازوکار شانس و تصادف
برای جامعه پژوهشی، درک ریاضیات حاکم بر داوری همتا مسیر انتشار اثر را دگرگون میکند. رد مقاله لزوماً به معنای نقص کار علمی نیست، بلکه در اغلب موارد نتیجه آماری تصادف در انتخاب ارزیابان است.[2][5]
به پژوهشگران توصیه میشود به این سازوکار به چشم سامانهای احتمالی بنگرند. با توجه به اینکه ضریب توافق میانگین داوران تفاوت چندانی با شانس ندارد، گرفتن دو داوری مثبت نیازمند ترکیبی از کیفیت کار پژوهشی و درصد بالایی از شانس مساعد است.[1][6]
این آگاهی به استقبال گسترده از پایگاههای پیشچاپ مانند آرکایو (arXiv) و بایورکایو (bioRxiv) انجامیده است که امروزه میلیونها دستنوشته را میزبانی میکنند. نویسندگان با اشتراکگذاری عمومی آثار پیش از فرایند رسمی داوری، بنبست سلیقهای دبیران را دور میزنند و ارزیابی را به کل جامعه علمی میسپارند.[5]
نسخههای پیشچاپ نیاز به بازخورد تخصصی را حذف نمیکنند، اما گردش دانش را از انحصار سلیقه فردی دبیر نشریه خارج میسازند. در این ساختار، اجماع جامعه علمی در بستر عمومی و در طول زمان شکل میگیرد، نه پشت درهای بسته.[3]
نسخههای پیشچاپ نیاز به بازخورد تخصصی را حذف نمیکنند، اما گردش دانش را از انحصار سلیقه فردی دبیر نشریه خارج میسازند.
این تحلیل چگونه انجام شد
- روش
- تجمیع و مقایسه شاخصهای پایایی میانارزیابها (شاخص کاپای کوهن و درصدهای توافق خام) در حوزههای علوم اعصاب بالینی، علوم پایه و سامانههای داوری گرنت به منظور محاسبه یک خط مبنای بینرشتهای از اجماع داوران مستقل.
- یافته
- در رشتههای گوناگون و الگوهای ارزیابی مختلف، میزان توافق داوران مستقل درباره شایستگی یک مقاله تفاوتی با تصادف محض ندارد؛ موضوعی که از منظر محاسباتی، تصمیم نهایی درباره پذیرش یا رد اثر را کاملاً به برداشت سلیقهای دبیر پرونده واگذار میکند.
- دادههایی که بر پایهٔ آنها کار کردیم
- ضریب توافق داوران در علوم اعصاب بالینی (کاپا): 0.17 — Brain
- میزان توافق داوران در اعطای گرنتهای مؤسسه ملی بهداشت آمریکا: Low/Chance-level — Proceedings of the National Academy of Sciences
- نرخ رد مقالات پیشتر چاپشده در آزمون مجدد: 89% — Behavioral and Brain Sciences
- محدودیتهای این تحلیل
- این ارزیابی متکی بر دادههای پیشین و نمونههای منتخبی از نشریات و گرنتهاست؛ ممکن است نرخ توافق در گرایشهای بسیار تخصصی یا تحت مدلهای نوین داوری باز مقادیر دیگری ثبت کند.
اصطلاحات کلیدی
- کاپای کوهن (Cohen's Kappa)
- شاخصی آماری برای سنجش پایایی میانارزیابها که اثر توافقهای حاصل از شانس تصادفی را حذف کرده و عددی بین ۰ تا ۱ ارائه میدهد.
- پایایی میانارزیابها (Inter-rater reliability)
- میزان همپوشانی و توافق نظر میان ارزیابان یا داوران مستقل هنگام بررسی یک موضوع یا مدرک مشخص.
- داوری دوسوکور (Double-blind review)
- شیوهای از داوری همتا که در آن هویت نویسندگان و داوران برای یکدیگر پوشیده میماند.
- پایگاه پیشچاپ (Preprint server)
- مخزن اینترنتی برای اشتراکگذاری دستنوشتههای علمی پیش از آنکه فرایند ارزیابی رسمی داوری همتا را طی کرده و در ژورنال منتشر شوند.
بررسی عمیق دیدگاهها
مدافعان ساختار کنونی
بر این باورند که با وجود توافق آماری اندک، داوری همتا پژوهشهای آشکارا بیکیفیت و غیرعلمی را مهار میکند.
این گروه معتقد است پایین بودن شاخص آماری، ویژگی مثبت ساختار است و نباید نقص شمرده شود. استدلال آنها این است که دبیران عمداً داورانی با تخصصهای مکمل (مانند یک متخصص آمار و یک متخصص موضوعی) را برمیگزینند که قرار است کاستیهای متفاوتی را شناسایی کنند؛ بنابراین کاپای ۰٫۱۷ نشاندهنده دقت همهجانبه است نه یک رفتار تصادفی، و دیدی کامل از ضعفهای مقاله به دبیر میدهد تا تصمیم نهایی را اتخاذ کند.
طرفداران دگرگونی بنیادین
سامانه کنونی را شبیه به گردونه شانس دانسته و خواستار تحول ساختاری مانند داوری باز یا ارزیابی پس از انتشار هستند.
منتقدان به آمارهایی استناد میکنند که ناتوانی سازوکار فعلی در تفکیک نظاممند علم معتبر از علم نامعتبر را اثبات میکند. پیشنهاد آنان تفکیک کامل فرایند انتشار از داوری و تکیه بر الگوی «اول چاپ، سپس گزینش» در پایگاههای پیشچاپ است؛ چراکه اجماع عمومی جامعه علمی در فضای باز را تنها شیوه منطقی و آماری برای ارزیابی میدانند که تصمیمگیری را از بنبست سلیقه یک دبیر آزاد میکند.
- ناشران سنتی
- فیلتر داوری موجود را سازوکاری ارزشمند میدانند و پایین بودن توافق را نشاندهنده دقت بالا و بررسی مقاله از زوایای گوناگون قلمداد میکنند.
- منتقدان آماری
- بر ناپایداری محاسباتی و عدم قابلیت اتکای این شیوه تأکید دارند و خواهان اصلاحات دادهمحور در سازوکار ارزیابی هستند.
- حامیان علم باز
- خواهان فراگیر شدن نسخههای پیشچاپ و داوری پس از انتشار هستند تا سلیقه فردی دبیران از مسیر انتشار علم حذف شود.
دیدگاههایی که این گزارش پوشش نداده
- پژوهشگران تازهکار که ارتقا و امنیت شغلیشان در گرو عبور از این بختآزمایی ارزیابی است.
- دبیران مجلات که باید بار کاری سنگین مدیریت و جمعبندی گزارشهای ضدونقیض داوران را به دوش بکشند.
منابع
[1]Brainمنتقدان آماریReproducibility of peer review in clinical neuroscience: Is agreement between reviewers any greater than would be expected by chance alone?
مطالعه در Brain →
[2]Scienceمنتقدان آماریChance and Consensus in Peer Review
مطالعه در Science →
[3]JAMAناشران سنتیEffects of Editorial Peer Review: A Systematic Review
مطالعه در JAMA →
[4]Cochrane Database of Systematic ReviewsEditorial peer review for improving the quality of reports of biomedical studies
مطالعه در Cochrane Database of Systematic Reviews →
[5]Journal of the Royal Society of MedicinePeer review: a flawed process at the heart of science and journals
مطالعه در Journal of the Royal Society of Medicine →
[6]Proceedings of the National Academy of Sciencesمنتقدان آماریLow agreement among reviewers evaluating the same NIH grant applications
مطالعه در Proceedings of the National Academy of Sciences →
[7]The BMJناشران سنتیEffect of open peer review on quality of reviews and on reviewers' recommendations: a randomised trial
مطالعه در The BMJ →
[8]Behavioral and Brain Sciencesحامیان علم بازPeer-review practices of psychological journals: The fate of published articles, submitted again
مطالعه در Behavioral and Brain Sciences →
[9]تیم سردبیری کوهستانحامیان علم بازتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در آموزش
مشاهده همه →کنکور ۱۴۰۶
تعیین تکلیف سوابق تحصیلی پایه یازدهم در کنکور ۱۴۰۶؛ تأثیر قطعی یا مثبت؟
4 منبع
آموزش دانشگاهها
ابلاغیه جدید وزارت علوم: آموزش دانشگاهها حضوری است؛ آموزش مجازی نیازمند مجوز کارگروه استانی
4 منبع
رتبهبندی دانشگاهها
برترین دانشگاههای ایران در ۳۳ رشته موضوعی رتبهبندی شانگهای ۲۰۲۶ معرفی شدند
3 منبع
کد استخدامی
تحصن ۳ روزه اساتید دانشگاه در سازمان برنامه و بودجه؛ کدهای استخدامی در انتظار یک امضا
2 منبع
نظرات
هر زاویه. هر روز.
اخبار آموزش با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





