رفتن به محتوای اصلی
کوهستان
پژوهش کوهستانپایایی داوری همتانشر دانشگاهی· 6 دقیقه مطالعه· در آموزش

توافق داوران در همتاداوری مقالات علمی تنها ۰٫۱۷ کاپا است؛ تصمیم نهایی به سلیقه دبیر مجله واگذار می‌شود

ارزیابی‌های آماری نشان می‌دهد داوران مستقل به‌ندرت درباره کیفیت مقالات علمی هم‌نظر می‌شوند. این میزان ناچیز از پایایی ارزیابی بدین معناست که پذیرش یا رد اثر عملاً بر اساس سلیقه شخصی دبیر پرونده تعیین می‌شود.

به قلم شیرین کریمی

به‌طور خلاصه

  • بررسی‌های آماری نشان می‌دهد توافق داوران همتا درباره کیفیت یک مقاله دانشگاهی تفاوت چندانی با شانس ندارد و میانگین شاخص کاپای کوهن در آن به ۰٫۱۷ می‌رسد.
  • به دلیل نبود اتفاق‌نظر میان داوران، رد یا قبولی نهایی پژوهش عملاً تابع تشخیص و سلیقه فردی دبیر پرونده است.
  • آزمایش‌های میدانی نشان می‌دهد با ارسال دوباره مقالات منتشرشده قبلی با اسامی غیرواقعی، داوران جدید در اغلب موارد خواستار رد همان مقالات می‌شوند.

سامانه نشر مقالات علمی بر پایه‌ای مشخص استوار است: اگر دو متخصص مستقل یک دست‌نوشته را ارزیابی کنند، باید درباره اعتبار علمی آن به نتیجه‌ای همسان برسند. برهم خوردن این توافق پایه نشان می‌دهد سازوکار ارزیابی علم کارکرد عینی و استاندارد خود را از دست داده است.

شواهد تجربی این اصل بنیادی را تأیید نمی‌کنند. ارزیابی‌های آماری پیاپی نشان داده‌اند هم‌پوشانی نظر داوران در سنجش شایستگی علمی مقالات تفاوت چندانی با احتمال تصادفی ندارد؛ در نتیجه سامانه نشر برای خروج از بن‌بست ناچار به قضاوت‌های فردی متکی می‌شود.[1][2]

هنگام بروز اختلاف نظر میان داوران، کل فرایند به تصمیم یک شخص متکی می‌شود. دبیر رسیدگی‌کننده پرونده باید اختلاف را برطرف کند؛ امری که فیلتر جمعی و معتبر علمی را عملاً به سلیقه و برداشت فردی برای ورود آثار به متون پژوهشی تبدیل می‌کند.[5]

این ناهماهنگی رویدادی نادر در نشریات کم‌اهمیت نیست، بلکه قاعده آماری رایج در میان ناشران بزرگ، ژورنال‌های معتبر پزشکی و کارگروه‌های تخصصی اعطای گرنت‌های پژوهشی است؛ واقعیتی که سازوکار پژوهشگران برای دریافت بودجه و ارتقای شغلی را دگرگون می‌کند.[3][6]

شاخص کاپای کوهن با رقم ۰٫۱۷ نشان‌دهنده توافق بسیار جزئی و ضعیف میان داوران مستقل است.

سنجش میزان توافق داوران

پژوهشگران برای سنجش کمی هم‌پوشانی داوران از شاخص آماری «کاپای کوهن» بهره می‌گیرند. این سنجه پایایی میان‌ارزیاب‌ها را در بازه صفر (توافق کاملاً تصادفی) تا ۱٫۰ (اجماع کامل میان ارزیابان) اندازه‌گیری می‌کند.[1]

بررسی آماری نشریات علوم اعصاب بالینی در سال ۲۰۰۰ نشان داد میانگین شاخص کاپای کوهن برای نظر داوران تنها ۰٫۱۷ بوده است. در علم آمار، نمره کمتر از ۰٫۲۰ نشان‌دهنده «توافق جزئی و ضعیف» است؛ یعنی داورانی که داده‌های یکسانی را خوانده‌اند، به خروجی‌های کاملاً متضاد رسیده‌اند.[1]

این عدم توافق در سایر رشته‌های دانشگاهی نیز مشاهده می‌شود. تحقیقی بنیادین در نشریه ساینس سازوکار داوری همتا را بررسی کرد و دریافت توافق میان ارزیابان بیش از آنکه حاصل کیفیت واقعی پژوهش باشد، از عامل شانس تأثیر می‌پذیرد.[2]

این مسئله به ارزیابی درخواست‌های بودجه‌های تحقیقاتی نیز سرایت کرده است. پژوهشی در سال ۲۰۱۸ در مجموعه مقالات فرهنگستان ملی علوم آمریکا (PNAS) نشان داد بررسی درخواست‌های پژوهشی یکسان توسط گروه‌های داوری متفاوت در مؤسسه ملی بهداشت آمریکا (NIH)، تفاوت و عدم توافق شدیدی به همراه دارد.[6]

ریچارد اسمیت، سردبیر پیشین نشریه بی‌ام‌جی، در سال ۲۰۰۶ در یادداشتی در ژورنال انجمن سلطنتی پزشکی این وضعیت را نقد کرد و نوشت: «داوری همتا فرایندی پراشکال و سرشار از معایب آشکار است که کارآمدی آن پشتوانه تجربی چندانی ندارد» و این سازوکار را به گردونه شانس تشبیه کرد.[5]

پایایی پایین ارزیابان هم در داوری مقالات مجلات و هم در ارزیابی درخواست‌های بودجه پژوهشی به چشم می‌خورد.

انتقال قدرت تصمیم‌گیری به دبیران

از آنجا که ارجاع مقاله به دو یا سه داور به‌ندرت به اجماع می‌رسد، اختیار تصمیم‌گیری نهایی عملاً به دبیر نشریه سپرده می‌شود. اوست که باید گزارش‌های متناقض را سبک‌سنگین کند و تشخیص دهد کدام نقد اعتبار علمی بالاتری دارد.[3]

این ساختار موجب می‌شود سرنوشت دست‌نوشته وابسته به این باشد که کدام دبیر رسیدگی به پرونده را بپذیرد. دبیری که رویکرد مثبتی به روش‌شناسی جدید دارد گزارش مثبت را برجسته می‌کند و دبیری با دیدگاه سنتی، نقد منفی را مبنای رد اثر قرار می‌دهد.[5]

مرورهای نظام‌مند بر فرایند داوری این گلوگاه ساختاری را آشکار کرده‌اند. یک مطالعه مرور نظام‌مند کاکرین در سال ۲۰۰۷ نشان داد شواهد تجربی کافی وجود ندارد که ثابت کند فرایند مرسوم داوری همتا کیفیت گزارش‌های زیست‌پزشکی را بهبود می‌بخشد یا مانع ورود خطاهای روش‌شناختی به ادبیات علمی می‌شود.[4]

در نتیجه، نویسندگان به‌جای برآورده کردن معیاری نامتغیر و عینی از سخت‌گیری علمی، ناچارند رضایت همان دبیر مشخص را به عنوان تصمیم‌گیرنده نهایی جلب کنند و نظرات داوران صرفاً توصیه‌هایی مشورتی برای تصمیم نهایی او محسوب می‌شوند.[3][5]

همین الگو توضیح می‌دهد چرا مقاله‌ای که در یک ژورنال تراز اول رد شده، چند هفته بعد در نشریه‌ای رقیب با سطحی مشابه منتشر می‌شود. مبانی علمی اثر تغییری نکرده، بلکه مقاله صرفاً به دست دبیری دیگر رسیده که ملاک‌های سلیقه‌ای متفاوتی داشته است.[2]

با بروز اختلاف میان داوران، نتیجه نهایی پذیرش کاملاً به تصمیم فردی دبیر پرونده محول می‌شود.

ارسال دوباره مقالات پیش‌تر منتشرشده

روشن‌ترین شواهد این ارزیابی‌های سلیقه‌ای از پژوهش‌های میدانی آزمایشی به دست آمده است؛ مطالعاتی که در آن‌ها مقالاتی که قبلاً در نشریات چاپ شده بودند با تغییر نام نویسندگان و وابستگی سازمانی دوباره به همان نشریات فرستاده شدند.[8]

در آزمایشی معروف در سال ۱۹۸۲ که در نشریه علوم رفتاری و مغزی منتشر شد، پژوهشگران ۱۲ مقاله منتشرشده در مجلات معتبر روان‌شناسی را انتخاب کردند و آنها را با نام‌های ناشناس و وابستگی‌های دانشگاهی کم‌اعتبار بازنشر دادند. نتایج این آزمایش تزلزل جدی فیلترهای ارزیابی را عیان کرد.[8]

بیشتر این نشریات متوجه نشدند که مقاله را پیش‌تر در صفحات خود چاپ کرده‌اند. افزون بر این، داوران جدید در ۸۹ درصد موارد توصیه کردند مقالاتی که خود نشریه قبلاً آنها را معتبر دانسته بود، این بار به دلیل ایرادهای علمی رد شوند.[8]

این دگرگونی نظر نشان می‌دهد متغیرهای بیرونی مانند اعتبار دانشگاه نویسنده یا وضعیت ذهنی داور تا چه میزان ارزیابی را منحرف می‌کنند. با حذف اعتبار صوری دانشگاه‌های نامدار، ادراک داوران از استحکام روش‌شناختی اثر فرومی‌پاشد.[8]

چنین آزمایش‌هایی آشکار می‌کنند که داوری همتا کیفیت ذاتی و پایدار یک دست‌نوشته را اندازه نمی‌گیرد، بلکه واکنش مقطعی یک خواننده مشخص در زمانی خاص است که به‌شدت تحت تأثیر بستر پیرامونی قرار دارد.[5][8]

در پژوهش‌های آزمایشی، داوران مقالاتی را که پیش‌تر توسط همان ژورنال چاپ شده بود به‌طور گسترده رد کردند.

آزمون داوری همتا به‌شیوه شفاف

در واکنش به این کاستی‌های ساختاری، ناشران الگوهای متفاوتی را برای افزایش پاسخگویی آزموده‌اند. یکی از راهکارهای مهم، داوری باز و شفاف است که در آن هویت داوران برای نویسندگان آشکار می‌شود و گاهی متن نقدها همراه مقاله انتشار می‌یابد.[7]

نشریه بی‌ام‌جی در سال ۱۹۹۹ کارآزمایی تصادفی‌سازی‌شده‌ای انجام داد تا بررسی کند آیا مشخص شدن نام داوران، کیفیت نقدها را بهتر می‌کند یا خیر. هدف این بود که مشخص شود پاسخگویی عمومی، بررسی‌ها را دقیق‌تر، بی‌طرفانه‌تر و همسوتر می‌سازد یا نه.[7]

خروجی کارآزمایی تغییر محسوسی نشان نداد. این پژوهش دریافت که داوری باز هیچ اثر آماری معناداری بر ارتقای کیفیت نقدها، لحن گزارش‌ها یا تصمیم‌گیری نهایی درباره پذیرش یا رد دست‌نوشته ندارد.[7]

شفافیت نه‌تنها مسئله پایایی را حل نکرد، بلکه دشواری‌های اجرایی ایجاد کرد؛ داوران در ارزیابی باز با نرخ بسیار بیشتری دعوت به داوری را رد کردند، زیرا نگران تلافی حرفه‌ای و تبعات دانشگاهی از سوی نویسندگان بودند.[7]

این وضعیت جامعه علمی را با انتخابی سخت روبه‌رو کرده است. الگوی دوسوکور سنتی به لحاظ آماری ناپایدار است و اصلاحات مبتنی بر شفافیت نیز پراکندگی قضاوت‌های فردی را کاهش نداده و اجماع علمی پایداری ایجاد نکرده است.[4][7]

طرح مفهومی: پژوهشگران به‌طور فزاینده‌ای به پایگاه‌های پیش‌چاپ روی می‌آورند تا بن‌بست سلیقه‌ای دبیران نشریات را دور بزنند.

انطباق با سازوکار شانس و تصادف

برای جامعه پژوهشی، درک ریاضیات حاکم بر داوری همتا مسیر انتشار اثر را دگرگون می‌کند. رد مقاله لزوماً به معنای نقص کار علمی نیست، بلکه در اغلب موارد نتیجه آماری تصادف در انتخاب ارزیابان است.[2][5]

به پژوهشگران توصیه می‌شود به این سازوکار به چشم سامانه‌ای احتمالی بنگرند. با توجه به اینکه ضریب توافق میانگین داوران تفاوت چندانی با شانس ندارد، گرفتن دو داوری مثبت نیازمند ترکیبی از کیفیت کار پژوهشی و درصد بالایی از شانس مساعد است.[1][6]

این آگاهی به استقبال گسترده از پایگاه‌های پیش‌چاپ مانند آرکایو (arXiv) و بایورکایو (bioRxiv) انجامیده است که امروزه میلیون‌ها دست‌نوشته را میزبانی می‌کنند. نویسندگان با اشتراک‌گذاری عمومی آثار پیش از فرایند رسمی داوری، بن‌بست سلیقه‌ای دبیران را دور می‌زنند و ارزیابی را به کل جامعه علمی می‌سپارند.[5]

نسخه‌های پیش‌چاپ نیاز به بازخورد تخصصی را حذف نمی‌کنند، اما گردش دانش را از انحصار سلیقه فردی دبیر نشریه خارج می‌سازند. در این ساختار، اجماع جامعه علمی در بستر عمومی و در طول زمان شکل می‌گیرد، نه پشت درهای بسته.[3]

نسخه‌های پیش‌چاپ نیاز به بازخورد تخصصی را حذف نمی‌کنند، اما گردش دانش را از انحصار سلیقه فردی دبیر نشریه خارج می‌سازند.

سامانه سنتی داوری همتا همچنان مبنای رسمی پذیرش و ارتقای علمی است. با این حال، شواهد نشان می‌دهد این فرایند نه ابزاری عینی برای سنجش حقیقت، بلکه سازوکاری برای غربالگری متون است که اساساً بر صلاحدید و سلیقه فردی مدیران نشریات کار می‌کند.[4][5]

این تحلیل چگونه انجام شد

روش
تجمیع و مقایسه شاخص‌های پایایی میان‌ارزیاب‌ها (شاخص کاپای کوهن و درصدهای توافق خام) در حوزه‌های علوم اعصاب بالینی، علوم پایه و سامانه‌های داوری گرنت به منظور محاسبه یک خط مبنای بین‌رشته‌ای از اجماع داوران مستقل.
یافته
در رشته‌های گوناگون و الگوهای ارزیابی مختلف، میزان توافق داوران مستقل درباره شایستگی یک مقاله تفاوتی با تصادف محض ندارد؛ موضوعی که از منظر محاسباتی، تصمیم نهایی درباره پذیرش یا رد اثر را کاملاً به برداشت سلیقه‌ای دبیر پرونده واگذار می‌کند.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
محدودیت‌های این تحلیل
این ارزیابی متکی بر داده‌های پیشین و نمونه‌های منتخبی از نشریات و گرنت‌هاست؛ ممکن است نرخ توافق در گرایش‌های بسیار تخصصی یا تحت مدل‌های نوین داوری باز مقادیر دیگری ثبت کند.

اصطلاحات کلیدی

کاپای کوهن (Cohen's Kappa)
شاخصی آماری برای سنجش پایایی میان‌ارزیاب‌ها که اثر توافق‌های حاصل از شانس تصادفی را حذف کرده و عددی بین ۰ تا ۱ ارائه می‌دهد.
پایایی میان‌ارزیاب‌ها (Inter-rater reliability)
میزان هم‌پوشانی و توافق نظر میان ارزیابان یا داوران مستقل هنگام بررسی یک موضوع یا مدرک مشخص.
داوری دوسوکور (Double-blind review)
شیوه‌ای از داوری همتا که در آن هویت نویسندگان و داوران برای یکدیگر پوشیده می‌ماند.
پایگاه پیش‌چاپ (Preprint server)
مخزن اینترنتی برای اشتراک‌گذاری دست‌نوشته‌های علمی پیش از آنکه فرایند ارزیابی رسمی داوری همتا را طی کرده و در ژورنال منتشر شوند.

بررسی عمیق دیدگاه‌ها

مدافعان ساختار کنونی

بر این باورند که با وجود توافق آماری اندک، داوری همتا پژوهش‌های آشکارا بی‌کیفیت و غیرعلمی را مهار می‌کند.

این گروه معتقد است پایین بودن شاخص آماری، ویژگی مثبت ساختار است و نباید نقص شمرده شود. استدلال آن‌ها این است که دبیران عمداً داورانی با تخصص‌های مکمل (مانند یک متخصص آمار و یک متخصص موضوعی) را برمی‌گزینند که قرار است کاستی‌های متفاوتی را شناسایی کنند؛ بنابراین کاپای ۰٫۱۷ نشان‌دهنده دقت همه‌جانبه است نه یک رفتار تصادفی، و دیدی کامل از ضعف‌های مقاله به دبیر می‌دهد تا تصمیم نهایی را اتخاذ کند.

طرفداران دگرگونی بنیادین

سامانه کنونی را شبیه به گردونه شانس دانسته و خواستار تحول ساختاری مانند داوری باز یا ارزیابی پس از انتشار هستند.

منتقدان به آمارهایی استناد می‌کنند که ناتوانی سازوکار فعلی در تفکیک نظام‌مند علم معتبر از علم نامعتبر را اثبات می‌کند. پیشنهاد آنان تفکیک کامل فرایند انتشار از داوری و تکیه بر الگوی «اول چاپ، سپس گزینش» در پایگاه‌های پیش‌چاپ است؛ چراکه اجماع عمومی جامعه علمی در فضای باز را تنها شیوه منطقی و آماری برای ارزیابی می‌دانند که تصمیم‌گیری را از بن‌بست سلیقه یک دبیر آزاد می‌کند.

ناشران سنتی 40%منتقدان آماری 35%حامیان علم باز 25%
ناشران سنتی
فیلتر داوری موجود را سازوکاری ارزشمند می‌دانند و پایین بودن توافق را نشان‌دهنده دقت بالا و بررسی مقاله از زوایای گوناگون قلمداد می‌کنند.
منتقدان آماری
بر ناپایداری محاسباتی و عدم قابلیت اتکای این شیوه تأکید دارند و خواهان اصلاحات داده‌محور در سازوکار ارزیابی هستند.
حامیان علم باز
خواهان فراگیر شدن نسخه‌های پیش‌چاپ و داوری پس از انتشار هستند تا سلیقه فردی دبیران از مسیر انتشار علم حذف شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • پژوهشگران تازه‌کار که ارتقا و امنیت شغلی‌شان در گرو عبور از این بخت‌آزمایی ارزیابی است.
  • دبیران مجلات که باید بار کاری سنگین مدیریت و جمع‌بندی گزارش‌های ضدونقیض داوران را به دوش بکشند.

منابع

پوشش منابع

9 منبع

3 دیدگاه شناسایی‌شده

ناشران سنتی 40%منتقدان آماری 35%حامیان علم باز 25%
  1. [1]Brainمنتقدان آماری

    Reproducibility of peer review in clinical neuroscience: Is agreement between reviewers any greater than would be expected by chance alone?

    مطالعه در Brain →
  2. [2]Scienceمنتقدان آماری

    Chance and Consensus in Peer Review

    مطالعه در Science →
  3. [3]JAMAناشران سنتی

    Effects of Editorial Peer Review: A Systematic Review

    مطالعه در JAMA →
  4. [4]Cochrane Database of Systematic Reviews

    Editorial peer review for improving the quality of reports of biomedical studies

    مطالعه در Cochrane Database of Systematic Reviews →
  5. [5]Journal of the Royal Society of Medicine

    Peer review: a flawed process at the heart of science and journals

    مطالعه در Journal of the Royal Society of Medicine →
  6. [6]Proceedings of the National Academy of Sciencesمنتقدان آماری

    Low agreement among reviewers evaluating the same NIH grant applications

    مطالعه در Proceedings of the National Academy of Sciences →
  7. [7]The BMJناشران سنتی

    Effect of open peer review on quality of reviews and on reviewers' recommendations: a randomised trial

    مطالعه در The BMJ →
  8. [8]Behavioral and Brain Sciencesحامیان علم باز

    Peer-review practices of psychological journals: The fate of published articles, submitted again

    مطالعه در Behavioral and Brain Sciences →
  9. [9]تیم سردبیری کوهستانحامیان علم باز

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار آموزش با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.