نتایج کارآزماییهای چندکلاسی: فرمهای ارزیابی اساتید نمره را میسنجند نه یادگیری واقعی را
مطالعات کنترلشده با بررسی هزاران دانشجو نشان میدهد اساتیدی که بالاترین امتیاز ارزیابی را میگیرند، اغلب بازده آموزشی بلندمدت ضعیفتری دارند. نظرسنجیهای رضایت دانشجو به جای سنجش کیفیت تدریس، چالش ذهنی لازم برای یادگیری عمیق را تنبیه و نمرهدهی آسان را پاداش میدهند.
به قلم نادر حیدری
این خبر را به اشتراک بگذارید
بهطور خلاصه
- کارآزماییهای چندکلاسی با واگذاری تصادفی دانشجویان به اساتید همسرفصل، سهم واقعی مدرس در یادگیری را اندازه میگیرند.
- دادههای طولی نشان میدهد دانشجویان بیشترین امتیاز را به اساتید آسانگیر میدهند و اساتیدی را که دروس تخصصی بعدی را پایهریزی میکنند جریمه میکنند.
- فراتحلیلهای مدرن تایید میکنند که پس از رفع خطای نمونههای کوچک، همبستگی میان ارزیابی دانشجو و یادگیری به صفر میرسد.
در این مطلب
مدیران دانشگاهی و کمیتههای ارتقای هیئت علمی مدام تکرار میکنند که فرمهای ارزیابی اساتید توسط دانشجویان شاخص معتبری برای سنجش کیفیت تدریس است، با این فرض که اساتید محبوبتر خروجی آموزشی بهتری میسازند. اما دادههای تجربی حاصل از کارآزماییهای کنترلشده این فرض بنیادین را کاملاً رد میکند. وقتی یادگیری عینی را از میزان رضایت دانشجو جدا کنید، مشخص میشود که این نمرات صرفاً بازتابی از دستودلبازی در نمرهدهی و آسانی مباحث هستند.[3][5]
شکاف میان کاربرد اداری این نظرسنجیها و اعتبار علمی آنها با گره خوردن تمدید قرارداد و ارتقای اساتید به این فرمها حادتر شده است. در نظام دانشگاهی امروز، سرنوشت شغلی یک استاد اغلب به تفاوتهای صدمدرصدی در میانگین این امتیازها بستگی دارد؛ در حالی که اقتصاددانان آموزش بارها اثبات کردهاند که این متغیرها مطلقاً نشاندهنده انتقال پایدار دانش نیستند.[3]
پژوهشگران برای تفکیک یادگیری واقعی از محبوبیت مقطعی، از متد کارآزمایی چندکلاسی استفاده میکنند که استاندارد طلایی سنجش در آموزش محسوب میشود. در این طرح، گروه بزرگی از دانشجویان بهطور کاملاً تصادفی میان اساتید مختلفی که سرفصل درسی یکسانی را تدریس میکنند تقسیم میشوند و در نهایت، همگی در یک امتحان نهایی استاندارد و هماهنگ شرکت میکنند.[3]
این شیوه دقیق پژوهشی خطای خودانتخابی دانشجویان—یعنی فرار از اساتید سختگیر و هجوم به سمت اساتید نمرهبده—را از میان میبرد. با خنثی کردن سطح هوش ورودی و یکسانسازی برگه امتحانی، ارزش افزوده واقعی هر مدرس در عملکرد تحصیلی بهدقت مشخص میشود. خروجی این محیطهای آزمایشگاهی بارها نشان داده که پیوند فرضی میان رضایت دانشجو و کیفیت تدریس یک توهم آماری است.[1][3]
آزمایش آکادمی نیروی هوایی
قاطعانهترین مدرک این شکاف آموزشی از یک مطالعه طولی گسترده در آکادمی نیروی هوایی ایالات متحده به دست آمد. اسکات کارل و جیمز وست، دو اقتصاددان سرشناس، ۱۰٬۵۳۴ دانشجو را بین سالهای ۲۰۰۰ تا ۲۰۰۷ زیر نظر گرفتند؛ جایی که به دلیل ضوابط سفتوسخت نظامی، دانشجویان هیچ اختیاری در انتخاب استاد نداشتند و کاملاً تصادفی به کلاسهای پایه ریاضی و مهندسی فرستاده میشدند.[1]
کارل و وست اثربخشی تدریس را از دو مسیر مستقل ارزیابی کردند: نخست نمره امتحان پایانی همان ترم مقدماتی، و سپس نمره دروس تخصصی پیشنیاز بعدی نظیر حساب دیفرانسیل و انتگرال ۲. در ابتدا به نظر میرسید نظرسنجیها دقیق هستند، چرا که اساتیدِ با نمره کلاسی بالاتر، امتیازهای بهتری از دانشجویان گرفتند؛ اما ردیابی بلندمدت فاش کرد که قضاوت دانشجویان از آموختههای خود دچار خطایی بنیادین است.[1]
وقتی محققان نمرات همان دانشجویان را در دروس پیچیدهتر مقاطع بعدی بررسی کردند، نتیجه کاملاً وارونه شد: اساتیدی که بالاترین موفقیت را در دروس تکمیلی بعدی رقم زده بودند—که نشانه یادگیری عمیق و پایدار است—کمترین امتیاز ارزیابی را از همان دانشجویان در ترم مقدماتی گرفته بودند. در نقطه مقابل، اساتیدی که بیشترین ستایش و نمره محبوبیت را داشتند، دانشجویان را در سطحیترین حالت برای دروس بعدی رها کرده بودند.[1]
کارل و وست در نشریه Journal of Political Economy تصریح کردند: «دانشجویان به نمرات بالاتر در ترم جاری پاداش میدهند، اما استادی را که یادگیری عمیق ایجاد میکند جریمه میکنند.» دادهها ثابت میکند که دانشجویان استادی را ترجیح میدهند که صرفاً برای پاس کردن امتحان فوری آموزش میدهد و چالش فکری لازم برای ماندگاری علم را به حداقل میرساند.[1]
این پدیده مختص ساختارهای نظامی یا دانشگاههای آمریکا نیست. در سال ۲۰۱۴، میکلا براگا، مارکو پاکانیلا و میکله پلیزاری همین نتایج را در دانشگاه بوکونی ایتالیا بازتولید کردند. با بهرهگیری از دادههای اداری دروس اجباری تصادفی، این پژوهشگران اروپایی دریافتند اگرچه مدرسان سهم متفاوتی در یادگیری دارند، اما این اثر مثبت هرگز در ستایش دانشجویان منعکس نمیشود.[2]
توهم همبستگی
تحقیق دانشگاه بوکونی تایید کرد که ارزیابی دانشجویان ارتباط منفی معناداری با موفقیت تحصیلی آتی آنها دارد. علاوه بر این، متغیرهای کاملاً بیربط به کیفیت آموزش نیز بر نمرات ارزیابی سایه میانداخت؛ برای مثال اگر در روز برگزاری نظرسنجی هوا سرد و بارانی بود، دانشجویان نمرات ارزیابی به مراتب بدتری برای استاد ثبت میکردند.[2]
دانشگاهها برای دههها استفاده از این فرمها را با استناد به فراتحلیلهای قدیمی نظیر پژوهش پیتر کوهن در سال ۱۹۸۱ توجیه میکردند؛ پژوهشی که مدعی همبستگی مثبت ۰٫۴۳ میان ارزیابی دانشجو و سطح پیشرفت بود. اما این دیوار دفاعی در سال ۲۰۱۷ فروریخت؛ زمانی که باب اوتل، کارملا وایت و دانیلا گونزالس دادههای گذشته را بازبینی کرده و خطاهای فاحش روششناختی آنها را فاش ساختند.[3]
تیم پژوهشی اوتل دریافتند که این همبستگی ظاهری تنها نتیجه نمونههای کوچک و خطای انتشار سیستماتیک مقالات بوده است. زمانی که آنها تحلیل را به کارآزماییهای چندکلاسی بزرگ و جدید با کنترل کامل دانش پیشین دانشجویان محدود کردند، همبستگی میان ارزیابی دانشجویان و یادگیری واقعی دقیقاً به عدد صفر رسید.[3]
محققان در سال ۲۰۱۷ گزارش دادند: «فراتحلیل بهروزشده ما از تمام آزمایشهای چندکلاسی، هیچ همبستگی معناداری میان نمرات ارزیابی تدریس و میزان یادگیری نشان نداد.» آنها صراحتاً هشدار دادند سازمانهایی که به دنبال پیشرفت واقعی و ارتقای شغلی دانشجویان هستند، باید این فرمها را کنار بگذارند، زیرا این نمرات حاوی هیچ داده معتبری از ارزش آموزشی نیستند.[3]
نقایص روانسنجی ابزارهای نظرسنجی این فاجعه را دوچندان میکند. پرسشنامههای سنتی طولانی و خستهکنندهاند و در نتیجه نرخ پاسخدهی پایینی دارند. وقتی تنها دانشجویان به شدت خشمگین یا به شدت شیفته در نظرسنجی شرکت میکنند، دادهها دچار خطای عدم پاسخدهی شده و هرگونه مقایسه اعشاری میان اساتید ارزش آماری خود را از دست میدهد.[3][5]
سوگیری و اینرسی سازمانی
فراتر از ناتوانی در سنجش یادگیری، این پرسشنامهها به بستر تبعیضهای جمعیتشناختی بدل شدهاند. پژوهش سال ۲۰۱۶ آن بورینگ، کلی اوتوبونی و فیلیپ استارک نشان داد که ارزیابیها به شکلی سیستماتیک اساتید زن و اقلیتها را تنبیه میکنند؛ حتی در مواردی که با معیارهای عینی اثبات شده این اساتید بازدهی یکسان یا برتری نسبت به همکاران مرد خود داشتهاند.[4]
در یک آزمایش میدانی کنترلشده، دانشجویان یک درس آنلاین با محتوا و سرعت تصحیح یکسان مواجه شدند، اما جنسیت ظاهری استاد تغییر داده شد. دانشجویان به هویت «مرد» نمرات بسیار بالاتری نسبت به هویت «زن» دادند، فارغ از اینکه چه کسی پشت صفحه تدریس میکرد. حتی در متغیرهای عینی، دانشجویان مدعی شدند استاد مرد برگهها را سریعتر تصحیح کرده است.[4]
مشکل دیگر اینجاست که این فرمها تدریس را یک مهارت تکبعدی میانگارند؛ در حالی که استانداردهای نوین آموزشی شامل طراحی برنامه درسی، تدوین آزمون معتبر، تسهیلگری پویا و راهنمایی مراجعان است. خلاصه کردن تمام این تخصصها در یک امتیاز چندستارهای، تقلیل دادن آموزش به یک مسابقه محبوبیت عوامانه است.[5]
با وجود این اجماع علمی قاطع، نظام آموزش عالی همچنان این فرمها را مبنای ارتقا و تمدید قرارداد قرار میدهد. علت بقای این سیستم نه ارزش تربیتی آن، بلکه آسانی کار مدیران است: فرمهای آنلاین ارزان هستند، به راحتی در تیراژ بالا تولید میشوند و نمرهای شستهرفته تولید میکنند که به سادگی در فایلهای اکسل اداری جا میگیرد.[4][5]
این رویکرد مدیریتی چرخهای مخرب در دانشکدهها راه انداخته است. اساتید جوان و قراردادی که ادامه کارشان را به این ارزیابیها وابسته میبینند، به جای ارتقای استانداردهای تحصیلی به سمت راضی کردن مقطعی دانشجو سوق داده میشوند. نتیجه مستقیم این رویکرد، پدیده تورم نمره و آب رفتن محتوای درسی است.[5]
هزینه کالاییسازی آموزش
بیشترین ضربه را اساتید حقالتدریس و پیمانی میخورند که بخش عمده ساعات آموزشی دورههای کارشناسی را به دوش میکشند. برعکس استادان رسمی که از حاشیه امنیت برای حفظ استانداردها برخوردارند، اساتید قراردادی در معرض فسخ قرارداد قرار دارند، تنها به این دلیل که میانگین نمره ارزیابیشان کمی از حد تعیینشده گروه پایینتر آمده است.[5]
وقتی یک سیستم سختگیری علمی را تنبیه میکند، واکنش منطقی اقتصادی استاد کاستن از سطح انتظارات است. با کاستن از تکالیف، نمرهدهی دستودلبازانه و حذف مفاهیم پیچیدهای که ذهن دانشجو را به چالش میکشد، اساتید میتوانند امتیاز رضایت خود را مصنوعی بالا ببرند؛ رفتاری که آمارها نشان میدهد دقیقاً از سوی دانشجویان پاداش میگیرد.[1][5]
این مناسبات شغلی متزلزل، فرمهای نظرسنجی را از ابزار کیفیتسنجی به اهرم کنترل اداری تنزل داده است. تکیه بر مدل «رضایت مشتری» برای مدیریت کادر آموزشی، کلاس درس را به کالایی سطحی تبدیل میکند و یافتههای کارآزماییهای چندکلاسی دقیقاً هزینه گزاف این تنبلی مدیریتی را آشکار میسازد.[5]
اقتصاددانان استدلال میکنند که نگاه مصرفکننده به دانشجو برای ارزیابی کیفیت خدمت، اساساً ماهیت آموزش را مخدوش میکند. دانشجو صلاحیت داوری درباره وقتشناسی، وضوح سرفصل یا ادب استاد را دارد، اما تخصص علمی لازم برای ارزیابی جامعیت و دقت سرفصل تخصصی تدریسشده را دارا نیست.[5]
اصلاح نظام ارزیابی استادان
اصطکاک شناختی که لازمه مسلط شدن بر مفاهیم پیچیده است، ذاتاً دردناک و سخت است. وقتی استادی دانشجو را وادار میکند به جای تحویل گرفتن لقمه آماده، با مسائل درگیر شود، دانشجو اغلب این سختی را به حساب ضعف تدریس میگذارد؛ در حالی که همین سختی ضامن بازدهی واقعی در مقاطع تحصیلی بعدی است.[1][5]
گذار از این نظرسنجیهای گمراهکننده مستلزم سرمایهگذاری روی الگوهای ارزیابی چندبعدی است. کارشناسان بر ارزیابی همتایان تاکید دارند؛ فرآیندی که در آن متخصصان فن، طرح درس، منابع آموزشی و نحوه اجرای کلاسی همکار خود را بازبینی میکنند. این مسیر اگرچه وقتگیرتر و گرانتر است، اما جوهره تدریس را محک میزند.[5]
راهکار مکمل دیگر، سنجش نتایج عینی یادگیری در دروس متوالی است؛ مشابه همان آزمایشی که در آکادمی نیروی هوایی اجرا شد. اگر یک گروه آموزشی قصد سنجش کیفیت تدریس درس شیمی عمومی را دارد، باید نمرات آن دانشجویان را در شیمی آلی سال بعد رصد کند. این کار شاخص ارزیابی را از حس رضایت گذرا به توانمندی ماندگار تغییر میدهد.[1][5]
راهکار مکمل دیگر، سنجش نتایج عینی یادگیری در دروس متوالی است؛ مشابه همان آزمایشی که در آکادمی نیروی هوایی اجرا شد.
برخی مراکز پیشرو پیوند میان نظرسنجی دانشجویی و تمدید قراردادهای کاری را قطع کردهاند و از این پرسشنامهها صرفاً برای بازخورد سازنده و محرمانه به شخص استاد بهره میبرند. با حذف ریسک اخراج یا توبیخ، انگیزه اساتید برای توزیع نمرات بیضابطه و حذف مباحث سنگین درسی کاهش مییابد.[3][5]
اصرار بر ارزیابی کیفیت آموزش بر پایه رضایتسنجی سنتی دانشجویان، نماد بارز مدیریت ضدعلمی در آموزش عالی است. نتایج قطعی کارآزماییهای چندکلاسی حاکی از آن است که این فرمها ترکیبی از توقع نمره بالا، سوگیریهای ناخودآگاه و سهلگیری استاد را ثبت میکنند و هرگز کمیت یا کیفیت یادگیری دانشجو را بازتاب نمیدهند.[1][2][3][4]
این تحلیل چگونه انجام شد
- روش
- محاسبه مجدد همبستگی نمرات ارزیابی دانشجویان و عملکرد در دروس بعدی با نرمالسازی اندازه اثر گزارششده در دادههای آکادمی نیروی هوایی و دانشگاه بوکونی، تعدیلشده بر اساس سطح علمی ورودی دانشجویان.
- یافته
- در کارآزماییهای چندکلاسی که یادگیری عمیق را بر اساس نمرات دروس تکمیلی بعدی میسنجند نه آزمونهای آنی، همبستگی رضایت دانشجو با یادگیری کاملاً منفی است؛ به این معنی که چالش فکری لازم برای ماندگاری دانش از سوی فرمهای ارزیابی جریمه میشود.
- دادههایی که بر پایهٔ آنها کار کردیم
- همبستگی عملکرد در دروس پیشنیاز بعدی در آکادمی نیروی هوایی: Negative correlation — Journal of Political Economy
- عملکرد دانشجویان در دروس بعدی دانشگاه بوکونی: Negative correlation — Economics of Education Review
- همبستگی فراتحلیلی یادگیری در کارآزماییهای چندکلاسی: r = 0.00 — Studies in Educational Evaluation
- محدودیتهای این تحلیل
- این تحلیل مبتنی بر دروس علوم پایه و اقتصاد است که بازدهی در مقاطع بعدی با نمرات عینی قابل اندازهگیری است؛ وضعیت در دروس علوم انسانی با ارزیابیهای کیفی ممکن است متفاوت باشد.
اصطلاحات کلیدی
- کارآزمایی چندکلاسی (Multisection course trial)
- طرح آزمایشی که در آن دانشجویان به شکل تصادفی میان اساتید مختلف با سرفصل و امتحان نهایی یکسان توزیع میشوند.
- فرم ارزیابی تدریس (SETs)
- پرسشنامه استانداردی که در پایان ترم برای ارزیابی سطح رضایت دانشجو از استاد توزیع میشود.
- اصطکاک شناختی (Cognitive friction)
- سختی و چالش ذهنی ناشی از یادگیری مفاهیم دشوار و جدید که پیشنیاز ثبت ماندگار دانش است.
- سوگیری عدم پاسخدهی (Non-response bias)
- انحراف آماری که به دلیل تفاوت دیدگاه پاسخدهندگان داوطلب با افرادی که پرسشنامه را پر نکردهاند رخ میدهد.
بررسی عمیق دیدگاهها
اقتصاددانان آموزش
پژوهشگرانی که نتایج عینی یادگیری را در برابر امتیازهای رضایت دانشجو ارزیابی میکنند.
اقتصاددانان آموزش و متخصصان روانسنجی استدلال میکنند که نگاه مصرفکننده به دانشجو و واگذاری داوری کیفیت محصول به او، ماهیتاً با فرآیند یادگیری تضاد دارد. دانشجو برای گزارش مواردی مانند حضوربهموقع، وضوح سرفصل یا ادب مدرس مناسب است، اما دانش تخصصی لازم برای تشخیص عمق آموزش را ندارد. پژوهشگران با پایش عملکرد دانشجو در یک دوره چندساله اثبات کردهاند چالش ذهنی لازم برای فهم درس ناخوشایند است؛ وقتی استادی دانشجو را مجبور به درک عمیق میکند، دانشجو این زحمت را به حساب تدریس بد میگذارد و نمره ارزیابی پایینی میدهد، هرچند همان دانشجو در ترمهای بعدی بسیار موفقتر عمل میکند.
مدیران دانشگاهی
روسای نهادهایی که برای مدیریت پرسنل به پرسشنامههای استاندارد تکیه میکنند.
برای روسای دانشکدهها و مدیران دانشگاهی، فرمهای ارزیابی ابزاری ارزان، سریع و مقیاسپذیر برای مدیریت کادر آموزشی بزرگ است. در شرایطی که نظارت حضوری بر تکتک مدرسان از نظر لجستیکی و مالی ناممکن است، این نظرسنجیها دادههای عددی تمیزی ارائه میدهند که به راحتی در پروندههای ترفیع ثبت میشوند. بسیاری از مدیران به خطاهای روششناختی و سوگیریهای این فرمها واقفند، اما معتقدند این ابزار حداقل یک مجرای ارتباطی با دانشجو است. اینرسی سازمانی در برابر تغییر این الگو بسیار شدید است، زیرا جایگزین کردن آن نیازمند هزینهکرد سنگین برای ارزیابی همتایان و سیستمهای ردیابی طولی است.
- اقتصاددانان آموزش
- معتقدند فرمهای رضایتسنجی به جای بازدهی علمی، توقع نمره و سوگیریها را میسنجند و باید با معیارهای خروجیمحور جایگزین شوند.
- مدیران دانشگاهی
- با وجود نقایص روششناختی این ابزارها، به دلیل هزینه پایین و سهولت اجرا در تصمیمگیریهای استخدامی از آنها استفاده میکنند.
- حامیان حقوق اساتید
- هشدار میدهند که گره زدن معیشت و امنیت شغلی مدرسان به نظرسنجیهای رضایت، آنها را ناچار به افت استانداردهای علمی میکند.
دیدگاههایی که این گزارش پوشش نداده
- دانشجویان مقطع کارشناسی
- اعضای کمیتههای ترفیع و ارتقای اعضای هیئت علمی
منابع
[1]Journal of Political Economyاقتصاددانان آموزشDoes Professor Quality Matter? Evidence from Random Assignment of Students to Professors
مطالعه در Journal of Political Economy →
[2]Economics of Education Reviewاقتصاددانان آموزشEvaluating Students' Evaluations of Professors
مطالعه در Economics of Education Review →
[3]Studies in Educational Evaluationاقتصاددانان آموزشMeta-analysis of faculty's teaching effectiveness: Student evaluation of teaching ratings and student learning are not related
مطالعه در Studies in Educational Evaluation →
[4]ScienceOpen Researchاقتصاددانان آموزشStudent evaluations of teaching (mostly) do not measure teaching effectiveness
مطالعه در ScienceOpen Research →
[5]تیم سردبیری کوهستانحامیان حقوق اساتیدتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در آموزش
مشاهده همه →ارزیابی یادگیری پیشین
چگونه سابقه کاری خود را به واحد دانشگاهی تبدیل کنید (ارزیابی یادگیری پیشین)
4 منبع
آزادی آکادمیک
دادگاه استیناف فدرال، قانون «توقف بیداری» فلوریدا را در بخش آموزش عالی لغو کرد
9 منبع
ارزیابی یادگیری قبلی
تبدیل سابقه کار به مدرک دانشگاهی: اثبات مهارت در سطح سرفصل دروس، نه صرفاً سالهای اشتغال
4 منبع
فناوری آموزشی
هوش مصنوعی چگونه نظام آموزش را تغییر میدهد؟ مزایا، تهدیدها و آینده یادگیری
4 منبع
نظرات
هر زاویه. هر روز.
اخبار آموزش با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





