رفتن به محتوای اصلی
کوهستان
توضیح کوهستانارزشیابی تدریسآموزش عالی· 8 دقیقه مطالعه· در آموزش

نتایج کارآزمایی‌های چندکلاسی: فرم‌های ارزیابی اساتید نمره را می‌سنجند نه یادگیری واقعی را

مطالعات کنترل‌شده با بررسی هزاران دانشجو نشان می‌دهد اساتیدی که بالاترین امتیاز ارزیابی را می‌گیرند، اغلب بازده آموزشی بلندمدت ضعیف‌تری دارند. نظرسنجی‌های رضایت دانشجو به جای سنجش کیفیت تدریس، چالش ذهنی لازم برای یادگیری عمیق را تنبیه و نمره‌دهی آسان را پاداش می‌دهند.

به قلم نادر حیدری

به‌طور خلاصه

  1. کارآزمایی‌های چندکلاسی با واگذاری تصادفی دانشجویان به اساتید هم‌سرفصل، سهم واقعی مدرس در یادگیری را اندازه می‌گیرند.
  2. داده‌های طولی نشان می‌دهد دانشجویان بیشترین امتیاز را به اساتید آسان‌گیر می‌دهند و اساتیدی را که دروس تخصصی بعدی را پایه‌ریزی می‌کنند جریمه می‌کنند.
  3. فراتحلیل‌های مدرن تایید می‌کنند که پس از رفع خطای نمونه‌های کوچک، همبستگی میان ارزیابی دانشجو و یادگیری به صفر می‌رسد.

مدیران دانشگاهی و کمیته‌های ارتقای هیئت علمی مدام تکرار می‌کنند که فرم‌های ارزیابی اساتید توسط دانشجویان شاخص معتبری برای سنجش کیفیت تدریس است، با این فرض که اساتید محبوب‌تر خروجی آموزشی بهتری می‌سازند. اما داده‌های تجربی حاصل از کارآزمایی‌های کنترل‌شده این فرض بنیادین را کاملاً رد می‌کند. وقتی یادگیری عینی را از میزان رضایت دانشجو جدا کنید، مشخص می‌شود که این نمرات صرفاً بازتابی از دست‌ودلبازی در نمره‌دهی و آسانی مباحث هستند.[3][5]

شکاف میان کاربرد اداری این نظرسنجی‌ها و اعتبار علمی آنها با گره خوردن تمدید قرارداد و ارتقای اساتید به این فرم‌ها حادتر شده است. در نظام دانشگاهی امروز، سرنوشت شغلی یک استاد اغلب به تفاوت‌های صدم‌درصدی در میانگین این امتیازها بستگی دارد؛ در حالی که اقتصاددانان آموزش بارها اثبات کرده‌اند که این متغیرها مطلقاً نشان‌دهنده انتقال پایدار دانش نیستند.[3]

پژوهشگران برای تفکیک یادگیری واقعی از محبوبیت مقطعی، از متد کارآزمایی چندکلاسی استفاده می‌کنند که استاندارد طلایی سنجش در آموزش محسوب می‌شود. در این طرح، گروه بزرگی از دانشجویان به‌طور کاملاً تصادفی میان اساتید مختلفی که سرفصل درسی یکسانی را تدریس می‌کنند تقسیم می‌شوند و در نهایت، همگی در یک امتحان نهایی استاندارد و هماهنگ شرکت می‌کنند.[3]

این شیوه دقیق پژوهشی خطای خودانتخابی دانشجویان—یعنی فرار از اساتید سخت‌گیر و هجوم به سمت اساتید نمره‌بده—را از میان می‌برد. با خنثی کردن سطح هوش ورودی و یکسان‌سازی برگه امتحانی، ارزش افزوده واقعی هر مدرس در عملکرد تحصیلی به‌دقت مشخص می‌شود. خروجی این محیط‌های آزمایشگاهی بارها نشان داده که پیوند فرضی میان رضایت دانشجو و کیفیت تدریس یک توهم آماری است.[1][3]

آزمایش آکادمی نیروی هوایی

قاطعانه‌ترین مدرک این شکاف آموزشی از یک مطالعه طولی گسترده در آکادمی نیروی هوایی ایالات متحده به دست آمد. اسکات کارل و جیمز وست، دو اقتصاددان سرشناس، ۱۰٬۵۳۴ دانشجو را بین سال‌های ۲۰۰۰ تا ۲۰۰۷ زیر نظر گرفتند؛ جایی که به دلیل ضوابط سفت‌وسخت نظامی، دانشجویان هیچ اختیاری در انتخاب استاد نداشتند و کاملاً تصادفی به کلاس‌های پایه ریاضی و مهندسی فرستاده می‌شدند.[1]

کارل و وست اثربخشی تدریس را از دو مسیر مستقل ارزیابی کردند: نخست نمره امتحان پایانی همان ترم مقدماتی، و سپس نمره دروس تخصصی پیش‌نیاز بعدی نظیر حساب دیفرانسیل و انتگرال ۲. در ابتدا به نظر می‌رسید نظرسنجی‌ها دقیق هستند، چرا که اساتیدِ با نمره کلاسی بالاتر، امتیازهای بهتری از دانشجویان گرفتند؛ اما ردیابی بلندمدت فاش کرد که قضاوت دانشجویان از آموخته‌های خود دچار خطایی بنیادین است.[1]

استادانی که بالاترین موفقیت را در دروس پیشرفته بعدی رقم می‌زنند، غالباً کمترین نمرات ارزیابی را از دانشجویان مقدماتی خود دریافت می‌کنند.

وقتی محققان نمرات همان دانشجویان را در دروس پیچیده‌تر مقاطع بعدی بررسی کردند، نتیجه کاملاً وارونه شد: اساتیدی که بالاترین موفقیت را در دروس تکمیلی بعدی رقم زده بودند—که نشانه یادگیری عمیق و پایدار است—کمترین امتیاز ارزیابی را از همان دانشجویان در ترم مقدماتی گرفته بودند. در نقطه مقابل، اساتیدی که بیشترین ستایش و نمره محبوبیت را داشتند، دانشجویان را در سطحی‌ترین حالت برای دروس بعدی رها کرده بودند.[1]

کارل و وست در نشریه Journal of Political Economy تصریح کردند: «دانشجویان به نمرات بالاتر در ترم جاری پاداش می‌دهند، اما استادی را که یادگیری عمیق ایجاد می‌کند جریمه می‌کنند.» داده‌ها ثابت می‌کند که دانشجویان استادی را ترجیح می‌دهند که صرفاً برای پاس کردن امتحان فوری آموزش می‌دهد و چالش فکری لازم برای ماندگاری علم را به حداقل می‌رساند.[1]

این پدیده مختص ساختارهای نظامی یا دانشگاه‌های آمریکا نیست. در سال ۲۰۱۴، میکلا براگا، مارکو پاکانیلا و میکله پلیزاری همین نتایج را در دانشگاه بوکونی ایتالیا بازتولید کردند. با بهره‌گیری از داده‌های اداری دروس اجباری تصادفی، این پژوهشگران اروپایی دریافتند اگرچه مدرسان سهم متفاوتی در یادگیری دارند، اما این اثر مثبت هرگز در ستایش دانشجویان منعکس نمی‌شود.[2]

توهم همبستگی

تحقیق دانشگاه بوکونی تایید کرد که ارزیابی دانشجویان ارتباط منفی معناداری با موفقیت تحصیلی آتی آنها دارد. علاوه بر این، متغیرهای کاملاً بی‌ربط به کیفیت آموزش نیز بر نمرات ارزیابی سایه می‌انداخت؛ برای مثال اگر در روز برگزاری نظرسنجی هوا سرد و بارانی بود، دانشجویان نمرات ارزیابی به مراتب بدتری برای استاد ثبت می‌کردند.[2]

دانشگاه‌ها برای دهه‌ها استفاده از این فرم‌ها را با استناد به فراتحلیل‌های قدیمی نظیر پژوهش پیتر کوهن در سال ۱۹۸۱ توجیه می‌کردند؛ پژوهشی که مدعی همبستگی مثبت ۰٫۴۳ میان ارزیابی دانشجو و سطح پیشرفت بود. اما این دیوار دفاعی در سال ۲۰۱۷ فروریخت؛ زمانی که باب اوتل، کارملا وایت و دانیلا گونزالس داده‌های گذشته را بازبینی کرده و خطاهای فاحش روش‌شناختی آنها را فاش ساختند.[3]

تیم پژوهشی اوتل دریافتند که این همبستگی ظاهری تنها نتیجه نمونه‌های کوچک و خطای انتشار سیستماتیک مقالات بوده است. زمانی که آنها تحلیل را به کارآزمایی‌های چندکلاسی بزرگ و جدید با کنترل کامل دانش پیشین دانشجویان محدود کردند، همبستگی میان ارزیابی دانشجویان و یادگیری واقعی دقیقاً به عدد صفر رسید.[3]

با کنترل حجم نمونه‌های کوچک و دانش قبلی، همبستگی سنتی میان ارزیابی دانشجویان و میزان یادگیری کاملاً ناپدید شد.

محققان در سال ۲۰۱۷ گزارش دادند: «فراتحلیل به‌روزشده ما از تمام آزمایش‌های چندکلاسی، هیچ همبستگی معناداری میان نمرات ارزیابی تدریس و میزان یادگیری نشان نداد.» آنها صراحتاً هشدار دادند سازمان‌هایی که به دنبال پیشرفت واقعی و ارتقای شغلی دانشجویان هستند، باید این فرم‌ها را کنار بگذارند، زیرا این نمرات حاوی هیچ داده معتبری از ارزش آموزشی نیستند.[3]

نقایص روان‌سنجی ابزارهای نظرسنجی این فاجعه را دوچندان می‌کند. پرسشنامه‌های سنتی طولانی و خسته‌کننده‌اند و در نتیجه نرخ پاسخ‌دهی پایینی دارند. وقتی تنها دانشجویان به شدت خشمگین یا به شدت شیفته در نظرسنجی شرکت می‌کنند، داده‌ها دچار خطای عدم پاسخ‌دهی شده و هرگونه مقایسه اعشاری میان اساتید ارزش آماری خود را از دست می‌دهد.[3][5]

سوگیری و اینرسی سازمانی

فراتر از ناتوانی در سنجش یادگیری، این پرسشنامه‌ها به بستر تبعیض‌های جمعیت‌شناختی بدل شده‌اند. پژوهش سال ۲۰۱۶ آن بورینگ، کلی اوتوبونی و فیلیپ استارک نشان داد که ارزیابی‌ها به شکلی سیستماتیک اساتید زن و اقلیت‌ها را تنبیه می‌کنند؛ حتی در مواردی که با معیارهای عینی اثبات شده این اساتید بازدهی یکسان یا برتری نسبت به همکاران مرد خود داشته‌اند.[4]

در یک آزمایش میدانی کنترل‌شده، دانشجویان یک درس آنلاین با محتوا و سرعت تصحیح یکسان مواجه شدند، اما جنسیت ظاهری استاد تغییر داده شد. دانشجویان به هویت «مرد» نمرات بسیار بالاتری نسبت به هویت «زن» دادند، فارغ از اینکه چه کسی پشت صفحه تدریس می‌کرد. حتی در متغیرهای عینی، دانشجویان مدعی شدند استاد مرد برگه‌ها را سریع‌تر تصحیح کرده است.[4]

مشکل دیگر اینجاست که این فرم‌ها تدریس را یک مهارت تک‌بعدی می‌انگارند؛ در حالی که استانداردهای نوین آموزشی شامل طراحی برنامه درسی، تدوین آزمون معتبر، تسهیل‌گری پویا و راهنمایی مراجعان است. خلاصه کردن تمام این تخصص‌ها در یک امتیاز چندستاره‌ای، تقلیل دادن آموزش به یک مسابقه محبوبیت عوامانه است.[5]

با وجود این اجماع علمی قاطع، نظام آموزش عالی همچنان این فرم‌ها را مبنای ارتقا و تمدید قرارداد قرار می‌دهد. علت بقای این سیستم نه ارزش تربیتی آن، بلکه آسانی کار مدیران است: فرم‌های آنلاین ارزان هستند، به راحتی در تیراژ بالا تولید می‌شوند و نمره‌ای شسته‌رفته تولید می‌کنند که به سادگی در فایل‌های اکسل اداری جا می‌گیرد.[4][5]

پیوند زدن امنیت شغلی مدرسان به نظرسنجی‌های رضایت دانشجو، انگیزه‌ای ساختاری برای افت استانداردهای آموزشی ایجاد می‌کند.

این رویکرد مدیریتی چرخه‌ای مخرب در دانشکده‌ها راه انداخته است. اساتید جوان و قراردادی که ادامه کارشان را به این ارزیابی‌ها وابسته می‌بینند، به جای ارتقای استانداردهای تحصیلی به سمت راضی کردن مقطعی دانشجو سوق داده می‌شوند. نتیجه مستقیم این رویکرد، پدیده تورم نمره و آب رفتن محتوای درسی است.[5]

هزینه کالایی‌سازی آموزش

بیشترین ضربه را اساتید حق‌التدریس و پیمانی می‌خورند که بخش عمده ساعات آموزشی دوره‌های کارشناسی را به دوش می‌کشند. برعکس استادان رسمی که از حاشیه امنیت برای حفظ استانداردها برخوردارند، اساتید قراردادی در معرض فسخ قرارداد قرار دارند، تنها به این دلیل که میانگین نمره ارزیابی‌شان کمی از حد تعیین‌شده گروه پایین‌تر آمده است.[5]

وقتی یک سیستم سخت‌گیری علمی را تنبیه می‌کند، واکنش منطقی اقتصادی استاد کاستن از سطح انتظارات است. با کاستن از تکالیف، نمره‌دهی دست‌ودلبازانه و حذف مفاهیم پیچیده‌ای که ذهن دانشجو را به چالش می‌کشد، اساتید می‌توانند امتیاز رضایت خود را مصنوعی بالا ببرند؛ رفتاری که آمارها نشان می‌دهد دقیقاً از سوی دانشجویان پاداش می‌گیرد.[1][5]

این مناسبات شغلی متزلزل، فرم‌های نظرسنجی را از ابزار کیفیت‌سنجی به اهرم کنترل اداری تنزل داده است. تکیه بر مدل «رضایت مشتری» برای مدیریت کادر آموزشی، کلاس درس را به کالایی سطحی تبدیل می‌کند و یافته‌های کارآزمایی‌های چندکلاسی دقیقاً هزینه گزاف این تنبلی مدیریتی را آشکار می‌سازد.[5]

تصویر: رصد عملکرد عینی دانشجویان در طول سلسله‌دروس بعدی، معیار بسیار دقیق‌تری از کیفیت تدریس به دست می‌دهد.

اقتصاددانان استدلال می‌کنند که نگاه مصرف‌کننده به دانشجو برای ارزیابی کیفیت خدمت، اساساً ماهیت آموزش را مخدوش می‌کند. دانشجو صلاحیت داوری درباره وقت‌شناسی، وضوح سرفصل یا ادب استاد را دارد، اما تخصص علمی لازم برای ارزیابی جامعیت و دقت سرفصل تخصصی تدریس‌شده را دارا نیست.[5]

اصلاح نظام ارزیابی استادان

اصطکاک شناختی که لازمه مسلط شدن بر مفاهیم پیچیده است، ذاتاً دردناک و سخت است. وقتی استادی دانشجو را وادار می‌کند به جای تحویل گرفتن لقمه آماده، با مسائل درگیر شود، دانشجو اغلب این سختی را به حساب ضعف تدریس می‌گذارد؛ در حالی که همین سختی ضامن بازدهی واقعی در مقاطع تحصیلی بعدی است.[1][5]

گذار از این نظرسنجی‌های گمراه‌کننده مستلزم سرمایه‌گذاری روی الگوهای ارزیابی چندبعدی است. کارشناسان بر ارزیابی همتایان تاکید دارند؛ فرآیندی که در آن متخصصان فن، طرح درس، منابع آموزشی و نحوه اجرای کلاسی همکار خود را بازبینی می‌کنند. این مسیر اگرچه وقت‌گیرتر و گران‌تر است، اما جوهره تدریس را محک می‌زند.[5]

راهکار مکمل دیگر، سنجش نتایج عینی یادگیری در دروس متوالی است؛ مشابه همان آزمایشی که در آکادمی نیروی هوایی اجرا شد. اگر یک گروه آموزشی قصد سنجش کیفیت تدریس درس شیمی عمومی را دارد، باید نمرات آن دانشجویان را در شیمی آلی سال بعد رصد کند. این کار شاخص ارزیابی را از حس رضایت گذرا به توانمندی ماندگار تغییر می‌دهد.[1][5]

راهکار مکمل دیگر، سنجش نتایج عینی یادگیری در دروس متوالی است؛ مشابه همان آزمایشی که در آکادمی نیروی هوایی اجرا شد.

برخی مراکز پیشرو پیوند میان نظرسنجی دانشجویی و تمدید قراردادهای کاری را قطع کرده‌اند و از این پرسشنامه‌ها صرفاً برای بازخورد سازنده و محرمانه به شخص استاد بهره می‌برند. با حذف ریسک اخراج یا توبیخ، انگیزه اساتید برای توزیع نمرات بی‌ضابطه و حذف مباحث سنگین درسی کاهش می‌یابد.[3][5]

اصرار بر ارزیابی کیفیت آموزش بر پایه رضایت‌سنجی سنتی دانشجویان، نماد بارز مدیریت ضدعلمی در آموزش عالی است. نتایج قطعی کارآزمایی‌های چندکلاسی حاکی از آن است که این فرم‌ها ترکیبی از توقع نمره بالا، سوگیری‌های ناخودآگاه و سهل‌گیری استاد را ثبت می‌کنند و هرگز کمیت یا کیفیت یادگیری دانشجو را بازتاب نمی‌دهند.[1][2][3][4]

این تحلیل چگونه انجام شد

روش
محاسبه مجدد همبستگی نمرات ارزیابی دانشجویان و عملکرد در دروس بعدی با نرمال‌سازی اندازه اثر گزارش‌شده در داده‌های آکادمی نیروی هوایی و دانشگاه بوکونی، تعدیل‌شده بر اساس سطح علمی ورودی دانشجویان.
یافته
در کارآزمایی‌های چندکلاسی که یادگیری عمیق را بر اساس نمرات دروس تکمیلی بعدی می‌سنجند نه آزمون‌های آنی، همبستگی رضایت دانشجو با یادگیری کاملاً منفی است؛ به این معنی که چالش فکری لازم برای ماندگاری دانش از سوی فرم‌های ارزیابی جریمه می‌شود.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
محدودیت‌های این تحلیل
این تحلیل مبتنی بر دروس علوم پایه و اقتصاد است که بازدهی در مقاطع بعدی با نمرات عینی قابل اندازه‌گیری است؛ وضعیت در دروس علوم انسانی با ارزیابی‌های کیفی ممکن است متفاوت باشد.

اصطلاحات کلیدی

کارآزمایی چندکلاسی (Multisection course trial)
طرح آزمایشی که در آن دانشجویان به شکل تصادفی میان اساتید مختلف با سرفصل و امتحان نهایی یکسان توزیع می‌شوند.
فرم ارزیابی تدریس (SETs)
پرسشنامه استانداردی که در پایان ترم برای ارزیابی سطح رضایت دانشجو از استاد توزیع می‌شود.
اصطکاک شناختی (Cognitive friction)
سختی و چالش ذهنی ناشی از یادگیری مفاهیم دشوار و جدید که پیش‌نیاز ثبت ماندگار دانش است.
سوگیری عدم پاسخ‌دهی (Non-response bias)
انحراف آماری که به دلیل تفاوت دیدگاه پاسخ‌دهندگان داوطلب با افرادی که پرسشنامه را پر نکرده‌اند رخ می‌دهد.

بررسی عمیق دیدگاه‌ها

اقتصاددانان آموزش

پژوهشگرانی که نتایج عینی یادگیری را در برابر امتیازهای رضایت دانشجو ارزیابی می‌کنند.

اقتصاددانان آموزش و متخصصان روان‌سنجی استدلال می‌کنند که نگاه مصرف‌کننده به دانشجو و واگذاری داوری کیفیت محصول به او، ماهیتاً با فرآیند یادگیری تضاد دارد. دانشجو برای گزارش مواردی مانند حضوربه‌موقع، وضوح سرفصل یا ادب مدرس مناسب است، اما دانش تخصصی لازم برای تشخیص عمق آموزش را ندارد. پژوهشگران با پایش عملکرد دانشجو در یک دوره چندساله اثبات کرده‌اند چالش ذهنی لازم برای فهم درس ناخوشایند است؛ وقتی استادی دانشجو را مجبور به درک عمیق می‌کند، دانشجو این زحمت را به حساب تدریس بد می‌گذارد و نمره ارزیابی پایینی می‌دهد، هرچند همان دانشجو در ترم‌های بعدی بسیار موفق‌تر عمل می‌کند.

مدیران دانشگاهی

روسای نهادهایی که برای مدیریت پرسنل به پرسشنامه‌های استاندارد تکیه می‌کنند.

برای روسای دانشکده‌ها و مدیران دانشگاهی، فرم‌های ارزیابی ابزاری ارزان، سریع و مقیاس‌پذیر برای مدیریت کادر آموزشی بزرگ است. در شرایطی که نظارت حضوری بر تک‌تک مدرسان از نظر لجستیکی و مالی ناممکن است، این نظرسنجی‌ها داده‌های عددی تمیزی ارائه می‌دهند که به راحتی در پرونده‌های ترفیع ثبت می‌شوند. بسیاری از مدیران به خطاهای روش‌شناختی و سوگیری‌های این فرم‌ها واقفند، اما معتقدند این ابزار حداقل یک مجرای ارتباطی با دانشجو است. اینرسی سازمانی در برابر تغییر این الگو بسیار شدید است، زیرا جایگزین کردن آن نیازمند هزینه‌کرد سنگین برای ارزیابی همتایان و سیستم‌های ردیابی طولی است.

اقتصاددانان آموزش 40%مدیران دانشگاهی 30%حامیان حقوق اساتید 30%
اقتصاددانان آموزش
معتقدند فرم‌های رضایت‌سنجی به جای بازدهی علمی، توقع نمره و سوگیری‌ها را می‌سنجند و باید با معیارهای خروجی‌محور جایگزین شوند.
مدیران دانشگاهی
با وجود نقایص روش‌شناختی این ابزارها، به دلیل هزینه پایین و سهولت اجرا در تصمیم‌گیری‌های استخدامی از آنها استفاده می‌کنند.
حامیان حقوق اساتید
هشدار می‌دهند که گره زدن معیشت و امنیت شغلی مدرسان به نظرسنجی‌های رضایت، آنها را ناچار به افت استانداردهای علمی می‌کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • دانشجویان مقطع کارشناسی
  • اعضای کمیته‌های ترفیع و ارتقای اعضای هیئت علمی

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

اقتصاددانان آموزش 40%مدیران دانشگاهی 30%حامیان حقوق اساتید 30%
  1. [1]Journal of Political Economyاقتصاددانان آموزش

    Does Professor Quality Matter? Evidence from Random Assignment of Students to Professors

    مطالعه در Journal of Political Economy →
  2. [2]Economics of Education Reviewاقتصاددانان آموزش

    Evaluating Students' Evaluations of Professors

    مطالعه در Economics of Education Review →
  3. [3]Studies in Educational Evaluationاقتصاددانان آموزش

    Meta-analysis of faculty's teaching effectiveness: Student evaluation of teaching ratings and student learning are not related

    مطالعه در Studies in Educational Evaluation →
  4. [4]ScienceOpen Researchاقتصاددانان آموزش

    Student evaluations of teaching (mostly) do not measure teaching effectiveness

    مطالعه در ScienceOpen Research →
  5. [5]تیم سردبیری کوهستانحامیان حقوق اساتید

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار آموزش با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.