پژوهش مرکز پیو: خطای ۱۰ تا ۱۹ درصدی نظرسنجیهای مبتنی بر هوش مصنوعی در برآورد میزان حمایت از جنگ علیه ایران
موسسات افکارسنجی که به دنبال جایگزینی انسانها با مدلهای هوش مصنوعی بودند، اکنون با یک مانع آماری جدی روبهرو شدهاند. مطالعه جدید مرکز تحقیقات پیو نشان میدهد که پاسخدهندگان مصنوعی در شبیهسازی افکار عمومی، بهویژه در موضوعات حساس ژئوپلیتیک مانند درگیریهای نظامی با ایران، دچار خطاهای سیستماتیک و سوگیریهای شدید میشوند.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
موسسات نظرسنجی و پژوهشگران داده که برای کاهش هزینهها در حال تصمیمگیری درباره استفاده از هوش مصنوعی به جای انسانها هستند، اکنون یک مبنای تجربی روشن در اختیار دارند. مرکز تحقیقات پیو در ۳۰ سپتامبر ۲۰۲۶ با انتشار یک گزارش جامع اعلام کرد که این فناوری هنوز برای جایگزینی با انسانها آماده نیست.[1]
این مطالعه در زمانی منتشر میشود که بخشهایی از صنعت افکارسنجی به شدت در تلاشند تا با استفاده از پاسخدهندگان «مصنوعی»، سرعت استخراج نتایج را افزایش و هزینههای عملیاتی را کاهش دهند. با این حال، دادههای جدید نشان میدهد که این رویکرد به قیمت از دست رفتن دقت تمام میشود.[2]
مرکز تحقیقات پیو در این آزمایش روششناختی، از مدلهای پیشرفته هوش مصنوعی به عنوان جایگزین ۱۵ هزار پاسخدهنده واقعی در پنل روندهای آمریکایی استفاده کرد. محققان میخواستند بدانند آیا یک ماشین میتواند پیچیدگیهای ذهنی انسانها را در مواجهه با پرسشهای سیاسی و اجتماعی بازتولید کند یا خیر.[1][3]
مکانیسم همزاد دیجیتال و خطای پایه
برای انجام این کار، پژوهشگران از روشی به نام «همزاد دیجیتال» استفاده کردند. آنها پروفایلهای جمعیتی، سوابق رایدهی و پاسخهای پیشین هر فرد به ۷۱ پرسش در سال ۲۰۲۵ را به مدل «کلود اوپوس ۴.۶» تغذیه کردند تا رفتار دقیق همان شخص را شبیهسازی کند.[2]
با وجود این شخصیسازی دقیق، نتایج نهایی ناامیدکننده بود. در بررسی نزدیک به ۳۰۰ پرسش مختلف در سه موج نظرسنجی، پاسخهای تولید شده توسط هوش مصنوعی به طور میانگین ۱۲ واحد درصد با پاسخهای انسانهای واقعی اختلاف داشتند.[1][2]
این انحراف آماری در برخی موارد بسیار شدیدتر بود. بر اساس گزارش منتشر شده، در ۲۸ درصد از پرسشها، میزان خطای مدل از ۱۵ واحد درصد فراتر رفت و در برخی گزینههای خاص، این اختلاف به ۲۰، ۳۰ یا حتی بیش از ۴۰ واحد درصد رسید.[2][3]
خطای محاسباتی در ارزیابی تنشهای ژئوپلیتیک
یکی از بزرگترین انحرافات آماری در این پژوهش، مربوط به ارزیابی افکار عمومی درباره درگیریهای نظامی اخیر میان ایالات متحده، اسرائیل و ایران بود که از ۲۸ فوریه ۲۰۲۶ آغاز شد. مدل هوش مصنوعی میزان حمایت عمومی از این درگیریها را به شکل چشمگیری بالاتر از واقعیت برآورد کرد.[1][2]
بر اساس دادههای این مرکز، برآوردهای هوش مصنوعی بین ۱۰ تا ۱۹ واحد درصد بیشتر از پاسخهای انسانهای واقعی بود. این خطا در موضوعاتی نظیر تایید حملات نظامی علیه ایران و پیشبینی پیامدهای این درگیری برای مردم ایران به وضوح مشاهده شد.[1]
این سوگیری در میان گروههای سیاسی خاص شدت بیشتری داشت. به عنوان مثال، در حالی که ۶۷ درصد از جمهوریخواهان واقعی در نظرسنجیها از حملات نظامی حمایت کرده بودند، مدل هوش مصنوعی این رقم را برای همزادهای دیجیتال جمهوریخواه ۹۳ درصد تخمین زد.[1][2]
هوش مصنوعی در پیشبینی نظرات دموکراتها نیز دچار خطای فاحش شد. در نظرسنجی مصنوعی، ۹۴ درصد از دموکراتها معتقد بودند که این درگیری وضعیت مردم ایران را بدتر خواهد کرد، در حالی که در دنیای واقعی تنها ۵۶ درصد از آنها چنین نظری داشتند.[1]
تکیه بر کلیشهها و حذف تنوع انسانی
دلیل اصلی این انحرافات آماری، اتکای مدلهای زبانی بزرگ به الگوهای از پیشآموخته و کلیشههای گروهی است. هوش مصنوعی به جای درک تفاوتهای ظریف فردی، تمایل دارد نظرات را به سمت افراطیترین و یکدستترین حالتهای مرتبط با یک گروه جمعیتی سوق دهد.[2][4]
این تکیه بر کلیشهها در سایر موضوعات نیز خود را نشان داد. هوش مصنوعی پیشبینی کرد که ۹۷ درصد از بزرگسالان اسپانیاییتبار مسابقات جام جهانی فوتبال را دنبال میکنند، در حالی که این رقم در میان پاسخدهندگان واقعی تنها ۴۳ درصد بود.[2]
علاوه بر موضوعات ژئوپلیتیک، این خطاها در مسائل داخلی نیز تکرار شد. هوش مصنوعی آگاهی عمومی درباره مراکز داده را به شدت اشتباه محاسبه کرد و نشان داد که مدلها در مواجهه با موضوعات نوظهور که در دادههای آموزشی آنها وجود ندارد، به سادگی دچار توهم آماری میشوند.[1][3]
علاوه بر این، پاسخدهندگان مصنوعی اغلب از انتخاب برخی گزینهها به طور کامل اجتناب میکردند. در ۴۷ درصد از پرسشهای این نظرسنجی مصنوعی، حداقل یک گزینه وجود داشت که حتی توسط یک پاسخدهنده هوش مصنوعی نیز انتخاب نشد، اتفاقی که در نظرسنجیهای انسانی بسیار نادر است.[1]
توزیع خطا در میان گروههای جمعیتی
بررسی دقیقتر دادهها نشان میدهد که میزان خطای هوش مصنوعی در میان تمام گروههای جمعیتی یکسان نبوده است. این فناوری در شبیهسازی نظرات برخی از اقلیتها و گروههای سیاسی عملکرد به مراتب ضعیفتری از خود نشان داد.[1][3]
میانگین خطای مدل برای پاسخدهندگان سیاهپوست ۱۵.۱ واحد درصد و برای جمهوریخواهان ۱۶.۱ واحد درصد بود، در حالی که این رقم برای بزرگسالان سفیدپوست ۱۲.۵ واحد درصد ثبت شد. هیچ گروه جمعیتی در این مطالعه میانگین خطایی کمتر از ۱۲ واحد درصد نداشت.[1][2]
ناتوانی هوش مصنوعی در درک تجربیات روزمره نیز مشهود بود. در حالی که ۳۰ درصد از انسانهای واقعی گزارش دادند که در خوابیدن مشکل دارند، هوش مصنوعی ۹۸ درصد از افراد را در دستههای میانی قرار داد و تنوع مشکلات خواب را کاملاً نادیده گرفت.[3]
ناتوانی در درک رویدادهای جدید
یکی دیگر از نقاط ضعف اساسی، ناتوانی هوش مصنوعی در ثبت تغییرات افکار عمومی در طول زمان است. دادههای آموزشی مدل کلود اوپوس ۴.۶ در ماه مه ۲۰۲۵ به پایان رسیده بود و این موضوع باعث شد تا مدل نتواند افت محبوبیت دونالد ترامپ را در سال ۲۰۲۶ تشخیص دهد.[1][2]
به عنوان نمونه، هوش مصنوعی میزان تایید عملکرد ترامپ را در ماههای ژانویه و آوریل ۲۰۲۶ روی عدد ثابت ۴۶ درصد نگه داشت. این در حالی است که نظرسنجیهای واقعی نشاندهنده افت این رقم به ۳۷ درصد و سپس ۳۴ درصد در این بازه زمانی بودند.[2][3]
آینده نظرسنجیها و حفظ صدای انسان
مرکز تحقیقات پیو با انتشار این نتایج تاکید کرد که گفتوگوی مستقیم با مردم برای سنجش دقیق افکار عمومی غیرقابل جایگزین است. این نهاد اعلام کرد که هیچ برنامهای برای استفاده از مدلهای هوش مصنوعی جهت تولید دادههای نظرسنجی ندارد.[1]
گزارش مرکز تحقیقات پیو در نتیجهگیری خود به صراحت اعلام میکند: «نظرسنجی مبتنی بر هوش مصنوعی به هیچ وجه جایگزینی برای نظرسنجی دقیق از انسانهای واقعی نیست.» این نهاد تاکید دارد که صدای انسانها همچنان محور اصلی پژوهشها باقی خواهد ماند.[2]
در نهایت، این آزمایش نشان میدهد که اگرچه هوش مصنوعی میتواند ابزار مفیدی برای تحلیل دادههای کلان باشد، اما نمیتواند جایگزین تجربه زیسته و نظرات متغیر انسانها شود. برای درک واقعی جامعه، پژوهشگران همچنان باید به روشهای سنتی و پرهزینهتر نظرسنجی متکی بمانند.[4]
نکات کلیدی
- مطالعه جدید مرکز تحقیقات پیو نشان داد که هوش مصنوعی در شبیهسازی نظرسنجیها به طور میانگین ۱۲ واحد درصد خطا دارد.
- مدلهای هوش مصنوعی میزان حمایت از درگیری نظامی با ایران را بین ۱۰ تا ۱۹ واحد درصد بیشتر از واقعیت برآورد کردند.
- این فناوری به جای درک تفاوتهای فردی، به شدت بر کلیشههای گروهی و الگوهای افراطی تکیه میکند.
- مرکز پیو اعلام کرد که هیچ برنامهای برای جایگزینی انسانها با هوش مصنوعی در نظرسنجیهای خود ندارد.
آنچه نمیدانیم
- مشخص نیست که آیا نسخههای آینده و پیشرفتهتر مدلهای زبانی بزرگ قادر به کاهش این خطای ساختاری خواهند بود یا خیر.
- هنوز ابعاد کامل تاثیر استفاده پنهان برخی موسسات کوچکتر از این فناوری بر کیفیت دادههای عمومی روشن نیست.
- پژوهشگران داده و افکارسنجی
- تاکید بر حفظ یکپارچگی روششناختی و غیرقابل جایگزین بودن انسانها در نظرسنجیها.
- ناظران فناوری و رسانه
- هشدار درباره خطرات استفاده زودهنگام از هوش مصنوعی در تصمیمسازیهای کلان.
دیدگاههایی که این گزارش پوشش نداده
- شرکتهای توسعهدهنده هوش مصنوعی
- موسسات نظرسنجی تجاری کوچک
منابع
[1]Pew Research Centerپژوهشگران داده و افکارسنجیCan AI Stand In for Human Survey-Takers? Not Really
مطالعه در Pew Research Center →
[2]ThePrintناظران فناوری و رسانهArtificial intelligence cannot replace people in opinion polls, at least for now, a study by the Pew Research Center has found
مطالعه در ThePrint →
[3]FingerLakes1ناظران فناوری و رسانهAI stand-ins miss the mark in Pew polling experiment
مطالعه در FingerLakes1 →
[4]تیم سردبیری کوهستانپژوهشگران داده و افکارسنجیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →تورم ایران
پیشبینی اقتصاددانان از تورم ۹۹ درصدی در پایان سال ۱۴۰۵ در تقابل با آمارهای بانک مرکزی
2 منبع
بحران ثبتنام
کاهش ۸۰ هزار نفری ثبتنام کلاساولیها در ایران؛ تقابل روایتهای جمعیتی و اقتصادی
4 منبع
مدلسازی بقا
مدل آماری نشان میدهد ۸۷ درصد از بیماران میلوما با تک-دارا به طول عمر طبیعی میرسند
4 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





