رفتن به محتوای اصلی
کوهستان
خطای هوش مصنوعیمرکز تحقیقات پیو· 5 دقیقه مطالعه· در تحلیل داده

پژوهش مرکز پیو: خطای ۱۰ تا ۱۹ درصدی نظرسنجی‌های مبتنی بر هوش مصنوعی در برآورد میزان حمایت از جنگ علیه ایران

موسسات افکارسنجی که به دنبال جایگزینی انسان‌ها با مدل‌های هوش مصنوعی بودند، اکنون با یک مانع آماری جدی روبه‌رو شده‌اند. مطالعه جدید مرکز تحقیقات پیو نشان می‌دهد که پاسخ‌دهندگان مصنوعی در شبیه‌سازی افکار عمومی، به‌ویژه در موضوعات حساس ژئوپلیتیک مانند درگیری‌های نظامی با ایران، دچار خطاهای سیستماتیک و سوگیری‌های شدید می‌شوند.

به قلم فرشید جمشیدی

موسسات نظرسنجی و پژوهشگران داده که برای کاهش هزینه‌ها در حال تصمیم‌گیری درباره استفاده از هوش مصنوعی به جای انسان‌ها هستند، اکنون یک مبنای تجربی روشن در اختیار دارند. مرکز تحقیقات پیو در ۳۰ سپتامبر ۲۰۲۶ با انتشار یک گزارش جامع اعلام کرد که این فناوری هنوز برای جایگزینی با انسان‌ها آماده نیست.[1]

این مطالعه در زمانی منتشر می‌شود که بخش‌هایی از صنعت افکارسنجی به شدت در تلاشند تا با استفاده از پاسخ‌دهندگان «مصنوعی»، سرعت استخراج نتایج را افزایش و هزینه‌های عملیاتی را کاهش دهند. با این حال، داده‌های جدید نشان می‌دهد که این رویکرد به قیمت از دست رفتن دقت تمام می‌شود.[2]

مرکز تحقیقات پیو در این آزمایش روش‌شناختی، از مدل‌های پیشرفته هوش مصنوعی به عنوان جایگزین ۱۵ هزار پاسخ‌دهنده واقعی در پنل روندهای آمریکایی استفاده کرد. محققان می‌خواستند بدانند آیا یک ماشین می‌تواند پیچیدگی‌های ذهنی انسان‌ها را در مواجهه با پرسش‌های سیاسی و اجتماعی بازتولید کند یا خیر.[1][3]

مکانیسم همزاد دیجیتال و خطای پایه

برای انجام این کار، پژوهشگران از روشی به نام «همزاد دیجیتال» استفاده کردند. آن‌ها پروفایل‌های جمعیتی، سوابق رای‌دهی و پاسخ‌های پیشین هر فرد به ۷۱ پرسش در سال ۲۰۲۵ را به مدل «کلود اوپوس ۴.۶» تغذیه کردند تا رفتار دقیق همان شخص را شبیه‌سازی کند.[2]

با وجود این شخصی‌سازی دقیق، نتایج نهایی ناامیدکننده بود. در بررسی نزدیک به ۳۰۰ پرسش مختلف در سه موج نظرسنجی، پاسخ‌های تولید شده توسط هوش مصنوعی به طور میانگین ۱۲ واحد درصد با پاسخ‌های انسان‌های واقعی اختلاف داشتند.[1][2]

اختلاف فاحش میان برآورد هوش مصنوعی و پاسخ‌های واقعی انسان‌ها در موضوعات ژئوپلیتیک.

این انحراف آماری در برخی موارد بسیار شدیدتر بود. بر اساس گزارش منتشر شده، در ۲۸ درصد از پرسش‌ها، میزان خطای مدل از ۱۵ واحد درصد فراتر رفت و در برخی گزینه‌های خاص، این اختلاف به ۲۰، ۳۰ یا حتی بیش از ۴۰ واحد درصد رسید.[2][3]

خطای محاسباتی در ارزیابی تنش‌های ژئوپلیتیک

یکی از بزرگ‌ترین انحرافات آماری در این پژوهش، مربوط به ارزیابی افکار عمومی درباره درگیری‌های نظامی اخیر میان ایالات متحده، اسرائیل و ایران بود که از ۲۸ فوریه ۲۰۲۶ آغاز شد. مدل هوش مصنوعی میزان حمایت عمومی از این درگیری‌ها را به شکل چشمگیری بالاتر از واقعیت برآورد کرد.[1][2]

بر اساس داده‌های این مرکز، برآوردهای هوش مصنوعی بین ۱۰ تا ۱۹ واحد درصد بیشتر از پاسخ‌های انسان‌های واقعی بود. این خطا در موضوعاتی نظیر تایید حملات نظامی علیه ایران و پیش‌بینی پیامدهای این درگیری برای مردم ایران به وضوح مشاهده شد.[1]

این سوگیری در میان گروه‌های سیاسی خاص شدت بیشتری داشت. به عنوان مثال، در حالی که ۶۷ درصد از جمهوری‌خواهان واقعی در نظرسنجی‌ها از حملات نظامی حمایت کرده بودند، مدل هوش مصنوعی این رقم را برای همزادهای دیجیتال جمهوری‌خواه ۹۳ درصد تخمین زد.[1][2]

هوش مصنوعی در پیش‌بینی نظرات دموکرات‌ها نیز دچار خطای فاحش شد. در نظرسنجی مصنوعی، ۹۴ درصد از دموکرات‌ها معتقد بودند که این درگیری وضعیت مردم ایران را بدتر خواهد کرد، در حالی که در دنیای واقعی تنها ۵۶ درصد از آن‌ها چنین نظری داشتند.[1]

تکیه بر کلیشه‌ها و حذف تنوع انسانی

دلیل اصلی این انحرافات آماری، اتکای مدل‌های زبانی بزرگ به الگوهای از پیش‌آموخته و کلیشه‌های گروهی است. هوش مصنوعی به جای درک تفاوت‌های ظریف فردی، تمایل دارد نظرات را به سمت افراطی‌ترین و یکدست‌ترین حالت‌های مرتبط با یک گروه جمعیتی سوق دهد.[2][4]

توزیع خطای شبیه‌سازی هوش مصنوعی در میان گروه‌های مختلف جمعیتی.

این تکیه بر کلیشه‌ها در سایر موضوعات نیز خود را نشان داد. هوش مصنوعی پیش‌بینی کرد که ۹۷ درصد از بزرگسالان اسپانیایی‌تبار مسابقات جام جهانی فوتبال را دنبال می‌کنند، در حالی که این رقم در میان پاسخ‌دهندگان واقعی تنها ۴۳ درصد بود.[2]

علاوه بر موضوعات ژئوپلیتیک، این خطاها در مسائل داخلی نیز تکرار شد. هوش مصنوعی آگاهی عمومی درباره مراکز داده را به شدت اشتباه محاسبه کرد و نشان داد که مدل‌ها در مواجهه با موضوعات نوظهور که در داده‌های آموزشی آن‌ها وجود ندارد، به سادگی دچار توهم آماری می‌شوند.[1][3]

علاوه بر این، پاسخ‌دهندگان مصنوعی اغلب از انتخاب برخی گزینه‌ها به طور کامل اجتناب می‌کردند. در ۴۷ درصد از پرسش‌های این نظرسنجی مصنوعی، حداقل یک گزینه وجود داشت که حتی توسط یک پاسخ‌دهنده هوش مصنوعی نیز انتخاب نشد، اتفاقی که در نظرسنجی‌های انسانی بسیار نادر است.[1]

توزیع خطا در میان گروه‌های جمعیتی

بررسی دقیق‌تر داده‌ها نشان می‌دهد که میزان خطای هوش مصنوعی در میان تمام گروه‌های جمعیتی یکسان نبوده است. این فناوری در شبیه‌سازی نظرات برخی از اقلیت‌ها و گروه‌های سیاسی عملکرد به مراتب ضعیف‌تری از خود نشان داد.[1][3]

میانگین خطای مدل برای پاسخ‌دهندگان سیاه‌پوست ۱۵.۱ واحد درصد و برای جمهوری‌خواهان ۱۶.۱ واحد درصد بود، در حالی که این رقم برای بزرگسالان سفیدپوست ۱۲.۵ واحد درصد ثبت شد. هیچ گروه جمعیتی در این مطالعه میانگین خطایی کمتر از ۱۲ واحد درصد نداشت.[1][2]

ناتوانی هوش مصنوعی در درک تجربیات روزمره نیز مشهود بود. در حالی که ۳۰ درصد از انسان‌های واقعی گزارش دادند که در خوابیدن مشکل دارند، هوش مصنوعی ۹۸ درصد از افراد را در دسته‌های میانی قرار داد و تنوع مشکلات خواب را کاملاً نادیده گرفت.[3]

تصویرسازی: محققان برای این آزمایش از پروفایل‌های واقعی ۱۵ هزار نفر برای ساخت همزادهای دیجیتال استفاده کردند.

ناتوانی در درک رویدادهای جدید

یکی دیگر از نقاط ضعف اساسی، ناتوانی هوش مصنوعی در ثبت تغییرات افکار عمومی در طول زمان است. داده‌های آموزشی مدل کلود اوپوس ۴.۶ در ماه مه ۲۰۲۵ به پایان رسیده بود و این موضوع باعث شد تا مدل نتواند افت محبوبیت دونالد ترامپ را در سال ۲۰۲۶ تشخیص دهد.[1][2]

به عنوان نمونه، هوش مصنوعی میزان تایید عملکرد ترامپ را در ماه‌های ژانویه و آوریل ۲۰۲۶ روی عدد ثابت ۴۶ درصد نگه داشت. این در حالی است که نظرسنجی‌های واقعی نشان‌دهنده افت این رقم به ۳۷ درصد و سپس ۳۴ درصد در این بازه زمانی بودند.[2][3]

آینده نظرسنجی‌ها و حفظ صدای انسان

مرکز تحقیقات پیو با انتشار این نتایج تاکید کرد که گفت‌وگوی مستقیم با مردم برای سنجش دقیق افکار عمومی غیرقابل جایگزین است. این نهاد اعلام کرد که هیچ برنامه‌ای برای استفاده از مدل‌های هوش مصنوعی جهت تولید داده‌های نظرسنجی ندارد.[1]

گزارش مرکز تحقیقات پیو در نتیجه‌گیری خود به صراحت اعلام می‌کند: «نظرسنجی مبتنی بر هوش مصنوعی به هیچ وجه جایگزینی برای نظرسنجی دقیق از انسان‌های واقعی نیست.» این نهاد تاکید دارد که صدای انسان‌ها همچنان محور اصلی پژوهش‌ها باقی خواهد ماند.[2]

در نهایت، این آزمایش نشان می‌دهد که اگرچه هوش مصنوعی می‌تواند ابزار مفیدی برای تحلیل داده‌های کلان باشد، اما نمی‌تواند جایگزین تجربه زیسته و نظرات متغیر انسان‌ها شود. برای درک واقعی جامعه، پژوهشگران همچنان باید به روش‌های سنتی و پرهزینه‌تر نظرسنجی متکی بمانند.[4]

نکات کلیدی

  1. مطالعه جدید مرکز تحقیقات پیو نشان داد که هوش مصنوعی در شبیه‌سازی نظرسنجی‌ها به طور میانگین ۱۲ واحد درصد خطا دارد.
  2. مدل‌های هوش مصنوعی میزان حمایت از درگیری نظامی با ایران را بین ۱۰ تا ۱۹ واحد درصد بیشتر از واقعیت برآورد کردند.
  3. این فناوری به جای درک تفاوت‌های فردی، به شدت بر کلیشه‌های گروهی و الگوهای افراطی تکیه می‌کند.
  4. مرکز پیو اعلام کرد که هیچ برنامه‌ای برای جایگزینی انسان‌ها با هوش مصنوعی در نظرسنجی‌های خود ندارد.

آنچه نمی‌دانیم

  • مشخص نیست که آیا نسخه‌های آینده و پیشرفته‌تر مدل‌های زبانی بزرگ قادر به کاهش این خطای ساختاری خواهند بود یا خیر.
  • هنوز ابعاد کامل تاثیر استفاده پنهان برخی موسسات کوچک‌تر از این فناوری بر کیفیت داده‌های عمومی روشن نیست.
پژوهشگران داده و افکارسنجی 60%ناظران فناوری و رسانه 40%
پژوهشگران داده و افکارسنجی
تاکید بر حفظ یکپارچگی روش‌شناختی و غیرقابل جایگزین بودن انسان‌ها در نظرسنجی‌ها.
ناظران فناوری و رسانه
هشدار درباره خطرات استفاده زودهنگام از هوش مصنوعی در تصمیم‌سازی‌های کلان.

دیدگاه‌هایی که این گزارش پوشش نداده

  • شرکت‌های توسعه‌دهنده هوش مصنوعی
  • موسسات نظرسنجی تجاری کوچک

منابع

پوشش منابع

4 منبع

2 دیدگاه شناسایی‌شده

پژوهشگران داده و افکارسنجی 60%ناظران فناوری و رسانه 40%
  1. [1]Pew Research Centerپژوهشگران داده و افکارسنجی

    Can AI Stand In for Human Survey-Takers? Not Really

    مطالعه در Pew Research Center →
  2. [2]ThePrintناظران فناوری و رسانه

    Artificial intelligence cannot replace people in opinion polls, at least for now, a study by the Pew Research Center has found

    مطالعه در ThePrint →
  3. [3]FingerLakes1ناظران فناوری و رسانه

    AI stand-ins miss the mark in Pew polling experiment

    مطالعه در FingerLakes1 →
  4. [4]تیم سردبیری کوهستانپژوهشگران داده و افکارسنجی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.