هوش مصنوعی چگونه در پیشبینی، به سطح پیشگویان برتر انسانی رسیده است؟
سامانههای هوش مصنوعی مجهز به جستجوی عاملمحور (Agentic Search) و کالیبراسیون آماری، اکنون در معیارهای اصلی، به دقت پیشبینیای دست یافتهاند که از نظر آماری با پیشگویان برتر انسانی قابل تمایز نیست.
به قلم غزل بختیاری
این خبر را به اشتراک بگذارید
- پیشگویان تجاری هوش مصنوعی
- توسعهدهندگانی که چارچوبهای تخصصی میسازند تا مدلهای زبان را به موتورهای پیشبینی خودمختار تبدیل کنند.
- مدیران معیارها
- سازمانهایی که به سنجش پیشرفت هوش مصنوعی از طریق آزمایشهای دقیق و عاری از آلودگی اختصاص دارند.
- پیشگویان برتر انسانی
- پیشبینیکنندگان نخبه انسانی که به قضاوت کیفی و استدلال ساختاریافته متکی هستند.
بررسی عمیق دیدگاهها
مدیران معیارها
سازمانهایی که به سنجش پیشرفت هوش مصنوعی از طریق آزمایشهای دقیق و عاری از آلودگی اختصاص دارند.
مؤسساتی مانند مؤسسه تحقیقات پیشبینی و متاکولوس استدلال میکنند که تنها راه واقعی برای سنجش هوش مصنوعی، آزمایش آن در برابر آینده است. از آنجایی که مدلهای زبان بزرگ حجم عظیمی از دادههای تاریخی را در طول آموزش جذب میکنند، آزمایشهای گذشتهنگر در معرض آلودگی قرار دارند. با وادار کردن مدلها به پیشبینی رویدادهایی که هنوز رخ ندادهاند و نمرهدهی به آنها ماهها بعد، این مدیران تنها مدرک قابل تأیید از قابلیتهای استدلالی را ارائه میدهند و هیاهوی بازاریابی را کنار میزنند تا پیشرفت واقعی را آشکار سازند.
پیشگویان تجاری هوش مصنوعی
توسعهدهندگانی که چارچوبهای تخصصی میسازند تا مدلهای زبان را به موتورهای پیشبینی خودمختار تبدیل کنند.
برای توسعهدهندگان تجاری و صندوقهای کمی، قابلیت پایه یک مدل زبان صرفاً نقطه شروع است. تیمهایی در آزمایشگاههای AIA Bridgewater و FutureSearch استدلال میکنند که قدرت پیشبینی واقعی از معماری ساخته شده در اطراف مدل ناشی میشود. آنها با پیادهسازی جستجوی عاملمحور، بحث چندعاملی و کالیبراسیون آماری، یک تولیدکننده متن ایستا را به یک موتور تحقیقاتی پویا تبدیل میکنند که قادر به پردازش اخبار زنده و اجرای معاملات در مقیاسی است که هیچ تیم انسانی نمیتواند با آن رقابت کند.
پیشگویان برتر انسانی
پیشبینیکنندگان نخبه انسانی که به قضاوت کیفی و استدلال ساختاریافته متکی هستند.
در حالی که ماشینها در پردازش مجموعهدادههای عظیم و ردیابی بهروزرسانیهای با فرکانس بالا برتری دارند، پیشگویان برتر انسانی معتقدند که آنها همچنان در محیطهای جدید و کمداده مزیت دارند. هنگامی که اطلاعات عمومی کمیاب است یا زمانی که نتیجه به مانورهای ژئوپلیتیک بیسابقهای بستگی دارد، قضاوت کیفی و شهود ظریف یک متخصص انسانی آموزشدیده همچنان برای سامانههای الگوریتمی دشوار است که بتوانند آن را تکرار کنند. بسیاری در این گروه، هوش مصنوعی را نه به عنوان جایگزین، بلکه به عنوان یک دستیار تحقیقاتی قدرتمند میبینند که جریان کاری پیشبینی خودشان را تقویت میکند.
چرا مهم است
از آنجایی که سامانههای هوش مصنوعی در دقت پیشبینی با پیشگویان برتر انسانی برابری میکنند، کسبوکارها و دولتها به پیشبینیهای استراتژیک بسیار دقیق و در دسترس دست مییابند. این تحول تهدید میکند که جمعآوری اطلاعاتی را که در حال حاضر محرک بازارهای مالی و برنامهریزیهای ژئوپلیتیک است، به یک کالای عمومی تبدیل کند.
مسئولان اصلیترین معیارهای پیشبینی جهان—مؤسسه تحقیقات پیشبینی (Forecasting Research Institute) و متاکولوس (Metaculus)—حرف آخر را در مورد پیشی گرفتن هوش مصنوعی از مهارت پیشبینی انسان میزنند. آنها در حال حاضر مشغول نمرهدهی به گروههای شرکتکننده در تورنمنت تابستان ۲۰۲۶ هستند و ارزیابی میکنند که عوامل ماشینی تا چه حد توانستهاند رویدادهای واقعی را پیش از وقوع پیشبینی کنند. زمانی که پاسخ نهایی این پرسشها در پاییز مشخص شود، این سازمانها نمراتی را منتشر خواهند کرد که یا برابری آماری ماشینها با پیشگویان برتر انسانی را تأیید میکند، یا نشان میدهد که ماشینها از آنها جلو افتادهاند.[1][2]
صنعت فناوری سال ۲۰۲۶ را صرف بازاریابی برای ورود قریبالوقوع «فرا هوشمندی» و عوامل خودمختاری کرده است که میتوانند کل کسبوکارها را اداره کنند. اما قابلیت واقعی که عرضه شده، محدودتر اما قابل تأیید است: سامانههای چندعاملی تخصصی که رویدادهای مجزای آینده—مانند حاشیه انتخابات، تصمیمات نرخ بهره و نقاط عطف فناوری—را پیشبینی میکنند. دگر توران، مدیرعامل متاکولوس، هنگام راهاندازی معیار FutureEval خاطرنشان کرد: «مدلهای هوش مصنوعی هنوز از حرفهایها بهتر نیستند، اما با سرعتی پیشرفت میکنند که باید برای جهانی که در آن بهتر خواهند بود، آماده شویم.»[2]
پیشبینی یکی از معدود حوزههایی است که در آن میتوان استدلال را در برابر واقعیت، بدون خطر آلودگی مجموعه آزمایشی، سنجید. در معیار ForecastBench مؤسسه تحقیقات پیشبینی، پیشگویان برتر انسانی در حال حاضر امتیاز بریر (Brier score) معادل ۰٫۰۸۶ دارند که به شاخص بریر ۷۰٫۶ درصد (٪۷۰٫۶) ترجمه میشود. این معیار ارزیابی میکند که پیشبینیهای احتمالی چقدر از حقیقت نهایی فاصله میگیرند؛ این مقیاس طوری تنظیم شده که ۵۰ درصد (٪۵۰) نشاندهنده حدس ناآگاهانه و ۱۰۰ درصد (٪۱۰۰) نشاندهنده بینش کامل است.[1]
مدلهای پیشرو هوش مصنوعی، که بدون ابزارهای اضافی و به صورت خام ارزیابی میشوند، در همین شاخص حدود ۶۷٫۹ درصد (٪۶۷٫۹) امتیاز کسب میکنند. شکاف بین ۷۰٫۶ و ۶۷٫۹ نشاندهنده تفاوت میان نخبهترین پیشبینیکنندگان انسانی جهان و یک مدل زبان خام است که تلاش میکند آینده را صرفاً بر اساس وزنهای آموزشی خود حدس بزند.[1]
با این حال، وقتی مدلها در چارچوبهای تخصصی قرار میگیرند، این شکاف از بین میرود. در نوامبر ۲۰۲۵، آزمایشگاههای AIA شرکت Bridgewater گزارشی فنی درباره سامانه AIA Forecaster خود منتشر کردند؛ سامانهای که در زیرمجموعهای از پرسشهای ForecastBench به امتیاز بریر ۰٫۱۰۸ دست یافت. این نتیجه از نظر آماری با میانه پیشگویان برتر انسانی (۰٫۱۱۱) در همان مجموعه، قابل تمایز نبود.[3]
با این حال، وقتی مدلها در چارچوبهای تخصصی قرار میگیرند، این شکاف از بین میرود.
معماری این سامانهها نشان میدهد که اندازه خام مدل دیگر عامل اصلی تمایز نیست. AIA Forecaster و سامانههای مشابه مانند FutureSearch—که در حال حاضر در تورنمنت FutureEval تابستان ۲۰۲۶ متاکولوس در میان ۱۶۳ ربات رقیب پیشتاز است—به شدت به جستجوی عاملمحور (Agentic Search) متکی هستند.[3]
این مدلها به جای پاسخ دادن بر اساس وزنهای از پیش آموزشدیده، به طور خودکار وب را جستجو میکنند، منابع خبری با کیفیت بالا را بازیابی کرده و دادههای روز را ترکیب میکنند و سپس یک احتمال تولید میکنند. هنگامی که Bridgewater در طول آزمایش، عملکرد جستجو را غیرفعال کرد، امتیاز بریر سامانه از ۰٫۱۰۰ به ۰٫۳۶۰ سقوط کرد و دقت آن حتی از پرتاب تصادفی سکه نیز کمتر شد.[3]
مکانیزم حیاتی دوم، تجمیع (Ensembling) و سازگاری توسط عامل ناظر است. توسعهدهندگان به جای تولید یک پیشبینی واحد، چندین عامل پیشبینی مستقل را فعال میکنند. سپس یک عامل ناظر، پیشبینیهای متفاوت را بررسی کرده، اختلافات را شناسایی میکند، جستجوهای هدفمند را برای حل آن تعارضات انجام میدهد و در نهایت یک پیشبینی تجمیعشده نهایی ارائه میدهد.[3]
حتی با وجود تحقیقات گسترده، مدلهای زبان بزرگ یک نقص رفتاری پایدار از خود نشان میدهند: آنها احتیاط میکنند. مدلهای از پیش آموزشدیده به طور سیستماتیک پیشبینیهای مطمئن را به سمت عدم قطعیت فشرده میکنند و برای رویدادی که ۸۵ درصد احتمال وقوع دارد، احتمال ۶۰ درصد را خروجی میدهند.
برای مقابله با این مشکل، توسعهدهندگان از تکنیکهای کالیبراسیون آماری، مانند مقیاسبندی پلات (Platt scaling) یا افراطیسازی فضای لوجیت (logit-space extremization)، استفاده میکنند که از نظر ریاضی احتمالات مدل را به صفر یا یک نزدیکتر میکند. این مرحله پسپردازش به طور جهانی در میان رباتهای برتر تورنمنت اعمال میشود.[3]
جدیدترین پیشرفت، که توسط FutureSearch در جولای ۲۰۲۶ به کار گرفته شد، مدلسازی صریح جهان (explicit world modeling) است. این سامانه به جای بررسی هر سؤال به صورت مجزا، محرکهای مشترک پشت رویدادهای مهم آینده را کشف میکند و هر پیشبینی جدید را با هزاران پیشبینی گذشته تطبیق میدهد. این رویکرد ماتریس تأثیر متقابل، امتیاز بریر نُه مدل پایه مختلف را در طول آزمایش بهبود بخشید و نشان داد که سازگاری ساختاری، دقت بالاتری به همراه دارد.
با وجود ادعاهای بازاریابی مبنی بر بینش فراانسانی، آزمون نهایی همچنان بازارهای پیشبینی زنده است که در آن سرمایه واقعی به کار گرفته میشود. در معیار MarketLiquid، که ۱٬۶۱۰ سؤال از پلتفرمهای پیشبینی عمومی را ردیابی میکند، AIA Forecaster به امتیاز بریر ۰٫۱۲۶ دست یافت که از امتیاز اجماع بازار (۰٫۱۱۱) ضعیفتر بود. با این حال، یک تجمیع که هوش مصنوعی را با اجماع بازار ترکیب میکرد، به امتیاز ۰٫۱۰۶ رسید و از خود بازار به تنهایی بهتر عمل کرد. ماشینها بازارهای انسانی را منسوخ نکردهاند، اما اکنون اطلاعات متنوع و افزودهای را فراهم میکنند که برای غلبه بر آنها لازم است.[3]
منابع
[1]Forecasting Research Instituteمدیران معیارهاForecastBench: A dynamic benchmark of LLM forecasting accuracy
مطالعه در Forecasting Research Institute →
[2]Metaculusمدیران معیارهاFutureEval: Measure the Forecasting Accuracy of AI
مطالعه در Metaculus →
[3]arXivپیشگویان تجاری هوش مصنوعیAIA Forecaster: Technical Report
مطالعه در arXiv →
[4]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.


