رفتن به محتوای اصلی
Koohestun
پیش‌بینی با هوش مصنوعیتوضیح· 5 دقیقه مطالعه· در متا

هوش مصنوعی چگونه در پیش‌بینی، به سطح پیشگویان برتر انسانی رسیده است؟

سامانه‌های هوش مصنوعی مجهز به جستجوی عامل‌محور (Agentic Search) و کالیبراسیون آماری، اکنون در معیارهای اصلی، به دقت پیش‌بینی‌ای دست یافته‌اند که از نظر آماری با پیشگویان برتر انسانی قابل تمایز نیست.

به قلم غزل بختیاری

پیشگویان تجاری هوش مصنوعی 40%مدیران معیارها 35%پیشگویان برتر انسانی 25%
پیشگویان تجاری هوش مصنوعی
توسعه‌دهندگانی که چارچوب‌های تخصصی می‌سازند تا مدل‌های زبان را به موتورهای پیش‌بینی خودمختار تبدیل کنند.
مدیران معیارها
سازمان‌هایی که به سنجش پیشرفت هوش مصنوعی از طریق آزمایش‌های دقیق و عاری از آلودگی اختصاص دارند.
پیشگویان برتر انسانی
پیش‌بینی‌کنندگان نخبه انسانی که به قضاوت کیفی و استدلال ساختاریافته متکی هستند.

بررسی عمیق دیدگاه‌ها

مدیران معیارها

سازمان‌هایی که به سنجش پیشرفت هوش مصنوعی از طریق آزمایش‌های دقیق و عاری از آلودگی اختصاص دارند.

مؤسساتی مانند مؤسسه تحقیقات پیش‌بینی و متاکولوس استدلال می‌کنند که تنها راه واقعی برای سنجش هوش مصنوعی، آزمایش آن در برابر آینده است. از آنجایی که مدل‌های زبان بزرگ حجم عظیمی از داده‌های تاریخی را در طول آموزش جذب می‌کنند، آزمایش‌های گذشته‌نگر در معرض آلودگی قرار دارند. با وادار کردن مدل‌ها به پیش‌بینی رویدادهایی که هنوز رخ نداده‌اند و نمره‌دهی به آنها ماه‌ها بعد، این مدیران تنها مدرک قابل تأیید از قابلیت‌های استدلالی را ارائه می‌دهند و هیاهوی بازاریابی را کنار می‌زنند تا پیشرفت واقعی را آشکار سازند.

پیشگویان تجاری هوش مصنوعی

توسعه‌دهندگانی که چارچوب‌های تخصصی می‌سازند تا مدل‌های زبان را به موتورهای پیش‌بینی خودمختار تبدیل کنند.

برای توسعه‌دهندگان تجاری و صندوق‌های کمی، قابلیت پایه یک مدل زبان صرفاً نقطه شروع است. تیم‌هایی در آزمایشگاه‌های AIA Bridgewater و FutureSearch استدلال می‌کنند که قدرت پیش‌بینی واقعی از معماری ساخته شده در اطراف مدل ناشی می‌شود. آنها با پیاده‌سازی جستجوی عامل‌محور، بحث چندعاملی و کالیبراسیون آماری، یک تولیدکننده متن ایستا را به یک موتور تحقیقاتی پویا تبدیل می‌کنند که قادر به پردازش اخبار زنده و اجرای معاملات در مقیاسی است که هیچ تیم انسانی نمی‌تواند با آن رقابت کند.

پیشگویان برتر انسانی

پیش‌بینی‌کنندگان نخبه انسانی که به قضاوت کیفی و استدلال ساختاریافته متکی هستند.

در حالی که ماشین‌ها در پردازش مجموعه‌داده‌های عظیم و ردیابی به‌روزرسانی‌های با فرکانس بالا برتری دارند، پیشگویان برتر انسانی معتقدند که آنها همچنان در محیط‌های جدید و کم‌داده مزیت دارند. هنگامی که اطلاعات عمومی کمیاب است یا زمانی که نتیجه به مانورهای ژئوپلیتیک بی‌سابقه‌ای بستگی دارد، قضاوت کیفی و شهود ظریف یک متخصص انسانی آموزش‌دیده همچنان برای سامانه‌های الگوریتمی دشوار است که بتوانند آن را تکرار کنند. بسیاری در این گروه، هوش مصنوعی را نه به عنوان جایگزین، بلکه به عنوان یک دستیار تحقیقاتی قدرتمند می‌بینند که جریان کاری پیش‌بینی خودشان را تقویت می‌کند.

چرا مهم است

از آنجایی که سامانه‌های هوش مصنوعی در دقت پیش‌بینی با پیشگویان برتر انسانی برابری می‌کنند، کسب‌وکارها و دولت‌ها به پیش‌بینی‌های استراتژیک بسیار دقیق و در دسترس دست می‌یابند. این تحول تهدید می‌کند که جمع‌آوری اطلاعاتی را که در حال حاضر محرک بازارهای مالی و برنامه‌ریزی‌های ژئوپلیتیک است، به یک کالای عمومی تبدیل کند.

مسئولان اصلی‌ترین معیارهای پیش‌بینی جهان—مؤسسه تحقیقات پیش‌بینی (Forecasting Research Institute) و متاکولوس (Metaculus)—حرف آخر را در مورد پیشی گرفتن هوش مصنوعی از مهارت پیش‌بینی انسان می‌زنند. آنها در حال حاضر مشغول نمره‌دهی به گروه‌های شرکت‌کننده در تورنمنت تابستان ۲۰۲۶ هستند و ارزیابی می‌کنند که عوامل ماشینی تا چه حد توانسته‌اند رویدادهای واقعی را پیش از وقوع پیش‌بینی کنند. زمانی که پاسخ نهایی این پرسش‌ها در پاییز مشخص شود، این سازمان‌ها نمراتی را منتشر خواهند کرد که یا برابری آماری ماشین‌ها با پیشگویان برتر انسانی را تأیید می‌کند، یا نشان می‌دهد که ماشین‌ها از آنها جلو افتاده‌اند.[1][2]

صنعت فناوری سال ۲۰۲۶ را صرف بازاریابی برای ورود قریب‌الوقوع «فرا هوشمندی» و عوامل خودمختاری کرده است که می‌توانند کل کسب‌وکارها را اداره کنند. اما قابلیت واقعی که عرضه شده، محدودتر اما قابل تأیید است: سامانه‌های چندعاملی تخصصی که رویدادهای مجزای آینده—مانند حاشیه انتخابات، تصمیمات نرخ بهره و نقاط عطف فناوری—را پیش‌بینی می‌کنند. دگر توران، مدیرعامل متاکولوس، هنگام راه‌اندازی معیار FutureEval خاطرنشان کرد: «مدل‌های هوش مصنوعی هنوز از حرفه‌ای‌ها بهتر نیستند، اما با سرعتی پیشرفت می‌کنند که باید برای جهانی که در آن بهتر خواهند بود، آماده شویم.»[2]

پیش‌بینی یکی از معدود حوزه‌هایی است که در آن می‌توان استدلال را در برابر واقعیت، بدون خطر آلودگی مجموعه آزمایشی، سنجید. در معیار ForecastBench مؤسسه تحقیقات پیش‌بینی، پیشگویان برتر انسانی در حال حاضر امتیاز بریر (Brier score) معادل ۰٫۰۸۶ دارند که به شاخص بریر ۷۰٫۶ درصد (٪۷۰٫۶) ترجمه می‌شود. این معیار ارزیابی می‌کند که پیش‌بینی‌های احتمالی چقدر از حقیقت نهایی فاصله می‌گیرند؛ این مقیاس طوری تنظیم شده که ۵۰ درصد (٪۵۰) نشان‌دهنده حدس ناآگاهانه و ۱۰۰ درصد (٪۱۰۰) نشان‌دهنده بینش کامل است.[1]

مدل‌های پیشرو هوش مصنوعی، که بدون ابزارهای اضافی و به صورت خام ارزیابی می‌شوند، در همین شاخص حدود ۶۷٫۹ درصد (٪۶۷٫۹) امتیاز کسب می‌کنند. شکاف بین ۷۰٫۶ و ۶۷٫۹ نشان‌دهنده تفاوت میان نخبه‌ترین پیش‌بینی‌کنندگان انسانی جهان و یک مدل زبان خام است که تلاش می‌کند آینده را صرفاً بر اساس وزن‌های آموزشی خود حدس بزند.[1]

مدل‌های زبان پایه، در صورت ارزیابی بدون ابزارهای تخصصی، همچنان از پیشگویان برتر انسانی عقب‌تر هستند.

با این حال، وقتی مدل‌ها در چارچوب‌های تخصصی قرار می‌گیرند، این شکاف از بین می‌رود. در نوامبر ۲۰۲۵، آزمایشگاه‌های AIA شرکت Bridgewater گزارشی فنی درباره سامانه AIA Forecaster خود منتشر کردند؛ سامانه‌ای که در زیرمجموعه‌ای از پرسش‌های ForecastBench به امتیاز بریر ۰٫۱۰۸ دست یافت. این نتیجه از نظر آماری با میانه پیشگویان برتر انسانی (۰٫۱۱۱) در همان مجموعه، قابل تمایز نبود.[3]

با این حال، وقتی مدل‌ها در چارچوب‌های تخصصی قرار می‌گیرند، این شکاف از بین می‌رود.

معماری این سامانه‌ها نشان می‌دهد که اندازه خام مدل دیگر عامل اصلی تمایز نیست. AIA Forecaster و سامانه‌های مشابه مانند FutureSearch—که در حال حاضر در تورنمنت FutureEval تابستان ۲۰۲۶ متاکولوس در میان ۱۶۳ ربات رقیب پیشتاز است—به شدت به جستجوی عامل‌محور (Agentic Search) متکی هستند.[3]

این مدل‌ها به جای پاسخ دادن بر اساس وزن‌های از پیش آموزش‌دیده، به طور خودکار وب را جستجو می‌کنند، منابع خبری با کیفیت بالا را بازیابی کرده و داده‌های روز را ترکیب می‌کنند و سپس یک احتمال تولید می‌کنند. هنگامی که Bridgewater در طول آزمایش، عملکرد جستجو را غیرفعال کرد، امتیاز بریر سامانه از ۰٫۱۰۰ به ۰٫۳۶۰ سقوط کرد و دقت آن حتی از پرتاب تصادفی سکه نیز کمتر شد.[3]

مکانیزم حیاتی دوم، تجمیع (Ensembling) و سازگاری توسط عامل ناظر است. توسعه‌دهندگان به جای تولید یک پیش‌بینی واحد، چندین عامل پیش‌بینی مستقل را فعال می‌کنند. سپس یک عامل ناظر، پیش‌بینی‌های متفاوت را بررسی کرده، اختلافات را شناسایی می‌کند، جستجوهای هدفمند را برای حل آن تعارضات انجام می‌دهد و در نهایت یک پیش‌بینی تجمیع‌شده نهایی ارائه می‌دهد.[3]

معماری یک پیشگوی مدرن هوش مصنوعی بر جستجو، تجمیع و کالیبراسیون ریاضی متکی است.

حتی با وجود تحقیقات گسترده، مدل‌های زبان بزرگ یک نقص رفتاری پایدار از خود نشان می‌دهند: آنها احتیاط می‌کنند. مدل‌های از پیش آموزش‌دیده به طور سیستماتیک پیش‌بینی‌های مطمئن را به سمت عدم قطعیت فشرده می‌کنند و برای رویدادی که ۸۵ درصد احتمال وقوع دارد، احتمال ۶۰ درصد را خروجی می‌دهند.

برای مقابله با این مشکل، توسعه‌دهندگان از تکنیک‌های کالیبراسیون آماری، مانند مقیاس‌بندی پلات (Platt scaling) یا افراطی‌سازی فضای لوجیت (logit-space extremization)، استفاده می‌کنند که از نظر ریاضی احتمالات مدل را به صفر یا یک نزدیک‌تر می‌کند. این مرحله پس‌پردازش به طور جهانی در میان ربات‌های برتر تورنمنت اعمال می‌شود.[3]

جدیدترین پیشرفت، که توسط FutureSearch در جولای ۲۰۲۶ به کار گرفته شد، مدل‌سازی صریح جهان (explicit world modeling) است. این سامانه به جای بررسی هر سؤال به صورت مجزا، محرک‌های مشترک پشت رویدادهای مهم آینده را کشف می‌کند و هر پیش‌بینی جدید را با هزاران پیش‌بینی گذشته تطبیق می‌دهد. این رویکرد ماتریس تأثیر متقابل، امتیاز بریر نُه مدل پایه مختلف را در طول آزمایش بهبود بخشید و نشان داد که سازگاری ساختاری، دقت بالاتری به همراه دارد.

با وجود ادعاهای بازاریابی مبنی بر بینش فراانسانی، آزمون نهایی همچنان بازارهای پیش‌بینی زنده است که در آن سرمایه واقعی به کار گرفته می‌شود. در معیار MarketLiquid، که ۱٬۶۱۰ سؤال از پلتفرم‌های پیش‌بینی عمومی را ردیابی می‌کند، AIA Forecaster به امتیاز بریر ۰٫۱۲۶ دست یافت که از امتیاز اجماع بازار (۰٫۱۱۱) ضعیف‌تر بود. با این حال، یک تجمیع که هوش مصنوعی را با اجماع بازار ترکیب می‌کرد، به امتیاز ۰٫۱۰۶ رسید و از خود بازار به تنهایی بهتر عمل کرد. ماشین‌ها بازارهای انسانی را منسوخ نکرده‌اند، اما اکنون اطلاعات متنوع و افزوده‌ای را فراهم می‌کنند که برای غلبه بر آنها لازم است.[3]

ترکیب پیش‌بینی‌های هوش مصنوعی با اجماع بازار، دقتی بالاتر از هر یک از این رویکردها به تنهایی به دست می‌دهد.

منابع

پوشش منابع

4 منبع

3 دیدگاه شناسایی‌شده

پیشگویان تجاری هوش مصنوعی 40%مدیران معیارها 35%پیشگویان برتر انسانی 25%
  1. [1]Forecasting Research Instituteمدیران معیارها

    ForecastBench: A dynamic benchmark of LLM forecasting accuracy

    مطالعه در Forecasting Research Institute
  2. [2]Metaculusمدیران معیارها

    FutureEval: Measure the Forecasting Accuracy of AI

    مطالعه در Metaculus
  3. [3]arXivپیشگویان تجاری هوش مصنوعی

    AIA Forecaster: Technical Report

    مطالعه در arXiv
  4. [4]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.