ارزیابان مستقل از اختلاف ۳۷ امتیازی در بنچمارک هوش مصنوعی GPT-6 Astra پرده برداشتند
مدل پرچمدار جدید OpenAI با استفاده از یک مهاربند حافظه سفارشی، در یک آزمون استدلال مهم امتیاز ۹۹.۹ درصد را کسب کرد، اما این رقم در شرایط تست استاندارد به ۶۲.۷ درصد سقوط کرد. این اختلاف فاحش نشان میدهد که چگونه داربستهای نرمافزاری اکنون به شدت بر معیارهای عملکرد هوش مصنوعی تاثیر میگذارند.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
- ارزیابان مستقل
- مدافع آزمایشهای استاندارد و مستقل از ارائهدهنده برای سنجش قابلیت خام مدل هستند.
- توسعهدهندگان مدل
- استدلال میکنند که بنچمارکها باید عملکرد کل سیستم، از جمله ابزارهای حافظه سفارشی را منعکس کنند.
- تحلیلگران صنعت
- بر شفافیت گزارشدهی بنچمارکها و پیامدهای اقتصادی کارایی مدل تمرکز دارند.
چرا مهم است
از آنجا که مدلهای هوش مصنوعی روزبهروز بیشتر برای وظایف خودمختار و چندمرحلهای به کار گرفته میشوند، این داربست نرمافزاری پیرامون آنهاست که قابلیت واقعیشان را دیکته میکند. درک تفاوت میان هوش خام مدل و عملکرد تقویتشده با مهاربند، به خریداران سازمانی و توسعهدهندگان کمک میکند تا با دقت ارزیابی کنند کدام ابزارهای هوش مصنوعی واقعاً برای حجم کاری آنها مناسب هستند.
برای اینکه یک بنچمارک هوش مصنوعی بتواند قابلیتهای خام را بسنجد، محیط تست — یعنی مهاربند نرمافزاری که مدل را احاطه کرده — نباید هیچگونه میانبر حافظه یا استدلالی ارائه دهد که خود مدل قادر به تولید آن نیست. در مورد مدل تازهمنتشرشده GPT-6 Astra از شرکت OpenAI، این شرط به طور یکسان صدق نمیکند و تفاوت در محیطهای تست، اختلافی ۳۷ درصدی در یک ارزیابی پرچمدار به همراه دارد.[1][6]
زمانی که OpenAI مدل GPT-6 Astra را در ۳ سپتامبر ۲۰۲۶ عرضه کرد، این شرکت آن را به عنوان یک جهش نسلی در استدلال و کارهای عاملمحور معرفی نمود. ادعای اصلی به شدت بر امتیاز تقریباً کامل ۹۹.۹ درصدی در ARC-AGI-3 استوار بود؛ یک آزمون بسیار دشوار در حل معماهای انتزاعی که نیازمند استنتاج قوانین در محیطهای جدید توسط هوش مصنوعی است.[2][6]
با این حال، آزمایشهای مستقل توسط بنیاد ARC Prize نشان داد که این امتیاز تقریباً کامل، کاملاً به نحوه اجازه دادن به مدل برای به خاطر سپردن گامهای قبلیاش بستگی دارد. وقتی این مدل تحت یک مهاربند استاندارد و مستقل از ارائهدهنده آزمایش شد — که مدل را مجبور میکند تنها به یادداشتهایی تکیه کند که صراحتاً خودش برای نوشتن انتخاب میکند — امتیاز GPT-6 Astra به ۶۲.۷ درصد کاهش یافت.[1][6]
نتیجه ۹۹.۹ درصدی با استفاده از یک مهاربند سفارشی به نام «Provider Adapter» به دست آمده بود. این محیط تخصصی، وضعیتهای استدلال پنهان مدل را بین درخواستها حفظ میکند و با استفاده از فشردهسازی پسزمینه، کارهای محاسباتی قبلی را دوباره به کار میگیرد؛ سازوکاری که در عمل یک حلقه حافظه پیوسته و پنهان به هوش مصنوعی میدهد تا نیازی به استخراج مجدد پاسخها از نقطه صفر نداشته باشد.[1]
این شکاف ۳۷ امتیازی یک نقص در مدل نیست، بلکه معیاری است برای سنجش اینکه Astra تا چه حد به حفظ استدلالهای پنهان خود در طول نوبتهای مختلف متکی است. این موضوع یک واقعیت رو به رشد را در هوش مصنوعی برجسته میکند: داربست پیرامون یک مدل اکنون به اندازه خود شبکه عصبی در عملکرد آن حیاتی است.[1][6]
این شکاف ۳۷ امتیازی یک نقص در مدل نیست، بلکه معیاری است برای سنجش اینکه Astra تا چه حد به حفظ استدلالهای پنهان خود در طول نوبتهای مختلف متکی است.
این اختلاف پس از انتشار مدل، به بخشی از یک گفتگوی گستردهتر درباره شفافیت بنچمارکها تبدیل شد. تنها چند روز پس از عرضه، OpenAI بیسروصدا چندین آمار منتشرشده در سایت خود را اصلاح کرد؛ از جمله نصف کردن نرخ توهم گزارششده Astra از ۴.۲ درصد به ۲.۰ درصد، پیش از آنکه دوباره آن را به عدد اولیه بازگرداند.[3][5]
در واکنش به این تغییر آمارها، یکی از سخنگویان OpenAI اعلام کرد: «ما همیشه ارزیابیها را پیش از انتشار بررسی میکنیم، بنابراین اصلاحات بین نسخه پیشنویس و نهایی طبیعی است.» با این وجود، این بازبینیها نشان میدهند که معیارهای اصلی تا چه حد به تغییرات جزئی در پیکربندی حساس هستند.[5]
از آن زمان، ارزیابان مستقل هوش خام Astra را در یک چارچوب مشخص قرار دادهاند. پلتفرم Artificial Analysis که یک شاخص هوش استاندارد را در سطح صنعت اجرا میکند، در ۹ سپتامبر ۲۰۲۶ به GPT-6 Astra امتیاز ۶۱.۲ داد. این امر پرچمدار جدید را عملاً در جایگاهی برابر با نسخه قبلی خود یعنی GPT-5.6 Sol با امتیاز ۶۰.۹، و کمی پایینتر از Claude Fable 5.1 شرکت Anthropic با امتیاز ۶۵.۷ قرار میدهد.[4]
جایی که Astra بدون شک در آن برتری دارد، کارایی عاملمحور و استفاده از کامپیوتر است. در شاخص عامل کدنویسی Artificial Analysis، مدل Astra با Fable 5.1 برابری میکند، در حالی که با حدود ۶۰ درصد هزینه کمتر به ازای هر وظیفه عمل کرده و از توکنهای خروجی بسیار کمتری برای رسیدن به همان نتایج استفاده میکند.[4]
این مدل همچنین در محیط ARC-AGI-3 از خط پایه کارایی-عملکرد انسانی پیشی گرفت و ۹۶.۰ درصد از مراحل آزمون را با استفاده از اقداماتی کمتر از میانگین شرکتکنندگان انسانی به پایان رساند.[1]
ظهور این شکاف ۳۷ امتیازی، نشاندهنده تغییری در نحوه ارزیابی قابلیتهای هوش مصنوعی است. از آنجا که مدلها برای انجام وظایف طولانیمدت توانمندتر میشوند، مرز میان وزنهای خام یک مدل و معماری نرمافزاری پیرامون آن در حال محو شدن است؛ موضوعی که تعیین اینکه الگوریتم کجا به پایان میرسد و ابزار از کجا آغاز میشود را بر دوش حسابرسان مستقل میگذارد.[1][4][6]
منابع
[1]Ofox AIارزیابان مستقلGPT-6 Astra Review: The 37-Point Benchmark and the Thinking You Can't See
مطالعه در Ofox AI →
[2]OpenAIتوسعهدهندگان مدلGPT-6 Astra: The next generation in intelligence for work
مطالعه در OpenAI →
[3]explainx.aiتحلیلگران صنعتOpenAI Changed GPT-6 Astra's Benchmark Numbers After Launch
مطالعه در explainx.ai →
[4]Artificial Analysisارزیابان مستقلBenchmarking GPT-6 Astra
مطالعه در Artificial Analysis →
[5]EdgeX Exchangeارزیابان مستقلOpenAI Quietly Revised Multiple GPT-6 Astra Benchmark Scores After Launch
مطالعه در EdgeX Exchange →
[6]Securing AIتحلیلگران صنعتNo, GPT-6 Astra is not AGI. Nvidia's CEO is wrong.
مطالعه در Securing AI →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →ایجنتهای هوش مصنوعی محلی
انتقال مدیریت ایجنتهای هوش مصنوعی پرپلکسیتی به ویندوز با یکپارچهسازی انویدیا RTX
7 منبع
معماری هوش مصنوعی
چگونه قاعده زنجیرهای سیگنالهای خطا را برای بهروزرسانی وزنهای شبکه عصبی به عقب میراند
6 منبع
اجرای محلی
چگونه فرمت GGML اجرای مدلهای زبانی بزرگ را تنها با پردازنده مرکزی (CPU) ممکن میکند
10 منبع
ایمنی هوش مصنوعی
اوپنایآی عرضه GPT-5.6 را به درخواست دولت آمریکا به تأخیر انداخت؛ نشانهای از آغاز دوران جدید نظارت فدرال
5 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





