رفتن به محتوای اصلی
Koohestun
بنچمارک‌های هوش مصنوعیرکورد عملکرد· 4 دقیقه مطالعه· در هوش مصنوعی

مدل Nemotron-3-Ultra-CC انویدیا رکورد برترین امتیاز انسانی را در المپیاد بین‌المللی کامپیوتر شکست

مدل هوش مصنوعی تخصصی انویدیا با فعالیت تحت محدودیت‌های سخت‌گیرانه مسابقه، امتیاز ۵۳۵.۴ از ۶۰۰ را در مجموعه سوالات المپیاد بین‌المللی کامپیوتر (IOI) سال ۲۰۲۶ کسب کرد. این نخستین بار است که یک هوش مصنوعی توانسته در این رویداد، برنامه‌نویسان نخبه انسانی را پشت سر بگذارد.

به قلم فرشید جمشیدی

پژوهشگران هوش مصنوعی 40%ناظران صنعت 40%برنامه‌نویسان رقابتی 20%
پژوهشگران هوش مصنوعی
تمرکز بر تغییر معماری به سمت محاسبات در زمان آزمایش و پایپ‌لاین‌های پس از آموزش، به جای تکیه بر مقیاس خام پارامترها.
ناظران صنعت
این نتیجه را یک نقطه عطف تاریخی می‌دانند که ثابت می‌کند مدل‌ها می‌توانند استدلال الگوریتمی پیوسته و چندمرحله‌ای را اجرا کنند.
برنامه‌نویسان رقابتی
تأکید می‌کنند که اگرچه هوش مصنوعی امتیاز بالاتری از انسان‌ها کسب کرد، اما به جای شهود انسانی، بر حلقه‌های تولید عظیم در زمان آزمایش متکی است.

دیدگاه‌هایی که این گزارش پوشش نداده

  • شرکت‌کنندگان انسانی IOI
  • برگزارکنندگان المپیاد

چرا مهم است

برنامه‌نویسی رقابتی نیازمند ساختاردهی الگوریتمی پیوسته و چندمرحله‌ای، و همچنین حل خلاقانه مسئله در محدودیت‌های زمانی دقیق است. پیشی گرفتن یک هوش مصنوعی از بالاترین امتیاز انسانی در چنین محیطی، نشان می‌دهد که مدل‌ها در حال عبور از مرحله تطبیق الگو و ورود به عرصه استدلال انتزاعی واقعی هستند.

لحظه سرنوشت‌ساز برای یک هوش مصنوعی که در تلاش برای کدنویسی است، زمانی نیست که یک کتاب درسی را حفظ می‌کند، بلکه زمانی است که وارد یک حلقه استنتاج در زمان آزمایش (test-time inference) می‌شود تا به‌طور مکرر راه‌حلی را برای مسئله‌ای که هرگز ندیده است، تولید، ارزیابی و اصلاح کند. همین چرخه اصلاح مبتنی بر بازخورد، دقیقاً همان چیزی است که به‌تازگی یک مدل زبانی را از بهترین برنامه‌نویسان انسانی جهان جلو انداخت. در المپیاد بین‌المللی کامپیوتر (IOI) سال ۲۰۲۶، یک سیستم هوش مصنوعی تحت همان محدودیت‌های زمانی و شرایط ارسال پاسخ که برای شرکت‌کنندگان انسانی وضع شده بود، عمل کرد و برای نخستین بار، امتیاز بالاتری نسبت به تمام افراد حاضر در رقابت به دست آورد.[1][4]

این سیستم که توسط پژوهشگران انویدیا (Nvidia) توسعه یافته، Nemotron-3-Ultra-CC نام دارد. در طول یک ارزیابی آینده‌نگرانه روی مجموعه سوالات زنده IOI ۲۰۲۶، این مدل توانست ۵۳۵.۴ امتیاز از مجموع ۶۰۰ امتیاز ممکن را کسب کند. این عملکرد با اختلافی چشمگیر از آستانه ۳۶۱.۱۲ امتیازی مدال طلا عبور کرد و حتی رکورد ۴۹۸.۲۷ امتیازی برترین رقیب انسانی را نیز شکست.[1][3][4]

الکساندر فیسک (Aleksander Ficek)، شان نارنتیران (Sean Narenthiran) و همکارانشان در انویدیا، در پیش‌چاپ مقاله‌ای که در ۳ سپتامبر در arXiv منتشر شد، نوشتند: «تا جایی که ما می‌دانیم، این نخستین سیستم هوش مصنوعی است که در مجموعه سوالات IOI امتیازی بالاتر از برترین شرکت‌کننده انسانی کسب می‌کند.» این نتیجه، نقطه عطفی تاریخی در برنامه‌نویسی رقابتی محسوب می‌شود؛ رشته‌ای که به جای تطبیق الگوی ساده، نیازمند ساختاردهی الگوریتمی پیوسته و چندمرحله‌ای است.[4]

معماری پشت این امتیاز رکوردشکن، بر یک طراحی ترکیبی از خبرگان (mixture-of-experts) استوار است. مدل Nemotron-3-Ultra-CC در مجموع شامل ۵۵۰ میلیارد پارامتر است، اما در هر مرحله از استنتاج، تنها ۵۵ میلیارد از آن‌ها را فعال می‌کند. مدل اولترا به جای تکیه بر یادگیری تقویتی، منحصراً با استفاده از تنظیم دقیق نظارت‌شده (supervised fine-tuning) روی یک مجموعه داده بسیار پالایش‌شده شامل ۲۲٬۰۰۰ مسئله برنامه‌نویسی رقابتی آموزش دیده است.[1][4]

مدل Nemotron-3-Ultra-CC انویدیا از آستانه مدال طلا و بالاترین امتیاز انسانی در IOI ۲۰۲۶ عبور کرد.

با این حال، تعداد خام پارامترها تنها نیمی از معادله است. مزیت تعیین‌کننده این سیستم از یک استراتژی محاسباتی در زمان آزمایش نشأت می‌گیرد که انویدیا آن را «GenCorrect» می‌نامد. به جای تولید یک پاسخ واحد و عبور از آن، GenCorrect به مدل اجازه می‌دهد تا به‌طور مکرر راه‌حل‌های کاندیدای متنوعی تولید کند، آن‌ها را با محدودیت‌های مسئله بسنجد و کد را بر اساس بازخورد حاصل از ارسال‌های ناموفق قبلی اصلاح کند.[4]

مزیت تعیین‌کننده این سیستم از یک استراتژی محاسباتی در زمان آزمایش نشأت می‌گیرد که انویدیا آن را «GenCorrect» می‌نامد.

این حلقه تکرارشونده، روش دیباگ کردن یک برنامه‌نویس انسانی را شبیه‌سازی می‌کند، اما با سرعت ماشین اجرا می‌شود. با انتقال منابع محاسباتی از مرحله آموزش اولیه به لحظه واقعی استنتاج، مدل می‌تواند خطاهای منطقی خود را پیش از نهایی کردن و ارسال پاسخ، شناسایی و اصلاح کند.[4]

انویدیا همچنین نشان داد که این پایپ‌لاین در مقیاس‌های کوچک‌تر نیز کارایی دارد. در کنار مدل عظیم اولترا، این تیم مدل Nemotron-3-Nano-CC را نیز آموزش داد؛ یک مدل ۳۰ میلیارد پارامتری که تنها ۳ میلیارد پارامتر فعال دارد. برخلاف برادر بزرگ‌تر خود، نسخه نانو هم از تنظیم دقیق نظارت‌شده و هم از یادگیری تقویتی بهره برده است.[1][4]

هنگامی که مدل Nano-CC روی بنچمارک سال گذشته یعنی IOI ۲۰۲۵ آزمایش شد، در ابتدا ۱۳۰ امتیاز کسب کرد. پس از اعمال پایپ‌لاین پس از آموزش، امتیاز آن به ۲۹۱ جهش یافت. زمانی که استراتژی زمان آزمایش GenCorrect فعال شد، این مدل ۳۰ میلیارد پارامتری به امتیاز ۴۶۸ رسید و به راحتی از آستانه ۴۳۸.۳ امتیازی مدال طلای سال ۲۰۲۵ عبور کرد.[4]

مدل Nemotron-3-Ultra-CC از معماری ترکیبی از خبرگان بهره می‌برد و در هر مرحله استنتاج، ۵۵ میلیارد پارامتر را فعال می‌کند.

اعتبار نتیجه سال ۲۰۲۶ به شدت به شرایط ارزیابی بستگی دارد. از آنجا که این آزمایش به‌صورت آینده‌نگرانه و در طول پنجره زمانی مسابقات واقعی IOI ۲۰۲۶ اجرا شد، مسائل کاملاً جدید بودند. این امر احتمال اینکه مدل صرفاً راه‌حل‌ها را از داده‌های آموزشی خود حفظ کرده باشد - که یک دام رایج در آزمایش‌های بنچمارک هوش مصنوعی است - از بین می‌برد.[1][4]

این سیستم همچنین دقیقاً به همان قوانین دسترسی به اینترنت و محدودیت‌های ارسال پاسخ که برای دانش‌آموزان انسانی وضع شده بود، محدود شد. حاشیه برتری ۳۷ امتیازی نسبت به برترین شرکت‌کننده انسانی در یک مجموعه ۶۰۰ امتیازی تحت این محدودیت‌های یکسان، نخستین شواهد ملموس را ارائه می‌دهد که مدل‌های زبانی می‌توانند استدلال انتزاعی را در سطحی نخبگانی اجرا کنند.[1][2][4]

این دستاورد نشان‌دهنده یک تغییر بنیادین در نحوه استقرار سیستم‌های هوش مصنوعی در مهندسی نرم‌افزار است. در حالی که مدل‌ها از تولید کدهای تکراری سازمانی به سمت معماری و اعتبارسنجی مستقل الگوریتم‌های پیچیده حرکت می‌کنند، گلوگاه توسعه نرم‌افزار احتمالاً از نوشتن کد، به تعریف محدودیت‌هایی که هوش مصنوعی باید حل کند، تغییر خواهد یافت.[2]

بررسی عمیق دیدگاه‌ها

پژوهشگران هوش مصنوعی

تمرکز بر تغییر معماری به سمت محاسبات در زمان آزمایش و پایپ‌لاین‌های پس از آموزش، به جای تکیه بر مقیاس خام پارامترها.

برای جامعه پژوهشی، امتیاز تیتروار کمتر از پایپ‌لاینی که آن را تولید کرده، جذاب است. مدل Nemotron-3-Ultra-CC نتیجه رکوردشکن خود را نه از طریق افزایش عظیم در مقیاس مدل پایه، بلکه از طریق یک رژیم تخصصی پس از آموزش به دست آورد. با ترکیب ۲۲٬۰۰۰ مسئله پالایش‌شده با یک استراتژی استنتاج در زمان آزمایش به نام GenCorrect، این سیستم به‌طور مکرر راه‌حل‌های خود را تولید، ارزیابی و اصلاح می‌کند. پژوهشگران این امر را تأییدی بر این موضوع می‌دانند که محاسبات در زمان آزمایش - یعنی اجازه دادن به مدل برای «فکر کردن» و دیباگ پیش از نهایی کردن پاسخ - کلید دستیابی به استدلال در سطح نخبگان است.

ناظران صنعت

این نتیجه را یک نقطه عطف تاریخی می‌دانند که ثابت می‌کند مدل‌ها می‌توانند استدلال الگوریتمی پیوسته و چندمرحله‌ای را اجرا کنند.

تحلیلگرانی که بخش تجاری هوش مصنوعی را دنبال می‌کنند، نتیجه IOI ۲۰۲۶ را یک تغییر بنیادین در قابلیت‌ها می‌دانند. برنامه‌نویسی رقابتی نیازمند حل مسئله انتزاعی و ترکیب الگوریتم‌های جدید تحت محدودیت‌های سخت‌گیرانه است؛ حوزه‌ای که مدل‌های زبانی از نظر تاریخی در آن با خطاهای مرکب دست‌وپنجه نرم می‌کرده‌اند. با عبور از بالاترین امتیاز انسانی با اختلاف بیش از ۳۷ امتیاز، این سیستم نشان می‌دهد که هوش مصنوعی در حال عبور از تولید کدهای تکراری سازمانی و ورود به قلمرو ساختاردهی الگوریتمی پیچیده و چندمرحله‌ای است. این امر نویدبخش آینده‌ای نزدیک است که در آن عامل‌های هوش مصنوعی می‌توانند به‌طور مستقل سیستم‌های نرم‌افزاری کامل را معماری و اعتبارسنجی کنند.

برنامه‌نویسان رقابتی

تأکید بر تفاوت میان شهود انسانی و حلقه‌های تولید مبتنی بر نیروی پردازشی خام مدل.

در جامعه برنامه‌نویسی رقابتی، این دستاورد با یک هشدار درباره روش‌شناسی پذیرفته شده است. اگرچه هوش مصنوعی تحت همان محدودیت‌های زمانی و ارسال پاسخ شرکت‌کنندگان انسانی عمل کرد، رویکرد آن به شدت متکی بر تولید و فیلتر کردن راه‌حل‌های کاندیدای متنوع با سرعتی است که برای انسان غیرممکن است. قهرمانان انسانی برای رسیدن به یک رویکرد صحیح، بر شهود الگوریتمی و بینش ریاضی تکیه می‌کنند، در حالی که استراتژی GenCorrect از توان عملیاتی عظیم مدل برای آزمایش و اصلاح مکرر کد بهره می‌برد. در نتیجه، برخی از رقبا استدلال می‌کنند که این مقایسه بیشتر نشان‌دهنده تفاوت در قدرت پردازش است تا یک برابری واقعی در استدلال انتزاعی.

نکات کلیدی

  • مدل Nemotron-3-Ultra-CC انویدیا در المپیاد بین‌المللی کامپیوتر سال ۲۰۲۶ امتیاز ۵۳۵.۴ از ۶۰۰ را کسب کرد.
  • این هوش مصنوعی تحت محدودیت‌های رقابتی یکسان، از بالاترین امتیاز انسانی یعنی ۴۹۸.۲۷ پیشی گرفت.
  • این مدل برای دیباگ کردن مکرر کدهای خود، بر یک استراتژی محاسباتی در زمان آزمایش به نام GenCorrect متکی است.
  • یک مدل کوچک‌تر ۳۰ میلیارد پارامتری نیز با استفاده از همان پایپ‌لاین پس از آموزش، از آستانه مدال طلا عبور کرد.

روند رویداد

  1. دسامبر ۲۰۲۵

    انویدیا مدل‌های پایه Nemotron-3-Nano و Ultra را عرضه کرد.

  2. مارس ۲۰۲۶

    مدل‌های Nemotron-Cascade انویدیا در بنچمارک‌ها به سطح مدال طلا رسیدند، اما نتوانستند رکورد بالاترین امتیاز انسانی را بشکنند.

  3. سپتامبر ۲۰۲۶

    مدل Nemotron-3-Ultra-CC به‌صورت آینده‌نگرانه در IOI ۲۰۲۶ ارزیابی شد و از بالاترین امتیاز انسانی پیشی گرفت.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران هوش مصنوعی 40%ناظران صنعت 40%برنامه‌نویسان رقابتی 20%
  1. [1]AI Weeklyناظران صنعت

    Nvidia's 550B Nemotron beats top human coder at IOI 2026

    مطالعه در AI Weekly
  2. [2]AlphaSignalناظران صنعت

    NVIDIA's Nemotron Beats the Best Human at the Coding Olympics

    مطالعه در AlphaSignal
  3. [3]赢政天下برنامه‌نویسان رقابتی

    NVIDIA Nemotron-3-Ultra-CC Surpasses Human High Score with 535.4 Points at IOI 2026 Onsite Competition

    مطالعه در 赢政天下
  4. [4]arXivپژوهشگران هوش مصنوعی

    Post-Training Language Models for Gold-Medal Performance in Coding Competitions

    مطالعه در arXiv
  5. [5]Hugging Faceپژوهشگران هوش مصنوعی

    Post-Training Language Models for Gold-Medal Performance in Coding Competitions

    مطالعه در Hugging Face

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.