مدل Nemotron-3-Ultra-CC انویدیا رکورد برترین امتیاز انسانی را در المپیاد بینالمللی کامپیوتر شکست
مدل هوش مصنوعی تخصصی انویدیا با فعالیت تحت محدودیتهای سختگیرانه مسابقه، امتیاز ۵۳۵.۴ از ۶۰۰ را در مجموعه سوالات المپیاد بینالمللی کامپیوتر (IOI) سال ۲۰۲۶ کسب کرد. این نخستین بار است که یک هوش مصنوعی توانسته در این رویداد، برنامهنویسان نخبه انسانی را پشت سر بگذارد.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
- پژوهشگران هوش مصنوعی
- تمرکز بر تغییر معماری به سمت محاسبات در زمان آزمایش و پایپلاینهای پس از آموزش، به جای تکیه بر مقیاس خام پارامترها.
- ناظران صنعت
- این نتیجه را یک نقطه عطف تاریخی میدانند که ثابت میکند مدلها میتوانند استدلال الگوریتمی پیوسته و چندمرحلهای را اجرا کنند.
- برنامهنویسان رقابتی
- تأکید میکنند که اگرچه هوش مصنوعی امتیاز بالاتری از انسانها کسب کرد، اما به جای شهود انسانی، بر حلقههای تولید عظیم در زمان آزمایش متکی است.
دیدگاههایی که این گزارش پوشش نداده
- شرکتکنندگان انسانی IOI
- برگزارکنندگان المپیاد
چرا مهم است
برنامهنویسی رقابتی نیازمند ساختاردهی الگوریتمی پیوسته و چندمرحلهای، و همچنین حل خلاقانه مسئله در محدودیتهای زمانی دقیق است. پیشی گرفتن یک هوش مصنوعی از بالاترین امتیاز انسانی در چنین محیطی، نشان میدهد که مدلها در حال عبور از مرحله تطبیق الگو و ورود به عرصه استدلال انتزاعی واقعی هستند.
لحظه سرنوشتساز برای یک هوش مصنوعی که در تلاش برای کدنویسی است، زمانی نیست که یک کتاب درسی را حفظ میکند، بلکه زمانی است که وارد یک حلقه استنتاج در زمان آزمایش (test-time inference) میشود تا بهطور مکرر راهحلی را برای مسئلهای که هرگز ندیده است، تولید، ارزیابی و اصلاح کند. همین چرخه اصلاح مبتنی بر بازخورد، دقیقاً همان چیزی است که بهتازگی یک مدل زبانی را از بهترین برنامهنویسان انسانی جهان جلو انداخت. در المپیاد بینالمللی کامپیوتر (IOI) سال ۲۰۲۶، یک سیستم هوش مصنوعی تحت همان محدودیتهای زمانی و شرایط ارسال پاسخ که برای شرکتکنندگان انسانی وضع شده بود، عمل کرد و برای نخستین بار، امتیاز بالاتری نسبت به تمام افراد حاضر در رقابت به دست آورد.[1][4]
این سیستم که توسط پژوهشگران انویدیا (Nvidia) توسعه یافته، Nemotron-3-Ultra-CC نام دارد. در طول یک ارزیابی آیندهنگرانه روی مجموعه سوالات زنده IOI ۲۰۲۶، این مدل توانست ۵۳۵.۴ امتیاز از مجموع ۶۰۰ امتیاز ممکن را کسب کند. این عملکرد با اختلافی چشمگیر از آستانه ۳۶۱.۱۲ امتیازی مدال طلا عبور کرد و حتی رکورد ۴۹۸.۲۷ امتیازی برترین رقیب انسانی را نیز شکست.[1][3][4]
الکساندر فیسک (Aleksander Ficek)، شان نارنتیران (Sean Narenthiran) و همکارانشان در انویدیا، در پیشچاپ مقالهای که در ۳ سپتامبر در arXiv منتشر شد، نوشتند: «تا جایی که ما میدانیم، این نخستین سیستم هوش مصنوعی است که در مجموعه سوالات IOI امتیازی بالاتر از برترین شرکتکننده انسانی کسب میکند.» این نتیجه، نقطه عطفی تاریخی در برنامهنویسی رقابتی محسوب میشود؛ رشتهای که به جای تطبیق الگوی ساده، نیازمند ساختاردهی الگوریتمی پیوسته و چندمرحلهای است.[4]
معماری پشت این امتیاز رکوردشکن، بر یک طراحی ترکیبی از خبرگان (mixture-of-experts) استوار است. مدل Nemotron-3-Ultra-CC در مجموع شامل ۵۵۰ میلیارد پارامتر است، اما در هر مرحله از استنتاج، تنها ۵۵ میلیارد از آنها را فعال میکند. مدل اولترا به جای تکیه بر یادگیری تقویتی، منحصراً با استفاده از تنظیم دقیق نظارتشده (supervised fine-tuning) روی یک مجموعه داده بسیار پالایششده شامل ۲۲٬۰۰۰ مسئله برنامهنویسی رقابتی آموزش دیده است.[1][4]
با این حال، تعداد خام پارامترها تنها نیمی از معادله است. مزیت تعیینکننده این سیستم از یک استراتژی محاسباتی در زمان آزمایش نشأت میگیرد که انویدیا آن را «GenCorrect» مینامد. به جای تولید یک پاسخ واحد و عبور از آن، GenCorrect به مدل اجازه میدهد تا بهطور مکرر راهحلهای کاندیدای متنوعی تولید کند، آنها را با محدودیتهای مسئله بسنجد و کد را بر اساس بازخورد حاصل از ارسالهای ناموفق قبلی اصلاح کند.[4]
مزیت تعیینکننده این سیستم از یک استراتژی محاسباتی در زمان آزمایش نشأت میگیرد که انویدیا آن را «GenCorrect» مینامد.
این حلقه تکرارشونده، روش دیباگ کردن یک برنامهنویس انسانی را شبیهسازی میکند، اما با سرعت ماشین اجرا میشود. با انتقال منابع محاسباتی از مرحله آموزش اولیه به لحظه واقعی استنتاج، مدل میتواند خطاهای منطقی خود را پیش از نهایی کردن و ارسال پاسخ، شناسایی و اصلاح کند.[4]
انویدیا همچنین نشان داد که این پایپلاین در مقیاسهای کوچکتر نیز کارایی دارد. در کنار مدل عظیم اولترا، این تیم مدل Nemotron-3-Nano-CC را نیز آموزش داد؛ یک مدل ۳۰ میلیارد پارامتری که تنها ۳ میلیارد پارامتر فعال دارد. برخلاف برادر بزرگتر خود، نسخه نانو هم از تنظیم دقیق نظارتشده و هم از یادگیری تقویتی بهره برده است.[1][4]
هنگامی که مدل Nano-CC روی بنچمارک سال گذشته یعنی IOI ۲۰۲۵ آزمایش شد، در ابتدا ۱۳۰ امتیاز کسب کرد. پس از اعمال پایپلاین پس از آموزش، امتیاز آن به ۲۹۱ جهش یافت. زمانی که استراتژی زمان آزمایش GenCorrect فعال شد، این مدل ۳۰ میلیارد پارامتری به امتیاز ۴۶۸ رسید و به راحتی از آستانه ۴۳۸.۳ امتیازی مدال طلای سال ۲۰۲۵ عبور کرد.[4]
اعتبار نتیجه سال ۲۰۲۶ به شدت به شرایط ارزیابی بستگی دارد. از آنجا که این آزمایش بهصورت آیندهنگرانه و در طول پنجره زمانی مسابقات واقعی IOI ۲۰۲۶ اجرا شد، مسائل کاملاً جدید بودند. این امر احتمال اینکه مدل صرفاً راهحلها را از دادههای آموزشی خود حفظ کرده باشد - که یک دام رایج در آزمایشهای بنچمارک هوش مصنوعی است - از بین میبرد.[1][4]
این سیستم همچنین دقیقاً به همان قوانین دسترسی به اینترنت و محدودیتهای ارسال پاسخ که برای دانشآموزان انسانی وضع شده بود، محدود شد. حاشیه برتری ۳۷ امتیازی نسبت به برترین شرکتکننده انسانی در یک مجموعه ۶۰۰ امتیازی تحت این محدودیتهای یکسان، نخستین شواهد ملموس را ارائه میدهد که مدلهای زبانی میتوانند استدلال انتزاعی را در سطحی نخبگانی اجرا کنند.[1][2][4]
این دستاورد نشاندهنده یک تغییر بنیادین در نحوه استقرار سیستمهای هوش مصنوعی در مهندسی نرمافزار است. در حالی که مدلها از تولید کدهای تکراری سازمانی به سمت معماری و اعتبارسنجی مستقل الگوریتمهای پیچیده حرکت میکنند، گلوگاه توسعه نرمافزار احتمالاً از نوشتن کد، به تعریف محدودیتهایی که هوش مصنوعی باید حل کند، تغییر خواهد یافت.[2]
بررسی عمیق دیدگاهها
پژوهشگران هوش مصنوعی
تمرکز بر تغییر معماری به سمت محاسبات در زمان آزمایش و پایپلاینهای پس از آموزش، به جای تکیه بر مقیاس خام پارامترها.
برای جامعه پژوهشی، امتیاز تیتروار کمتر از پایپلاینی که آن را تولید کرده، جذاب است. مدل Nemotron-3-Ultra-CC نتیجه رکوردشکن خود را نه از طریق افزایش عظیم در مقیاس مدل پایه، بلکه از طریق یک رژیم تخصصی پس از آموزش به دست آورد. با ترکیب ۲۲٬۰۰۰ مسئله پالایششده با یک استراتژی استنتاج در زمان آزمایش به نام GenCorrect، این سیستم بهطور مکرر راهحلهای خود را تولید، ارزیابی و اصلاح میکند. پژوهشگران این امر را تأییدی بر این موضوع میدانند که محاسبات در زمان آزمایش - یعنی اجازه دادن به مدل برای «فکر کردن» و دیباگ پیش از نهایی کردن پاسخ - کلید دستیابی به استدلال در سطح نخبگان است.
ناظران صنعت
این نتیجه را یک نقطه عطف تاریخی میدانند که ثابت میکند مدلها میتوانند استدلال الگوریتمی پیوسته و چندمرحلهای را اجرا کنند.
تحلیلگرانی که بخش تجاری هوش مصنوعی را دنبال میکنند، نتیجه IOI ۲۰۲۶ را یک تغییر بنیادین در قابلیتها میدانند. برنامهنویسی رقابتی نیازمند حل مسئله انتزاعی و ترکیب الگوریتمهای جدید تحت محدودیتهای سختگیرانه است؛ حوزهای که مدلهای زبانی از نظر تاریخی در آن با خطاهای مرکب دستوپنجه نرم میکردهاند. با عبور از بالاترین امتیاز انسانی با اختلاف بیش از ۳۷ امتیاز، این سیستم نشان میدهد که هوش مصنوعی در حال عبور از تولید کدهای تکراری سازمانی و ورود به قلمرو ساختاردهی الگوریتمی پیچیده و چندمرحلهای است. این امر نویدبخش آیندهای نزدیک است که در آن عاملهای هوش مصنوعی میتوانند بهطور مستقل سیستمهای نرمافزاری کامل را معماری و اعتبارسنجی کنند.
برنامهنویسان رقابتی
تأکید بر تفاوت میان شهود انسانی و حلقههای تولید مبتنی بر نیروی پردازشی خام مدل.
در جامعه برنامهنویسی رقابتی، این دستاورد با یک هشدار درباره روششناسی پذیرفته شده است. اگرچه هوش مصنوعی تحت همان محدودیتهای زمانی و ارسال پاسخ شرکتکنندگان انسانی عمل کرد، رویکرد آن به شدت متکی بر تولید و فیلتر کردن راهحلهای کاندیدای متنوع با سرعتی است که برای انسان غیرممکن است. قهرمانان انسانی برای رسیدن به یک رویکرد صحیح، بر شهود الگوریتمی و بینش ریاضی تکیه میکنند، در حالی که استراتژی GenCorrect از توان عملیاتی عظیم مدل برای آزمایش و اصلاح مکرر کد بهره میبرد. در نتیجه، برخی از رقبا استدلال میکنند که این مقایسه بیشتر نشاندهنده تفاوت در قدرت پردازش است تا یک برابری واقعی در استدلال انتزاعی.
نکات کلیدی
- مدل Nemotron-3-Ultra-CC انویدیا در المپیاد بینالمللی کامپیوتر سال ۲۰۲۶ امتیاز ۵۳۵.۴ از ۶۰۰ را کسب کرد.
- این هوش مصنوعی تحت محدودیتهای رقابتی یکسان، از بالاترین امتیاز انسانی یعنی ۴۹۸.۲۷ پیشی گرفت.
- این مدل برای دیباگ کردن مکرر کدهای خود، بر یک استراتژی محاسباتی در زمان آزمایش به نام GenCorrect متکی است.
- یک مدل کوچکتر ۳۰ میلیارد پارامتری نیز با استفاده از همان پایپلاین پس از آموزش، از آستانه مدال طلا عبور کرد.
روند رویداد
دسامبر ۲۰۲۵
انویدیا مدلهای پایه Nemotron-3-Nano و Ultra را عرضه کرد.
مارس ۲۰۲۶
مدلهای Nemotron-Cascade انویدیا در بنچمارکها به سطح مدال طلا رسیدند، اما نتوانستند رکورد بالاترین امتیاز انسانی را بشکنند.
سپتامبر ۲۰۲۶
مدل Nemotron-3-Ultra-CC بهصورت آیندهنگرانه در IOI ۲۰۲۶ ارزیابی شد و از بالاترین امتیاز انسانی پیشی گرفت.
منابع
[1]AI Weeklyناظران صنعتNvidia's 550B Nemotron beats top human coder at IOI 2026
مطالعه در AI Weekly →
[2]AlphaSignalناظران صنعتNVIDIA's Nemotron Beats the Best Human at the Coding Olympics
مطالعه در AlphaSignal →
[3]赢政天下برنامهنویسان رقابتیNVIDIA Nemotron-3-Ultra-CC Surpasses Human High Score with 535.4 Points at IOI 2026 Onsite Competition
مطالعه در 赢政天下 →
[4]arXivپژوهشگران هوش مصنوعیPost-Training Language Models for Gold-Medal Performance in Coding Competitions
مطالعه در arXiv →
[5]Hugging Faceپژوهشگران هوش مصنوعیPost-Training Language Models for Gold-Medal Performance in Coding Competitions
مطالعه در Hugging Face →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



