انویدیا از پردازنده «ورا» و معماری روبین رونمایی کرد؛ تغییر معیار هوش مصنوعی به «توکن در هر وات»
پلتفرم آتی «ورا روبین» انویدیا با اتصال محکم پردازندههای مرکزی و گرافیکی سفارشی به همراه نرمافزار مدیریت توان پویا، وعده افزایش ۴۰ درصدی در بهرهوری استنتاج را میدهد. این تغییر نشان میدهد که چگونه محدودیتهای شبکه برق، صنعت هوش مصنوعی را مجبور کرده است تا درآمد حاصل از هر مگاوات را بر سرعت خام ترجیح دهد.
به قلم دلناز نورانی
این خبر را به اشتراک بگذارید
- اپراتورهای ابری هایپراسکیل
- تمرکز بر به حداکثر رساندن درآمد به ازای هر مگاوات در محدودیتهای ثابت شبکه، با در نظر گرفتن بهرهوری به عنوان محرک مستقیم سود.
- شکاکان سختافزار و مدیران تأسیسات
- زیر سؤال بردن امکان بازسازی مراکز داده موجود برای خنککاری مایع شدید و چگالی توان مورد نیاز این معماریهای جدید.
- توسعهدهندگان مدلهای هوش مصنوعی
- ارزش قائل شدن برای کاهش هزینههای استنتاج، که به آنها اجازه میدهد مدلهای هوش مصنوعی عاملیتمحور و پیچیدهتری را بدون ورشکست کردن کاربران خود مستقر کنند.
- انویدیا و شرکای اکوسیستم
- ترویج «طراحی مشترک شدید» سختافزار و نرمافزار اختصاصی به عنوان تنها راه برای غلبه بر پایان مقیاسبندی سنتی.
نکات کلیدی
- پلتفرم آتی ورا روبین انویدیا، معیار اصلی عملکرد صنعت را از سرعت خام به «توکن در هر وات» تغییر میدهد.
- این شرکت افزایش ۴۰ درصدی در بهرهوری استنتاج را پیشبینی میکند که به اپراتورها اجازه میدهد جیپییوهای بیشتری را در همان بودجه برق اجرا کنند.
- این بهرهوری به شدت متکی به نرمافزار MaxLPS است که توان را به صورت پویا در سطح قفسه مدیریت میکند تا برق بلااستفاده را بازیابی کند.
- چگالی توان بسیار بالای معماری جدید نیازمند خنککاری مایع مستقیم روی تراشه است، که یک چالش زیرساختی بزرگ برای مراکز داده قدیمی ایجاد میکند.
گلوگاه در هوش مصنوعی دیگر صرفاً عرضه سیلیکون نیست؛ بلکه تأمین برق است. برای توسعهدهندگانی که نسل بعدی عوامل هوش مصنوعی را میسازند و مصرفکنندگانی که به آنها متکی هستند، هزینه و سرعت هر تعامل دیجیتال به طور فزایندهای توسط میزان برقی تعیین میشود که یک مرکز داده مجاز است به صورت قانونی و فیزیکی از شبکه محلی دریافت کند.[4][5]
انویدیا با درک این سقف فیزیکی، جزئیات معماری پلتفرم آتی خود به نام «ورا روبین» را رونمایی کرده و به صراحت معیار موفقیت صنعت را تغییر داده است. این شرکت به جای اینکه صرفاً سرعت خام یا عملیات ممیز شناور در ثانیه را تبلیغ کند، به شدت در حال ترویج یک معیار جدید است: «توکن در هر وات».[1][4]
ادعای اصلی انویدیا قابل توجه است. این شرکت تأکید میکند که پلتفرم ورا روبین – که ترکیبی از پردازنده مرکزی جدید ورا، پردازنده گرافیکی روبین و مجموعهای از نرمافزارهای مدیریت توان است – ۴۰ درصد افزایش در بهرهوری استنتاج ارائه میدهد. در عمل، این بدان معناست که اپراتورهای مراکز داده میتوانند ۴۰ درصد ظرفیت جیپییو بیشتری را در همان بودجه برق موجود جای دهند و اساساً اقتصاد اجرای هوش مصنوعی در مقیاس بزرگ را تغییر دهند.[1][3]
با این حال، باید با دیدی شکاک بین آنچه امروز عرضه میشود و آنچه برای فردا وعده داده شده است، تمایز قائل شد. در حالی که معماری بلکول (Blackwell) انویدیا در حال حاضر در مراکز داده هایپراسکیل مستقر میشود، پلتفرم ورا روبین برای افزایش تولید در نیمه دوم سال ۲۰۲۶ برنامهریزی شده است. افزایش ۴۰ درصدی بهرهوری که تبلیغ میشود، بر اساس آزمایشهای اولیه، مدلهای «طراحی مشترک شدید» و محیطهای آزمایشگاهی بسیار بهینهسازی شده است، نه دادههای گسترده میدانی و واقعی.[1][2]
برای درک این تغییر، باید معیار جدید را تعریف کرد. «توکن» تقریباً معادل کسری از یک کلمه در پردازش هوش مصنوعی است. تولید آن توکن نیازمند چرخههای محاسباتی است که به نوبه خود به وات برق نیاز دارند. از آنجایی که «استنتاج» – یعنی عمل واقعی پرسوجوی کاربران از مدل – به مرکز هزینه غالب در هوش مصنوعی تبدیل شده است، شرکتهای هایپراسکیل دیگر فقط تراشه نمیخرند؛ بلکه توانایی تبدیل برق به توکنهای قابل صورتحساب را با حداکثر کارایی ممکن خریداری میکنند.[4][5]
زیربنای سختافزاری این تغییر، پردازنده مرکزی ورا است. برخلاف معماریهای سنتی سرور که در آنها یک پردازنده آماده صرفاً دادهها را به یک جیپییو پرمصرف میرساند، ورا یک تراشه سفارشی مبتنی بر معماری آرم (ARM) است که دارای ۸۸ هسته «المپوس» است. این پردازنده به طور خاص برای عصر «هوش مصنوعی عاملیتمحور» ساخته شده است، جایی که مدلها فقط متن تولید نمیکنند، بلکه فعالانه کد مینویسند، آن را در محیطهای ایزوله اجرا میکنند و از ابزارهای خارجی برای حل مسائل چندمرحلهای استفاده میکنند.[1][2][6]
این پردازنده مرکزی از طریق یک اتصال داخلی فوقسریع به نام NVLink-C2C با پردازنده گرافیکی روبین جفت شده است که دادهها را با سرعت ۱.۸ ترابایت در ثانیه منتقل میکند. انویدیا با طراحی هر دو پردازنده مرکزی و گرافیکی به صورت داخلی، قصد دارد گلوگاههای ارتباطی سنتی را که باعث میشوند جیپییوها در حالت بیکاری بمانند – و برق هدر دهند – در حالی که منتظر پردازش منطق ترتیبی توسط سیپییو هستند، از بین ببرد.[6][7]
این پردازنده مرکزی از طریق یک اتصال داخلی فوقسریع به نام NVLink-C2C با پردازنده گرافیکی روبین جفت شده است که دادهها را با سرعت ۱.۸ ترابایت در ثانیه منتقل میکند.
فوریت پشت این تغییر معماری ناشی از واقعیت تلخ شبکه برق است. مراکز داده مدرن به طور معمول صدها مگاوات برق درخواست میکنند و شرکتهای برق منطقهای برای تأمین آن با مشکل مواجه هستند. با توجه به اینکه تراشههای قدیمیتر H100 حدود ۷۰۰ وات مصرف میکنند و سیلیکونهای آینده مصرف را به بیش از ۱۲۰۰ تا ۲۳۰۰ وات در هر تراشه میرسانند، اپراتورها نمیتوانند به سادگی قفسههای بیشتری را بدون عبور از محدودیتهای برق شهری متصل کنند.[4]
در نتیجه، ادعای ۴۰ درصدی انویدیا در مورد بهرهوری تنها به سختافزار متکی نیست. این ادعا به شدت بر یک لایه نرمافزاری به نام MaxLPS تکیه دارد که بخشی از پلتفرم گستردهتر DSX است. MaxLPS توان را به صورت پویا در سطح قفسه مدیریت میکند و به طور مداوم محدودیتهای حرارتی و تقاضاهای بار کاری را نظارت میکند تا «توان بلااستفاده» – برقی که برای یک قفسه تأمین شده اما به دلیل توزیع بار ناکارآمد استفاده نمیشود – را بازیابی کند.[1][3]
این نرمافزار با انتقال توان در کسری از ثانیه به جایی که بیشتر مورد نیاز است، تضمین میکند که کل قفسه در کارآمدترین نقطه خود عمل کند. برای ارائهدهندگان خدمات ابری، این یک هدف بسیار مهم است: اگر یک مرکز به شدت در ۱۰۰ مگاوات محدود شده باشد، تنها راه ریاضی برای افزایش درآمد، استخراج توکنهای قابل صورتحساب بیشتر از همان ظرفیت ۱۰۰ مگاواتی است.[3][4]
با این حال، یک مشکل قابل توجه در این چشمانداز با چگالی بالا وجود دارد. دستیابی به این ارقام نیازمند خنککاری مایع مستقیم روی تراشه است، زیرا تهویه مطبوع سنتی به لحاظ فیزیکی نمیتواند گرمای تولید شده توسط قفسه ورا روبین را دفع کند. بسیاری از مراکز داده موجود، لولهکشی نشدهاند یا از نظر ساختاری تقویت نشدهاند تا وزن عظیم و نیازهای مایع این سیستمهای نسل بعدی را تحمل کنند، که این امر یک گلوگاه زیرساختی بزرگ ایجاد میکند.[1][3]
گذار به معیار توکن در هر وات همچنین منعکسکننده یک تغییر اساسی در نحوه عملکرد مدلهای هوش مصنوعی است. صنعت در حال حرکت به سمت «مقیاسبندی زمان آزمایش» است، جایی که به مدلها زمان بیشتری داده میشود تا قبل از پاسخ دادن «فکر کنند». این امر نیازمند پنجرههای متنی عظیم و تبادل مداوم بین پردازنده مرکزی و گرافیکی است، که بهرهوری انرژی را به محدودیت اصلی برای تعیین میزان هوشمندی یک هوش مصنوعی تبدیل میکند.[1][7]
انویدیا در این درک تنها نیست. رقبایی مانند AMD و همچنین بخشهای سیلیکون سفارشی گوگل و آمازون، همگی به شدت در حال بهینهسازی برای بهرهوری استنتاج هستند. با این حال، استراتژی انویدیا این است که از چرخه انتشار سالانه خود استفاده کند تا اکوسیستم را به شبکههای اختصاصی NVLink و نرمافزار DSX خود وابسته کند، که این امر ترکیب و تطبیق سختافزار را برای اپراتورها دشوار میسازد.[2]
در نهایت، ارتقای «توکن در هر وات» به عنوان معیار تعیینکننده صنعت، مرز فیزیکی سختی را به رسمیت میشناسد. رشد هوش مصنوعی دیگر صرفاً توسط محدودیتهای قانون مور محدود نمیشود، بلکه توسط ظرفیت شبکه برق محدود شده است. اینکه آیا افزایش ۴۰ درصدی بهرهوری انویدیا در واقعیت آشفته مراکز داده جهانی دوام خواهد آورد یا خیر، احتمالاً هزینه هوش مصنوعی را برای بقیه این دهه تعیین خواهد کرد.[3][4][5]
اصطلاحات کلیدی
- توکن در هر وات
- معیاری که اندازهگیری میکند یک سیستم هوش مصنوعی به ازای هر واحد توان الکتریکی مصرفی، چند قطعه متن (توکن) میتواند تولید کند.
- استنتاج
- فرآیند اجرای یک مدل هوش مصنوعی آموزشدیده برای تولید پاسخها، پیشبینیها یا اقدامات بر اساس ورودی کاربر.
- هوش مصنوعی عاملیتمحور
- سیستمهای هوش مصنوعی طراحی شدهاند تا چندین مرحله را طی کنند، از ابزارهای خارجی استفاده کنند و به طور مستقل برای حل مسائل پیچیده استدلال کنند.
- خنککاری مایع
- یک تکنیک مدیریت حرارتی که مایع خنککننده را مستقیماً به تراشهها پمپاژ میکند، این روش زمانی ضروری است که خنککاری هوایی دیگر نتواند گرمای شدید قفسههای سرور متراکم را دفع کند.
- توان بلااستفاده (Stranded Power)
- ظرفیت الکتریکی که برای یک قفسه مرکز داده تأمین شده است اما به دلیل توزیع بار ناکارآمد یا محدودیتهای حرارتی، استفاده نشده باقی میماند.
منابع
[1]NVIDIAانویدیا و شرکای اکوسیستمNVIDIA Vera Rubin Platform Architecture and Efficiency
مطالعه در NVIDIA →
[2]SiliconANGLEشکاکان سختافزار و مدیران تأسیساتNvidia reveals fresh trove of performance benchmarks for Vera Rubin platform
مطالعه در SiliconANGLE →
[3]The Futurum Groupاپراتورهای ابری هایپراسکیلDSX Reframes the Gigawatt From a Power Budget to a Revenue Function
مطالعه در The Futurum Group →
[4]Mediumاپراتورهای ابری هایپراسکیلTokens Per Watt: Scaling Revenue and Margins
مطالعه در Medium →
[5]Varidataتوسعهدهندگان مدلهای هوش مصنوعیTokens per Watt Metric: Maximizing GPU Efficiency
مطالعه در Varidata →
[6]VRLA Techانویدیا و شرکای اکوسیستمThe Full Vera Rubin Platform: Six Co-Designed Chips
مطالعه در VRLA Tech →
[7]Civoتوسعهدهندگان مدلهای هوش مصنوعیVera Rubin: NVIDIA's Answer to AI Computing Demand
مطالعه در Civo →
نظرات
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



