چگونه NVLink Fusion تراشههای استنتاج d-Matrix را به رکهای سرور انویدیا متصل میکند
یک یکپارچهسازی جدید به دیتاسنترها اجازه میدهد تا بارهای کاری هوش مصنوعی را بین پردازندههای گرافیکی انویدیا و پردازندههای تخصصی d-Matrix در یک رک سرور مشترک تقسیم کنند؛ راهکاری که برنامههای حساس به تأخیر را هدف قرار داده است.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- طراحان سیلیکونهای تخصصی
- تمرکز بر غلبه بر دیوار حافظه از طریق معماریهای استنتاج هدفمند.
- اکوسیستمهای زیرساختی
- تمرکز بر استانداردسازی لایههای فیزیکی و شبکه در دیتاسنترهای هوش مصنوعی.
- اپراتورهای دیتاسنتر
- تمرکز بر بهینهسازی هزینههای سرمایهای از طریق تفکیک ناهمگن.
دیدگاههایی که این گزارش پوشش نداده
- توسعهدهندگان نرمافزاری که انتقال سختافزاری را مدیریت میکنند
- کاربران نهایی خدمات توکن پریمیوم
اپراتورهای دیتاسنتر اکنون میتوانند تراشههای استنتاج هوش مصنوعی شخص ثالث را مستقیماً در رکهای سرور اختصاصی انویدیا قرار دهند و بار کاری تولید متن را بین معماریهای مختلف پردازنده تقسیم کنند تا زمان پاسخگویی تسریع شود. این یکپارچهسازی که در ۱۰ سپتامبر ۲۰۲۶ اعلام شد، پردازندههای آینده Raptor شرکت d-Matrix را با استفاده از فناوری NVLink Fusion به زیرساخت انویدیا متصل میکند. با باز شدن این بستر ارتباطی پرسرعت که پیشتر تنها واحدهای پردازش گرافیکی (GPU) خود انویدیا را به هم متصل میکرد، این همکاری به تأسیسات اجازه میدهد تا سختافزارها را بدون نیاز به سیمکشی مجدد دیتاسنترهایشان با هم ترکیب کنند. این حرکت نشاندهنده تغییر رویکرد صنعت به زیرساخت فیزیکی هوش مصنوعی است؛ گذار از خوشههای همگن به سمت سیستمهای تخصصی و تفکیکشده.[1][2]
این تغییر معماری یک گلوگاه اساسی را در نحوه سرویسدهی مدلهای زبانی بزرگ به کاربران در محیطهای عملیاتی برطرف میکند. وقتی فردی درخواستی را به یک سیستم هوش مصنوعی ارسال میکند، شبکه عصبی زیربنایی برای ارائه پاسخ، دو وظیفه محاسباتی مجزا را انجام میدهد. گام اول خواندن و پردازش درخواست ورودی است که به فاز پیشپر کردن (Prefill) معروف است. گام دوم تولید کلمه به کلمه پاسخ است که فاز رمزگشایی (Decode) نامیده میشود. از آنجا که این دو فاز تقاضاهای کاملاً متفاوتی از سختافزار دارند، اجرای هر دوی آنها روی یک پردازنده، اپراتورهای دیتاسنتر را مجبور میکند تا بین سرعت یا هزینه یکی را فدا کنند؛ مسئلهای که با مقیاسپذیری مدلها برای سرویسدهی همزمان به میلیونها کاربر، ناکارآمدیهایی ایجاد میکند.[5]
فاز پیشپر کردن بسیار موازی و نیازمند محاسبات سنگین است، که آن را به یک بار کاری ایدهآل برای قابلیتهای پردازش موازی عظیم واحدهای پردازش گرافیکی مانند معماری Vera Rubin انویدیا تبدیل میکند. با این حال، فاز رمزگشایی متوالی و به شدت وابسته به حافظه است. مدل باید برای هر توکنی که تولید میکند، کل ماتریس وزن خود را در حافظه بارگذاری کند؛ این امر یک گلوگاه تأخیر ایجاد میکند که در آن پردازنده بیکار میماند و منتظر رسیدن دادهها از تراشههای حافظه میشود. از آنجا که هستههای محاسباتی میتوانند دادهها را بسیار سریعتر از آنچه حافظه میتواند تأمین کند پردازش کنند، فاز رمزگشایی عملاً پردازنده را در تنگنا قرار میدهد و قدرت محاسباتی گرانقیمتی را که پردازندههای گرافیکی را برای آموزش تا این حد ارزشمند میکند، هدر میدهد.[3]
برای حل این دیوار حافظه، اپراتورهای دیتاسنتر به سمت یک مدل استقرار به نام تفکیک ناهمگن (heterogeneous disaggregation) حرکت میکنند. به جای مجبور کردن یک واحد پردازش گرافیکی به مدیریت ناکارآمد هر دو فاز، بار کاری در میان سختافزارهای تخصصی که به صورت هماهنگ کار میکنند، تقسیم میشود. پردازندههای انویدیا فاز سنگین پیشپر کردن را مدیریت کرده و زمینه درخواست را محاسبه میکنند، و سپس آن زمینه را به واحدهای پردازش استنتاج تخصصی میسپارند که مشخصاً برای تسریع فاز رمزگشایی وابسته به حافظه طراحی شدهاند. این تقسیم کار تضمین میکند که هر قطعه سیلیکونی دقیقاً همان عملیات ریاضی را انجام میدهد که برای اجرای آن مهندسی شده است و توان عملیاتی کلی رک سرور را به حداکثر میرساند.[1]
چالش فنی اصلی در این تفکیک، انتقال دادهها بین پردازنده گرافیکی و پردازنده استنتاج با سرعتی است که دستاورد افزایش سرعت در حین این انتقال از بین نرود. اتصالات استاندارد اترنت تأخیر بسیار زیادی را برای برنامههای بیدرنگ ایجاد میکنند و یک گلوگاه در سوئیچ شبکه به وجود میآورند. فناوری NVLink Fusion انویدیا این مشکل را با گسترش بستر مقیاسپذیر اختصاصی خود - که پیشتر صرفاً برای سیلیکونهای خود انویدیا رزرو شده بود - به پردازندههای شخص ثالث حل میکند. با پذیرش این استاندارد، طراحان تراشههای خارجی میتوانند به سختافزار خود اجازه دهند تا با پردازندههای انویدیا طوری ارتباط برقرار کنند که گویی بخشی از همان تراشه فیزیکی هستند و پشته شبکه سنتی را به طور کامل دور بزنند.[4][6]
فناوری NVLink Fusion یک دامنه با پهنای باند بالا و تأخیر پایین در داخل رک سرور فراهم میکند و عملاً حافظه چندین پردازنده را یکپارچه میسازد. به گفته انویدیا، نسل ششم NVLink سه ترابایت بر ثانیه پهنای باند همهجانبه به ازای هر واحد پردازش استنتاج ارائه میدهد. این شرکت بیان میکند که این معماری نرخ بستههای داده را ۱۰ برابر بیشتر و تأخیر را ۳ برابر کمتر از شبکههای اترنت معمولی فراهم میکند و امکان سوئیچینگ سریع زمینه را که برای استنتاج تفکیکشده ضروری است، فراهم میسازد. با حذف گلوگاه شبکه، این بستر اجازه میدهد فازهای پیشپر کردن و رمزگشایی به طور پیوسته و بدون توقف عمل کنند و نرخ بهرهوری واحدهای پردازش گرافیکی گرانقیمت را در بالاترین حد ممکن نگه دارند.[1][3]
فناوری NVLink Fusion یک دامنه با پهنای باند بالا و تأخیر پایین در داخل رک سرور فراهم میکند و عملاً حافظه چندین پردازنده را یکپارچه میسازد.
فراتر از اتصالات، این همکاری تراشههای d-Matrix را مستقیماً در معماری رک MGX انویدیا ادغام میکند. معماری MGX یک طراحی مرجع ماژولار است که سینیهای فیزیکی، سیستم تأمین نیرو و زیرساخت خنککننده مایع را در دیتاسنترها استاندارد میکند و به تأسیسات اجازه میدهد بدون نیاز به بازسازی اتاق، توان محاسباتی خود را ارتقا دهند. سید شث، همبنیانگذار و مدیرعامل d-Matrix گفت: «تقاضا برای استنتاج در حال اوجگیری است، اما سرمایه، زمان و انرژی محدود باقی ماندهاند. با NVLink Fusion و MGX، ما میتوانیم واحدهای پردازش استنتاج (XPU) مدل Raptor خود را در یک معماری خنکشونده با مایع که به طور گسترده مستقر شده است ادغام کنیم و مسیر سریعتر و کمخطرتری برای استقرار و مقیاسپذیری استنتاج با تأخیر فوقالعاده پایین به مشتریان ارائه دهیم.»[1]
واحد پردازش استنتاج Raptor به خودی خود گلوگاه حافظه در فاز رمزگشایی را از طریق یک طراحی فیزیکی نوین برطرف میکند. به جای قرار دادن تراشههای حافظه در کنار هستههای محاسباتی روی یک برد مدار چاپی دو بعدی - رویکرد استاندارد برای اکثر شتابدهندهها - d-Matrix از یک رویکرد انباشت سهبعدی استفاده میکند. این شرکت پیشنمایشی از این معماری را در کنفرانس Hot Chips سال ۲۰۲۶ ارائه کرد و به تفصیل توضیح داد که چگونه آرایش فیزیکی سیلیکون، سرعت بازیابی دادهها را تغییر میدهد. با تغییر هندسه تراشه، این طراحی مسافت فیزیکی را که سیگنالهای الکتریکی باید در طول فراخوانیهای مکرر حافظه برای تولید متن طی کنند، به حداقل میرساند.[2][5]
به طور خاص، پکیج Raptor یک تراشه حافظه با دسترسی تصادفی پویا (DRAM) را مستقیماً روی یک تراشه محاسباتی حافظه با دسترسی تصادفی ایستا (SRAM) انباشته میکند و یک پکیج دو طبقه واحد را تشکیل میدهد که توسط مسیرهای عمودی میکروسکوپی به هم متصل شدهاند. این مجاورت فیزیکی به شدت مسافتی را که دادهها باید طی کنند کاهش میدهد، مصرف انرژی مورد نیاز برای ارسال سیگنال را پایین میآورد و سرعتی را که هستههای محاسباتی میتوانند وزنهای مدل را در طول فاز متوالی رمزگشایی فراخوانی کنند، افزایش میدهد. از آنجا که فاز رمزگشایی کاملاً به پهنای باند حافظه وابسته است، این یکپارچگی عمودی مستقیماً به سرعت تولید بالاتر برای کاربر نهایی ترجمه میشود.[2]
معماری حاصل، آنچه را که d-Matrix «اقتصاد توکن پریمیوم» مینامد، هدف قرار میدهد. اینها برنامههای سازمانی هستند که در آنها تعاملپذیری، ارزش پیشنهادی اصلی است و مشتریان حاضرند برای سرعت آنی هزینه بیشتری بپردازند. مثالها شامل دستیارهای صوتی بیدرنگ که باید بدون مکثهای ناخوشایند پاسخ دهند، رباتهای چت خدمات مشتریان زنده، و دستیارهای کدنویسی هوش مصنوعی که همزمان با تایپ برنامهنویس پیشنهاداتی تولید میکنند، میشود. در این موارد استفاده، تأخیر ایجاد شده توسط پیکربندیهای سختافزاری سنتی، توهم یک مکالمه یکپارچه را از بین میبرد و شتابدهی تخصصی رمزگشایی را به جای یک ویژگی لوکس، به یک الزام قطعی تبدیل میکند.[2][5]
برای اپراتورهای دیتاسنتر، این یکپارچهسازی راهی برای مقیاسپذیری ظرفیت استنتاج آنها بدون خرید واحدهای پردازش گرافیکی پرچمدار اضافی ارائه میدهد. با قرار دادن پردازندههای استنتاج Raptor در همان رکهای خنکشونده با مایع در کنار واحدهای پردازش مرکزی انویدیا، واحدهای پردازش داده BlueField و تجهیزات شبکه اترنت Spectrum-X، ارائهدهندگان خدمات ابری مقیاسپذیر میتوانند ترکیب سختافزاری خود را برای تقاضاهای اقتصادی خاص بارهای کاری استنتاج بهینه کنند. این انعطافپذیری به ارائهدهندگان ابری اجازه میدهد تا مدلهای قیمتگذاری چندلایهای ارائه دهند؛ به طوری که وظایف پردازش دستهای را به سختافزار استاندارد هدایت کرده و رکهای پرسرعت و تفکیکشده را برای مشتریانی که خواهان عملکرد بیدرنگ هستند، رزرو کنند.[3][4]
سختافزار فیزیکی مورد نیاز برای اجرای این معماری تفکیکشده هنوز در مرحله تولید انبوه نیست. انتظار میرود تراشه Raptor مرحله نهایی طراحی خود را که در صنعت نیمههادی به عنوان tape-out شناخته میشود، قبل از پایان سال ۲۰۲۶ به اتمام برساند. پس از تولید و آزمایش، در دسترس بودن اولیه پردازندههای استنتاج یکپارچه در اکوسیستم رک MGX انویدیا برای سهماهه چهارم سال ۲۰۲۷ پیشبینی میشود، که البته منوط به اعتبارسنجی نهایی توسط آزمایشگاههای پیشگام هوش مصنوعی است که در حال حاضر این سیلیکون را ارزیابی میکنند.[5]
در حالی که d-Matrix یکی از پذیرندگان اولیه این استاندارد است، موفقیت NVLink Fusion به پذیرش گستردهتر اکوسیستم و یکپارچهسازی پیچیده نرمافزاری بستگی دارد. انویدیا فهرستی از دیگر شرکای سختافزاری، از جمله Astera Labs برای راهکارهای اتصال سفارشی را اعلام کرده است، اما دوام بلندمدت تفکیک ناهمگن به چارچوبهای نرمافزاری متکی است که بتوانند انتقال کار بین معماریهای سیلیکونی رقیب را در مقیاس وسیع به طور یکپارچه مدیریت کنند. اگر لایه نرمافزاری نتواند وظایف پیشپر کردن و رمزگشایی را به طور کارآمد مسیریابی کند، سرعتهای سختافزاری تئوری در محیطهای عملیاتی محقق نخواهند شد.[3][6]
آنچه نمیدانیم
- آیا چارچوبهای نرمافزاری میتوانند انتقال کار بین پردازندههای گرافیکی و XPUها را در مقیاس وسیع به طور یکپارچه مدیریت کنند یا خیر.
- ساختار نهایی قیمتگذاری برای اپراتورهای دیتاسنتر که این معماری تفکیکشده را اتخاذ میکنند، چگونه خواهد بود.
- استانداردهای ارتباطی رقیب در واکنش به باز شدن NVLink انویدیا به روی اشخاص ثالث چه رویکردی خواهند داشت.
نکات کلیدی
- دیتاسنترها اکنون میتوانند با استفاده از NVLink Fusion، تراشههای استنتاج d-Matrix را مستقیماً در رکهای سرور انویدیا ادغام کنند.
- این یکپارچهسازی امکان تفکیک ناهمگن را فراهم میکند و بارهای کاری هوش مصنوعی را بین پردازندههای گرافیکی برای پردازش درخواست و پردازندههای XPU برای تولید متن تقسیم میکند.
- فناوری NVLink Fusion انویدیا سه ترابایت بر ثانیه پهنای باند ارائه میدهد که به طور قابلتوجهی از اتصالات استاندارد اترنت بهتر عمل میکند.
- تراشه Raptor شرکت d-Matrix از انباشت سهبعدی حافظه برای کاهش تأخیر در برنامههای بیدرنگ مانند دستیارهای صوتی و ابزارهای کدنویسی بهره میبرد.
چرا مهم است
با گذر هوش مصنوعی از مرحله آموزش به استفاده روزمره، سرعت تولید پاسخ به یک گلوگاه حیاتی تبدیل شده است. امکان اتصال مستقیم تراشههای تخصصی استنتاج به زیرساخت غالب انویدیا، هزینه و تأخیر اجرای ابزارهای بیدرنگ هوش مصنوعی مانند دستیارهای صوتی و ابزارهای کدنویسی را کاهش میدهد.
اصطلاحات کلیدی
- فاز پیشپر کردن (Prefill)
- مرحله اولیه تولید متن هوش مصنوعی که در آن مدل کل درخواست ورودی کاربر را به طور همزمان میخواند و پردازش میکند.
- فاز رمزگشایی (Decode)
- مرحله متوالی تولید متن هوش مصنوعی که در آن مدل پاسخ را کلمه به کلمه یا توکن به توکن تولید میکند.
- تفکیک ناهمگن (Heterogeneous Disaggregation)
- عمل تقسیم یک بار کاری محاسباتی واحد در میان انواع مختلف پردازندههای تخصصی برای به حداکثر رساندن کارایی.
- فناوری NVLink Fusion
- یک فناوری شبکه اختصاصی که به پردازندههای شخص ثالث اجازه میدهد با سختافزار انویدیا با سرعت بسیار بالا ارتباط برقرار کنند.
منابع
[1]NVIDIA Blogاکوسیستمهای زیرساختیd-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment
مطالعه در NVIDIA Blog →
[2]d-Matrixطراحان سیلیکونهای تخصصیd-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment
مطالعه در d-Matrix →
[3]Converge Digestاکوسیستمهای زیرساختیd-Matrix Taps NVIDIA NVLink Fusion for AI Inference
مطالعه در Converge Digest →
[4]The Economic Timesاپراتورهای دیتاسنترd-Matrix will integrate its Raptor XPUs with Nvidia's NVLink Fusion technology
مطالعه در The Economic Times →
[5]Unite.aiطراحان سیلیکونهای تخصصیd-Matrix gains entry into NVIDIA's AI factory ecosystem by adopting NVLink Fusion for its Raptor inference XPUs
مطالعه در Unite.ai →
[6]PR Newswireاکوسیستمهای زیرساختیd-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment
مطالعه در PR Newswire →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →عملیات نفوذ سایبری
گزارش نیویورکتایمز: استفاده ایران، چین و شرکتهای اسرائیلی از ایجنتهای هوش مصنوعی برای عملیات نفوذ خودکار
4 منبع
معماری عامل
مرز معماری میان عاملهای واکنشی ساده و مبتنی بر مدل
9 منبع
معماری سیستمها
انواع عوامل هوش مصنوعی (AI Agents) و کاربردهای آنها در دنیای واقعی
3 منبع
AI Architecture
هوش مصنوعی عامل (AI Agent) چیست؟ تفاوت آن با مدلهای زبانی استاندارد
4 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





