رفتن به محتوای اصلی
Koohestun
زیرساخت هوش مصنوعیمقاله تشریحی· 8 دقیقه مطالعه· در هوش مصنوعی

چگونه NVLink Fusion تراشه‌های استنتاج d-Matrix را به رک‌های سرور انویدیا متصل می‌کند

یک یکپارچه‌سازی جدید به دیتاسنترها اجازه می‌دهد تا بارهای کاری هوش مصنوعی را بین پردازنده‌های گرافیکی انویدیا و پردازنده‌های تخصصی d-Matrix در یک رک سرور مشترک تقسیم کنند؛ راهکاری که برنامه‌های حساس به تأخیر را هدف قرار داده است.

به قلم ساناز امامی

طراحان سیلیکون‌های تخصصی 35%اکوسیستم‌های زیرساختی 35%اپراتورهای دیتاسنتر 30%
طراحان سیلیکون‌های تخصصی
تمرکز بر غلبه بر دیوار حافظه از طریق معماری‌های استنتاج هدفمند.
اکوسیستم‌های زیرساختی
تمرکز بر استانداردسازی لایه‌های فیزیکی و شبکه در دیتاسنترهای هوش مصنوعی.
اپراتورهای دیتاسنتر
تمرکز بر بهینه‌سازی هزینه‌های سرمایه‌ای از طریق تفکیک ناهمگن.

دیدگاه‌هایی که این گزارش پوشش نداده

  • توسعه‌دهندگان نرم‌افزاری که انتقال سخت‌افزاری را مدیریت می‌کنند
  • کاربران نهایی خدمات توکن پریمیوم

اپراتورهای دیتاسنتر اکنون می‌توانند تراشه‌های استنتاج هوش مصنوعی شخص ثالث را مستقیماً در رک‌های سرور اختصاصی انویدیا قرار دهند و بار کاری تولید متن را بین معماری‌های مختلف پردازنده تقسیم کنند تا زمان پاسخ‌گویی تسریع شود. این یکپارچه‌سازی که در ۱۰ سپتامبر ۲۰۲۶ اعلام شد، پردازنده‌های آینده Raptor شرکت d-Matrix را با استفاده از فناوری NVLink Fusion به زیرساخت انویدیا متصل می‌کند. با باز شدن این بستر ارتباطی پرسرعت که پیش‌تر تنها واحدهای پردازش گرافیکی (GPU) خود انویدیا را به هم متصل می‌کرد، این همکاری به تأسیسات اجازه می‌دهد تا سخت‌افزارها را بدون نیاز به سیم‌کشی مجدد دیتاسنترهایشان با هم ترکیب کنند. این حرکت نشان‌دهنده تغییر رویکرد صنعت به زیرساخت فیزیکی هوش مصنوعی است؛ گذار از خوشه‌های همگن به سمت سیستم‌های تخصصی و تفکیک‌شده.[1][2]

این تغییر معماری یک گلوگاه اساسی را در نحوه سرویس‌دهی مدل‌های زبانی بزرگ به کاربران در محیط‌های عملیاتی برطرف می‌کند. وقتی فردی درخواستی را به یک سیستم هوش مصنوعی ارسال می‌کند، شبکه عصبی زیربنایی برای ارائه پاسخ، دو وظیفه محاسباتی مجزا را انجام می‌دهد. گام اول خواندن و پردازش درخواست ورودی است که به فاز پیش‌پر کردن (Prefill) معروف است. گام دوم تولید کلمه به کلمه پاسخ است که فاز رمزگشایی (Decode) نامیده می‌شود. از آنجا که این دو فاز تقاضاهای کاملاً متفاوتی از سخت‌افزار دارند، اجرای هر دوی آن‌ها روی یک پردازنده، اپراتورهای دیتاسنتر را مجبور می‌کند تا بین سرعت یا هزینه یکی را فدا کنند؛ مسئله‌ای که با مقیاس‌پذیری مدل‌ها برای سرویس‌دهی همزمان به میلیون‌ها کاربر، ناکارآمدی‌هایی ایجاد می‌کند.[5]

فاز پیش‌پر کردن بسیار موازی و نیازمند محاسبات سنگین است، که آن را به یک بار کاری ایده‌آل برای قابلیت‌های پردازش موازی عظیم واحدهای پردازش گرافیکی مانند معماری Vera Rubin انویدیا تبدیل می‌کند. با این حال، فاز رمزگشایی متوالی و به شدت وابسته به حافظه است. مدل باید برای هر توکنی که تولید می‌کند، کل ماتریس وزن خود را در حافظه بارگذاری کند؛ این امر یک گلوگاه تأخیر ایجاد می‌کند که در آن پردازنده بیکار می‌ماند و منتظر رسیدن داده‌ها از تراشه‌های حافظه می‌شود. از آنجا که هسته‌های محاسباتی می‌توانند داده‌ها را بسیار سریع‌تر از آنچه حافظه می‌تواند تأمین کند پردازش کنند، فاز رمزگشایی عملاً پردازنده را در تنگنا قرار می‌دهد و قدرت محاسباتی گران‌قیمتی را که پردازنده‌های گرافیکی را برای آموزش تا این حد ارزشمند می‌کند، هدر می‌دهد.[3]

فاز پیش‌پر کردن کل درخواست را به صورت موازی پردازش می‌کند، در حالی که فاز رمزگشایی پاسخ را به صورت متوالی تولید می‌کند.

برای حل این دیوار حافظه، اپراتورهای دیتاسنتر به سمت یک مدل استقرار به نام تفکیک ناهمگن (heterogeneous disaggregation) حرکت می‌کنند. به جای مجبور کردن یک واحد پردازش گرافیکی به مدیریت ناکارآمد هر دو فاز، بار کاری در میان سخت‌افزارهای تخصصی که به صورت هماهنگ کار می‌کنند، تقسیم می‌شود. پردازنده‌های انویدیا فاز سنگین پیش‌پر کردن را مدیریت کرده و زمینه درخواست را محاسبه می‌کنند، و سپس آن زمینه را به واحدهای پردازش استنتاج تخصصی می‌سپارند که مشخصاً برای تسریع فاز رمزگشایی وابسته به حافظه طراحی شده‌اند. این تقسیم کار تضمین می‌کند که هر قطعه سیلیکونی دقیقاً همان عملیات ریاضی را انجام می‌دهد که برای اجرای آن مهندسی شده است و توان عملیاتی کلی رک سرور را به حداکثر می‌رساند.[1]

چالش فنی اصلی در این تفکیک، انتقال داده‌ها بین پردازنده گرافیکی و پردازنده استنتاج با سرعتی است که دستاورد افزایش سرعت در حین این انتقال از بین نرود. اتصالات استاندارد اترنت تأخیر بسیار زیادی را برای برنامه‌های بی‌درنگ ایجاد می‌کنند و یک گلوگاه در سوئیچ شبکه به وجود می‌آورند. فناوری NVLink Fusion انویدیا این مشکل را با گسترش بستر مقیاس‌پذیر اختصاصی خود - که پیش‌تر صرفاً برای سیلیکون‌های خود انویدیا رزرو شده بود - به پردازنده‌های شخص ثالث حل می‌کند. با پذیرش این استاندارد، طراحان تراشه‌های خارجی می‌توانند به سخت‌افزار خود اجازه دهند تا با پردازنده‌های انویدیا طوری ارتباط برقرار کنند که گویی بخشی از همان تراشه فیزیکی هستند و پشته شبکه سنتی را به طور کامل دور بزنند.[4][6]

فناوری NVLink Fusion یک دامنه با پهنای باند بالا و تأخیر پایین در داخل رک سرور فراهم می‌کند و عملاً حافظه چندین پردازنده را یکپارچه می‌سازد. به گفته انویدیا، نسل ششم NVLink سه ترابایت بر ثانیه پهنای باند همه‌جانبه به ازای هر واحد پردازش استنتاج ارائه می‌دهد. این شرکت بیان می‌کند که این معماری نرخ بسته‌های داده را ۱۰ برابر بیشتر و تأخیر را ۳ برابر کمتر از شبکه‌های اترنت معمولی فراهم می‌کند و امکان سوئیچینگ سریع زمینه را که برای استنتاج تفکیک‌شده ضروری است، فراهم می‌سازد. با حذف گلوگاه شبکه، این بستر اجازه می‌دهد فازهای پیش‌پر کردن و رمزگشایی به طور پیوسته و بدون توقف عمل کنند و نرخ بهره‌وری واحدهای پردازش گرافیکی گران‌قیمت را در بالاترین حد ممکن نگه دارند.[1][3]

انویدیا بیان می‌کند که نسل ششم NVLink پهنای باند بسیار بالاتر و تأخیر کمتری نسبت به شبکه‌های اترنت معمولی ارائه می‌دهد.
فناوری NVLink Fusion یک دامنه با پهنای باند بالا و تأخیر پایین در داخل رک سرور فراهم می‌کند و عملاً حافظه چندین پردازنده را یکپارچه می‌سازد.

فراتر از اتصالات، این همکاری تراشه‌های d-Matrix را مستقیماً در معماری رک MGX انویدیا ادغام می‌کند. معماری MGX یک طراحی مرجع ماژولار است که سینی‌های فیزیکی، سیستم تأمین نیرو و زیرساخت خنک‌کننده مایع را در دیتاسنترها استاندارد می‌کند و به تأسیسات اجازه می‌دهد بدون نیاز به بازسازی اتاق، توان محاسباتی خود را ارتقا دهند. سید شث، هم‌بنیان‌گذار و مدیرعامل d-Matrix گفت: «تقاضا برای استنتاج در حال اوج‌گیری است، اما سرمایه، زمان و انرژی محدود باقی مانده‌اند. با NVLink Fusion و MGX، ما می‌توانیم واحدهای پردازش استنتاج (XPU) مدل Raptor خود را در یک معماری خنک‌شونده با مایع که به طور گسترده مستقر شده است ادغام کنیم و مسیر سریع‌تر و کم‌خطرتری برای استقرار و مقیاس‌پذیری استنتاج با تأخیر فوق‌العاده پایین به مشتریان ارائه دهیم.»[1]

واحد پردازش استنتاج Raptor به خودی خود گلوگاه حافظه در فاز رمزگشایی را از طریق یک طراحی فیزیکی نوین برطرف می‌کند. به جای قرار دادن تراشه‌های حافظه در کنار هسته‌های محاسباتی روی یک برد مدار چاپی دو بعدی - رویکرد استاندارد برای اکثر شتاب‌دهنده‌ها - d-Matrix از یک رویکرد انباشت سه‌بعدی استفاده می‌کند. این شرکت پیش‌نمایشی از این معماری را در کنفرانس Hot Chips سال ۲۰۲۶ ارائه کرد و به تفصیل توضیح داد که چگونه آرایش فیزیکی سیلیکون، سرعت بازیابی داده‌ها را تغییر می‌دهد. با تغییر هندسه تراشه، این طراحی مسافت فیزیکی را که سیگنال‌های الکتریکی باید در طول فراخوانی‌های مکرر حافظه برای تولید متن طی کنند، به حداقل می‌رساند.[2][5]

به طور خاص، پکیج Raptor یک تراشه حافظه با دسترسی تصادفی پویا (DRAM) را مستقیماً روی یک تراشه محاسباتی حافظه با دسترسی تصادفی ایستا (SRAM) انباشته می‌کند و یک پکیج دو طبقه واحد را تشکیل می‌دهد که توسط مسیرهای عمودی میکروسکوپی به هم متصل شده‌اند. این مجاورت فیزیکی به شدت مسافتی را که داده‌ها باید طی کنند کاهش می‌دهد، مصرف انرژی مورد نیاز برای ارسال سیگنال را پایین می‌آورد و سرعتی را که هسته‌های محاسباتی می‌توانند وزن‌های مدل را در طول فاز متوالی رمزگشایی فراخوانی کنند، افزایش می‌دهد. از آنجا که فاز رمزگشایی کاملاً به پهنای باند حافظه وابسته است، این یکپارچگی عمودی مستقیماً به سرعت تولید بالاتر برای کاربر نهایی ترجمه می‌شود.[2]

پردازنده Raptor XPU حافظه را مستقیماً روی هسته‌های محاسباتی انباشته می‌کند تا مسافت فیزیکی انتقال داده‌ها در طول استنتاج را کاهش دهد.

معماری حاصل، آنچه را که d-Matrix «اقتصاد توکن پریمیوم» می‌نامد، هدف قرار می‌دهد. این‌ها برنامه‌های سازمانی هستند که در آن‌ها تعامل‌پذیری، ارزش پیشنهادی اصلی است و مشتریان حاضرند برای سرعت آنی هزینه بیشتری بپردازند. مثال‌ها شامل دستیارهای صوتی بی‌درنگ که باید بدون مکث‌های ناخوشایند پاسخ دهند، ربات‌های چت خدمات مشتریان زنده، و دستیارهای کدنویسی هوش مصنوعی که هم‌زمان با تایپ برنامه‌نویس پیشنهاداتی تولید می‌کنند، می‌شود. در این موارد استفاده، تأخیر ایجاد شده توسط پیکربندی‌های سخت‌افزاری سنتی، توهم یک مکالمه یکپارچه را از بین می‌برد و شتاب‌دهی تخصصی رمزگشایی را به جای یک ویژگی لوکس، به یک الزام قطعی تبدیل می‌کند.[2][5]

برای اپراتورهای دیتاسنتر، این یکپارچه‌سازی راهی برای مقیاس‌پذیری ظرفیت استنتاج آن‌ها بدون خرید واحدهای پردازش گرافیکی پرچم‌دار اضافی ارائه می‌دهد. با قرار دادن پردازنده‌های استنتاج Raptor در همان رک‌های خنک‌شونده با مایع در کنار واحدهای پردازش مرکزی انویدیا، واحدهای پردازش داده BlueField و تجهیزات شبکه اترنت Spectrum-X، ارائه‌دهندگان خدمات ابری مقیاس‌پذیر می‌توانند ترکیب سخت‌افزاری خود را برای تقاضاهای اقتصادی خاص بارهای کاری استنتاج بهینه کنند. این انعطاف‌پذیری به ارائه‌دهندگان ابری اجازه می‌دهد تا مدل‌های قیمت‌گذاری چندلایه‌ای ارائه دهند؛ به طوری که وظایف پردازش دسته‌ای را به سخت‌افزار استاندارد هدایت کرده و رک‌های پرسرعت و تفکیک‌شده را برای مشتریانی که خواهان عملکرد بی‌درنگ هستند، رزرو کنند.[3][4]

سخت‌افزار فیزیکی مورد نیاز برای اجرای این معماری تفکیک‌شده هنوز در مرحله تولید انبوه نیست. انتظار می‌رود تراشه Raptor مرحله نهایی طراحی خود را که در صنعت نیمه‌هادی به عنوان tape-out شناخته می‌شود، قبل از پایان سال ۲۰۲۶ به اتمام برساند. پس از تولید و آزمایش، در دسترس بودن اولیه پردازنده‌های استنتاج یکپارچه در اکوسیستم رک MGX انویدیا برای سه‌ماهه چهارم سال ۲۰۲۷ پیش‌بینی می‌شود، که البته منوط به اعتبارسنجی نهایی توسط آزمایشگاه‌های پیشگام هوش مصنوعی است که در حال حاضر این سیلیکون را ارزیابی می‌کنند.[5]

در حالی که d-Matrix یکی از پذیرندگان اولیه این استاندارد است، موفقیت NVLink Fusion به پذیرش گسترده‌تر اکوسیستم و یکپارچه‌سازی پیچیده نرم‌افزاری بستگی دارد. انویدیا فهرستی از دیگر شرکای سخت‌افزاری، از جمله Astera Labs برای راهکارهای اتصال سفارشی را اعلام کرده است، اما دوام بلندمدت تفکیک ناهمگن به چارچوب‌های نرم‌افزاری متکی است که بتوانند انتقال کار بین معماری‌های سیلیکونی رقیب را در مقیاس وسیع به طور یکپارچه مدیریت کنند. اگر لایه نرم‌افزاری نتواند وظایف پیش‌پر کردن و رمزگشایی را به طور کارآمد مسیریابی کند، سرعت‌های سخت‌افزاری تئوری در محیط‌های عملیاتی محقق نخواهند شد.[3][6]

آنچه نمی‌دانیم

  • آیا چارچوب‌های نرم‌افزاری می‌توانند انتقال کار بین پردازنده‌های گرافیکی و XPUها را در مقیاس وسیع به طور یکپارچه مدیریت کنند یا خیر.
  • ساختار نهایی قیمت‌گذاری برای اپراتورهای دیتاسنتر که این معماری تفکیک‌شده را اتخاذ می‌کنند، چگونه خواهد بود.
  • استانداردهای ارتباطی رقیب در واکنش به باز شدن NVLink انویدیا به روی اشخاص ثالث چه رویکردی خواهند داشت.

نکات کلیدی

  • دیتاسنترها اکنون می‌توانند با استفاده از NVLink Fusion، تراشه‌های استنتاج d-Matrix را مستقیماً در رک‌های سرور انویدیا ادغام کنند.
  • این یکپارچه‌سازی امکان تفکیک ناهمگن را فراهم می‌کند و بارهای کاری هوش مصنوعی را بین پردازنده‌های گرافیکی برای پردازش درخواست و پردازنده‌های XPU برای تولید متن تقسیم می‌کند.
  • فناوری NVLink Fusion انویدیا سه ترابایت بر ثانیه پهنای باند ارائه می‌دهد که به طور قابل‌توجهی از اتصالات استاندارد اترنت بهتر عمل می‌کند.
  • تراشه Raptor شرکت d-Matrix از انباشت سه‌بعدی حافظه برای کاهش تأخیر در برنامه‌های بی‌درنگ مانند دستیارهای صوتی و ابزارهای کدنویسی بهره می‌برد.

چرا مهم است

با گذر هوش مصنوعی از مرحله آموزش به استفاده روزمره، سرعت تولید پاسخ به یک گلوگاه حیاتی تبدیل شده است. امکان اتصال مستقیم تراشه‌های تخصصی استنتاج به زیرساخت غالب انویدیا، هزینه و تأخیر اجرای ابزارهای بی‌درنگ هوش مصنوعی مانند دستیارهای صوتی و ابزارهای کدنویسی را کاهش می‌دهد.

اصطلاحات کلیدی

فاز پیش‌پر کردن (Prefill)
مرحله اولیه تولید متن هوش مصنوعی که در آن مدل کل درخواست ورودی کاربر را به طور همزمان می‌خواند و پردازش می‌کند.
فاز رمزگشایی (Decode)
مرحله متوالی تولید متن هوش مصنوعی که در آن مدل پاسخ را کلمه به کلمه یا توکن به توکن تولید می‌کند.
تفکیک ناهمگن (Heterogeneous Disaggregation)
عمل تقسیم یک بار کاری محاسباتی واحد در میان انواع مختلف پردازنده‌های تخصصی برای به حداکثر رساندن کارایی.
فناوری NVLink Fusion
یک فناوری شبکه اختصاصی که به پردازنده‌های شخص ثالث اجازه می‌دهد با سخت‌افزار انویدیا با سرعت بسیار بالا ارتباط برقرار کنند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

طراحان سیلیکون‌های تخصصی 35%اکوسیستم‌های زیرساختی 35%اپراتورهای دیتاسنتر 30%
  1. [1]NVIDIA Blogاکوسیستم‌های زیرساختی

    d-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment

    مطالعه در NVIDIA Blog
  2. [2]d-Matrixطراحان سیلیکون‌های تخصصی

    d-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment

    مطالعه در d-Matrix
  3. [3]Converge Digestاکوسیستم‌های زیرساختی

    d-Matrix Taps NVIDIA NVLink Fusion for AI Inference

    مطالعه در Converge Digest
  4. [4]The Economic Timesاپراتورهای دیتاسنتر

    d-Matrix will integrate its Raptor XPUs with Nvidia's NVLink Fusion technology

    مطالعه در The Economic Times
  5. [5]Unite.aiطراحان سیلیکون‌های تخصصی

    d-Matrix gains entry into NVIDIA's AI factory ecosystem by adopting NVLink Fusion for its Raptor inference XPUs

    مطالعه در Unite.ai
  6. [6]PR Newswireاکوسیستم‌های زیرساختی

    d-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment

    مطالعه در PR Newswire

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.