رفتن به محتوای اصلی
کوهستان
توضیح کوهستانسخت‌افزار هوش مصنوعیانویدیا H100· 7 دقیقه مطالعه· در هوش مصنوعی

رمزگشایی خودبازگشتی تک‌توکنی در نسبت یک فلاپس بر بایت؛ تله‌ای که هسته‌های تانسور را زیر سقف بازدهی حبس می‌کند

هنگام تولید تک‌توکنی، مدل‌های زبانی بزرگ ماتریس‌های عظیم وزن را از حافظه بارگذاری می‌کنند تا به ازای هر پارامتر تنها یک محاسبه انجام دهند. این عدم تقارن ساختاری شتاب‌دهنده‌های پیشرفته هوش مصنوعی را ناچار می‌کند در کسری از ظرفیت محاسباتی اسمی خود کار کنند و گلوگاه بنیادین سرعت استنتاج را رقم بزند.

به قلم فرشید جمشیدی

به‌طور خلاصه

  • رمزگشایی خودبازگشتی نیازمند بارگذاری کل مدل از حافظه برای تولید هر تک‌توکن است که به شدت محاسباتی ناچیز یک فلاپس بر بایت می‌انجامد.
  • این نسبت یک به یک، ۲۹۵ برابر کمتر از نقطه برآمدگی محاسبه به حافظه در انویدیا H100 است و بیش از ۹۹ درصد از توان هسته‌های تانسور را بیکار می‌گذارد.
  • ارتقاهای سخت‌افزاری جدید مانند H200 سرعت تولید متن را نه با توان محاسباتی بیشتر، بلکه با رساندن پهنای باند حافظه به ۴٫۸ ترابایت بر ثانیه بهبود بخشیده‌اند.

شرط بنیادین برای دستیابی هر پردازنده‌ای به سقف سرعت اسمی خود این است که داده‌ها با همان سرعتی به واحدهای محاسباتی برسند که هسته‌ها قادر به ضرب و جمع آن هستند. در نسل فعلی مدل‌های زبانی بزرگ که کلمات را تک‌به‌تک و گام‌به‌گام می‌سازند، این شرط بنیادین دچار فروپاشی ساختاری می‌شود.[3]

معماری رمزگشایی خودبازگشتی، سامانه پردازشی را ناچار می‌کند برای تولید تک‌تک واژه‌ها، کل وزن‌های مدل را از اول تا آخر از حافظه بخواند. از آنجا که هر واژه جدید مستقیماً بر اساس توالی پیشین بنا می‌شود، فرایند تولید خروجی در بعد زمان امکان موازی‌سازی ندارد.[3]

نتیجه این سازوکار، ایجاد یک گلوگاه محاسباتی است که پیشرفته‌ترین شتاب‌دهنده‌های هوش مصنوعی جهان را در وضعیتی نزدیک به بیکاری کامل قرار می‌دهد. هنگامی که یک پردازنده انویدیا H100 تنها یک توکن تولید می‌کند، هسته‌های تانسور آن بیش از ۹۹ درصد از سیکل‌های پردازشی خود را در انتظار رسیدن داده‌ها هدر می‌دهند.[3]

این پدیده در مهندسی کامپیوتر «دیوار حافظه» نام دارد؛ دیواری که اقتصاد زیرساخت‌های هوش مصنوعی را تعیین می‌کند، معماری سخت‌افزارهای نسل بعدی را هدایت می‌نماید و روشن می‌سازد چرا تولید یک پاسخ چند برابر کندتر از خواندن صورت مسئله است.[3]

حساب و کتاب ریاضی یک تک‌توکن

برای درک چرایی این گلوگاه، باید عملیات دقیق ریاضیِ لازم برای ساخت یک توکن منفرد را گام‌به‌گام ردیابی کرد. یک مدل زبانی بزرگ در عمل چیزی جز مجموعه‌ای گسترده از ماتریس‌های وزنی پیوسته نیست.[3]

در یک مدل استاندارد ۷ میلیارد پارامتری که با دقت اعشاری ۱۶ بیتی ذخیره شده است، این وزن‌ها فضایی حدود ۱۴ گیگابایت را اشغال می‌کنند. در زمان استنتاج، پردازنده گرافیکی مجبور است تک‌تک این پارامترها را از حافظه با پهنای باند بالا (HBM) فراخوانی کرده و درون رم ایستا (SRAM) روی تراشه بارگذاری کند.[2][3]

یک مدل ۷ میلیارد پارامتری برای تولید هر توکن منفرد نیازمند جابه‌جایی ۱۴ گیگابایت داده است.

پردازنده به ازای بارگذاری هر پارامتر، دقیقاً دو عمل ریاضی انجام می‌دهد: یک عمل ضرب و یک عمل جمع. نسبت میان این دو متغیر، مفهوم بنیادین «شدت محاسباتی» را تعریف می‌کند.[1][3]

از آنجا که سیستم برای انجام دو عملیات ممیز شناور ناگزیر به بارگذاری دو بایت داده است، شدت محاسباتی رمزگشایی تک‌توکنی دقیقاً یک فلاپس بر بایت محاسبه می‌شود. این نسبت یک به یک، واقعیت ریاضی گریزناپذیر در استنتاج خودبازگشتی با اندازه دسته یک است.[3]

مدل سقف بازدهی و نقطه برآمدگی

طراحان سیلیکون این رابطه فیزیکی را با استفاده از «مدل سقف بازدهی» تحلیل می‌کنند؛ چارچوبی تصویری که محدودیت‌های عملکرد پردازنده را بر پایه شدت محاسباتی ترسیم می‌نماید. این نمودار شمایلی شبیه به یک سقف شیروانی با شیب آغازین و سقفی افقی دارد.[1]

بخش شیب‌دار نمایانگر بارهای کاریِ محدود به پهنای باند حافظه است، جایی که توان عملیاتی به شکل خطی متناسب با سرعت انتقال داده بالا می‌رود. خط افقی و مسطح بالای نمودار نیز حد نهایی فیزیکی هسته‌های پردازشی را نشان می‌دهد، یعنی نقطه‌ای که سیلیکون با بالاترین توان محاسباتی ممکن عمل می‌کند.[1]

محل تلاقی این شیب صعودی با خط افقی سقف، «نقطه برآمدگی» نامیده می‌شود. این نقطه نشان‌دهنده حداقل شدت محاسباتی لازم است تا هسته‌های محاسباتی پیوسته از داده تغذیه شوند و از گلوگاه حافظه عبور کنند.[1]

در نسخه H100 SXM انویدیا، حداکثر توان تئوریک برای محاسبات ۱۶ بیتی به ۹۸۹ ترافلاپس می‌رسد. در مقابل، زیرسیستم حافظه آن توان تحویل داده با حداکثر نرخ ۳٫۳۵ ترابایت بر ثانیه را داراست.[3]

مدل سقف بازدهی نقطه‌ای دقیق را نشان می‌دهد که پردازنده از حالت محدود به حافظه وارد محدوده وابسته به محاسبه می‌شود.

با تقسیم سقف توان محاسباتی بر پهنای باند حافظه، نقطه برآمدگی روی عدد ۲۹۵ فلاپس بر بایت قرار می‌گیرد. به این معنی که برای بهره‌برداری کامل از توان H100، هر الگوریتم باید به ازای هر بایت داده‌ای که از حافظه اصلی استخراج می‌کند، دست‌کم ۲۹۵ عمل محاسباتی انجام دهد.[3]

فروپاشی ضریب بهره‌وری

فرایند رمزگشایی تک‌توکنی تنها با نسبت یک فلاپس بر بایت کار می‌کند که ۲۹۵ بار پایین‌تر از نقطه برآمدگی H100 است. بدین ترتیب بار کاری به انتهای سمت چپ نمودار سقف بازدهی دوخته می‌شود، یعنی در اعماق محدوده وابسته به حافظه.[1][3]

پیامد عینی این نسبت نامتوازن، فروپاشی چشمگیر بهره‌وری است. کارت گرافیک وزن‌ها را با سرعت ۳٫۳۵ ترابایت بر ثانیه پمپاژ می‌کند، اما چون روی هر بایت پردازش ناچیزی انجام می‌گیرد، واحدهای محاسباتی بلافاصله کار خود را به اتمام می‌رسانند.[3]

در اندازه دسته یک، سقف بهره‌وری محاسباتی H100 به زیر ۰٫۴ درصد سقوط می‌کند. در این حالت پردازنده عملاً به یک کنترل‌کننده حافظه بسیار گران‌قیمت بدل می‌شود که هسته‌های تانسور ۹۸۹ ترافلاپسی آن از بی‌کاری گرسنه مانده‌اند.[3]

همین سازوکار توضیح می‌دهد که چرا برای یک مدل ۱۴ گیگابایتی، عبور دادن وزن‌ها از گذرگاه حافظه با سرعت دو ترابایت بر ثانیه حدود هفت میلی‌ثانیه زمان می‌برد، در حالی که انجام محاسبات ریاضیِ واقعی کسری از میلی‌ثانیه طول می‌کشد. مابقی این زمان صرفاً تاخیر انتقال است.[3]

عدم تقارن میان ورودی و خروجی

این وضعیت اسفبار محدود به حافظه صرفاً بر مرحله رمزگشایی یا همان تولید متن حاکم است. هنگامی که کاربر پرامپت اولیه را ثبت می‌کند، مدل تمام توکن‌های ورودی را به طور همزمان در مرحله‌ای به نام «پیش‌بارگذاری» پردازش می‌نماید.[3]

پردازش ورودی اولیه ظرفیت محاسباتی پردازنده گرافیکی را به‌طور کامل پر می‌کند، در حالی که تولید پاسخ پردازنده را تقریباً کاملاً بیکار رها می‌سازد.

در مرحله پیش‌بارگذاری، پردازنده گرافیکی باز هم ۱۴ گیگابایت وزن‌ها را تنها یک بار بارگذاری می‌کند، اما این بار همان وزن‌ها را به شکل همزمان در تک‌تک توکن‌های موجود در پرامپت ضرب می‌نماید.[3]

اگر کاربر پرامپتی متشکل از ۲۰۴۸ توکن ارسال کند، شدت محاسباتی ناگهان تا حدود ۲۰۴۸ فلاپس بر بایت اوج می‌گیرد. این عدد جهشی بار کاری را از نقطه برآمدگی ۲۹۵ فلاپس بسیار فراتر برده و آن را روی سقف افقی نمودار می‌نشاند.[1][3]

در این محدوده وابسته به محاسبه، هسته‌های تانسور با تمام توان کار می‌کنند و پهنای باند حافظه دیگر عامل محدودکننده نیست. این عدم تقارن ساختاری آشکار می‌سازد چرا پردازش یک متن هزار کلمه‌ای در کسری از ثانیه تمام می‌شود، اما نوشتن یک پاسخ هزار کلمه‌ای ثانیه‌ها زمان می‌برد.[3]

تغییر گلوگاه با اندازه دسته‌ها

ابزار اصلی مهندسان برای افزایش شدت محاسباتی در فاز تولید، تکنیک دسته‌بندی است. با پردازش همزمان درخواست چندین کاربر، سرور مدل را یک‌بار از حافظه می‌خواند و آن را برای تولید همزمان چند توکن خروجی مختلف به کار می‌بندد.[3]

افزایش اندازه دسته از یک به ۳۲، شدت محاسباتی را به ۳۲ فلاپس بر بایت می‌رساند. گرچه این رقم همچنان زیر نقطه برآمدگی H100 جای دارد، اما ظرفیت خروجی کل سامانه را ۳۲ برابر می‌کند بدون آنکه نیازی به خواندن مکرر وزن‌ها از حافظه باشد.[3]

با این حال، دسته‌بندی چالش‌های خاص خود را تحمیل می‌کند. هر رشته پردازشی همزمان نیازمند حافظه موقت کلید-مقدار (KV Cache) مستقل است تا بستر توکن‌های قبلی را ذخیره کند.[3]

ارتقاهای سخت‌افزاری اخیر تماماً بر افزایش پهنای باند حافظه متمرکز بوده‌اند تا سرعت تولید متن افزایش یابد.

با بزرگ‌تر شدن اندازه دسته و طول پنجره زمینه، این حافظه موقت سهم بیشتری از گنجایش و پهنای باند کارت گرافیک را می‌بلعد. پژوهشگران دریافته‌اند در دسته‌های بزرگ، اشباع پهنای باند حافظه DRAM اصلی‌ترین گلوگاه باقی می‌ماند و بیش از نیمی از چرخه‌های هسته توجه را متوقف می‌کند.[3]

راهکارهای سخت‌افزاری و نرم‌افزاری

از آنجا که قدرت محاسباتی خام دردی از کمبود پهنای باند حافظه دوا نمی‌کند، سازندگان سخت‌افزار رویکرد خود را به سمت سرعت حافظه تغییر داده‌اند. پردازنده انویدیا H200 با همان توان محاسباتی ۹۸۹ ترافلاپسی H100 عرضه شد، اما استاندارد حافظه آن به HBM3e ارتقا یافت.[2][3]

این حافظه جدید به پهنای باند ۴٫۸ ترابایت بر ثانیه دست یافته که افزایشی ۴۳ درصدی نسبت به H100 محسوب می‌شود. در فرایند تولید وابسته به حافظه، این رقم مستقیماً به ۴۳ درصد افزایش سرعت تولید توکن در هر ثانیه ترجمه می‌گردد.[2][3]

در سطح نرم‌افزار، فنون کوانتیزاسیون یک میانبر ریاضی ارائه می‌دهند. مهندسان با فشرده‌سازی وزن‌های ۱۶ بیتی به اعداد صحیح ۸ بیتی یا ۴ بیتی، حجم داده عبوری از گذرگاه حافظه را به نصف یا یک‌چهارم کاهش می‌دهند.[3]

یک مدل ۸ بیتی برای بارگذاری تنها به نیمی از پهنای باند نیاز دارد و به این ترتیب نرخ تولید را دو برابر می‌سازد. هرچند این کار با افتی اندک در دقت همراه است، در حال حاضر کارآمدترین دستکاری نرم‌افزاری برای فرار از دیوار حافظه به شمار می‌رود.[3]

راهکارهای دیگر مانند رمزگشایی گمانه‌زن در تلاش‌اند تا این گلوگاه را دور بزنند. در این سامانه‌ها، ابتدا یک مدل کوچک چند توکن بعدی را حدس می‌زند، سپس مدل بزرگ با اتکا به توان محاسباتی بلااستفاده خود، در یک گام موازی تمامی توکن‌ها را به شکل یکجا ارزیابی می‌کند.[3]

کوانتیزاسیون حجم داده‌ای را که باید از گذرگاه حافظه عبور کند به نصف می‌رساند و سرعت تولید متن را دو برابر می‌کند.

قوانین بنیادین فیزیک در جابه‌جایی داده‌ها نشان می‌دهند پهنای باند حافظه با سرعتی بسیار کمتر از تراکم توان محاسباتی رشد می‌کند. طی یک دهه اخیر، توان ترافلاپسی شتاب‌دهنده‌ها رشد نمایی داشته، در حالی که سرعت حافظه صرفاً رشدی خطی را تجربه کرده است.[1][3]

تا زمانی که یک دگرگونی بنیادی در معماری سخت‌افزار رخ ندهد و حافظه و پردازنده به صورت فیزیکی درهم تنیده نشوند، رمزگشایی تک‌توکنی زیر نقطه برآمدگی حبس خواهد ماند؛ جایی که پیشرفته‌ترین پردازنده‌های جهان بیشتر وقت خود را به انتظار کشیدن برای رسیدن داده‌ها می‌گذرانند.[3]

این تحلیل چگونه انجام شد

روش
بازمحاسبه ضریب بهره‌وری سخت‌افزار از طریق مقایسه توان عملیاتی اوج ضرب ماتریسی در برابر محدودیت‌های پهنای باند حافظه حین استنتاج خودبازگشتی با اندازه دسته یک.
یافته
در اندازه دسته یک، یک شتاب‌دهنده H100 بیش از ۹۹٫۶ درصد از سیکل‌های محاسباتی خود را در انتظار داده‌های حافظه تلف می‌کند و عملاً با بهره‌وری زیر ۰٫۴ درصد از حداکثر توان تئوریک خود کار می‌کند.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
محدودیت‌های این تحلیل
این محاسبات بر فرض بار کاری خالص با اندازه دسته یک، بدون در نظر گرفتن رمزگشایی گمانه‌زن، محدودیت‌های حافظه پنهان کلید-مقدار یا تأخیر شبکه صورت گرفته است؛ عواملی که هر یک می‌توانند نرخ بهره‌وری واقعی را تغییر دهند.

اصطلاحات کلیدی

شدت محاسباتی (Arithmetic Intensity)
نسبت تعداد محاسبات ریاضی انجام‌شده به ازای هر بایت داده‌ای که از حافظه اصلی بارگذاری می‌شود.
مدل سقف بازدهی (Roofline Model)
نموداری تصویری در مهندسی سخت‌افزار که نشان می‌دهد آیا عملکرد یک برنامه توسط سرعت حافظه محدود شده یا توان پردازنده.
نقطه برآمدگی (Ridge Point)
شدت محاسباتی معینی که در آن پهنای باند حافظه پردازنده دقیقاً با حداکثر ظرفیت محاسباتی سیلیکون همگام می‌شود.
هسته‌های تانسور (Tensor Cores)
واحدهای پردازشی تخصصی درون پردازنده‌های گرافیکی جدید که برای ضرب پرسرعت ماتریس‌های بزرگ طراحی شده‌اند.
حافظه با پهنای باند بالا (HBM)
نوعی معماری حافظه سه‌بعدی لایه‌بندی‌شده که رم را به پردازنده بسیار نزدیک می‌کند تا نرخ تبادل چند ترابایت بر ثانیه‌ای حاصل شود.

پرسش‌های متداول

چرا افزودن پردازنده‌های گرافیکی بیشتر سرعت ساخت تک‌توکن را افزایش نمی‌دهد؟

تقسیم یک مدل میان چندین پردازنده حجم داده لازم برای هر تراشه را می‌کاهد، اما تاخیر ارتباطی میان‌تراشه‌ای را به همراه دارد. زمانی که صرف تبادل داده بین کارت‌ها می‌شود اغلب مزیتی را که از بارگذاری حافظه کمتر به دست آمده می‌بلعد.

معماری حافظه یکپارچه اپل با این گلوگاه چگونه برخورد می‌کند؟

تراشه‌های اپل حافظه مشترکی میان سی‌پی‌یو و جی‌پی‌یو ارائه می‌دهند که پهنای باندی تا ۴۰۰ گیگابایت بر ثانیه دارد. هرچند این مقدار برای دستگاه‌های مصرفی چشمگیر است، اما همچنان حدود هشت برابر کندتر از HBM3 در کارت H100 بوده و سرعت تولید آن به همان نسبت پایین‌تر است.

آیا مدل‌های انتشار برای تولید تصویر نیز با همین دیوار حافظه روبرو هستند؟

خیر. مدل‌های انتشار گام‌های متعدد نویززدایی پیچیده‌ای را روی همان وزن‌های بارگذاری‌شده انجام می‌دهند که شدت محاسباتی آن‌ها را بالا می‌برد. این مدل‌ها عموماً وابسته به پردازش هستند و مستقیماً از افزایش ترافلاپس بهره‌مند می‌شوند.

بررسی عمیق دیدگاه‌ها

طراحان سخت‌افزار

مهندسانی که تمرکز خود را بر افزایش فیزیکی پهنای باند حافظه و توسعه استانداردهای نوین ارتباطی گذاشته‌اند.

مهندسان سیلیکون دیوار حافظه را پیش از هر چیز یک چالش فیزیکی در بسته‌بندی تراشه‌ها می‌دانند. از آنجا که حافظه‌های HBM برای دستیابی به سرعت‌های چند ترابایتی باید دقیقاً در مجاورت فیزیکی قالب پردازشی قرار گیرند، محدودیت‌های حرارتی و فضا مانع افزایش نامحدود پهنای باند می‌شوند. مسیر اصلی پیش روی این گروه، استفاده از پشته‌سازی سه‌بعدی و فوتونیک سیلیکونی است تا بزرگراه‌های داده بدون ذوب کردن تراشه عریض‌تر شوند.

پژوهشگران الگوریتم

پژوهشگرانی که به دنبال دور زدن گلوگاه خودبازگشتی از مسیر نوآوری‌های الگوریتمی و نرم‌افزاری هستند.

متخصصان نرم‌افزار معتقدند انتظار برای سخت‌افزار راه‌حلی ناکافی است، زیرا سرعت رشد محاسبات همواره از پهنای باند پیشی می‌گیرد. تمرکز آنان بر تغییر مکانیسم تولید واژگان است. با طراحی متدهای رمزگشایی گمانه‌زن و رویکردهای غیرخودبازگشتی، آنان درصددند شدت محاسباتی استنتاج را به شکل مصنوعی بالا ببرند تا چرخه‌های هدررفته پردازنده به کار گرفته شوند.

حامیان استقرار بر روی دستگاه

توسعه‌دهندگانی که استفاده افراطی از کوانتیزاسیون را برای اجرای مدل‌ها روی سیلیکون‌های محدود مصرف‌کننده در اولویت قرار داده‌اند.

مهندسانی که مدل‌ها را برای تلفن‌های هوشمند و لپ‌تاپ‌ها بهینه‌سازی می‌کنند با پهنای باندهایی در مقیاس گیگابایت سر و کار دارند. این اردوگاه کوانتیزاسیون تهاجمی را با کاهش مدل‌ها به ۴ بیت یا حتی ۲ بیت دنبال می‌کند. آنان افت نسبی استدلال منطقی مدل را به عنوان بهایی اجتناب‌ناپذیر می‌پذیرند تا بتوانند بار پردازش را در چارچوب سخت‌افزارهای تجاری بگنجانند.

طراحان سخت‌افزار 35%پژوهشگران الگوریتم 35%حامیان استقرار بر روی دستگاه 30%
طراحان سخت‌افزار
مهندسانی که تمرکز خود را بر افزایش فیزیکی پهنای باند حافظه و توسعه استانداردهای نوین ارتباطی گذاشته‌اند.
پژوهشگران الگوریتم
پژوهشگرانی که به دنبال دور زدن گلوگاه خودبازگشتی از مسیر نوآوری‌های الگوریتمی و نرم‌افزاری هستند.
حامیان استقرار بر روی دستگاه
توسعه‌دهندگانی که استفاده افراطی از کوانتیزاسیون را برای اجرای مدل‌ها روی سیلیکون‌های محدود مصرف‌کننده در اولویت قرار داده‌اند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • ارائه‌دهندگان زیرساخت‌های ابری
  • اپراتورهای شبکه برق و انرژی

منابع

پوشش منابع

3 منبع

3 دیدگاه شناسایی‌شده

طراحان سخت‌افزار 35%پژوهشگران الگوریتم 35%حامیان استقرار بر روی دستگاه 30%
  1. [1]Wikipediaطراحان سخت‌افزار

    Roofline model

    مطالعه در Wikipedia →
  2. [2]Wikipediaطراحان سخت‌افزار

    High Bandwidth Memory

    مطالعه در Wikipedia →
  3. [3]تیم سردبیری کوهستانپژوهشگران الگوریتم

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.