رمزگشایی خودبازگشتی تکتوکنی در نسبت یک فلاپس بر بایت؛ تلهای که هستههای تانسور را زیر سقف بازدهی حبس میکند
هنگام تولید تکتوکنی، مدلهای زبانی بزرگ ماتریسهای عظیم وزن را از حافظه بارگذاری میکنند تا به ازای هر پارامتر تنها یک محاسبه انجام دهند. این عدم تقارن ساختاری شتابدهندههای پیشرفته هوش مصنوعی را ناچار میکند در کسری از ظرفیت محاسباتی اسمی خود کار کنند و گلوگاه بنیادین سرعت استنتاج را رقم بزند.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- رمزگشایی خودبازگشتی نیازمند بارگذاری کل مدل از حافظه برای تولید هر تکتوکن است که به شدت محاسباتی ناچیز یک فلاپس بر بایت میانجامد.
- این نسبت یک به یک، ۲۹۵ برابر کمتر از نقطه برآمدگی محاسبه به حافظه در انویدیا H100 است و بیش از ۹۹ درصد از توان هستههای تانسور را بیکار میگذارد.
- ارتقاهای سختافزاری جدید مانند H200 سرعت تولید متن را نه با توان محاسباتی بیشتر، بلکه با رساندن پهنای باند حافظه به ۴٫۸ ترابایت بر ثانیه بهبود بخشیدهاند.
در این مطلب
شرط بنیادین برای دستیابی هر پردازندهای به سقف سرعت اسمی خود این است که دادهها با همان سرعتی به واحدهای محاسباتی برسند که هستهها قادر به ضرب و جمع آن هستند. در نسل فعلی مدلهای زبانی بزرگ که کلمات را تکبهتک و گامبهگام میسازند، این شرط بنیادین دچار فروپاشی ساختاری میشود.[3]
معماری رمزگشایی خودبازگشتی، سامانه پردازشی را ناچار میکند برای تولید تکتک واژهها، کل وزنهای مدل را از اول تا آخر از حافظه بخواند. از آنجا که هر واژه جدید مستقیماً بر اساس توالی پیشین بنا میشود، فرایند تولید خروجی در بعد زمان امکان موازیسازی ندارد.[3]
نتیجه این سازوکار، ایجاد یک گلوگاه محاسباتی است که پیشرفتهترین شتابدهندههای هوش مصنوعی جهان را در وضعیتی نزدیک به بیکاری کامل قرار میدهد. هنگامی که یک پردازنده انویدیا H100 تنها یک توکن تولید میکند، هستههای تانسور آن بیش از ۹۹ درصد از سیکلهای پردازشی خود را در انتظار رسیدن دادهها هدر میدهند.[3]
این پدیده در مهندسی کامپیوتر «دیوار حافظه» نام دارد؛ دیواری که اقتصاد زیرساختهای هوش مصنوعی را تعیین میکند، معماری سختافزارهای نسل بعدی را هدایت مینماید و روشن میسازد چرا تولید یک پاسخ چند برابر کندتر از خواندن صورت مسئله است.[3]
حساب و کتاب ریاضی یک تکتوکن
برای درک چرایی این گلوگاه، باید عملیات دقیق ریاضیِ لازم برای ساخت یک توکن منفرد را گامبهگام ردیابی کرد. یک مدل زبانی بزرگ در عمل چیزی جز مجموعهای گسترده از ماتریسهای وزنی پیوسته نیست.[3]
در یک مدل استاندارد ۷ میلیارد پارامتری که با دقت اعشاری ۱۶ بیتی ذخیره شده است، این وزنها فضایی حدود ۱۴ گیگابایت را اشغال میکنند. در زمان استنتاج، پردازنده گرافیکی مجبور است تکتک این پارامترها را از حافظه با پهنای باند بالا (HBM) فراخوانی کرده و درون رم ایستا (SRAM) روی تراشه بارگذاری کند.[2][3]
پردازنده به ازای بارگذاری هر پارامتر، دقیقاً دو عمل ریاضی انجام میدهد: یک عمل ضرب و یک عمل جمع. نسبت میان این دو متغیر، مفهوم بنیادین «شدت محاسباتی» را تعریف میکند.[1][3]
از آنجا که سیستم برای انجام دو عملیات ممیز شناور ناگزیر به بارگذاری دو بایت داده است، شدت محاسباتی رمزگشایی تکتوکنی دقیقاً یک فلاپس بر بایت محاسبه میشود. این نسبت یک به یک، واقعیت ریاضی گریزناپذیر در استنتاج خودبازگشتی با اندازه دسته یک است.[3]
مدل سقف بازدهی و نقطه برآمدگی
طراحان سیلیکون این رابطه فیزیکی را با استفاده از «مدل سقف بازدهی» تحلیل میکنند؛ چارچوبی تصویری که محدودیتهای عملکرد پردازنده را بر پایه شدت محاسباتی ترسیم مینماید. این نمودار شمایلی شبیه به یک سقف شیروانی با شیب آغازین و سقفی افقی دارد.[1]
بخش شیبدار نمایانگر بارهای کاریِ محدود به پهنای باند حافظه است، جایی که توان عملیاتی به شکل خطی متناسب با سرعت انتقال داده بالا میرود. خط افقی و مسطح بالای نمودار نیز حد نهایی فیزیکی هستههای پردازشی را نشان میدهد، یعنی نقطهای که سیلیکون با بالاترین توان محاسباتی ممکن عمل میکند.[1]
محل تلاقی این شیب صعودی با خط افقی سقف، «نقطه برآمدگی» نامیده میشود. این نقطه نشاندهنده حداقل شدت محاسباتی لازم است تا هستههای محاسباتی پیوسته از داده تغذیه شوند و از گلوگاه حافظه عبور کنند.[1]
در نسخه H100 SXM انویدیا، حداکثر توان تئوریک برای محاسبات ۱۶ بیتی به ۹۸۹ ترافلاپس میرسد. در مقابل، زیرسیستم حافظه آن توان تحویل داده با حداکثر نرخ ۳٫۳۵ ترابایت بر ثانیه را داراست.[3]
با تقسیم سقف توان محاسباتی بر پهنای باند حافظه، نقطه برآمدگی روی عدد ۲۹۵ فلاپس بر بایت قرار میگیرد. به این معنی که برای بهرهبرداری کامل از توان H100، هر الگوریتم باید به ازای هر بایت دادهای که از حافظه اصلی استخراج میکند، دستکم ۲۹۵ عمل محاسباتی انجام دهد.[3]
فروپاشی ضریب بهرهوری
فرایند رمزگشایی تکتوکنی تنها با نسبت یک فلاپس بر بایت کار میکند که ۲۹۵ بار پایینتر از نقطه برآمدگی H100 است. بدین ترتیب بار کاری به انتهای سمت چپ نمودار سقف بازدهی دوخته میشود، یعنی در اعماق محدوده وابسته به حافظه.[1][3]
پیامد عینی این نسبت نامتوازن، فروپاشی چشمگیر بهرهوری است. کارت گرافیک وزنها را با سرعت ۳٫۳۵ ترابایت بر ثانیه پمپاژ میکند، اما چون روی هر بایت پردازش ناچیزی انجام میگیرد، واحدهای محاسباتی بلافاصله کار خود را به اتمام میرسانند.[3]
در اندازه دسته یک، سقف بهرهوری محاسباتی H100 به زیر ۰٫۴ درصد سقوط میکند. در این حالت پردازنده عملاً به یک کنترلکننده حافظه بسیار گرانقیمت بدل میشود که هستههای تانسور ۹۸۹ ترافلاپسی آن از بیکاری گرسنه ماندهاند.[3]
همین سازوکار توضیح میدهد که چرا برای یک مدل ۱۴ گیگابایتی، عبور دادن وزنها از گذرگاه حافظه با سرعت دو ترابایت بر ثانیه حدود هفت میلیثانیه زمان میبرد، در حالی که انجام محاسبات ریاضیِ واقعی کسری از میلیثانیه طول میکشد. مابقی این زمان صرفاً تاخیر انتقال است.[3]
عدم تقارن میان ورودی و خروجی
این وضعیت اسفبار محدود به حافظه صرفاً بر مرحله رمزگشایی یا همان تولید متن حاکم است. هنگامی که کاربر پرامپت اولیه را ثبت میکند، مدل تمام توکنهای ورودی را به طور همزمان در مرحلهای به نام «پیشبارگذاری» پردازش مینماید.[3]
در مرحله پیشبارگذاری، پردازنده گرافیکی باز هم ۱۴ گیگابایت وزنها را تنها یک بار بارگذاری میکند، اما این بار همان وزنها را به شکل همزمان در تکتک توکنهای موجود در پرامپت ضرب مینماید.[3]
اگر کاربر پرامپتی متشکل از ۲۰۴۸ توکن ارسال کند، شدت محاسباتی ناگهان تا حدود ۲۰۴۸ فلاپس بر بایت اوج میگیرد. این عدد جهشی بار کاری را از نقطه برآمدگی ۲۹۵ فلاپس بسیار فراتر برده و آن را روی سقف افقی نمودار مینشاند.[1][3]
در این محدوده وابسته به محاسبه، هستههای تانسور با تمام توان کار میکنند و پهنای باند حافظه دیگر عامل محدودکننده نیست. این عدم تقارن ساختاری آشکار میسازد چرا پردازش یک متن هزار کلمهای در کسری از ثانیه تمام میشود، اما نوشتن یک پاسخ هزار کلمهای ثانیهها زمان میبرد.[3]
تغییر گلوگاه با اندازه دستهها
ابزار اصلی مهندسان برای افزایش شدت محاسباتی در فاز تولید، تکنیک دستهبندی است. با پردازش همزمان درخواست چندین کاربر، سرور مدل را یکبار از حافظه میخواند و آن را برای تولید همزمان چند توکن خروجی مختلف به کار میبندد.[3]
افزایش اندازه دسته از یک به ۳۲، شدت محاسباتی را به ۳۲ فلاپس بر بایت میرساند. گرچه این رقم همچنان زیر نقطه برآمدگی H100 جای دارد، اما ظرفیت خروجی کل سامانه را ۳۲ برابر میکند بدون آنکه نیازی به خواندن مکرر وزنها از حافظه باشد.[3]
با این حال، دستهبندی چالشهای خاص خود را تحمیل میکند. هر رشته پردازشی همزمان نیازمند حافظه موقت کلید-مقدار (KV Cache) مستقل است تا بستر توکنهای قبلی را ذخیره کند.[3]
با بزرگتر شدن اندازه دسته و طول پنجره زمینه، این حافظه موقت سهم بیشتری از گنجایش و پهنای باند کارت گرافیک را میبلعد. پژوهشگران دریافتهاند در دستههای بزرگ، اشباع پهنای باند حافظه DRAM اصلیترین گلوگاه باقی میماند و بیش از نیمی از چرخههای هسته توجه را متوقف میکند.[3]
راهکارهای سختافزاری و نرمافزاری
از آنجا که قدرت محاسباتی خام دردی از کمبود پهنای باند حافظه دوا نمیکند، سازندگان سختافزار رویکرد خود را به سمت سرعت حافظه تغییر دادهاند. پردازنده انویدیا H200 با همان توان محاسباتی ۹۸۹ ترافلاپسی H100 عرضه شد، اما استاندارد حافظه آن به HBM3e ارتقا یافت.[2][3]
این حافظه جدید به پهنای باند ۴٫۸ ترابایت بر ثانیه دست یافته که افزایشی ۴۳ درصدی نسبت به H100 محسوب میشود. در فرایند تولید وابسته به حافظه، این رقم مستقیماً به ۴۳ درصد افزایش سرعت تولید توکن در هر ثانیه ترجمه میگردد.[2][3]
در سطح نرمافزار، فنون کوانتیزاسیون یک میانبر ریاضی ارائه میدهند. مهندسان با فشردهسازی وزنهای ۱۶ بیتی به اعداد صحیح ۸ بیتی یا ۴ بیتی، حجم داده عبوری از گذرگاه حافظه را به نصف یا یکچهارم کاهش میدهند.[3]
یک مدل ۸ بیتی برای بارگذاری تنها به نیمی از پهنای باند نیاز دارد و به این ترتیب نرخ تولید را دو برابر میسازد. هرچند این کار با افتی اندک در دقت همراه است، در حال حاضر کارآمدترین دستکاری نرمافزاری برای فرار از دیوار حافظه به شمار میرود.[3]
راهکارهای دیگر مانند رمزگشایی گمانهزن در تلاشاند تا این گلوگاه را دور بزنند. در این سامانهها، ابتدا یک مدل کوچک چند توکن بعدی را حدس میزند، سپس مدل بزرگ با اتکا به توان محاسباتی بلااستفاده خود، در یک گام موازی تمامی توکنها را به شکل یکجا ارزیابی میکند.[3]
قوانین بنیادین فیزیک در جابهجایی دادهها نشان میدهند پهنای باند حافظه با سرعتی بسیار کمتر از تراکم توان محاسباتی رشد میکند. طی یک دهه اخیر، توان ترافلاپسی شتابدهندهها رشد نمایی داشته، در حالی که سرعت حافظه صرفاً رشدی خطی را تجربه کرده است.[1][3]
تا زمانی که یک دگرگونی بنیادی در معماری سختافزار رخ ندهد و حافظه و پردازنده به صورت فیزیکی درهم تنیده نشوند، رمزگشایی تکتوکنی زیر نقطه برآمدگی حبس خواهد ماند؛ جایی که پیشرفتهترین پردازندههای جهان بیشتر وقت خود را به انتظار کشیدن برای رسیدن دادهها میگذرانند.[3]
این تحلیل چگونه انجام شد
- روش
- بازمحاسبه ضریب بهرهوری سختافزار از طریق مقایسه توان عملیاتی اوج ضرب ماتریسی در برابر محدودیتهای پهنای باند حافظه حین استنتاج خودبازگشتی با اندازه دسته یک.
- یافته
- در اندازه دسته یک، یک شتابدهنده H100 بیش از ۹۹٫۶ درصد از سیکلهای محاسباتی خود را در انتظار دادههای حافظه تلف میکند و عملاً با بهرهوری زیر ۰٫۴ درصد از حداکثر توان تئوریک خود کار میکند.
- دادههایی که بر پایهٔ آنها کار کردیم
- حداکثر تئوریک محاسبات هستههای تانسور FP16 در پردازنده H100 SXM: 989 TFLOPs — تیم سردبیری کوهستان
- پهنای باند حافظه H100 SXM: 3.35 TB/s — تیم سردبیری کوهستان
- محدودیتهای این تحلیل
- این محاسبات بر فرض بار کاری خالص با اندازه دسته یک، بدون در نظر گرفتن رمزگشایی گمانهزن، محدودیتهای حافظه پنهان کلید-مقدار یا تأخیر شبکه صورت گرفته است؛ عواملی که هر یک میتوانند نرخ بهرهوری واقعی را تغییر دهند.
اصطلاحات کلیدی
- شدت محاسباتی (Arithmetic Intensity)
- نسبت تعداد محاسبات ریاضی انجامشده به ازای هر بایت دادهای که از حافظه اصلی بارگذاری میشود.
- مدل سقف بازدهی (Roofline Model)
- نموداری تصویری در مهندسی سختافزار که نشان میدهد آیا عملکرد یک برنامه توسط سرعت حافظه محدود شده یا توان پردازنده.
- نقطه برآمدگی (Ridge Point)
- شدت محاسباتی معینی که در آن پهنای باند حافظه پردازنده دقیقاً با حداکثر ظرفیت محاسباتی سیلیکون همگام میشود.
- هستههای تانسور (Tensor Cores)
- واحدهای پردازشی تخصصی درون پردازندههای گرافیکی جدید که برای ضرب پرسرعت ماتریسهای بزرگ طراحی شدهاند.
- حافظه با پهنای باند بالا (HBM)
- نوعی معماری حافظه سهبعدی لایهبندیشده که رم را به پردازنده بسیار نزدیک میکند تا نرخ تبادل چند ترابایت بر ثانیهای حاصل شود.
پرسشهای متداول
چرا افزودن پردازندههای گرافیکی بیشتر سرعت ساخت تکتوکن را افزایش نمیدهد؟
تقسیم یک مدل میان چندین پردازنده حجم داده لازم برای هر تراشه را میکاهد، اما تاخیر ارتباطی میانتراشهای را به همراه دارد. زمانی که صرف تبادل داده بین کارتها میشود اغلب مزیتی را که از بارگذاری حافظه کمتر به دست آمده میبلعد.
معماری حافظه یکپارچه اپل با این گلوگاه چگونه برخورد میکند؟
تراشههای اپل حافظه مشترکی میان سیپییو و جیپییو ارائه میدهند که پهنای باندی تا ۴۰۰ گیگابایت بر ثانیه دارد. هرچند این مقدار برای دستگاههای مصرفی چشمگیر است، اما همچنان حدود هشت برابر کندتر از HBM3 در کارت H100 بوده و سرعت تولید آن به همان نسبت پایینتر است.
آیا مدلهای انتشار برای تولید تصویر نیز با همین دیوار حافظه روبرو هستند؟
خیر. مدلهای انتشار گامهای متعدد نویززدایی پیچیدهای را روی همان وزنهای بارگذاریشده انجام میدهند که شدت محاسباتی آنها را بالا میبرد. این مدلها عموماً وابسته به پردازش هستند و مستقیماً از افزایش ترافلاپس بهرهمند میشوند.
بررسی عمیق دیدگاهها
طراحان سختافزار
مهندسانی که تمرکز خود را بر افزایش فیزیکی پهنای باند حافظه و توسعه استانداردهای نوین ارتباطی گذاشتهاند.
مهندسان سیلیکون دیوار حافظه را پیش از هر چیز یک چالش فیزیکی در بستهبندی تراشهها میدانند. از آنجا که حافظههای HBM برای دستیابی به سرعتهای چند ترابایتی باید دقیقاً در مجاورت فیزیکی قالب پردازشی قرار گیرند، محدودیتهای حرارتی و فضا مانع افزایش نامحدود پهنای باند میشوند. مسیر اصلی پیش روی این گروه، استفاده از پشتهسازی سهبعدی و فوتونیک سیلیکونی است تا بزرگراههای داده بدون ذوب کردن تراشه عریضتر شوند.
پژوهشگران الگوریتم
پژوهشگرانی که به دنبال دور زدن گلوگاه خودبازگشتی از مسیر نوآوریهای الگوریتمی و نرمافزاری هستند.
متخصصان نرمافزار معتقدند انتظار برای سختافزار راهحلی ناکافی است، زیرا سرعت رشد محاسبات همواره از پهنای باند پیشی میگیرد. تمرکز آنان بر تغییر مکانیسم تولید واژگان است. با طراحی متدهای رمزگشایی گمانهزن و رویکردهای غیرخودبازگشتی، آنان درصددند شدت محاسباتی استنتاج را به شکل مصنوعی بالا ببرند تا چرخههای هدررفته پردازنده به کار گرفته شوند.
حامیان استقرار بر روی دستگاه
توسعهدهندگانی که استفاده افراطی از کوانتیزاسیون را برای اجرای مدلها روی سیلیکونهای محدود مصرفکننده در اولویت قرار دادهاند.
مهندسانی که مدلها را برای تلفنهای هوشمند و لپتاپها بهینهسازی میکنند با پهنای باندهایی در مقیاس گیگابایت سر و کار دارند. این اردوگاه کوانتیزاسیون تهاجمی را با کاهش مدلها به ۴ بیت یا حتی ۲ بیت دنبال میکند. آنان افت نسبی استدلال منطقی مدل را به عنوان بهایی اجتنابناپذیر میپذیرند تا بتوانند بار پردازش را در چارچوب سختافزارهای تجاری بگنجانند.
- طراحان سختافزار
- مهندسانی که تمرکز خود را بر افزایش فیزیکی پهنای باند حافظه و توسعه استانداردهای نوین ارتباطی گذاشتهاند.
- پژوهشگران الگوریتم
- پژوهشگرانی که به دنبال دور زدن گلوگاه خودبازگشتی از مسیر نوآوریهای الگوریتمی و نرمافزاری هستند.
- حامیان استقرار بر روی دستگاه
- توسعهدهندگانی که استفاده افراطی از کوانتیزاسیون را برای اجرای مدلها روی سیلیکونهای محدود مصرفکننده در اولویت قرار دادهاند.
دیدگاههایی که این گزارش پوشش نداده
- ارائهدهندگان زیرساختهای ابری
- اپراتورهای شبکه برق و انرژی
منابع
[1]Wikipediaطراحان سختافزارRoofline model
مطالعه در Wikipedia →
[2]Wikipediaطراحان سختافزارHigh Bandwidth Memory
مطالعه در Wikipedia →
[3]تیم سردبیری کوهستانپژوهشگران الگوریتمتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →محاسبات در حافظه
چگونه معماریهای «پردازش در حافظه» از تنگنای فون نویمان در شتابدهندههای هوش مصنوعی عبور میکنند
5 منبع
زیرساخت هوش مصنوعی
تعهد تقریباً ۲ تریلیون دلاری ابرشرکتهای ابری برای تأمین سختافزار و حافظه هوش مصنوعی؛ پیشتازی گوگل با ۸۱۱ میلیارد دلار
7 منبع
EDA عاملی
سیناپس از گردش کارهای طراحی تراشه با هوش مصنوعی خودران رونمایی کرد؛ کاهش ۴۰ درصدی زمان اشکالزدایی
7 منبع
ساخت نیمهرسانا
تیاسامسی تولید انبوه تراشههای ۲ نانومتری را زودتر از موعد آغاز کرد؛ تسریع نقشههای راه تراشههای هوش مصنوعی
3 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





