چگونه رمزگشایی گمانهزن از گلوگاه پهنای باند حافظه در استنتاج هوش مصنوعی عبور میکند
رمزگشایی گمانهزن با جفت کردن یک مدل زبانی عظیم با یک مدل پیشنویس کوچکتر و سریعتر، چندین کلمه را در یک گام محاسباتی تولید میکند. این رویکرد بدون تغییر در خروجی نهایی، تاخیر را به میزان چشمگیری کاهش میدهد.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- رمزگشایی گمانهزن یک مدل زبانی عظیم را با یک مدل پیشنویس کوچکتر جفت میکند تا تولید متن را شتاب بخشد.
- مدل پیشنویس به سرعت چند کلمه بعدی را حدس میزند و مدل بزرگتر آنها را در یک گام تایید میکند.
- این کار گلوگاه پهنای باند حافظه را دور میزند و چندین کلمه را در زمان تولید یک کلمه ایجاد میکند.
در طراحی ریزپردازندههای مدرن، پیشبینی انشعاب (branch prediction) با حدس زدن مسیری که برنامه طی خواهد کرد، محاسبات را شتاب میبخشد تا خط لوله دستورالعملها پر بماند. رمزگشایی گمانهزن فلسفهای موازی را در هوش مصنوعی به کار میگیرد، اما با یک تفاوت اساسی: به جای حدس زدن مسیر دستورالعملها، دادههای واقعی (چند کلمه بعدی متن) را با استفاده از یک شبکه عصبی مینیاتوری حدس میزند و به شبکه اصلی و عظیم تنها برای تصحیح این تکالیف تکیه میکند.[3]
محدودیت سرعت بنیادین یک مدل زبانی بزرگ، سرعت پردازندههای آن در ضرب اعداد نیست، بلکه سرعت جابهجایی آنهاست. در تولید خودهمبسته (autoregressive) استاندارد، تولید یک کلمه واحد نیازمند بارگذاری تمام وزنهای مدل (که اغلب برای یک مدل ۷۰ میلیارد پارامتری از ۱۴۰ گیگابایت فراتر میرود) از حافظه با پهنای باند بالا به هستههای محاسباتی است.[3]
یک تحلیل فنی در سال ۲۰۲۳ که توسط پژوهشگران هاگینگ فیس (Hugging Face) منتشر شد، خاطرنشان میکند: «استنتاج مدلهای زبانی بزرگ (LLM) به شدت محدود به پهنای باند حافظه است.» از آنجا که مدل باید پیش از محاسبه توکن بعدی منتظر تکمیل انتقال حافظه بماند، قدرت محاسباتی عظیم پردازندههای گرافیکی (GPU) مدرن در هر گام برای کسری از میلیثانیه بیکار میماند.
رمزگشایی گمانهزن این مشکل را با معرفی یک عدم تقارن عمدی در معماری حل میکند. یک مدل «پیشنویس» بسیار کوچکتر (شاید ۱.۵ میلیارد پارامتر در مقایسه با ۷۰ میلیارد پارامتر مدل هدف) وظیفه دارد به سرعت دنبالهای از، به عنوان مثال، چهار توکن بعدی احتمالی را تولید کند. از آنجا که مدل پیشنویس به اندازه کافی کوچک است تا به راحتی در سریعترین حافظه پنهان (cache) پردازنده گرافیکی جای گیرد، این حدسها را در کسری از زمان تولید میکند.[1][3]
سپس مدل هدف عظیم این دنباله چهار توکنی پیشنویس شده را دریافت میکند. به جای تولید تکتک آنها، یک گذر رو به جلو (forward pass) واحد را روی هر چهار توکن به طور همزمان انجام میدهد. این تایید موازی دقیقاً از همان مقدار پهنای باند حافظه استفاده میکند که برای تولید یک توکن از ابتدا نیاز است و عملاً گلوگاه فون نویمان را دور میزند.[2][3]
اگر توزیع احتمال داخلی مدل هدف با انتخابهای مدل پیشنویس همخوانی داشته باشد، هر چهار توکن فوراً پذیرفته میشوند. سیستم به این ترتیب چهار کلمه را با هزینه زمان و حافظه یک کلمه تولید کرده است که منجر به جهش عظیمی در توان عملیاتی توکن بر ثانیه میشود.[1]
وقتی مدلها با هم اختلاف نظر دارند، سیستم به جای از کار افتادن، به نرمی افت میکند. اگر مدل هدف سومین توکن پیشنویس شده را رد کند، دو توکن اول را میپذیرد، بقیه را کنار میگذارد و از محاسبات خود برای خروجی دادن توکن سوم صحیح استفاده میکند. سپس فرآیند از همان نقطه دوباره آغاز میشود.[2]
نکته حیاتی این است که این یک تقریب نیست که کیفیت را فدای سرعت کند. فرمولبندی ریاضی نمونهبرداری گمانهزن، که برای اولین بار در مقالات مستقل سال ۲۰۲۳ توسط پژوهشگران گوگل و دیپمایند به تفصیل شرح داده شد، تضمین میکند که توزیع خروجی نهایی از نظر ریاضی دقیقاً مشابه چیزی است که مدل هدف به تنهایی تولید میکرد.[1][2]
نتایج عملی این تضمین ریاضی قابل توجه است. در آزمونهای بنچمارک که در پیشچاپ مقاله دیپمایند به تفصیل آمده است، رمزگشایی گمانهزن مدل ۷۰ میلیارد پارامتری چینچیلا (Chinchilla) را با ضریب ۲.۵ شتاب بخشید، بدون اینکه هیچگونه افت کیفیتی در خروجی یا توانایی استدلال آن ایجاد شود.[2]
کارایی این سیستم کاملاً به همسویی بین مدلهای پیشنویس و هدف بستگی دارد. اگر مدل پیشنویس بیش از حد کوچک باشد، حدسهای آن به طور مداوم رد میشوند و سربار اجرای آن در واقع سیستم را کند میکند. اگر بیش از حد بزرگ باشد، تولید پیشنویسها زمان زیادی میبرد و مزیت سرعت را از بین میبرد.[3]
محدودیتهای سختافزاری نیز مرزهای این رویکرد را تعیین میکنند. در حالی که رمزگشایی گمانهزن در پهنای باند حافظه صرفهجویی میکند، نیازمند ظرفیت حافظه اضافی برای نگهداری همزمان حافظه پنهان کلید-مقدار (KV cache) برای هر دو مدل است، که مهندسان را مجبور میکند بین سرعت و حافظه ویدیویی (VRAM) در دسترس تعادل ایجاد کنند.
از آنجا که توسعهدهندگان متنباز به طور فزایندهای مدلها را به صورت محلی روی سختافزارهای مصرفی مستقر میکنند، تکنیکهایی که گلوگاههای حافظه را دور میزنند، تعیینکننده مرزهای امکانپذیری هستند. رمزگشایی گمانهزن به مدلهای با توانمندی بالا اجازه میدهد تا با سرعت خواندن انسان روی سختافزاری اجرا شوند که در حالت عادی برای تولید چند کلمه در ثانیه با مشکل مواجه میشد.[3]
اصطلاحات کلیدی
- تولید خودهمبسته (Autoregressive generation)
- روش استانداردی که مدلهای زبانی از طریق آن متن تولید میکنند و بر اساس تمام کلمات تولید شده قبلی، هر بار یک کلمه میسازند.
- پهنای باند حافظه (Memory bandwidth)
- نرخی که در آن دادهها میتوانند توسط یک پردازنده از یک حافظه نیمههادی خوانده یا در آن ذخیره شوند، که اغلب گلوگاه اصلی در استنتاج هوش مصنوعی است.
- گذر رو به جلو (Forward pass)
- یک پیمایش محاسباتی واحد در لایههای یک شبکه عصبی برای تولید یک خروجی از یک ورودی مشخص.
- توکن (Token)
- واحد بنیادی دادهها که توسط یک مدل زبانی پردازش میشود و تقریباً معادل یک کلمه یا بخشی از یک کلمه است.
پرسشهای متداول
آیا رمزگشایی گمانهزن پاسخهای مدل را تغییر میدهد؟
خیر. فرمولبندی ریاضی تضمین میکند که خروجی نهایی دقیقاً مشابه چیزی است که مدل هدف بزرگ به تنهایی تولید میکرد.
آیا برای اجرای این روش به دو پردازنده گرافیکی (GPU) مجزا نیاز دارم؟
خیر. هم مدل پیشنویس و هم مدل هدف میتوانند روی یک پردازنده گرافیکی اجرا شوند، به شرطی که حافظه ویدیویی (VRAM) کافی برای نگهداری وزنها و وضعیتهای حافظه هر دو وجود داشته باشد.
چرا برای همه چیز فقط از مدل پیشنویس استفاده نکنیم؟
مدل پیشنویس آنقدر کوچک است که نمیتواند به تنهایی استدلال دقیقی داشته باشد یا زبان باکیفیتی را حفظ کند. رمزگشایی گمانهزن از آن تنها برای سرعت استفاده میکند و برای هوشمندی به مدل بزرگ متکی است.
بررسی عمیق دیدگاهها
مهندسان سختافزار
تمرکز بر به حداکثر رساندن بهرهوری از پهنای باند حافظه و تغذیه مداوم هستههای محاسباتی پردازنده گرافیکی با دادهها.
از دیدگاه سختافزاری، تولید خودهمبسته استاندارد بسیار ناکارآمد است. هستههای محاسباتی یک پردازنده گرافیکی H100 قادر به انجام تریلیونها عملیات در ثانیه هستند، اما در طول تولید متن، بخش اعظم زمان خود را صرف انتظار برای انتقال وزنهای مدل از حافظه با پهنای باند بالا (HBM) به پردازنده میکنند. مهندسان سختافزار به رمزگشایی گمانهزن به عنوان یک راهحل نرمافزاری برای گلوگاه سختافزاری فون نویمان نگاه میکنند. با تایید چندین توکن در یک گذر رو به جلو، این سیستم سرانجام کار موازی کافی را برای هستههای محاسباتی فراهم میکند تا در حین انتقال حافظه انجام دهند، که این امر نرخ بهرهوری کلی سیلیکون را به شدت افزایش میدهد.
پژوهشگران الگوریتم
اولویت دادن به تضمین ریاضی مبنی بر اینکه این بهینهسازی، توزیع خروجی مدل هدف را تغییر نمیدهد.
برای پژوهشگران الگوریتم، نبوغ رمزگشایی گمانهزن نه در پیشنویسسازی، بلکه در مکانیزم نمونهبرداری حذفی (rejection sampling) نهفته است. بسیاری از بهینهسازیهای استنتاج، مانند کوانتیزهسازی (quantization) یا هرس (pruning)، با تغییر وزنهای مدل، هوشمندی آن را به طور بنیادین تغییر میدهند. رمزگشایی گمانهزن کاملاً بدون اتلاف (lossless) است. پژوهشگران به شدت بر همسویی آماری بین مدلهای پیشنویس و هدف تمرکز میکنند؛ اگر توزیع احتمال مدل پیشنویس بیش از حد از مدل هدف فاصله بگیرد، نرخ رد شدن به شدت بالا میرود و سربار محاسباتی اجرای مدل پیشنویس منجر به کندی خالص میشود. آموزش مدلهای پیشنویس بسیار همسو، همچنان یک حوزه فعال در پژوهشهای الگوریتمی است.
توسعهدهندگان متنباز
ارزشگذاری این تکنیک به عنوان راهی برای اجرای مدلهای عظیم و بسیار توانمند روی سختافزارهای مصرفی با پهنای باند حافظه محدود.
در جامعه متنباز، با رمزگشایی گمانهزن به عنوان یک پیشرفت در دسترسیپذیری برخورد میشود. سختافزارهای مصرفی، مانند تراشههای سری M اپل یا پردازندههای گرافیکی استاندارد دسکتاپ، دارای قدرت محاسباتی خام کافی برای اجرای مدلهای بزرگ هستند، اما به شدت فاقد پهنای باند حافظه تراشههای دیتاسنتر سازمانی میباشند. با انتقال گلوگاه از پهنای باند حافظه به محاسبات خام، رمزگشایی گمانهزن به توسعهدهندگان اجازه میدهد تا مدلهای ۷۰ میلیارد پارامتری را به صورت محلی با سرعت مکالمه اجرا کنند. این جامعه به طور فعال در حال آزمایش جفت کردن مدلهای پیشنویس و هدف مختلف است و اغلب درمییابد که مدلهای پیشنویس به شدت کوانتیزه شده، بهترین تعادل بین سرعت و نرخ پذیرش را روی سختافزارهای مصرفی ارائه میدهند.
- مهندسان سختافزار
- تمرکز بر به حداکثر رساندن بهرهوری از پهنای باند حافظه و تغذیه مداوم هستههای محاسباتی پردازنده گرافیکی با دادهها.
- پژوهشگران الگوریتم
- اولویت دادن به تضمین ریاضی مبنی بر اینکه این بهینهسازی، توزیع خروجی مدل هدف را تغییر نمیدهد.
- توسعهدهندگان متنباز
- ارزشگذاری این تکنیک به عنوان راهی برای اجرای مدلهای عظیم و بسیار توانمند روی سختافزارهای مصرفی با پهنای باند حافظه محدود.
دیدگاههایی که این گزارش پوشش نداده
- ارائهدهندگان زیرساخت ابری
- تولیدکنندگان سختافزار مصرفی
منابع
[1]arXivپژوهشگران الگوریتمFast Inference from Transformers via Speculative Decoding
مطالعه در arXiv →
[2]arXivپژوهشگران الگوریتمAccelerating Large Language Model Decoding with Speculative Sampling
مطالعه در arXiv →
[3]تیم سردبیری کوهستانتوسعهدهندگان متنبازتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →هوش مصنوعی در روابط عمومی
استفاده از هوش مصنوعی برای تولید محتوا: درسهایی از گاف چتجیپیتی سردار آزمون
3 منبع
بازسازی سیری
اپل نسخه بازسازیشده سیری را با قدرت جمینای گوگل در تمام سیستمعاملهای اصلی خود منتشر کرد
5 منبع
یادگیری فدرال
چگونه یادگیری فدرال دقت مدل را فدای امنیت داده میکند؟
6 منبع
شبکههای عصبی
مکانیسمهای اصلی پسانتشار (Backpropagation): الگوریتمی که نیروی محرکه تمام یادگیری عمیق مدرن است
5 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





