چگونه رمزگشایی گمانهزن از گلوگاه پهنای باند حافظه در استنتاج هوش مصنوعی عبور میکند
رمزگشایی گمانهزن با جفت کردن یک مدل زبانی عظیم با یک مدل پیشنویس کوچکتر و سریعتر، چندین کلمه را در یک گام محاسباتی تولید میکند. این رویکرد بدون تغییر در خروجی نهایی، تاخیر را به میزان چشمگیری کاهش میدهد.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- مهندسان سختافزار
- تمرکز بر به حداکثر رساندن بهرهوری از پهنای باند حافظه و تغذیه مداوم هستههای محاسباتی پردازنده گرافیکی با دادهها.
- پژوهشگران الگوریتم
- اولویت دادن به تضمین ریاضی مبنی بر اینکه این بهینهسازی، توزیع خروجی مدل هدف را تغییر نمیدهد.
- توسعهدهندگان متنباز
- ارزشگذاری این تکنیک به عنوان راهی برای اجرای مدلهای عظیم و بسیار توانمند روی سختافزارهای مصرفی با پهنای باند حافظه محدود.
دیدگاههایی که این گزارش پوشش نداده
- ارائهدهندگان زیرساخت ابری
- تولیدکنندگان سختافزار مصرفی
در طراحی ریزپردازندههای مدرن، پیشبینی انشعاب (branch prediction) با حدس زدن مسیری که برنامه طی خواهد کرد، محاسبات را شتاب میبخشد تا خط لوله دستورالعملها پر بماند. رمزگشایی گمانهزن فلسفهای موازی را در هوش مصنوعی به کار میگیرد، اما با یک تفاوت اساسی: به جای حدس زدن مسیر دستورالعملها، دادههای واقعی (چند کلمه بعدی متن) را با استفاده از یک شبکه عصبی مینیاتوری حدس میزند و به شبکه اصلی و عظیم تنها برای تصحیح این تکالیف تکیه میکند.[3]
محدودیت سرعت بنیادین یک مدل زبانی بزرگ، سرعت پردازندههای آن در ضرب اعداد نیست، بلکه سرعت جابهجایی آنهاست. در تولید خودهمبسته (autoregressive) استاندارد، تولید یک کلمه واحد نیازمند بارگذاری تمام وزنهای مدل (که اغلب برای یک مدل ۷۰ میلیارد پارامتری از ۱۴۰ گیگابایت فراتر میرود) از حافظه با پهنای باند بالا به هستههای محاسباتی است.[3]
یک تحلیل فنی در سال ۲۰۲۳ که توسط پژوهشگران هاگینگ فیس (Hugging Face) منتشر شد، خاطرنشان میکند: «استنتاج مدلهای زبانی بزرگ (LLM) به شدت محدود به پهنای باند حافظه است.» از آنجا که مدل باید پیش از محاسبه توکن بعدی منتظر تکمیل انتقال حافظه بماند، قدرت محاسباتی عظیم پردازندههای گرافیکی (GPU) مدرن در هر گام برای کسری از میلیثانیه بیکار میماند.
رمزگشایی گمانهزن این مشکل را با معرفی یک عدم تقارن عمدی در معماری حل میکند. یک مدل «پیشنویس» بسیار کوچکتر (شاید ۱.۵ میلیارد پارامتر در مقایسه با ۷۰ میلیارد پارامتر مدل هدف) وظیفه دارد به سرعت دنبالهای از، به عنوان مثال، چهار توکن بعدی احتمالی را تولید کند. از آنجا که مدل پیشنویس به اندازه کافی کوچک است تا به راحتی در سریعترین حافظه پنهان (cache) پردازنده گرافیکی جای گیرد، این حدسها را در کسری از زمان تولید میکند.[1][3]
سپس مدل هدف عظیم این دنباله چهار توکنی پیشنویس شده را دریافت میکند. به جای تولید تکتک آنها، یک گذر رو به جلو (forward pass) واحد را روی هر چهار توکن به طور همزمان انجام میدهد. این تایید موازی دقیقاً از همان مقدار پهنای باند حافظه استفاده میکند که برای تولید یک توکن از ابتدا نیاز است و عملاً گلوگاه فون نویمان را دور میزند.[2][3]
سپس مدل هدف عظیم این دنباله چهار توکنی پیشنویس شده را دریافت میکند.
اگر توزیع احتمال داخلی مدل هدف با انتخابهای مدل پیشنویس همخوانی داشته باشد، هر چهار توکن فوراً پذیرفته میشوند. سیستم به این ترتیب چهار کلمه را با هزینه زمان و حافظه یک کلمه تولید کرده است که منجر به جهش عظیمی در توان عملیاتی توکن بر ثانیه میشود.[1]
وقتی مدلها با هم اختلاف نظر دارند، سیستم به جای از کار افتادن، به نرمی افت میکند. اگر مدل هدف سومین توکن پیشنویس شده را رد کند، دو توکن اول را میپذیرد، بقیه را کنار میگذارد و از محاسبات خود برای خروجی دادن توکن سوم صحیح استفاده میکند. سپس فرآیند از همان نقطه دوباره آغاز میشود.[2]
نکته حیاتی این است که این یک تقریب نیست که کیفیت را فدای سرعت کند. فرمولبندی ریاضی نمونهبرداری گمانهزن، که برای اولین بار در مقالات مستقل سال ۲۰۲۳ توسط پژوهشگران گوگل و دیپمایند به تفصیل شرح داده شد، تضمین میکند که توزیع خروجی نهایی از نظر ریاضی دقیقاً مشابه چیزی است که مدل هدف به تنهایی تولید میکرد.[1][2]
نتایج عملی این تضمین ریاضی قابل توجه است. در آزمونهای بنچمارک که در پیشچاپ مقاله دیپمایند به تفصیل آمده است، رمزگشایی گمانهزن مدل ۷۰ میلیارد پارامتری چینچیلا (Chinchilla) را با ضریب ۲.۵ شتاب بخشید، بدون اینکه هیچگونه افت کیفیتی در خروجی یا توانایی استدلال آن ایجاد شود.[2]
کارایی این سیستم کاملاً به همسویی بین مدلهای پیشنویس و هدف بستگی دارد. اگر مدل پیشنویس بیش از حد کوچک باشد، حدسهای آن به طور مداوم رد میشوند و سربار اجرای آن در واقع سیستم را کند میکند. اگر بیش از حد بزرگ باشد، تولید پیشنویسها زمان زیادی میبرد و مزیت سرعت را از بین میبرد.[3]
محدودیتهای سختافزاری نیز مرزهای این رویکرد را تعیین میکنند. در حالی که رمزگشایی گمانهزن در پهنای باند حافظه صرفهجویی میکند، نیازمند ظرفیت حافظه اضافی برای نگهداری همزمان حافظه پنهان کلید-مقدار (KV cache) برای هر دو مدل است، که مهندسان را مجبور میکند بین سرعت و حافظه ویدیویی (VRAM) در دسترس تعادل ایجاد کنند.
از آنجا که توسعهدهندگان متنباز به طور فزایندهای مدلها را به صورت محلی روی سختافزارهای مصرفی مستقر میکنند، تکنیکهایی که گلوگاههای حافظه را دور میزنند، تعیینکننده مرزهای امکانپذیری هستند. رمزگشایی گمانهزن به مدلهای با توانمندی بالا اجازه میدهد تا با سرعت خواندن انسان روی سختافزاری اجرا شوند که در حالت عادی برای تولید چند کلمه در ثانیه با مشکل مواجه میشد.[3]
نکات کلیدی
- رمزگشایی گمانهزن یک مدل زبانی عظیم را با یک مدل پیشنویس کوچکتر جفت میکند تا تولید متن را شتاب بخشد.
- مدل پیشنویس به سرعت چند کلمه بعدی را حدس میزند و مدل بزرگتر آنها را در یک گام تایید میکند.
- این کار گلوگاه پهنای باند حافظه را دور میزند و چندین کلمه را در زمان تولید یک کلمه ایجاد میکند.
- این تکنیک از نظر ریاضی تضمین میکند که خروجی نهایی دقیقاً مشابه خروجی استاندارد مدل بزرگ باقی بماند.
- پژوهشگران دیپمایند (DeepMind) با استفاده از این روش، افزایش سرعت ۲.۵ برابری را روی یک مدل ۷۰ میلیارد پارامتری به اثبات رساندند.
اصطلاحات کلیدی
- تولید خودهمبسته (Autoregressive generation)
- روش استانداردی که مدلهای زبانی از طریق آن متن تولید میکنند و بر اساس تمام کلمات تولید شده قبلی، هر بار یک کلمه میسازند.
- پهنای باند حافظه (Memory bandwidth)
- نرخی که در آن دادهها میتوانند توسط یک پردازنده از یک حافظه نیمههادی خوانده یا در آن ذخیره شوند، که اغلب گلوگاه اصلی در استنتاج هوش مصنوعی است.
- گذر رو به جلو (Forward pass)
- یک پیمایش محاسباتی واحد در لایههای یک شبکه عصبی برای تولید یک خروجی از یک ورودی مشخص.
- توکن (Token)
- واحد بنیادی دادهها که توسط یک مدل زبانی پردازش میشود و تقریباً معادل یک کلمه یا بخشی از یک کلمه است.
منابع
[1]arXivپژوهشگران الگوریتمFast Inference from Transformers via Speculative Decoding
مطالعه در arXiv →
[2]arXivپژوهشگران الگوریتمAccelerating Large Language Model Decoding with Speculative Sampling
مطالعه در arXiv →
[3]تیم سردبیری کوهستانتوسعهدهندگان متنبازتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →بنچمارکهای هوش مصنوعی
ارزیابان مستقل از اختلاف ۳۷ امتیازی در بنچمارک هوش مصنوعی GPT-6 Astra پرده برداشتند
6 منبع
آموزش مدل
چگونه الگوریتم GRPO گلوگاه حافظه را در آموزش استدلال هوش مصنوعی از بین میبرد
6 منبع
ایجنتهای هوش مصنوعی محلی
انتقال مدیریت ایجنتهای هوش مصنوعی پرپلکسیتی به ویندوز با یکپارچهسازی انویدیا RTX
7 منبع
حاکمیت هوش مصنوعی
سیگنال چین برای تغییر سیاست: محدودیت دسترسی به پیشرفتهترین مدلهای هوش مصنوعی «وزن باز»
8 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





