چگونه هرس بدون ساختار، ۹۰ درصد از وزنهای یک مدل را بدون افت دقت حذف میکند
مهندسان با صفر کردن سیستماتیک اتصالات منفرد، میتوانند شبکههای عصبی عظیم را در قالب ماتریسهای خلوت فشرده کنند. این تکنیک بر یافتن «بلیتهای برنده» پنهان در معماری مدل تکیه دارد، هرچند سختافزارهای استاندارد برای شتابدهی به الگوهای نامنظمِ حاصل از آن با چالش مواجهاند.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- پژوهشگران نظری
- تمرکز بر ویژگیهای ریاضیاتی خلوتی و ماهیت بنیادین مقداردهی اولیه شبکههای عصبی.
- مهندسان سختافزار
- تأکید بر محدودیتهای عملی اجرای ماتریسهای خلوت نامنظم روی پردازندههای سیلیکونی استاندارد.
- متخصصان استقرار
- اولویت دادن به کاهش فوری فضای ذخیرهسازی و ردپای حافظه برای استقرار مدلها روی دستگاههای لبه.
دیدگاههایی که این گزارش پوشش نداده
- طراحان تراشههای تخصصی هوش مصنوعی
- توسعهدهندگان مدلهای متنباز
نکات کلیدی
- هرس بدون ساختار تا ۹۰ درصد از وزنهای منفرد یک شبکه عصبی را بهطور دائم و بدون فدا کردن دقت پیشبینی حذف میکند.
- این تکنیک بر «فرضیه بلیت بختآزمایی» استوار است؛ فرضیهای که میگوید شبکههای عظیم دارای زیرشبکههای بهینه و خلوتی هستند که در زمان مقداردهی اولیه بهطور تصادفی ایجاد شدهاند.
- یافتن یک «بلیت برنده» نیازمند یک فرآیند تکرارشونده و فشرده از آموزش، هرس و بازنشانی شبکه به وزنهای اولیهاش است.
- درحالیکه هرس بدون ساختار، فضای ذخیرهسازی مدل را بهشدت کاهش میدهد، پردازندههای سیلیکونی استاندارد در شتابدهی به ماتریسهای خلوت و نامنظمِ حاصل از آن با مشکل مواجه میشوند.
- صنعت بهطور فزایندهای بر طراحی مشترک سختافزارهای تخصصی متمرکز است که بتوانند بهطور ذاتی از محاسبات صفرشده عبور کنند تا به بهبودهای بیدرنگ در تأخیر دست یابند.
چرا مهم است
با رشد مدلهای هوش مصنوعی و رسیدن آنها به میلیاردها پارامتر، هزینه محاسباتی اجرای آنها دسترسیپذیریشان را تهدید میکند. هرس بدون ساختار مسیری برای فشردهسازی ۹۰ درصدی این سیستمهای عظیم ارائه میدهد و به هوش مصنوعی پیشرفته اجازه میدهد تا بهجای اتکا به زیرساختهای گرانقیمت ابری، بهصورت محلی روی دستگاههای کاربران اجرا شود.
وقتی یک مهندس هوش مصنوعی یک شبکه عصبی آموزشدیده را برای استقرار آماده میکند، این توانایی را دارد که تا ۹۰ درصد از اتصالات داخلی آن را برای همیشه حذف کند. این تصمیم که در مرحله پس از آموزش به نام «هرس بدون ساختار» اجرا میشود، مدل را مجبور میکند تا تنها با کسری از ردپای حافظه اصلی خود کار کند. توسعهدهندگان با شناسایی سیستماتیک و صفر کردن وزنهایی که کمترین نقش را در خروجی نهایی دارند، میتوانند معماریهای عظیمی با میلیاردها پارامتر را بدون فدا کردن دقت پیشبینی، در قالب ماتریسهای خلوت فشرده کنند.[4]
این سازوکار بر افزونگی ذاتی یادگیری عمیق تکیه دارد. در طول فاز اولیه آموزش، یک شبکه عصبی مسیرهای همپوشان متعددی را برای تشخیص الگوهای یکسان توسعه میدهد. هرس بدون ساختار، پارامترهای منفرد را در سراسر شبکه هدف قرار داده و هر اتصال را بهطور مستقل ارزیابی میکند. اگر وزن خاصی به زیر یک آستانه اندازه از پیش تعیینشده برسد - که اغلب ۲۰ درصدِ پایین مقادیر در یک لایه مشخص است - مهندس مقدار آن را دقیقاً روی صفر تنظیم میکند.[4][5]
این رویکرد دانهدانه، تفاوت بنیادینی با هرس ساختاریافته دارد که اجزای معماری مانند فیلترهای کانولوشن یا هدهای توجه را بهطور کامل حذف میکند. از آنجا که هرس بدون ساختار هیچ محدودیتی برای حذف پارامترهای خاص قائل نمیشود، به شبکه اجازه میدهد تا یک الگوی بسیار نامنظم و پراکنده از اتصالات فعال را حفظ کند. همین انعطافپذیری است که امکان حذف ۹۰ درصد از وزنها را در عین حفظ معیارهای عملکرد اصلی مدل فراهم میکند.[3][4]
پایه نظری این پدیده در سال ۲۰۱۸ توسط پژوهشگرانی به نامهای جاناتان فرانکل و مایکل کاربین در موسسه فناوری ماساچوست (MIT) فرمولبندی شد. آنها در مقاله بنیادین خود نشان دادند که اکثریت قریببهاتفاق پارامترهای یک شبکه در نهایت برای وظیفه نهایی آن غیرضروری هستند. آنها چیزی را بیان کردند که اکنون یک اصل مرکزی در فشردهسازی مدل است: «شبکههای پیشخورِ متراکم با مقداردهی اولیه تصادفی، حاوی زیرشبکههایی (بلیتهای برنده) هستند که وقتی بهطور مجزا آموزش داده شوند، در تعداد مشابهی از تکرارها به دقت آزمونی قابلمقایسه با شبکه اصلی دست مییابند.»[1]
این مفهوم که با عنوان «فرضیه بلیت بختآزمایی» شناخته میشود، نگاه صنعت به مقداردهی اولیه شبکههای عصبی را بهطور بنیادین تغییر داد. این فرضیه مطرح میکند که آموزش یک مدل عظیم و بیشازحد پارامتربندیشده، از نظر ریاضی معادل خرید میلیونها بلیت بختآزمایی است. اکثریت قریببهاتفاق اتصالات بازندهاند، اما یک زیرشبکه کوچک و خلوت - همان بلیت برنده - تصادفاً دقیقاً همان وزنهای اولیهای را دریافت میکند که برای یادگیری کارآمدِ وظیفه موردنظر لازم است.[1][6]
این مفهوم که با عنوان «فرضیه بلیت بختآزمایی» شناخته میشود، نگاه صنعت به مقداردهی اولیه شبکههای عصبی را بهطور بنیادین تغییر داد.
یافتن این بلیتهای برنده نیازمند یک فرآیند تکرارشونده با بار محاسباتی سنگین است. یک مهندس ابتدا باید شبکه متراکم را تا انتها آموزش دهد، وزنهایی با کمترین اندازه را شناسایی کند و آنها را به نسبت مشخصی، معمولاً ۲۰ درصد در هر دور، هرس کند. نکته حیاتی این است که اتصالات باقیمانده سپس دقیقاً به مقادیر اولیه خود پیش از آغاز آموزش بازنشانی میشوند. شبکه خلوت سپس دوباره از صفر آموزش داده میشود و این چرخه تا رسیدن به خلوتیِ ۹۰ درصدیِ مطلوب تکرار میگردد.[1][6]
در سال ۲۰۲۰، پژوهشگرانی به نامهای اران مالاخ و شای شالو-شوارتز یک اثبات ریاضی در تأیید این فرضیه منتشر کردند و نشان دادند که هر شبکه عصبیِ بهاندازه کافی بزرگ، تضمین میشود که حاوی زیرشبکهای باشد که بتواند بدون هیچگونه بهروزرسانی وزن، با تابع هدف مطابقت داشته باشد. کار آنها تأیید کرد که قدرت یادگیری عمیق تا حد زیادی از انفجار ترکیبیِ زیرشبکههای ممکنی نشأت میگیرد که در زمان مقداردهی اولیه تولید میشوند.[2]
با این حال، ترجمه خلوتیِ نظری به شتابدهی سختافزاریِ عملی همچنان یک گلوگاه مهندسی مهم است. درحالیکه هرس بدون ساختار بهطور قابلاطمینانی اندازه فایل مدل را برای ذخیرهسازی کاهش میدهد، پردازندههای سیلیکونی استاندارد در بهرهبرداری از صفرهای پراکنده با مشکل مواجهاند. همانطور که تحلیلگران صنعت اشاره کردهاند، از آنجا که «هرس بدون ساختار شامل صفر کردن وزنهای منفرد در ماتریسهای وزن است، این بدان معناست که تمام محاسباتِ پیش از هرس مدل انجام میشوند و در نتیجه بهبود حداقلی در تأخیر وجود دارد.»[4]
واحدهای پردازش گرافیکی مدرن برای ضرب ماتریسهای متراکم بهینهسازی شدهاند و دادهها را در بلوکهای پیوسته ۳۲ یا ۶۴ ریسمانی پردازش میکنند. وقتی یک پردازنده با ماتریسی روبهرو میشود که ۹۰ درصد مقادیر آن صفر است، اما این صفرها بهطور تصادفی توزیع شدهاند، نمیتواند بهراحتی از عملیاتهای خالی عبور کند. سختافزار همچنان باید کل ماتریس را در حافظه بارگذاری کرده و مراحل ریاضی را اجرا کند؛ به این معنی که سرعت استنتاج با وجود کاهش عظیم پارامترهای فعال، تا حد زیادی بدون تغییر باقی میماند.[3][4]
برای پر کردن این شکاف، صنعت بهطور فزایندهای در حال بررسی شتابدهندههای تخصصی ماتریس خلوت و رویکردهای ترکیبی است. تا سال ۲۰۲۳، بررسیهایی که بیش از ۱۵۰ روش متمایز هرس شبکههای عصبی عمیق را تحلیل میکردند، چرخش بهسمت تکنیکهای فشردهسازیِ آگاه از سختافزار را برجسته کردند. این مدلهای ترکیبی تلاش میکنند تا تعادلی میان حفظ دقت بالای هرس بدون ساختار و کارایی محاسباتی روشهای ساختاریافته ایجاد کنند.[5]
یک بررسی جامع در سال ۲۰۲۵ که در ژورنال Frontiers in Robotics and AI منتشر شد، تأکید کرد که آینده فشردهسازی مدل در طراحی مشترک الگوریتمها و سختافزار نهفته است. تا زمانی که معماریهای سیلیکونی برای عبور ذاتی از محاسبات خلوتِ نامنظم تکامل نیابند، مهندسان باید مزایای ذخیرهسازی هرس بدون ساختار را در برابر فقدان کاهش فوری تأخیر بسنجند.[3]
کشف بلیتهای برنده ثابت میکند که مقیاس عظیم مدلهای مدرن هوش مصنوعی، محصول جانبی فرآیند آموزش است، نه یک الزام قطعی برای هوشمندی. فاز بعدی بهینهسازی بر شناسایی این ساختارهای خلوتِ بهینه پیش از آغاز اجرای اولیه آموزش تکیه دارد، که بهطور بالقوه نیاز به محاسبه میلیاردها وزنی را که در نهایت دور ریخته خواهند شد، از بین میبرد.[1][2]
اصطلاحات کلیدی
- هرس بدون ساختار (Unstructured Pruning)
- فرآیند صفر کردن وزنهای منفرد با اندازه کوچک در یک شبکه عصبی بدون حذف ساختارهای معماری بهطور کامل.
- فرضیه بلیت بختآزمایی (Lottery Ticket Hypothesis)
- نظریهای که میگوید شبکههای عصبی متراکم حاوی زیرشبکههای کوچکتر و خلوتی هستند که در صورت آموزش مجزا از مقادیر اولیه خود، میتوانند با عملکرد مدل اصلی برابری کنند.
- ماتریس خلوت (Sparse Matrix)
- یک شبکه ریاضی که اکثریت قریببهاتفاق مقادیر آن صفر است و از هرس وزنهای یک شبکه عصبی حاصل میشود.
- تأخیر استنتاج (Inference Latency)
- مدتزمانی که طول میکشد تا یک مدل هوش مصنوعی آموزشدیده، دادههای جدید را پردازش کرده و یک پیشبینی تولید کند.
- هرس ساختاریافته (Structured Pruning)
- یک روش فشردهسازی که نورونها، فیلترها یا کانالها را بهطور کامل از یک شبکه حذف میکند و مدلی کوچکتر اما کاملاً متراکم ایجاد میکند.
منابع
[1]arXivپژوهشگران نظریThe Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks
مطالعه در arXiv →
[2]Proceedings of Machine Learning Research (PMLR)پژوهشگران نظریProving the Lottery Ticket Hypothesis: Pruning is All You Need
مطالعه در Proceedings of Machine Learning Research (PMLR) →
[3]Frontiers in Robotics and AIمهندسان سختافزارA survey of model compression techniques: past, present, and future
مطالعه در Frontiers in Robotics and AI →
[4]Datature Blogمتخصصان استقرارA Comprehensive Guide to Neural Network Model Pruning
مطالعه در Datature Blog →
[5]arXivپژوهشگران نظریA Survey on Deep Neural Network Pruning: Taxonomy, Comparison, Analysis, and Recommendations
مطالعه در arXiv →
[6]Wikipediaمتخصصان استقرارLottery ticket hypothesis
مطالعه در Wikipedia →
[7]تیم سردبیری کوهستانمتخصصان استقرارتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

