چگونه جریمه L1 در رگرسیون لاسو برای انتخاب ویژگی، ضرایب را به صفر میرساند
روش لاسو با اعمال یک جریمه قدر مطلق روی ضرایب رگرسیون، متغیرهای کماهمیتتر را دقیقاً به صفر میرساند. این محدودیت هندسی به الگوریتم اجازه میدهد تا در مجموعهدادههای با ابعاد بالا، جایی که مدلهای سنتی با شکست مواجه میشوند، انتخاب ویژگی را بهطور خودکار انجام دهد.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
- طرفداران پراکندگی
- لاسو را به دلیل تواناییاش در تولید مدلهای هرسشده و بسیار قابل تفسیر ترجیح میدهند.
- طرفداران پایداری
- ریج را به خاطر پایداری ریاضی و مدیریت همخطی چندگانه ترجیح میدهند.
- متخصصان رویکرد ترکیبی
- شبکه الاستیک را برای ایجاد تعادل بین هر دو مزیت، به قیمت افزایش هزینه محاسباتی، ترجیح میدهند.
چرا مهم است
روش لاسو با صفر کردن دقیق وزنهای ریاضی متغیرهای نامربوط، به دانشمندان داده اجازه میدهد تا نویزها را در مجموعهدادههای عظیم بهطور خودکار فیلتر کنند. این سازوکار باعث میشود مدلهای پیشبینی هم سریعتر اجرا شوند و هم تفسیر آنها برای انسان آسانتر باشد.
در سال ۱۹۹۶، رابرت تیبشیرانی (Robert Tibshirani)، آمارشناس، مقالهای ۲۲ صفحهای در مجله انجمن آمار سلطنتی منتشر کرد که نحوه پردازش دادههای با ابعاد بالا توسط الگوریتمها را اساساً تغییر داد. تیبشیرانی با معرفی «عملگر انتخاب و انقباض کمترین قدر مطلق» (Lasso)، سازوکاری ریاضی ارائه کرد که نه تنها ضرایب رگرسیون را کوچک میکرد، بلکه ضریب متغیرهای کماهمیتتر را دقیقاً به صفر میرساند.[1][5]
پیش از انتشار این مقاله، مدلهایی که با صدها متغیر سروکار داشتند، بهشدت به رگرسیون ریج (Ridge) یا انتخاب گامبهگام وابسته بودند. رگرسیون ریج یک جریمه L2 اعمال میکند — یعنی ضرایب را به توان دو میرساند — که برای جلوگیری از بیشبرازش، آنها را به سمت صفر میل میدهد، اما هرگز آنها را واقعاً از معادله حذف نمیکند. مدلی که با استفاده از جریمه L2 روی ۱۰۰۰ ورودی آموزش دیده باشد، برای انجام تنها یک پیشبینی همچنان به تمام آن ۱۰۰۰ ورودی نیاز دارد.[4][5]
لاسو جریمه تواندار L2 را با یک جریمه L1 جایگزین کرد که قدر مطلق ضرایب را در نظر میگیرد. این تغییر جبری، هندسه مسئله بهینهسازی را دگرگون میکند. وقتی الگوریتم میانگین مربعات خطا را در کنار این جریمه L1 کمینه میکند، فضای محدودیت به شکل یک لوزی با گوشههای تیز درمیآید.[1][3][5]
از آنجا که خطوط تراز بیضوی تابع خطا از سمت راهحل بدون جریمه به سمت بیرون گسترش مییابند، تقریباً همیشه ابتدا با گوشههای تیز لوزی L1 برخورد میکنند. این گوشهها دقیقاً روی محورهای دستگاه مختصات قرار دارند. وقتی این تقاطع روی یک محور رخ میدهد، ضریب مربوطه دقیقاً برابر با ۰ تنظیم میشود.[1][5][6]
این تقاطع هندسی به لاسو قابلیتی دوگانه میبخشد: مدل را برای جلوگیری از بیشبرازش منظم میکند و همزمان انتخاب ویژگی را نیز انجام میدهد. اگر یک مجموعهداده شامل ۵۰,۰۰۰ ویژگی باشد اما تنها ۱۵ مورد از آنها واقعاً بر نتیجه تأثیر بگذارند، جریمه L1 با صفر کردن وزن ۴۹,۹۸۵ ویژگی دیگر، آنها را کنار میگذارد. این سازوکار به روش حداقل مربعات معمولی اجازه میدهد تا حتی زمانی که تعداد پیشبینیکنندهها از تعداد مشاهدات بیشتر است، به درستی عمل کند.[2][3][5]
این تقاطع هندسی به لاسو قابلیتی دوگانه میبخشد: مدل را برای جلوگیری از بیشبرازش منظم میکند و همزمان انتخاب ویژگی را نیز انجام میدهد.
قدرت این جریمه توسط یک پارامتر تنظیمکننده به نام لاندا (λ) کنترل میشود. وقتی λ روی ۰ تنظیم شود، جریمه کاملاً از بین میرود و مدل به رگرسیون خطی استاندارد بازمیگردد. با افزایش λ، لوزی کوچکتر میشود و ضرایب بیشتری را به ۰ میرساند تا جایی که مدل کاملاً خالی از متغیر شود.[3][5]
دانشمندان داده معمولاً از اعتبارسنجی متقاطع برای یافتن λ بهینه استفاده میکنند؛ نقطهای که در آن، مدل نویز کافی را حذف میکند تا بتواند بهخوبی روی دادههای جدید تعمیم یابد، اما سیگنال کافی را نیز برای حفظ دقت خود نگه میدارد. کتابخانه scikit-learn در پایتون این بهینهسازی را با استفاده از الگوریتمهای نزول مختصات بهطور کارآمدی پیادهسازی میکند و به مدلها اجازه میدهد حتی روی مجموعهدادههای عظیم نیز بهسرعت همگرا شوند.[2][3]
با این حال، جریمه L1 هنگام برخورد با متغیرهای بسیار همبسته، یک نقطه ضعف ریاضی مستند دارد. اگر سه ویژگی حاوی اطلاعاتی تقریباً یکسان باشند، لاسو تمایل دارد بهطور دلخواه یکی را انتخاب کرده و دو مورد دیگر را صفر کند. این ناپایداری، تفسیر مدل نهایی را دشوارتر میسازد، زیرا در صورت تغییر جزئی دادههای آموزشی، متغیر انتخابشده ممکن است کاملاً تغییر کند.[2][4]
برای حل این ناپایداری، آمارشناسانی به نامهای هوی زو (Hui Zou) و ترور هستی (Trevor Hastie) در آوریل ۲۰۰۵ شبکه الاستیک (Elastic Net) را معرفی کردند و یافتههای خود را در ۲۰ صفحه منتشر ساختند. همانطور که زو و هستی در مقدمه خود نوشتند، این روش «یک اثر گروهبندی را تشویق میکند، جایی که پیشبینیکنندههای بهشدت همبسته تمایل دارند با هم در مدل حضور داشته باشند یا با هم از آن خارج شوند.» شبکه الاستیک با ترکیب جریمه L1 لاسو و جریمه L2 رگرسیون ریج، توانایی لاسو در حذف متغیرهای بیفایده را حفظ کرده و در عین حال پایداری ریج را نیز به ارث میبرد.[4]
امروزه انتخاب میان این جریمهها، پایه و اساس رگرسیون منظمشده را تشکیل میدهد. جریمه L1 همچنان ابزار قطعی برای انتخاب ویژگی خالص است و سیگنال ریاضی را در مجموعهدادههایی که در غیر این صورت برای تحلیل بسیار گسترده هستند، جدا میکند. مرز بعدی در منظمسازی، شامل تطبیق همین محدودیتهای هندسی دقیق برای شبکههای عصبی عمیق است؛ جایی که اعمال پراکندگی میتواند میلیاردها پارامتری را که در حال حاضر برای مدلهای زبانی بزرگ مورد نیاز است، بهشدت کاهش دهد.[2][5][6]
بررسی عمیق دیدگاهها
لاسو (جریمه L1)
با صفر کردن ضرایب، مدل را برای پراکندگی بهینهسازی میکند.
لاسو در محیطهای با ابعاد بالا که مدل پایه واقعی پراکنده است — به این معنی که تنها بخش کوچکی از ویژگیهای موجود واقعاً بر نتیجه تأثیر میگذارند — عملکردی عالی دارد. با اعمال جریمه L1، این روش مجموعهداده را بهشدت هرس میکند و مدلهایی بسیار قابل تفسیر به دست میدهد که در زمان استنتاج به ورودیهای کمتری نیاز دارند. با این حال، لاسو با همخطی چندگانه مشکل دارد و اغلب متغیرهای همبسته را بهطور غیرقابلپیشبینی حذف میکند. زمانی که انتخاب ویژگی هدف اصلی باشد، بسیار مناسب است؛ اما وقتی متغیرها بهشدت همبسته باشند، گزینه خوبی نیست.
ریج (جریمه L2)
با کوچک کردن ضرایب بدون حذف آنها، مدل را برای پایداری بهینهسازی میکند.
رگرسیون ریج یک جریمه تواندار اعمال میکند که بهآرامی تمام ضرایب را به سمت صفر کوچک کرده و به جای انتخاب یک برنده واحد، وزنها را میان ویژگیهای همبسته توزیع میکند. این سازوکار باعث میشود مدل بسیار پایدار و از نظر ریاضی خوشرفتار باشد و اغلب زمانی که بیشتر متغیرها حداقل تأثیر اندکی بر نتیجه دارند، دقت پیشبینی برتری ارائه میدهد. با این حال، این روش در انتخاب ویژگی ناکام میماند و مدل را به اندازه دادههای خام پیچیده رها میکند. زمانی که تصور میشود تمام ویژگیها مرتبط هستند، بسیار مناسب است؛ اما وقتی به یک مدل پراکنده و قابل تفسیر نیاز باشد، گزینه خوبی نیست.
شبکه الاستیک (ترکیبی)
با ترکیب هر دو جریمه، بین پراکندگی و پایداری تعادل برقرار میکند.
شبکه الاستیک با ترکیب جریمههای L1 و L2، به بهترین ویژگیهای هر دو هندسه دست مییابد. این روش میتواند مانند لاسو ضرایب را به صفر برساند، اما وقتی با گروهی از متغیرهای بهشدت همبسته روبرو میشود، جزء L2 تضمین میکند که آنها به عنوان یک بلوک با هم انتخاب یا حذف شوند. این امر نیازمند تنظیم یک ابرپارامتر اضافی (نسبت ترکیب) است که هزینه محاسباتی را در طول اعتبارسنجی متقاطع افزایش میدهد. زمانی که مجموعهدادهها هم ابعاد بالا و هم همبستگیهای داخلی قوی دارند، بسیار مناسب است؛ اما وقتی منابع محاسباتی برای تنظیم ابرپارامترها بهشدت محدود باشد، گزینه خوبی نیست.
آنچه نمیدانیم
- وقتی لاسو با گروهی از متغیرهای همخط روبرو میشود، اینکه دقیقاً کدام متغیر همبسته را انتخاب میکند، از نظر ریاضی همچنان دلخواه و نامشخص است.
- هزینه محاسباتی دقیق برای تنظیم ابرپارامترهای دوگانه در شبکه الاستیک روی مجموعهدادههای عظیم و در مقیاس ترابایت، هنوز کاملاً مشخص نیست.
منابع
[1]Oxford Academicطرفداران پراکندگیRegression Shrinkage and Selection Via the Lasso
مطالعه در Oxford Academic →
[2]MCP Analyticsمتخصصان رویکرد ترکیبیLasso Regression: Practical Guide for Data-Driven Decisions
مطالعه در MCP Analytics →
[3]scikit-learnطرفداران پایداری1.1.3. Lasso
مطالعه در scikit-learn →
[4]Wileyمتخصصان رویکرد ترکیبیRegularization and variable selection via the elastic net
مطالعه در Wiley →
[5]IBMطرفداران پراکندگیWhat is lasso regression?
مطالعه در IBM →
[6]Factlen Editorial TeamSynthesis by Factlen editorial team
مطالعه در Factlen Editorial Team →
نظرات
بیشتر در تحلیل داده
مشاهده همه →نظریه آماری
چرا بازه اطمینان ۹۵ درصدی به معنای احتمال ۹۵ درصدی برای یافتن میانگین واقعی در آن محدوده نیست؟
10 منبع
بازدهی کشاورزی
دادههای کشاورزی ارگانیک در برابر سنتی: چرا اثرات زیستمحیطی به نحوه اندازهگیری شما بستگی دارد
5 منبع
هندسه دادهها
نقص هندسی نمودارهای راداری: سازوکار اختلال مساحت بر اثر ترتیب محورها و خطای مقایسههای چندمعیاره
5 منبع
مدلسازی اقلیمی
چگونه مدلهای دادهای جدید، تضعیف ۵۸ درصدی جریان اقیانوسی اطلس را تا سال ۲۱۰۰ پیشبینی میکنند
7 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





