چگونه تنظیمکنندگی L1 ضرایب را به صفر میرساند در حالی که رگرسیون ریج همه آنها را حفظ میکند
در حالی که هر دو تکنیک از بیشبرازش مدلهای یادگیری ماشین جلوگیری میکنند، رگرسیون لاسو به طور منحصر به فردی با حذف کامل متغیرهای کماهمیتتر از طریق محاسبات ریاضی، اقدام به انتخاب ویژگی میکند.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
- حامیان دقت پیشبینی
- استدلال میکنند که به حداقل رساندن خطای کلی پیشبینی از اهمیت بالایی برخوردار است و به نفع رگرسیون ریج هستند تا تمام سیگنالهای موجود حفظ شوند.
- حامیان تفسیرپذیری
- مدلهای تنک را در اولویت قرار میدهند که در آنها انسانها میتوانند دقیقاً بفهمند کدام متغیرها پیشبینی را هدایت میکنند، و از لاسو حمایت میکنند.
- متخصصان ترکیبی
- استدلال میکنند که ترکیب هر دو جریمه از طریق شبکه الاستیک، بیثباتی لاسو در برابر متغیرهای همبسته را حل میکند در حالی که تنکی مدل حفظ میشود.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان سختافزار محاسباتی که معماری تراشه را برای ماتریسهای تنک بهینهسازی میکنند
رگرسیون ریج با کاهش متناسب تأثیر هر متغیر، از حفظ نویز توسط مدل جلوگیری میکند. اگر یک مجموعهداده دارای ۱۰٬۰۰۰ پیشبینیکننده باشد، ریج مدلی با ۱۰٬۰۰۰ پیشبینیکننده که کمی تضعیف شدهاند، ارائه میدهد. رگرسیون لاسو در یک جنبه اساسی متفاوت است: این روش تأثیر متغیرها را به میزان ثابتی کاهش میدهد، که باعث میشود کماهمیتترین آنها دقیقاً به صفر برسند. این روش که در سال ۱۹۹۶ توسط رابرت تیبشیرانی، آمارشناس دانشگاه استنفورد، معرفی شد، برای حل مشکل تفسیرپذیری مجموعهدادههای عظیم طراحی شده بود.[3][6]
مکانیسم پشت این تفاوت در شکل جریمه ریاضی است که هر روش بر ضرایب مدل اعمال میکند. رگرسیون ریج که در سال ۱۹۷۰ رسمیت یافت، مجموع ضرایب مربعشده را جریمه میکند. این کار یک ناحیه محدودیت صاف و دایرهای در فضای هندسی دادهها ایجاد میکند. راهحل بهینه—جایی که خطای مدل با این محدودیت تلاقی میکند—تقریباً همیشه روی منحنی دایره قرار میگیرد، به این معنی که همه متغیرها مقداری غیرصفر را حفظ میکنند.[3][7]
لاسو یک محدودیت ریاضی متفاوت اعمال میکند. همانطور که محققان دانشکده بهداشت عمومی میلمن دانشگاه کلمبیا اشاره میکنند، «LASSO یک روش تحلیل رگرسیون است که هم انتخاب متغیر و هم تنظیمکنندگی را برای افزایش دقت پیشبینی و تفسیرپذیری انجام میدهد.» این امر با جریمه کردن مجموع مقادیر مطلق ضرایب حاصل میشود. از نظر هندسی، این کار یک ناحیه محدودیت لوزیشکل با گوشههای تیز ایجاد میکند.[2][4]
هنگامی که مدل به دنبال راهحل بهینه تحت جریمه L1 است، تلاقی ریاضی به طور غالب در یکی از این گوشههای تیز رخ میدهد، که دقیقاً روی محورهای فضای هندسی قرار دارند. قرار گرفتن روی یک محور به این معنی است که ضریب آن متغیر خاص دقیقاً صفر است و عملاً آن را از معادله حذف میکند. مرز دایرهای مدل ریج فاقد این گوشهها است، که تلاقی با محور را از نظر آماری نامحتمل میسازد.[3][5][7]
هنگامی که مدل به دنبال راهحل بهینه تحت جریمه L1 است، تلاقی ریاضی به طور غالب در یکی از این گوشههای تیز رخ میدهد، که دقیقاً روی محورهای فضای هندسی قرار دارند.
این ویژگی، لاسو را از یک ابزار تنظیمکنندگی ساده به یک انتخابکننده خودکار ویژگی تبدیل میکند. در زمینههایی مانند بیوانفورماتیک، محققان اغلب ۲۰٬۰۰۰ سطح بیان ژن را برای پیشبینی یک نتیجه بیماری واحد به مدلها وارد میکنند. یک مدل ریج وزن ناچیزی به هر ژن اختصاص میدهد و محققان را مجبور میکند حدس بزنند کدام ژنها واقعاً اهمیت دارند. در مقابل، یک مدل لاسو ۱۹٬۹۵۰ ژن نامربوط را به طور کامل حذف میکند و یک مدل تنک و قابل تفسیر حاوی تنها ۵۰ نشانگر پیشبینیکننده اصلی باقی میگذارد.[2][4][6]
با این حال، جریمه L1 هنگام برخورد با متغیرهای با همبستگی بالا، محدودیتهای خاصی دارد. اگر سه متغیر کاملاً همگام حرکت کنند—مانند وزن بیمار بر حسب پوند، وزن بر حسب کیلوگرم، و شاخص توده بدنی—رگرسیون ریج وزن پیشبینی را به طور مساوی بین هر سه تقسیم میکند و به هر کدام ضریبی در حدود ۰٫۳۳ اختصاص میدهد. در مقابل، لاسو به طور دلخواه یکی از متغیرهای همبسته را برای حفظ با وزن ۱٫۰ انتخاب میکند و ضرایب دو متغیر دیگر را به سمت صفر میراند.[3][6][7]
این انتخاب دلخواه، لاسو را برای استنتاج علّی در شرایطی که همخطی چندگانه بالاست، ناپایدار میکند. اگر مدلی یک متغیر را حذف کند، لزوماً به این معنی نیست که آن متغیر هیچ تأثیر واقعی در دنیای واقعی ندارد؛ بلکه ممکن است صرفاً به این معنی باشد که متغیر دیگری در مجموعهداده، همان اطلاعات را زودتر جذب کرده است. در نتیجه، در سال ۲۰۰۵، آمارشناسان شبکه الاستیک (Elastic Net) را معرفی کردند، یک رویکرد ترکیبی که جریمههای L1 و L2 را برای دستیابی به هر دو هدف انتخاب ویژگی و پایداری در میان پیشبینیکنندههای همبسته ترکیب میکند.[1][2][4][5]
کارایی محاسباتی یک مدل تنک در محیطهای عملیاتی قابل اغماض نیست. مدلی که برای پیشبینی به ۱۰٬۰۰۰ ورودی نیاز دارد، به طور قابل توجهی حافظه و قدرت پردازش بیشتری نسبت به مدلی که فقط به ۵۰ ورودی نیاز دارد، مصرف میکند. لاسو با رساندن ضرایب به صفر در طول مرحله آموزش، تضمین میکند که مدل نهایی مستقر شده، سبک و سریع باشد. رگرسیون ریج عموماً دقت پیشبینی کلی بهتری را ارائه میدهد زمانی که اکثر متغیرها تأثیر کوچک اما واقعی دارند، اما لاسو زمانی برتری مییابد که واقعیت زیربنایی تنک باشد.[3][4]
نکات کلیدی
- رگرسیون ریج همه ضرایب را به نسبت کوچک میکند اما هر متغیر را در مدل نهایی حفظ میکند.
- رگرسیون لاسو یک جریمه مقدار مطلق اعمال میکند که ضرایب کماهمیتتر را دقیقاً به صفر میرساند.
- این اثر صفر کردن، لاسو را به یک انتخابکننده خودکار ویژگی تبدیل میکند که برای مجموعهدادههای با ابعاد بالا ایدهآل است.
- لاسو با متغیرهای با همبستگی بالا مشکل دارد و اغلب به طور دلخواه یکی را نگه میدارد و بقیه را حذف میکند.
چرا مهم است
از آنجایی که مجموعهدادهها رشد کرده و شامل میلیونها متغیر میشوند—از توالیهای ژنومی گرفته تا شاخصهای مالی—توانایی حذف خودکار دادههای نامرتبط باعث میشود مدلها سریعتر، ارزانتر و برای انسانها قابل تفسیرتر باشند.
منابع
[1]Penn State Universityحامیان دقت پیشبینی5.4 - The Lasso
مطالعه در Penn State University →
[2]Columbia University Mailman School of Public Healthحامیان تفسیرپذیریLeast Absolute Shrinkage and Selection Operator (LASSO)
مطالعه در Columbia University Mailman School of Public Health →
[3]Stanford Universityحامیان تفسیرپذیریThe Elements of Statistical Learning: Data Mining, Inference, and Prediction (Second Edition)
مطالعه در Stanford University →
[4]IBMمتخصصان ترکیبیWhat is lasso regression?
مطالعه در IBM →
[5]GeeksforGeeksمتخصصان ترکیبیWhat is Lasso Regression
مطالعه در GeeksforGeeks →
[6]R-bloggersحامیان دقت پیشبینیUnderstanding Lasso and Ridge Regression
مطالعه در R-bloggers →
[7]GeeksforGeeksمتخصصان ترکیبیRidge Regression vs Lasso Regression
مطالعه در GeeksforGeeks →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →تنگه هرمز
تحلیل دادههای ترافیک دریایی: چگونه نوسانات عبور کشتیها از تنگه هرمز اندازهگیری میشود
5 منبع
نوسانات ارزی
تحلیل دادههای نوسان نرخ ارز: عملکرد ۱۲ ماهه ریال در برابر دلار و یورو
4 منبع
معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





