رفتن به محتوای اصلی
Koohestun
توضیح کوهستانروش‌های تنظیم‌کنندگیمکانیک الگوریتم· 4 دقیقه مطالعه· در تحلیل داده

چگونه تنظیم‌کنندگی L1 ضرایب را به صفر می‌رساند در حالی که رگرسیون ریج همه آن‌ها را حفظ می‌کند

در حالی که هر دو تکنیک از بیش‌برازش مدل‌های یادگیری ماشین جلوگیری می‌کنند، رگرسیون لاسو به طور منحصر به فردی با حذف کامل متغیرهای کم‌اهمیت‌تر از طریق محاسبات ریاضی، اقدام به انتخاب ویژگی می‌کند.

به قلم الوین شادمهر

حامیان دقت پیش‌بینی 35%حامیان تفسیرپذیری 35%متخصصان ترکیبی 30%
حامیان دقت پیش‌بینی
استدلال می‌کنند که به حداقل رساندن خطای کلی پیش‌بینی از اهمیت بالایی برخوردار است و به نفع رگرسیون ریج هستند تا تمام سیگنال‌های موجود حفظ شوند.
حامیان تفسیرپذیری
مدل‌های تنک را در اولویت قرار می‌دهند که در آن‌ها انسان‌ها می‌توانند دقیقاً بفهمند کدام متغیرها پیش‌بینی را هدایت می‌کنند، و از لاسو حمایت می‌کنند.
متخصصان ترکیبی
استدلال می‌کنند که ترکیب هر دو جریمه از طریق شبکه الاستیک، بی‌ثباتی لاسو در برابر متغیرهای همبسته را حل می‌کند در حالی که تنکی مدل حفظ می‌شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مهندسان سخت‌افزار محاسباتی که معماری تراشه را برای ماتریس‌های تنک بهینه‌سازی می‌کنند

رگرسیون ریج با کاهش متناسب تأثیر هر متغیر، از حفظ نویز توسط مدل جلوگیری می‌کند. اگر یک مجموعه‌داده دارای ۱۰٬۰۰۰ پیش‌بینی‌کننده باشد، ریج مدلی با ۱۰٬۰۰۰ پیش‌بینی‌کننده که کمی تضعیف شده‌اند، ارائه می‌دهد. رگرسیون لاسو در یک جنبه اساسی متفاوت است: این روش تأثیر متغیرها را به میزان ثابتی کاهش می‌دهد، که باعث می‌شود کم‌اهمیت‌ترین آن‌ها دقیقاً به صفر برسند. این روش که در سال ۱۹۹۶ توسط رابرت تیبشیرانی، آمارشناس دانشگاه استنفورد، معرفی شد، برای حل مشکل تفسیرپذیری مجموعه‌داده‌های عظیم طراحی شده بود.[3][6]

مکانیسم پشت این تفاوت در شکل جریمه ریاضی است که هر روش بر ضرایب مدل اعمال می‌کند. رگرسیون ریج که در سال ۱۹۷۰ رسمیت یافت، مجموع ضرایب مربع‌شده را جریمه می‌کند. این کار یک ناحیه محدودیت صاف و دایره‌ای در فضای هندسی داده‌ها ایجاد می‌کند. راه‌حل بهینه—جایی که خطای مدل با این محدودیت تلاقی می‌کند—تقریباً همیشه روی منحنی دایره قرار می‌گیرد، به این معنی که همه متغیرها مقداری غیرصفر را حفظ می‌کنند.[3][7]

لاسو یک محدودیت ریاضی متفاوت اعمال می‌کند. همانطور که محققان دانشکده بهداشت عمومی میلمن دانشگاه کلمبیا اشاره می‌کنند، «LASSO یک روش تحلیل رگرسیون است که هم انتخاب متغیر و هم تنظیم‌کنندگی را برای افزایش دقت پیش‌بینی و تفسیرپذیری انجام می‌دهد.» این امر با جریمه کردن مجموع مقادیر مطلق ضرایب حاصل می‌شود. از نظر هندسی، این کار یک ناحیه محدودیت لوزی‌شکل با گوشه‌های تیز ایجاد می‌کند.[2][4]

گوشه‌های تیز محدودیت لوزی‌شکل جریمه L1، راه‌حل بهینه را مجبور می‌کند تا با یک محور تلاقی کند و یک ضریب را دقیقاً به صفر برساند.

هنگامی که مدل به دنبال راه‌حل بهینه تحت جریمه L1 است، تلاقی ریاضی به طور غالب در یکی از این گوشه‌های تیز رخ می‌دهد، که دقیقاً روی محورهای فضای هندسی قرار دارند. قرار گرفتن روی یک محور به این معنی است که ضریب آن متغیر خاص دقیقاً صفر است و عملاً آن را از معادله حذف می‌کند. مرز دایره‌ای مدل ریج فاقد این گوشه‌ها است، که تلاقی با محور را از نظر آماری نامحتمل می‌سازد.[3][5][7]

هنگامی که مدل به دنبال راه‌حل بهینه تحت جریمه L1 است، تلاقی ریاضی به طور غالب در یکی از این گوشه‌های تیز رخ می‌دهد، که دقیقاً روی محورهای فضای هندسی قرار دارند.

این ویژگی، لاسو را از یک ابزار تنظیم‌کنندگی ساده به یک انتخاب‌کننده خودکار ویژگی تبدیل می‌کند. در زمینه‌هایی مانند بیوانفورماتیک، محققان اغلب ۲۰٬۰۰۰ سطح بیان ژن را برای پیش‌بینی یک نتیجه بیماری واحد به مدل‌ها وارد می‌کنند. یک مدل ریج وزن ناچیزی به هر ژن اختصاص می‌دهد و محققان را مجبور می‌کند حدس بزنند کدام ژن‌ها واقعاً اهمیت دارند. در مقابل، یک مدل لاسو ۱۹٬۹۵۰ ژن نامربوط را به طور کامل حذف می‌کند و یک مدل تنک و قابل تفسیر حاوی تنها ۵۰ نشانگر پیش‌بینی‌کننده اصلی باقی می‌گذارد.[2][4][6]

با افزایش جریمه، رگرسیون ریج همه ضرایب را به سمت صفر کوچک می‌کند، در حالی که لاسو آن‌ها را یکی یکی دقیقاً به صفر می‌رساند.

با این حال، جریمه L1 هنگام برخورد با متغیرهای با همبستگی بالا، محدودیت‌های خاصی دارد. اگر سه متغیر کاملاً همگام حرکت کنند—مانند وزن بیمار بر حسب پوند، وزن بر حسب کیلوگرم، و شاخص توده بدنی—رگرسیون ریج وزن پیش‌بینی را به طور مساوی بین هر سه تقسیم می‌کند و به هر کدام ضریبی در حدود ۰٫۳۳ اختصاص می‌دهد. در مقابل، لاسو به طور دلخواه یکی از متغیرهای همبسته را برای حفظ با وزن ۱٫۰ انتخاب می‌کند و ضرایب دو متغیر دیگر را به سمت صفر می‌راند.[3][6][7]

این انتخاب دلخواه، لاسو را برای استنتاج علّی در شرایطی که هم‌خطی چندگانه بالاست، ناپایدار می‌کند. اگر مدلی یک متغیر را حذف کند، لزوماً به این معنی نیست که آن متغیر هیچ تأثیر واقعی در دنیای واقعی ندارد؛ بلکه ممکن است صرفاً به این معنی باشد که متغیر دیگری در مجموعه‌داده، همان اطلاعات را زودتر جذب کرده است. در نتیجه، در سال ۲۰۰۵، آمارشناسان شبکه الاستیک (Elastic Net) را معرفی کردند، یک رویکرد ترکیبی که جریمه‌های L1 و L2 را برای دستیابی به هر دو هدف انتخاب ویژگی و پایداری در میان پیش‌بینی‌کننده‌های همبسته ترکیب می‌کند.[1][2][4][5]

تفاوت‌های کلیدی در نحوه برخورد جریمه‌های L1 و L2 با داده‌های با ابعاد بالا.

کارایی محاسباتی یک مدل تنک در محیط‌های عملیاتی قابل اغماض نیست. مدلی که برای پیش‌بینی به ۱۰٬۰۰۰ ورودی نیاز دارد، به طور قابل توجهی حافظه و قدرت پردازش بیشتری نسبت به مدلی که فقط به ۵۰ ورودی نیاز دارد، مصرف می‌کند. لاسو با رساندن ضرایب به صفر در طول مرحله آموزش، تضمین می‌کند که مدل نهایی مستقر شده، سبک و سریع باشد. رگرسیون ریج عموماً دقت پیش‌بینی کلی بهتری را ارائه می‌دهد زمانی که اکثر متغیرها تأثیر کوچک اما واقعی دارند، اما لاسو زمانی برتری می‌یابد که واقعیت زیربنایی تنک باشد.[3][4]

نکات کلیدی

  • رگرسیون ریج همه ضرایب را به نسبت کوچک می‌کند اما هر متغیر را در مدل نهایی حفظ می‌کند.
  • رگرسیون لاسو یک جریمه مقدار مطلق اعمال می‌کند که ضرایب کم‌اهمیت‌تر را دقیقاً به صفر می‌رساند.
  • این اثر صفر کردن، لاسو را به یک انتخاب‌کننده خودکار ویژگی تبدیل می‌کند که برای مجموعه‌داده‌های با ابعاد بالا ایده‌آل است.
  • لاسو با متغیرهای با همبستگی بالا مشکل دارد و اغلب به طور دلخواه یکی را نگه می‌دارد و بقیه را حذف می‌کند.

چرا مهم است

از آنجایی که مجموعه‌داده‌ها رشد کرده و شامل میلیون‌ها متغیر می‌شوند—از توالی‌های ژنومی گرفته تا شاخص‌های مالی—توانایی حذف خودکار داده‌های نامرتبط باعث می‌شود مدل‌ها سریع‌تر، ارزان‌تر و برای انسان‌ها قابل تفسیرتر باشند.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

حامیان دقت پیش‌بینی 35%حامیان تفسیرپذیری 35%متخصصان ترکیبی 30%
  1. [1]Penn State Universityحامیان دقت پیش‌بینی

    5.4 - The Lasso

    مطالعه در Penn State University
  2. [2]Columbia University Mailman School of Public Healthحامیان تفسیرپذیری

    Least Absolute Shrinkage and Selection Operator (LASSO)

    مطالعه در Columbia University Mailman School of Public Health
  3. [3]Stanford Universityحامیان تفسیرپذیری

    The Elements of Statistical Learning: Data Mining, Inference, and Prediction (Second Edition)

    مطالعه در Stanford University
  4. [4]IBMمتخصصان ترکیبی

    What is lasso regression?

    مطالعه در IBM
  5. [5]GeeksforGeeksمتخصصان ترکیبی

    What is Lasso Regression

    مطالعه در GeeksforGeeks
  6. [6]R-bloggersحامیان دقت پیش‌بینی

    Understanding Lasso and Ridge Regression

    مطالعه در R-bloggers
  7. [7]GeeksforGeeksمتخصصان ترکیبی

    Ridge Regression vs Lasso Regression

    مطالعه در GeeksforGeeks
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.