رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمدل‌سازی آماریبسته شواهد· 5 دقیقه مطالعه· در تحلیل داده

چگونه تابع پیوند، پیش‌بین خطی را به برآمد مورد انتظار در مدل‌های خطی تعمیم‌یافته متصل می‌کند

توابع پیوند با ترجمه ریاضیاتی برآمدهای محدود دنیای واقعی به معادلات خطی نامحدود، این امکان را فراهم می‌کنند که احتمالات، شمارش‌ها و داده‌های پیوسته در یک چارچوب واحد مدل‌سازی شوند.

به قلم ندا وزیری

آمارشناسان نظریه‌پرداز 40%دانشمندان داده کاربردی 40%توسعه‌دهندگان نرم‌افزار 20%
آمارشناسان نظریه‌پرداز
اولویت را به ظرافت نظری توابع پیوند متعارف می‌دهند که کاملاً با توزیع داده‌های زیربنایی مطابقت دارند.
دانشمندان داده کاربردی
بر کاربرد عملی مدل‌های خطی تعمیم‌یافته تمرکز می‌کنند و بر نیاز به ترجمه ضرایب تبدیل‌یافته به اثرات حاشیه‌ای قابل تفسیر تأکید دارند.
توسعه‌دهندگان نرم‌افزار
توابع پیوند را به عنوان یک لایه محاسباتی ضروری می‌بینند که باید در بسته‌های آماری استانداردسازی و بهینه‌سازی شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آمارشناسان بیزی
  • پژوهشگران استنتاج علی

یک مدل پیش‌بینی‌کننده که احتمال نکول را ۱۱۵٪ محاسبه کند، یا ورود منفی سه بیمار به اورژانس را پیش‌بینی کند، در یک آزمون اولیه از واقعیت فیزیکی مردود شده است. ریشه این شکست در یک ناهماهنگی ساختاری نهفته است: جبر خطی استاندارد در هر دو جهت تا بی‌نهایت امتداد می‌یابد، در حالی که برآمدهای دنیای واقعی اکیداً محدود هستند. یک احتمال باید دقیقاً بین ۰ و ۱ قرار گیرد. یک شمارش فیزیکی نمی‌تواند به زیر ۰ سقوط کند. وقتی تحلیلگران سعی می‌کنند این واقعیت‌های محدود را مستقیماً به یک رگرسیون خطی استاندارد تحمیل کنند، خط مستقیم ناگزیر از این مرزها عبور کرده و مزخرفات ریاضیاتی تولید می‌کند.[3][4]

راه‌حل این ناهماهنگی در سال ۱۹۷۲ توسط آمارشناسانی به نام‌های جان نلدر و رابرت ودربرن فرمول‌بندی شد؛ کسانی که مدل خطی تعمیم‌یافته (GLM) را معرفی کردند. چارچوب آن‌ها تشخیص داد که اگرچه دنیای واقعی غیرخطی و محدود است، اما ریاضیات ترکیبات خطی — یعنی جمع کردن متغیرهای وزن‌دار با یکدیگر — بسیار قدرتمندتر و کارآمدتر از آن است که بتوان آن را کنار گذاشت. برای پر کردن این شکاف، آن‌ها مدل را به سه جزء مجزا تفکیک کردند: یک جزء تصادفی که توزیع داده‌ها را توصیف می‌کند، یک جزء سیستماتیک (پیش‌بین خطی)، و یک مترجم ریاضیاتی که این دو را به هم متصل می‌کند.[1][7]

هر مدل خطی تعمیم‌یافته بر روی سه ستون بنیادین بنا شده است.

آن مترجم، همان تابع پیوند است. همان‌طور که ارائه‌دهنده نرم‌افزار آماری مینی‌تب (Minitab) آن را تعریف می‌کند: «تابع پیوند، رابطه بین پیش‌بین خطی و میانگین تابع توزیع را فراهم می‌کند.» این تابع مانند یک قیف ریاضیاتی عمل می‌کند. در یک سو، برآمد مورد انتظار و محدود دنیای واقعی (میانگین یا مو) را دریافت می‌کند. در سوی دیگر، آن مقدار محدود را به یک مقیاس نامحدود تبدیل می‌کند که از منفی بی‌نهایت تا مثبت بی‌نهایت کشیده شده است و با دامنه طبیعی یک معادله خطی تطابق دارد.[5]

خود پیش‌بین خطی، صرفاً حاصل‌جمع ضرایب مدل ضرب در متغیرهای مربوطه آن‌هاست. از آنجا که این متغیرها و وزن‌ها از نظر تئوری می‌توانند هر مقداری به خود بگیرند، حاصل‌جمع نهایی کاملاً بدون محدودیت است. متن بوک‌داون (Bookdown) در سال ۲۰۲۳ درباره مدل‌های خطی تعمیم‌یافته خاطرنشان می‌کند که «تابع پیوند پیش‌بین خطی را به مقدار مورد انتظار متغیر پاسخ متصل می‌کند.» با اعمال تابع پیوند بر برآمد مورد انتظار، مدل تضمین می‌کند که پیش‌بین خطی همیشه به یک فضای معتبر و از نظر ریاضیاتی درست نگاشت می‌شود.[3]

مشهورترین کاربرد این سازوکار، رگرسیون لجستیک است که بر تابع پیوند لاجیت تکیه دارد. هنگام پیش‌بینی یک برآمد دودویی — مانند اینکه آیا یک ایمیل اسپم است یا خیر — مقدار مورد انتظار، احتمالی بین ۰ و ۱ است. پیوند لاجیت این احتمال را به لگاریتم شانس (log-odds) تبدیل می‌کند. احتمال ۵۰٪ به لگاریتم شانس ۰ تبدیل می‌شود. احتمال ۹۹٪ به مثبت بی‌نهایت و احتمال ۱٪ به منفی بی‌نهایت میل می‌کند. پیش‌بین خطی، لگاریتم شانس را محاسبه می‌کند و معکوس تابع پیوند، آن عدد نامحدود را با خیال راحت به یک درصد معتبر برمی‌گرداند.[2][6]

تابع پیوند لاجیت، احتمالات محدود شده بین ۰ و ۱ را روی یک مقیاس بی‌نهایت نگاشت می‌کند.
مشهورترین کاربرد این سازوکار، رگرسیون لجستیک است که بر تابع پیوند لاجیت تکیه دارد.

برای داده‌های شمارشی، مانند تعداد تصادفات رانندگی در یک تقاطع، مرز تغییر می‌کند: برآمد باید ۰ یا بیشتر باشد، اما هیچ حد بالایی ندارد. در اینجا، تحلیلگران از تابع پیوند لگاریتمی (log) استفاده می‌کنند. همان‌طور که در تحلیل سال ۲۰۲۱ توسط ساینتیفیکالی ساوند (Scientifically Sound) به تفصیل بیان شده است، پیوند لگاریتمی شمارش مورد انتظار اکیداً مثبت را می‌گیرد و لگاریتم طبیعی آن را محاسبه می‌کند. این کار، فضای شمارش محدود را روی کل محور اعداد حقیقی نگاشت می‌کند. پیش‌بین خطی در این فضای لگاریتمی عمل می‌کند و مدل برای بازگرداندن یک شمارش معتبر و غیرمنفی، نتیجه را به توان می‌رساند.[4]

حتی رگرسیون خطی استاندارد نیز از نظر فنی یک مدل خطی تعمیم‌یافته است که تحت عنوان تابع پیوند همانی (identity) عمل می‌کند. در این حالت خاص، فرض بر این است که برآمد مورد انتظار از قبل پیوسته و نامحدود است، به این معنی که هیچ تبدیلی لازم نیست. تابع پیوند به سادگی بیان می‌کند که مقدار مورد انتظار مستقیماً برابر با پیش‌بین خطی است. این ظرافت همان دلیلی است که مقاله سال ۱۹۷۲ نلدر و ودربرن را بنیادین نگه می‌دارد: این مقاله ثابت کرد که رگرسیون خطی، رگرسیون لجستیک و رگرسیون پواسون الگوریتم‌های جداگانه‌ای نبودند، بلکه تغییراتی از یک معماری ریاضیاتی واحد بودند.[1][7]

انتخاب تابع پیوند صرفاً یک تشریفات ریاضیاتی نیست؛ بلکه هندسه بنیادین پیش‌بینی‌های مدل را دیکته می‌کند. یک تابع پیوند متعارف (canonical) — یعنی پیوند پیش‌فرضی که از نظر ریاضیاتی با یک توزیع احتمال خاص جفت شده است، مانند پیوند لاجیت برای داده‌های دوجمله‌ای — تضمین می‌کند که ریاضیات زیربنایی مدل بسیار پایدار و از نظر محاسباتی کارآمد باقی بمانند. وقتی نرم‌افزارهایی مانند آموزش‌های دیتاکمپ (DataCamp) این چارچوب را آموزش می‌دهند، تأکید می‌کنند که تطبیق پیوند صحیح با توزیع داده‌ها، تصمیم اولیه‌ای است که یک تحلیلگر اتخاذ می‌کند.[6]

تابع پیوند لگاریتمی اجازه می‌دهد تا داده‌های شمارشی اکیداً مثبت با استفاده از معادلات خطی نامحدود مدل‌سازی شوند.

با این حال، این ظرافت ریاضیاتی به قیمت کاهش قابلیت تفسیر برای انسان تمام می‌شود. از آنجا که پیش‌بین خطی در یک فضای تبدیل‌یافته عمل می‌کند، ضرایب مدل دیگر نشان‌دهنده تغییرات مستقیم و افزایشی در برآمد دنیای واقعی نیستند. در یک رگرسیون لجستیک، ضریب ۱٫۵ به این معنا نیست که احتمال ۱٫۵ واحد افزایش می‌یابد؛ بلکه به این معناست که لگاریتم شانس ۱٫۵ واحد بیشتر می‌شود. برای درک تأثیر واقعی بر احتمال، تحلیلگر باید نتیجه را از طریق معکوس تابع پیوند به عقب برگرداند؛ فرآیندی که بسته به اینکه احتمال پایه از کجا شروع شده است، اثرات حاشیه‌ای متفاوتی به دست می‌دهد.[2][3]

چالش مداوم برای آمارشناسان کاربردی، ایجاد تعادل بین خلوص نظری توابع پیوند متعارف و نیاز عملی به توضیح مدل‌ها برای تصمیم‌گیرندگان است. در حالی که ریاضیات تابع پیوند به طور کامل مشکل مرزها را حل می‌کند، تحلیلگران را مجبور می‌سازد برای ترجمه منطق داخلی مدل به زبان ساده، بر محاسبات ثانویه‌ای مانند اثرات حاشیه‌ای یا نسبت‌های ریسک تکیه کنند. معادله حل شده است، اما ترجمه از لگاریتم شانس به شهود انسانی همچنان یک مرحله دستی باقی می‌ماند.[4][8]

نکات کلیدی

  • رگرسیون خطی استاندارد در داده‌های دنیای واقعی مانند احتمالات و شمارش‌ها شکست می‌خورد، زیرا معادلات آن تا بی‌نهایت امتداد دارند.
  • مدل‌های خطی تعمیم‌یافته (GLMs) این مشکل را با استفاده از یک تابع پیوند برای پر کردن شکاف میان واقعیت محدود و ریاضیات نامحدود حل می‌کنند.
  • پیوند لاجیت، احتمالات (بین ۰ تا ۱) را به لگاریتم شانس نگاشت می‌کند و رگرسیون لجستیک را امکان‌پذیر می‌سازد.
  • پیوند لگاریتمی، شمارش‌های اکیداً مثبت (۰ و بالاتر) را به محور اعداد حقیقی نگاشت می‌کند و رگرسیون پواسون را ممکن می‌سازد.
  • اگرچه توابع پیوند از نظر ریاضیاتی ظریف و زیبا هستند، اما تفسیر مستقیم ضرایب مدل حاصل را برای انسان‌ها دشوارتر می‌کنند.

چرا مهم است

بدون توابع پیوند، مدل‌های پیش‌بینی‌کننده مرتباً مقادیر غیرممکنی مانند تعداد منفی بیماران یا احتمالات بالای ۱۰۰ درصد را خروجی می‌دادند. این پل ریاضیاتی به تحلیلگران اجازه می‌دهد تا از جبر خطی ساده برای حل مسائل پیچیده و غیرخطی دنیای واقعی استفاده کنند.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان نظریه‌پرداز 40%دانشمندان داده کاربردی 40%توسعه‌دهندگان نرم‌افزار 20%
  1. [1]P. McCullaghآمارشناسان نظریه‌پرداز

    Nelder and Wedderburn (1972) Generalized Linear Models

    مطالعه در P. McCullagh
  2. [2]DTUتوسعه‌دهندگان نرم‌افزار

    The Generalized Linear Model. The link function.

    مطالعه در DTU
  3. [3]Bookdownدانشمندان داده کاربردی

    Chapter 12 Generalized Linear Models

    مطالعه در Bookdown
  4. [4]Scientifically Soundدانشمندان داده کاربردی

    Generalised linear models, part 1: Link functions

    مطالعه در Scientifically Sound
  5. [5]Minitabتوسعه‌دهندگان نرم‌افزار

    What is a link function?

    مطالعه در Minitab
  6. [6]DataCampدانشمندان داده کاربردی

    Generalized Linear Models (GLM): What You Should Know

    مطالعه در DataCamp
  7. [7]Jeff Gillآمارشناسان نظریه‌پرداز

    Introduction to Generalized Linear Models

    مطالعه در Jeff Gill
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.