رفتن به محتوای اصلی
کوهستان
توضیح کوهستانمدل‌سازی آماریبسته شواهد· 5 دقیقه مطالعه· در تحلیل داده

چگونه تابع پیوند، پیش‌بین خطی را به برآمد مورد انتظار در مدل‌های خطی تعمیم‌یافته متصل می‌کند

توابع پیوند با ترجمه ریاضیاتی برآمدهای محدود دنیای واقعی به معادلات خطی نامحدود، این امکان را فراهم می‌کنند که احتمالات، شمارش‌ها و داده‌های پیوسته در یک چارچوب واحد مدل‌سازی شوند.

به قلم ندا وزیری

به‌طور خلاصه

  • رگرسیون خطی استاندارد در داده‌های دنیای واقعی مانند احتمالات و شمارش‌ها شکست می‌خورد، زیرا معادلات آن تا بی‌نهایت امتداد دارند.
  • مدل‌های خطی تعمیم‌یافته (GLMs) این مشکل را با استفاده از یک تابع پیوند برای پر کردن شکاف میان واقعیت محدود و ریاضیات نامحدود حل می‌کنند.
  • پیوند لاجیت، احتمالات (بین ۰ تا ۱) را به لگاریتم شانس نگاشت می‌کند و رگرسیون لجستیک را امکان‌پذیر می‌سازد.

یک مدل پیش‌بینی‌کننده که احتمال نکول را ۱۱۵٪ محاسبه کند، یا ورود منفی سه بیمار به اورژانس را پیش‌بینی کند، در یک آزمون اولیه از واقعیت فیزیکی مردود شده است. ریشه این شکست در یک ناهماهنگی ساختاری نهفته است: جبر خطی استاندارد در هر دو جهت تا بی‌نهایت امتداد می‌یابد، در حالی که برآمدهای دنیای واقعی اکیداً محدود هستند.

یک احتمال باید دقیقاً بین ۰ و ۱ قرار گیرد. یک شمارش فیزیکی نمی‌تواند به زیر ۰ سقوط کند. وقتی تحلیلگران سعی می‌کنند این واقعیت‌های محدود را مستقیماً به یک رگرسیون خطی استاندارد تحمیل کنند، خط مستقیم ناگزیر از این مرزها عبور کرده و مزخرفات ریاضیاتی تولید می‌کند.[3][4]

راه‌حل این ناهماهنگی در سال ۱۹۷۲ توسط آمارشناسانی به نام‌های جان نلدر و رابرت ودربرن فرمول‌بندی شد؛ کسانی که مدل خطی تعمیم‌یافته (GLM) را معرفی کردند. چارچوب آن‌ها تشخیص داد که اگرچه دنیای واقعی غیرخطی و محدود است، اما ریاضیات ترکیبات خطی — یعنی جمع کردن متغیرهای وزن‌دار با یکدیگر — بسیار قدرتمندتر و کارآمدتر از آن است که بتوان آن را کنار گذاشت.

برای پر کردن این شکاف، آن‌ها مدل را به سه جزء مجزا تفکیک کردند: یک جزء تصادفی که توزیع داده‌ها را توصیف می‌کند، یک جزء سیستماتیک (پیش‌بین خطی)، و یک مترجم ریاضیاتی که این دو را به هم متصل می‌کند.[1][7]

هر مدل خطی تعمیم‌یافته بر روی سه ستون بنیادین بنا شده است.

آن مترجم، همان تابع پیوند است. همان‌طور که ارائه‌دهنده نرم‌افزار آماری مینی‌تب (Minitab) آن را تعریف می‌کند: «تابع پیوند، رابطه بین پیش‌بین خطی و میانگین تابع توزیع را فراهم می‌کند.» این تابع مانند یک قیف ریاضیاتی عمل می‌کند. در یک سو، برآمد مورد انتظار و محدود دنیای واقعی (میانگین یا مو) را دریافت می‌کند. در سوی دیگر، آن مقدار محدود را به یک مقیاس نامحدود تبدیل می‌کند که از منفی بی‌نهایت تا مثبت بی‌نهایت کشیده شده است و با دامنه طبیعی یک معادله خطی تطابق دارد.[5]

خود پیش‌بین خطی، صرفاً حاصل‌جمع ضرایب مدل ضرب در متغیرهای مربوطه آن‌هاست. از آنجا که این متغیرها و وزن‌ها از نظر تئوری می‌توانند هر مقداری به خود بگیرند، حاصل‌جمع نهایی کاملاً بدون محدودیت است. متن بوک‌داون (Bookdown) در سال ۲۰۲۳ درباره مدل‌های خطی تعمیم‌یافته خاطرنشان می‌کند که «تابع پیوند پیش‌بین خطی را به مقدار مورد انتظار متغیر پاسخ متصل می‌کند.» با اعمال تابع پیوند بر برآمد مورد انتظار، مدل تضمین می‌کند که پیش‌بین خطی همیشه به یک فضای معتبر و از نظر ریاضیاتی درست نگاشت می‌شود.[3]

مشهورترین کاربرد این سازوکار، رگرسیون لجستیک است که بر تابع پیوند لاجیت تکیه دارد. هنگام پیش‌بینی یک برآمد دودویی — مانند اینکه آیا یک ایمیل اسپم است یا خیر — مقدار مورد انتظار، احتمالی بین ۰ و ۱ است. پیوند لاجیت این احتمال را به لگاریتم شانس (log-odds) تبدیل می‌کند.

احتمال ۵۰٪ به لگاریتم شانس ۰ تبدیل می‌شود. احتمال ۹۹٪ به مثبت بی‌نهایت و احتمال ۱٪ به منفی بی‌نهایت میل می‌کند. پیش‌بین خطی، لگاریتم شانس را محاسبه می‌کند و معکوس تابع پیوند، آن عدد نامحدود را با خیال راحت به یک درصد معتبر برمی‌گرداند.[2][6]

تابع پیوند لاجیت، احتمالات محدود شده بین ۰ و ۱ را روی یک مقیاس بی‌نهایت نگاشت می‌کند.

برای داده‌های شمارشی، مانند تعداد تصادفات رانندگی در یک تقاطع، مرز تغییر می‌کند: برآمد باید ۰ یا بیشتر باشد، اما هیچ حد بالایی ندارد. در اینجا، تحلیلگران از تابع پیوند لگاریتمی (log) استفاده می‌کنند. همان‌طور که در تحلیل سال ۲۰۲۱ توسط ساینتیفیکالی ساوند (Scientifically Sound) به تفصیل بیان شده است، پیوند لگاریتمی شمارش مورد انتظار اکیداً مثبت را می‌گیرد و لگاریتم طبیعی آن را محاسبه می‌کند.

این کار، فضای شمارش محدود را روی کل محور اعداد حقیقی نگاشت می‌کند. پیش‌بین خطی در این فضای لگاریتمی عمل می‌کند و مدل برای بازگرداندن یک شمارش معتبر و غیرمنفی، نتیجه را به توان می‌رساند.[4]

حتی رگرسیون خطی استاندارد نیز از نظر فنی یک مدل خطی تعمیم‌یافته است که تحت عنوان تابع پیوند همانی (identity) عمل می‌کند. در این حالت خاص، فرض بر این است که برآمد مورد انتظار از قبل پیوسته و نامحدود است، به این معنی که هیچ تبدیلی لازم نیست.

تابع پیوند به سادگی بیان می‌کند که مقدار مورد انتظار مستقیماً برابر با پیش‌بین خطی است. این ظرافت همان دلیلی است که مقاله سال ۱۹۷۲ نلدر و ودربرن را بنیادین نگه می‌دارد: این مقاله ثابت کرد که رگرسیون خطی، رگرسیون لجستیک و رگرسیون پواسون الگوریتم‌های جداگانه‌ای نبودند، بلکه تغییراتی از یک معماری ریاضیاتی واحد بودند.[1][7]

انتخاب تابع پیوند صرفاً یک تشریفات ریاضیاتی نیست؛ بلکه هندسه بنیادین پیش‌بینی‌های مدل را دیکته می‌کند. یک تابع پیوند متعارف (canonical) — یعنی پیوند پیش‌فرضی که از نظر ریاضیاتی با یک توزیع احتمال خاص جفت شده است، مانند پیوند لاجیت برای داده‌های دوجمله‌ای — تضمین می‌کند که ریاضیات زیربنایی مدل بسیار پایدار و از نظر محاسباتی کارآمد باقی بمانند. وقتی نرم‌افزارهایی مانند آموزش‌های دیتاکمپ (DataCamp) این چارچوب را آموزش می‌دهند، تأکید می‌کنند که تطبیق پیوند صحیح با توزیع داده‌ها، تصمیم اولیه‌ای است که یک تحلیلگر اتخاذ می‌کند.[6]

تابع پیوند لگاریتمی اجازه می‌دهد تا داده‌های شمارشی اکیداً مثبت با استفاده از معادلات خطی نامحدود مدل‌سازی شوند.

با این حال، این ظرافت ریاضیاتی به قیمت کاهش قابلیت تفسیر برای انسان تمام می‌شود. از آنجا که پیش‌بین خطی در یک فضای تبدیل‌یافته عمل می‌کند، ضرایب مدل دیگر نشان‌دهنده تغییرات مستقیم و افزایشی در برآمد دنیای واقعی نیستند.

در یک رگرسیون لجستیک، ضریب ۱٫۵ به این معنا نیست که احتمال ۱٫۵ واحد افزایش می‌یابد؛ بلکه به این معناست که لگاریتم شانس ۱٫۵ واحد بیشتر می‌شود. برای درک تأثیر واقعی بر احتمال، تحلیلگر باید نتیجه را از طریق معکوس تابع پیوند به عقب برگرداند؛ فرآیندی که بسته به اینکه احتمال پایه از کجا شروع شده است، اثرات حاشیه‌ای متفاوتی به دست می‌دهد.[2][3]

چالش مداوم برای آمارشناسان کاربردی، ایجاد تعادل بین خلوص نظری توابع پیوند متعارف و نیاز عملی به توضیح مدل‌ها برای تصمیم‌گیرندگان است. در حالی که ریاضیات تابع پیوند به طور کامل مشکل مرزها را حل می‌کند، تحلیلگران را مجبور می‌سازد برای ترجمه منطق داخلی مدل به زبان ساده، بر محاسبات ثانویه‌ای مانند اثرات حاشیه‌ای یا نسبت‌های ریسک تکیه کنند. معادله حل شده است، اما ترجمه از لگاریتم شانس به شهود انسانی همچنان یک مرحله دستی باقی می‌ماند.[4][8]

اصطلاحات کلیدی

پیش‌بین خطی
جزء سیستماتیک یک مدل که با ضرب متغیرها در وزن‌هایشان و جمع کردن آن‌ها با یکدیگر محاسبه می‌شود و از نظر تئوری می‌تواند به هر عددی منجر شود.
تابع پیوند
فرمول ریاضیاتی که برآمد مورد انتظار و محدود یک مدل را به مقیاس نامحدود پیش‌بین خطی ترجمه می‌کند.
پیوند متعارف
تابع پیوند پیش‌فرض و از نظر ریاضیاتی بهینه که با یک توزیع احتمال خاص جفت می‌شود، مانند پیوند لاجیت برای داده‌های دودویی.
معکوس پیوند
عملیات ریاضیاتی معکوس که پیش‌بینی خطی نامحدود مدل را به یک مقدار محدود در دنیای واقعی مانند احتمال یا شمارش برمی‌گرداند.

بررسی عمیق دیدگاه‌ها

آمارشناسان نظریه‌پرداز

تمرکز بر ظرافت نظری و پایداری ریاضیاتی توابع پیوند متعارف.

برای آمارشناسان نظری، تابع پیوند یک پیروزی در انتزاع ریاضیاتی است. مقاله سال ۱۹۷۲ نلدر و ودربرن با اثبات اینکه رگرسیون‌های خطی، لجستیک و پواسون صرفاً موارد خاصی از یک چارچوب فراگیر واحد هستند، دهه‌ها روش‌های آماری پراکنده را یکپارچه کرد. نظریه‌پردازان بر استفاده از توابع پیوند متعارف — آن‌هایی که به طور طبیعی با خانواده توزیع‌های نمایی جفت می‌شوند — تأکید می‌کنند، زیرا آن‌ها تضمین می‌کنند که برآوردهای حداکثر درست‌نمایی مدل به طور کارآمد و قابل اعتمادی همگرا شوند، صرف‌نظر از اینکه از چه نرم‌افزاری استفاده می‌شود.

دانشمندان داده کاربردی

تمرکز بر مبادله بین صحت ریاضیاتی و توانایی توضیح مدل برای ذینفعان.

در محیط‌های کاربردی، ظرافت ریاضیاتی تابع پیوند یک گلوگاه ارتباطی شدید ایجاد می‌کند. وقتی یک دانشمند داده یک رگرسیون لجستیک برای پیش‌بینی ریزش مشتری می‌سازد، ذینفعان تجاری می‌خواهند بدانند که یک ویژگی خاص چقدر احتمال ریزش را افزایش می‌دهد. از آنجا که تابع پیوند در فضای لگاریتم شانس عمل می‌کند، ضرایب خام نمی‌توانند مستقیماً به این سؤال پاسخ دهند. متخصصان کاربردی باید بر تبدیلات ثانویه، محاسبه اثرات حاشیه‌ای یا نسبت‌های ریسک تکیه کنند تا خروجی از نظر ریاضیاتی درست مدل را به واقعیت محدود معیارهای تجاری ترجمه کنند.

توسعه‌دهندگان نرم‌افزار

نگاه به تابع پیوند به عنوان یک لایه محاسباتی ماژولار که باید در پلتفرم‌های مختلف استانداردسازی شود.

برای توسعه‌دهندگانی که بسته‌های آماری مانند مینی‌تب یا کتابخانه‌های آموزش داده شده در دیتاکمپ را می‌سازند، چارچوب مدل‌های خطی تعمیم‌یافته یک دارایی مهندسی نرم‌افزار است. از آنجا که تابع پیوند، تبدیل غیرخطی را از پیش‌بین خطی جدا می‌کند، توسعه‌دهندگان نیازی به نوشتن الگوریتم‌های بهینه‌سازی کاملاً مجزا برای انواع مختلف رگرسیون ندارند. آن‌ها می‌توانند یک حل‌کننده خطی واحد و بسیار بهینه‌سازی‌شده بسازند و بسته به اینکه کاربر توزیع دوجمله‌ای، پواسون یا گاوسی را مشخص کرده باشد، به سادگی ماژول تابع پیوند را تعویض کنند.

آمارشناسان نظریه‌پرداز 40%دانشمندان داده کاربردی 40%توسعه‌دهندگان نرم‌افزار 20%
آمارشناسان نظریه‌پرداز
اولویت را به ظرافت نظری توابع پیوند متعارف می‌دهند که کاملاً با توزیع داده‌های زیربنایی مطابقت دارند.
دانشمندان داده کاربردی
بر کاربرد عملی مدل‌های خطی تعمیم‌یافته تمرکز می‌کنند و بر نیاز به ترجمه ضرایب تبدیل‌یافته به اثرات حاشیه‌ای قابل تفسیر تأکید دارند.
توسعه‌دهندگان نرم‌افزار
توابع پیوند را به عنوان یک لایه محاسباتی ضروری می‌بینند که باید در بسته‌های آماری استانداردسازی و بهینه‌سازی شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آمارشناسان بیزی
  • پژوهشگران استنتاج علی

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان نظریه‌پرداز 40%دانشمندان داده کاربردی 40%توسعه‌دهندگان نرم‌افزار 20%
  1. [1]P. McCullaghآمارشناسان نظریه‌پرداز

    Nelder and Wedderburn (1972) Generalized Linear Models

    مطالعه در P. McCullagh →
  2. [2]DTUتوسعه‌دهندگان نرم‌افزار

    The Generalized Linear Model. The link function.

    مطالعه در DTU →
  3. [3]Bookdownدانشمندان داده کاربردی

    Chapter 12 Generalized Linear Models

    مطالعه در Bookdown →
  4. [4]Scientifically Soundدانشمندان داده کاربردی

    Generalised linear models, part 1: Link functions

    مطالعه در Scientifically Sound →
  5. [5]Minitabتوسعه‌دهندگان نرم‌افزار

    What is a link function?

    مطالعه در Minitab →
  6. [6]DataCampدانشمندان داده کاربردی

    Generalized Linear Models (GLM): What You Should Know

    مطالعه در DataCamp →
  7. [7]Jeff Gillآمارشناسان نظریه‌پرداز

    Introduction to Generalized Linear Models

    مطالعه در Jeff Gill →
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.