رفتن به محتوای اصلی
Koohestun
توضیح کوهستانانتخاب مدلآموزش آماری· 5 دقیقه مطالعه· در تحلیل داده

مکانیسم انتخاب مدل: چرا BIC حقیقت را می‌یابد، اما AIC پیش‌بینی را بهینه می‌کند

شواهد آماری نشان می‌دهد که معیارهای اطلاعاتی آکائیکه (AIC) و بیزی (BIC) قابل جایگزینی با یکدیگر نیستند. معیار AIC خطای پیش‌بینی آینده را به حداقل می‌رساند، در حالی که با افزایش حجم نمونه، BIC به طور پیوسته مدل واقعی زیربنایی را شناسایی می‌کند.

به قلم ساناز امامی

آمارشناسان نظری 40%مدل‌سازان پیش‌بینی 40%متخصصان عمل‌گرا 20%
آمارشناسان نظری
سازگاری مجانبی و شناسایی فرآیند واقعی تولید داده را بر هر چیز دیگری ترجیح می‌دهند.
مدل‌سازان پیش‌بینی
تمرکزشان صرفاً بر به حداقل رساندن خطای خارج از نمونه و میانگین مربعات خطا برای پیش‌بینی است.
متخصصان عمل‌گرا
استدلال می‌کنند که مدل «واقعی» هرگز در مجموعه گزینه‌ها وجود ندارد، که این امر کارایی را در عمل مفیدتر از سازگاری می‌سازد.

دانشمندان داده اغلب معیارهای اطلاعاتی آکائیکه (AIC) و بیزی (BIC) را به عنوان جریمه‌هایی قابل جایگزین برای پیچیدگی مدل در نظر می‌گیرند و هر معیاری که نمره کمتری در مجموعه اعتبارسنجی بدهد را انتخاب می‌کنند. اما شواهد آماری مستقیماً این رویه را رد می‌کند. استخراج‌های ریاضی نشان می‌دهند که AIC و BIC برای اهدافی کاملاً متضاد بهینه‌سازی شده‌اند: AIC خطای پیش‌بینی برای داده‌های آینده را به حداقل می‌رساند، در حالی که BIC به طور سازگار فرآیند واقعی تولید داده را (به شرطی که در میان گزینه‌ها وجود داشته باشد) شناسایی می‌کند.[1][2]

برای درک سازوکار این دو، ابتدا باید بدانیم هر دو معیار به یک مشکل اساسی در یادگیری ماشین و آمار می‌پردازند: بیش‌برازش (Overfitting). هرچه محققان پارامترهای بیشتری به یک مدل اضافه کنند، برازش روی داده‌های آموزشی همیشه بهتر می‌شود. برای جلوگیری از حفظ کردن نویزها توسط مدل، هم AIC و هم BIC یک جریمه ریاضی برای پیچیدگی اعمال می‌کنند و تعادلی بین نیکویی برازش و تعداد پارامترهای استفاده شده برقرار می‌سازند.[4]

تفاوت این دو دقیقاً در نحوه محاسبه این جریمه نهفته است. هر دو فرمول با یک معیار دقیقاً یکسان برای برازش آغاز می‌شوند: منفی دو برابر لگاریتم درست‌نمایی (log-likelihood) مدل. به این خط پایه، AIC جریمه‌ای معادل ۲k اضافه می‌کند که در آن k نشان‌دهنده تعداد پارامترهای تخمین‌زده‌شده است. این جریمه فارغ از اینکه چه مقدار داده جمع‌آوری شده است، ثابت می‌ماند.[1]

اما BIC که در سال ۱۹۷۸ توسط گیدئون شوارتز (Gideon Schwarz) استخراج شد، یک ضریب پویا را جایگزین این ضریب ثابت می‌کند. به جای افزودن ۲k، معیار BIC جریمه‌ای معادل k ضربدر لگاریتم طبیعی n را اضافه می‌کند، که در آن n کل تعداد مشاهدات در مجموعه داده است. این جایگزینی، رفتار مجانبی این معیار را با بزرگتر شدن مجموعه داده‌ها به طور بنیادین تغییر می‌دهد.[5]

دقیقاً در هشت مشاهده، منحنی جریمه BIC از AIC پیشی می‌گیرد و مدل‌های پیچیده را با شدت بیشتری مجازات می‌کند.

این شکاف ریاضی در یک حجم نمونه بسیار مشخص رخ می‌دهد. از آنجا که لگاریتم طبیعی ۸ تقریباً برابر با ۲٫۰۷۹ است، هر مجموعه داده‌ای که شامل هشت مشاهده یا بیشتر باشد، باعث می‌شود BIC مدل‌های پیچیده را بسیار سخت‌گیرانه‌تر از AIC جریمه کند. در مجموعه داده‌های مدرن که شامل میلیون‌ها سطر هستند، این ضریب لگاریتمی به شدت بزرگ می‌شود و BIC را مجبور می‌کند تا پارامترهای حاشیه‌ای را با خشونت حذف کند.[6][7]

این تفاوت ساختاری مستقیماً به دو ویژگی آماری متمایز ترجمه می‌شود: سازگاری (consistency) و کارایی (efficiency). یک معیار انتخاب مدل زمانی «سازگار» در نظر گرفته می‌شود که با نزدیک شدن حجم نمونه به بی‌نهایت، احتمال انتخاب مدل واقعی به ۱۰۰٪ میل کند. BIC این ویژگی را دارد؛ اما AIC فاقد آن است.[2][5]

این تفاوت ساختاری مستقیماً به دو ویژگی آماری متمایز ترجمه می‌شود: سازگاری (consistency) و کارایی (efficiency).

از آنجا که جریمه AIC بدون توجه به میزان داده‌های جمع‌آوری‌شده روی ۲k ثابت می‌ماند، حتی با وجود داده‌های بی‌نهایت، احتمال غیرصفری برای بیش‌برازش در آن باقی می‌ماند. در یک مطالعه شبیه‌سازی در سال ۲۰۱۲ بر روی ۱۰۰۰ مجموعه داده که هر کدام ۵۰۰ مشاهده داشتند، BIC در ۹۸٪ از آزمایش‌ها مدل واقعی ۳-پارامتری را به درستی شناسایی کرد، در حالی که AIC در ۱۶٪ از تکرارها یک مدل بیش‌برازش‌شده ۴ یا ۵-پارامتری را انتخاب کرد.[1][4]

با این حال، ناتوانی AIC در شناسایی مدل واقعی یک ویژگی عمدی است، نه یک نقص ریاضی. AIC به طور مجانبی «کارا» است، به این معنی که میانگین مربعات خطا را برای پیش‌بینی داده‌های جدید و دیده نشده به حداقل می‌رساند. وقتی فرآیند واقعی تولید داده بی‌نهایت پیچیده باشد — همان‌طور که اغلب در زیست‌شناسی، اقتصاد و روان‌شناسی چنین است — هیچ مدل «واقعی» متناهی برای کشف کردن وجود ندارد.[3]

هر دو معیار پایه درست‌نمایی لگاریتمی یکسانی دارند، اما در جریمه‌های پیچیدگی خود کاملاً از هم فاصله می‌گیرند.

در این سناریوها، AIC می‌درخشد. همان‌طور که یوهونگ یانگ (Yuhong Yang) در تحلیل سال ۲۰۰۵ خود در نشریه Biometrika نشان داد، «AIC برای تخمین تابع رگرسیون دارای نرخ بهینه مینی‌ماکس است، در حالی که BIC برای انتخاب مدل واقعی سازگار است.» اثبات‌های ریاضی یانگ نشان داد که هیچ معیار واحدی نمی‌تواند به طور همزمان هم به پیش‌بینی بهینه و هم به شناسایی سازگار مدل دست یابد.[2]

این شواهد یک قانون عملیاتی روشن را برای تحلیلگران دیکته می‌کند. اگر هدف استنتاج است — یعنی درک متغیرهای دقیقی که یک سیستم را هدایت می‌کنند، مانند شناسایی اینکه کدام نشانگرهای ژنتیکی خاص باعث یک بیماری می‌شوند — BIC از نظر ریاضی انتخاب درستی است، زیرا با افزایش مقیاس داده‌ها، همبستگی‌های جعلی را فیلتر می‌کند.[1][6]

برعکس، اگر هدف صرفاً پیش‌بینی است — مانند پیش‌بینی آب‌وهوای فردا یا پیش‌بینی ریزش مشتری — AIC برتری دارد. این معیار اثرات کوچک و حاشیه‌ای را که دقت پیش‌بینی را بهبود می‌بخشند حفظ می‌کند، و می‌پذیرد که برخی از این اثرات ممکن است به جای مکانیسم‌های علی، صرفاً مصنوعات آماری باشند.[3][4]

در یادگیری ماشین مدرن، اعمال معیار انتخاب اشتباه می‌تواند به مدل‌هایی با اطمینان بالا اما اساساً ناقص منجر شود.

دانشکده آمار دانشگاه مینه‌سوتا (University of Minnesota) خاطرنشان می‌کند که مقایسه مستقیم مقادیر AIC و BIC از نظر ریاضی نامعتبر است، زیرا آنها در مقیاس‌های متفاوتی عمل می‌کنند و به سؤالات متفاوتی پاسخ می‌دهند. یادداشت‌های سخنرانی سال ۲۰۲۵ این دانشگاه بیان می‌کند: «BIC در تلاش است تا مدل واقعی را پیدا کند»، در حالی که AIC به دنبال بهترین مدل تقریبی برای داده‌های آینده است.[6]

انتخاب بین AIC و BIC این نیست که کدام معیار دقیق‌تر است، بلکه به این برمی‌گردد که محقق چه فرض فلسفی‌ای درباره جهان دارد. اگر یک مدل ساده و واقعی وجود داشته باشد، BIC آن را پیدا خواهد کرد. اما اگر واقعیت زیربنایی بی‌نهایت پیچیده باشد، AIC کارآمدترین تقریب را ارائه می‌دهد و می‌پذیرد که حقیقت مطلق همچنان دور از دسترس است.[7]

چرا مهم است

انتخاب معیار اشتباه برای گزینش مدل می‌تواند نتایج یک مطالعه را کاملاً تغییر دهد. استفاده از AIC هنگام جستجوی متغیرهای علی منجر به مثبت کاذب می‌شود، در حالی که استفاده از BIC برای پیش‌بینی، دقت پیش‌بینی را کاهش می‌دهد.

بررسی عمیق دیدگاه‌ها

استدلال سازگاری

استدلال ریاضی برای اولویت دادن به شناسایی مدل واقعی زیربنایی.

آمارشناسانی که طرفدار BIC هستند استدلال می‌کنند که هدف اصلی علم، استنتاج است — یعنی درک دقیق مکانیسم‌های علی که یک پدیده را هدایت می‌کنند. از آنجا که BIC از نظر مجانبی سازگار است، تضمین می‌کند که هرچه محقق داده‌های بیشتری جمع‌آوری کند، احتمال انتخاب مدل کاملاً واقعی به ۱۰۰٪ نزدیک می‌شود. این دیدگاه، تمایل AIC به حفظ پارامترهای حاشیه‌ای و غیرعلی را یک نقص اساسی می‌داند که ادبیات علمی را با مثبت‌های کاذب آلوده می‌کند.

استدلال کارایی

استدلال ریاضی برای اولویت دادن به دقت پیش‌بینی بر حقیقت علی.

طرفداران AIC استدلال می‌کنند که در سیستم‌های پیچیده بیولوژیکی، اقتصادی یا اجتماعی، فرآیند «واقعی» تولید داده بی‌نهایت پیچیده است و بنابراین هرگز در مجموعه محدود مدل‌هایی که یک محقق در حال آزمایش آنهاست، وجود ندارد. اگر مدل واقعی به دلیل اینکه جزو گزینه‌ها نیست نتواند انتخاب شود، سازگاری به یک موضوع ریاضی بی‌اهمیت تبدیل می‌شود. در عوض، آنها استدلال می‌کنند که محققان باید بر کارایی تمرکز کنند: به حداقل رساندن میانگین مربعات خطا زمانی که مدل روی داده‌های جدید و دیده نشده اعمال می‌شود، وظیفه‌ای که از نظر ریاضی ثابت شده است AIC در آن بهینه عمل می‌کند.

آنچه نمی‌دانیم

  • اینکه آیا فرآیند «واقعی» تولید داده در سیستم‌های پیچیده بیولوژیکی یا اجتماعی هرگز می‌تواند به طور کامل توسط مجموعه محدودی از پارامترها ثبت شود یا خیر.
  • نحوه عملکرد این معیارها زمانی که تعداد پارامترها (k) متناسب با حجم نمونه (n) در یادگیری ماشین با ابعاد بالا رشد می‌کند.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان نظری 40%مدل‌سازان پیش‌بینی 40%متخصصان عمل‌گرا 20%
  1. [1]Psychological Methodsمتخصصان عمل‌گرا

    Model selection and psychological theory: A discussion of the differences between the Akaike Information Criterion (AIC) and the Bayesian Information Criterion (BIC)

    مطالعه در Psychological Methods
  2. [2]Biometrikaآمارشناسان نظری

    Can the strengths of AIC and BIC be shared? A conflict between model indentification and regression estimation

    مطالعه در Biometrika
  3. [3]Systematic Biologyمدل‌سازان پیش‌بینی

    Performance of Akaike Information Criterion and Bayesian Information Criterion in Selecting Partition Models and Mixture Models

    مطالعه در Systematic Biology
  4. [4]Cross Validatedمتخصصان عمل‌گرا

    Is there any reason to prefer the AIC or BIC over the other?

    مطالعه در Cross Validated
  5. [5]Stats StackExchange

    Why is BIC considered consistent (though AIC is mostly used) for large number of observation?

    مطالعه در Stats StackExchange
  6. [6]School of Statisticsآمارشناسان نظری

    Stat 5421 Lecture Notes: Model Selection and Model Averaging

    مطالعه در School of Statistics
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.