مکانیسم انتخاب مدل: چرا BIC حقیقت را مییابد، اما AIC پیشبینی را بهینه میکند
شواهد آماری نشان میدهد که معیارهای اطلاعاتی آکائیکه (AIC) و بیزی (BIC) قابل جایگزینی با یکدیگر نیستند. معیار AIC خطای پیشبینی آینده را به حداقل میرساند، در حالی که با افزایش حجم نمونه، BIC به طور پیوسته مدل واقعی زیربنایی را شناسایی میکند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- آمارشناسان نظری
- سازگاری مجانبی و شناسایی فرآیند واقعی تولید داده را بر هر چیز دیگری ترجیح میدهند.
- مدلسازان پیشبینی
- تمرکزشان صرفاً بر به حداقل رساندن خطای خارج از نمونه و میانگین مربعات خطا برای پیشبینی است.
- متخصصان عملگرا
- استدلال میکنند که مدل «واقعی» هرگز در مجموعه گزینهها وجود ندارد، که این امر کارایی را در عمل مفیدتر از سازگاری میسازد.
دانشمندان داده اغلب معیارهای اطلاعاتی آکائیکه (AIC) و بیزی (BIC) را به عنوان جریمههایی قابل جایگزین برای پیچیدگی مدل در نظر میگیرند و هر معیاری که نمره کمتری در مجموعه اعتبارسنجی بدهد را انتخاب میکنند. اما شواهد آماری مستقیماً این رویه را رد میکند. استخراجهای ریاضی نشان میدهند که AIC و BIC برای اهدافی کاملاً متضاد بهینهسازی شدهاند: AIC خطای پیشبینی برای دادههای آینده را به حداقل میرساند، در حالی که BIC به طور سازگار فرآیند واقعی تولید داده را (به شرطی که در میان گزینهها وجود داشته باشد) شناسایی میکند.[1][2]
برای درک سازوکار این دو، ابتدا باید بدانیم هر دو معیار به یک مشکل اساسی در یادگیری ماشین و آمار میپردازند: بیشبرازش (Overfitting). هرچه محققان پارامترهای بیشتری به یک مدل اضافه کنند، برازش روی دادههای آموزشی همیشه بهتر میشود. برای جلوگیری از حفظ کردن نویزها توسط مدل، هم AIC و هم BIC یک جریمه ریاضی برای پیچیدگی اعمال میکنند و تعادلی بین نیکویی برازش و تعداد پارامترهای استفاده شده برقرار میسازند.[4]
تفاوت این دو دقیقاً در نحوه محاسبه این جریمه نهفته است. هر دو فرمول با یک معیار دقیقاً یکسان برای برازش آغاز میشوند: منفی دو برابر لگاریتم درستنمایی (log-likelihood) مدل. به این خط پایه، AIC جریمهای معادل ۲k اضافه میکند که در آن k نشاندهنده تعداد پارامترهای تخمینزدهشده است. این جریمه فارغ از اینکه چه مقدار داده جمعآوری شده است، ثابت میماند.[1]
اما BIC که در سال ۱۹۷۸ توسط گیدئون شوارتز (Gideon Schwarz) استخراج شد، یک ضریب پویا را جایگزین این ضریب ثابت میکند. به جای افزودن ۲k، معیار BIC جریمهای معادل k ضربدر لگاریتم طبیعی n را اضافه میکند، که در آن n کل تعداد مشاهدات در مجموعه داده است. این جایگزینی، رفتار مجانبی این معیار را با بزرگتر شدن مجموعه دادهها به طور بنیادین تغییر میدهد.[5]
این شکاف ریاضی در یک حجم نمونه بسیار مشخص رخ میدهد. از آنجا که لگاریتم طبیعی ۸ تقریباً برابر با ۲٫۰۷۹ است، هر مجموعه دادهای که شامل هشت مشاهده یا بیشتر باشد، باعث میشود BIC مدلهای پیچیده را بسیار سختگیرانهتر از AIC جریمه کند. در مجموعه دادههای مدرن که شامل میلیونها سطر هستند، این ضریب لگاریتمی به شدت بزرگ میشود و BIC را مجبور میکند تا پارامترهای حاشیهای را با خشونت حذف کند.[6][7]
این تفاوت ساختاری مستقیماً به دو ویژگی آماری متمایز ترجمه میشود: سازگاری (consistency) و کارایی (efficiency). یک معیار انتخاب مدل زمانی «سازگار» در نظر گرفته میشود که با نزدیک شدن حجم نمونه به بینهایت، احتمال انتخاب مدل واقعی به ۱۰۰٪ میل کند. BIC این ویژگی را دارد؛ اما AIC فاقد آن است.[2][5]
این تفاوت ساختاری مستقیماً به دو ویژگی آماری متمایز ترجمه میشود: سازگاری (consistency) و کارایی (efficiency).
از آنجا که جریمه AIC بدون توجه به میزان دادههای جمعآوریشده روی ۲k ثابت میماند، حتی با وجود دادههای بینهایت، احتمال غیرصفری برای بیشبرازش در آن باقی میماند. در یک مطالعه شبیهسازی در سال ۲۰۱۲ بر روی ۱۰۰۰ مجموعه داده که هر کدام ۵۰۰ مشاهده داشتند، BIC در ۹۸٪ از آزمایشها مدل واقعی ۳-پارامتری را به درستی شناسایی کرد، در حالی که AIC در ۱۶٪ از تکرارها یک مدل بیشبرازششده ۴ یا ۵-پارامتری را انتخاب کرد.[1][4]
با این حال، ناتوانی AIC در شناسایی مدل واقعی یک ویژگی عمدی است، نه یک نقص ریاضی. AIC به طور مجانبی «کارا» است، به این معنی که میانگین مربعات خطا را برای پیشبینی دادههای جدید و دیده نشده به حداقل میرساند. وقتی فرآیند واقعی تولید داده بینهایت پیچیده باشد — همانطور که اغلب در زیستشناسی، اقتصاد و روانشناسی چنین است — هیچ مدل «واقعی» متناهی برای کشف کردن وجود ندارد.[3]
در این سناریوها، AIC میدرخشد. همانطور که یوهونگ یانگ (Yuhong Yang) در تحلیل سال ۲۰۰۵ خود در نشریه Biometrika نشان داد، «AIC برای تخمین تابع رگرسیون دارای نرخ بهینه مینیماکس است، در حالی که BIC برای انتخاب مدل واقعی سازگار است.» اثباتهای ریاضی یانگ نشان داد که هیچ معیار واحدی نمیتواند به طور همزمان هم به پیشبینی بهینه و هم به شناسایی سازگار مدل دست یابد.[2]
این شواهد یک قانون عملیاتی روشن را برای تحلیلگران دیکته میکند. اگر هدف استنتاج است — یعنی درک متغیرهای دقیقی که یک سیستم را هدایت میکنند، مانند شناسایی اینکه کدام نشانگرهای ژنتیکی خاص باعث یک بیماری میشوند — BIC از نظر ریاضی انتخاب درستی است، زیرا با افزایش مقیاس دادهها، همبستگیهای جعلی را فیلتر میکند.[1][6]
برعکس، اگر هدف صرفاً پیشبینی است — مانند پیشبینی آبوهوای فردا یا پیشبینی ریزش مشتری — AIC برتری دارد. این معیار اثرات کوچک و حاشیهای را که دقت پیشبینی را بهبود میبخشند حفظ میکند، و میپذیرد که برخی از این اثرات ممکن است به جای مکانیسمهای علی، صرفاً مصنوعات آماری باشند.[3][4]
دانشکده آمار دانشگاه مینهسوتا (University of Minnesota) خاطرنشان میکند که مقایسه مستقیم مقادیر AIC و BIC از نظر ریاضی نامعتبر است، زیرا آنها در مقیاسهای متفاوتی عمل میکنند و به سؤالات متفاوتی پاسخ میدهند. یادداشتهای سخنرانی سال ۲۰۲۵ این دانشگاه بیان میکند: «BIC در تلاش است تا مدل واقعی را پیدا کند»، در حالی که AIC به دنبال بهترین مدل تقریبی برای دادههای آینده است.[6]
انتخاب بین AIC و BIC این نیست که کدام معیار دقیقتر است، بلکه به این برمیگردد که محقق چه فرض فلسفیای درباره جهان دارد. اگر یک مدل ساده و واقعی وجود داشته باشد، BIC آن را پیدا خواهد کرد. اما اگر واقعیت زیربنایی بینهایت پیچیده باشد، AIC کارآمدترین تقریب را ارائه میدهد و میپذیرد که حقیقت مطلق همچنان دور از دسترس است.[7]
چرا مهم است
انتخاب معیار اشتباه برای گزینش مدل میتواند نتایج یک مطالعه را کاملاً تغییر دهد. استفاده از AIC هنگام جستجوی متغیرهای علی منجر به مثبت کاذب میشود، در حالی که استفاده از BIC برای پیشبینی، دقت پیشبینی را کاهش میدهد.
بررسی عمیق دیدگاهها
استدلال سازگاری
استدلال ریاضی برای اولویت دادن به شناسایی مدل واقعی زیربنایی.
آمارشناسانی که طرفدار BIC هستند استدلال میکنند که هدف اصلی علم، استنتاج است — یعنی درک دقیق مکانیسمهای علی که یک پدیده را هدایت میکنند. از آنجا که BIC از نظر مجانبی سازگار است، تضمین میکند که هرچه محقق دادههای بیشتری جمعآوری کند، احتمال انتخاب مدل کاملاً واقعی به ۱۰۰٪ نزدیک میشود. این دیدگاه، تمایل AIC به حفظ پارامترهای حاشیهای و غیرعلی را یک نقص اساسی میداند که ادبیات علمی را با مثبتهای کاذب آلوده میکند.
استدلال کارایی
استدلال ریاضی برای اولویت دادن به دقت پیشبینی بر حقیقت علی.
طرفداران AIC استدلال میکنند که در سیستمهای پیچیده بیولوژیکی، اقتصادی یا اجتماعی، فرآیند «واقعی» تولید داده بینهایت پیچیده است و بنابراین هرگز در مجموعه محدود مدلهایی که یک محقق در حال آزمایش آنهاست، وجود ندارد. اگر مدل واقعی به دلیل اینکه جزو گزینهها نیست نتواند انتخاب شود، سازگاری به یک موضوع ریاضی بیاهمیت تبدیل میشود. در عوض، آنها استدلال میکنند که محققان باید بر کارایی تمرکز کنند: به حداقل رساندن میانگین مربعات خطا زمانی که مدل روی دادههای جدید و دیده نشده اعمال میشود، وظیفهای که از نظر ریاضی ثابت شده است AIC در آن بهینه عمل میکند.
آنچه نمیدانیم
- اینکه آیا فرآیند «واقعی» تولید داده در سیستمهای پیچیده بیولوژیکی یا اجتماعی هرگز میتواند به طور کامل توسط مجموعه محدودی از پارامترها ثبت شود یا خیر.
- نحوه عملکرد این معیارها زمانی که تعداد پارامترها (k) متناسب با حجم نمونه (n) در یادگیری ماشین با ابعاد بالا رشد میکند.
منابع
[1]Psychological Methodsمتخصصان عملگراModel selection and psychological theory: A discussion of the differences between the Akaike Information Criterion (AIC) and the Bayesian Information Criterion (BIC)
مطالعه در Psychological Methods →
[2]Biometrikaآمارشناسان نظریCan the strengths of AIC and BIC be shared? A conflict between model indentification and regression estimation
مطالعه در Biometrika →
[3]Systematic Biologyمدلسازان پیشبینیPerformance of Akaike Information Criterion and Bayesian Information Criterion in Selecting Partition Models and Mixture Models
مطالعه در Systematic Biology →
[4]Cross Validatedمتخصصان عملگراIs there any reason to prefer the AIC or BIC over the other?
مطالعه در Cross Validated →
[5]Stats StackExchangeWhy is BIC considered consistent (though AIC is mostly used) for large number of observation?
مطالعه در Stats StackExchange →
[6]School of Statisticsآمارشناسان نظریStat 5421 Lecture Notes: Model Selection and Model Averaging
مطالعه در School of Statistics →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





