چگونه دو مؤلفه امتیاز بریر، پیشبینیهای دقیق را از حدسهای پرادعا متمایز میکنند
امتیاز بریر (Brier score) پیشبینیهای احتمالی را با تقسیم دقت به دو معیار مجزا ارزیابی میکند: قابلیت اطمینان و تفکیکپذیری. درک این تفکیک ریاضی نشان میدهد که چرا مدلی که با اطمینان کامل نتیجهای اشتباه را پیشبینی میکند، بسیار بیشتر از مدلی که به عدم قطعیت خود اذعان دارد، جریمه میشود.
به قلم نیما موسوی
این خبر را به اشتراک بگذارید
- طرفداران خلوص آماری
- استدلال میکنند که تفکیک استاندارد مورفی تنها راه عینی و ریاضی برای ارزیابی یک پیشبینی است.
- مدلسازان ریسک بالینی
- از وزندهی به تجزیه برای بازتاب هزینههای نامتقارن خطاهای دنیای واقعی حمایت میکنند.
- عملگرایان یادگیری ماشین
- بر محدودیتهای محاسباتی تجزیه در مجموعهدادههای با ابعاد بالا و نمونههای کوچک تمرکز میکنند.
دیدگاههایی که این گزارش پوشش نداده
- کاربران نهایی پیشبینیها (مانند بیماران و خلبانان) که به جای احتمالات، به تصمیمگیریهای صفر و یکی متکی هستند.
- نهادهای نظارتی که مدلهای هوش مصنوعی را برای استقرار تجاری ارزیابی میکنند.
روند رویداد
۱۹۵۰
گلن بریر امتیاز اولیه بریر را برای ارزیابی دقت پیشبینیهای آبوهوا معرفی میکند.
۱۹۷۳
آلن مورفی تفکیک برداری را منتشر میکند و امتیاز را به قابلیت اطمینان، تفکیکپذیری و عدم قطعیت تقسیم میکند.
۲۰۰۸
محققان دو مؤلفه اضافی را در تجزیه شناسایی میکنند تا نویز آماری در نمونههای کوچک را در نظر بگیرند.
۲۰۲۳
محققان بالینی امتیاز بریر وزندار را پیشنهاد میکنند تا هزینههای نامتقارن پیشبینیهای پزشکی را لحاظ کنند.
آزمون واقعی یک پیشبینی احتمالی نه در زمان وقوع رویداد، بلکه در لحظهای اتفاق میافتد که پیشبینی به مؤلفههای ریاضی خود تجزیه میشود. وقتی یک هواشناس میگوید ۷۰٪ احتمال بارندگی وجود دارد، یا یک مدل بالینی احتمال ۱۵ درصدی برای یک بیماری در نظر میگیرد، نتیجه به تنهایی نمیتواند این عدد را تأیید کند. در عوض، آماردانان از تجزیه امتیاز بریر استفاده میکنند؛ یک عملیات ریاضی که خطای پیشبینی را به قابلیت اطمینان، تفکیکپذیری و عدم قطعیت پایه تقسیم میکند. این تفکیک همان مکانیزمی است که یک مدل با قدرت پیشبینی واقعی را از مدلی که صرفاً میانگین تاریخی را حفظ کرده، متمایز میسازد.[2]
این معیار اولیه در سال ۱۹۵۰ توسط گلن بریر برای ارزیابی پیشبینیهای آبوهوا معرفی شد، اما این مقاله آلن مورفی در سال ۱۹۷۳ در مجله هواشناسی کاربردی بود که نحوه استفاده از این امتیاز را اساساً تغییر داد. مورفی نشان داد که یک عدد خطای کلی و تجمیعشده، رفتار واقعی مدل را پنهان میکند. اثری که مورفی با عنوان «یک تفکیک برداری جدید برای امتیاز احتمال» منتشر کرد، ثابت نمود که مهارت پیشبینی یک بعد واحد نیست، بلکه تعادلی از قابلیتهای متمایز است.[1][2]
برای درک این تفکیک، ابتدا باید به خط پایه نگاه کرد: عدم قطعیت. عدم قطعیت، تغییرپذیری ذاتی رویدادِ در حال پیشبینی را مستقل از خود پیشبینی اندازهگیری میکند. اگر شهری در طول یک سال دقیقاً در ۲۰٪ روزها بارانی باشد، مدلی که کورکورانه برای هر روز احتمال ۲۰٪ بارندگی را پیشبینی کند، به یک امتیاز بریر پایه دست مییابد. هدف هر سیستم پیشبینی پیشرفتهای — چه یک شبکه عصبی باشد و چه یک رگرسیون آماری — شکست دادن این خط پایه است.[3]
اولین مؤلفه فعال در این بهبود، قابلیت اطمینان است که اغلب کالیبراسیون نامیده میشود. قابلیت اطمینان میسنجد که احتمالات پیشبینیشده تا چه حد با فراوانیهای مشاهدهشده تطابق دارند. اگر مدلی ۱۰۰ بار احتمال ۴۰ درصدی وقوع یک رویداد را پیشبینی کند، آن رویداد باید دقیقاً ۴۰ بار رخ دهد. بر اساس مستندات مرکز تحقیقات آبوهوا و اقلیم استرالیا (CAWCR)، قابلیت اطمینان درجهای است که در آن «احتمال پیشبینی با فراوانی نسبی مشاهدهشده مطابقت دارد.»[3]
وقتی در بروشورهای تبلیغاتی سیستمهای جدید هوش مصنوعیِ پیشبین ادعای اطمینان ۹۹ درصدی میشود، آنها اغلب «اطمینان» را با «قابلیت اطمینان» اشتباه میگیرند. یک سیستم میتواند بسیار مطمئن اما کاملاً غیرقابلاطمینان باشد. اگر مدلی بگوید ۹۰٪ مطمئن است که یک سهام صعود میکند، اما آن سهام تنها در ۵۰٪ مواقعی که این پیشبینیها انجام میشود واقعاً صعود کند، مدل به طرز ضعیفی کالیبره شده است. تجزیه بریر این اعتمادبهنفس کاذب را به شدت جریمه کرده و به نمره خطای کل میافزاید.[5]
دومین مؤلفه فعال، تفکیکپذیری است. تفکیکپذیری توانایی یک مدل را برای دستهبندی رویدادها در دستههای احتمالی متمایز که با میانگین پایه تفاوت دارند، کمّی میکند. مدلی با تفکیکپذیری بالا صرفاً در حوالی میانگین تاریخی ۲۰٪ پرسه نمیزند؛ بلکه با اطمینان و به درستی روزهای خاصی را که احتمال در آنها ۵٪ است و روزهای دیگری را که احتمال ۹۰٪ است، شناسایی میکند.[3]
تفکیکپذیری توانایی یک مدل را برای دستهبندی رویدادها در دستههای احتمالی متمایز که با میانگین پایه تفاوت دارند، کمّی میکند.
مستندات CAWCR با تأکید بر اینکه «تفکیکپذیری و قابلیت اطمینان متفاوت هستند»، خاطرنشان میکند که یک پیشبینی میتواند کاملاً قابلاطمینان باشد اما اگر هر روز صرفاً میانگین اقلیمی را صادر کند، تفکیکپذیری آن صفر خواهد بود. برعکس، یک مدل میتواند با جدا کردن جسورانه رویدادها در سطلهای ۰٪ و ۱۰۰٪ تفکیکپذیری بالایی داشته باشد، اما اگر این پیشبینیهای جسورانه اشتباه باشند، امتیاز قابلیت اطمینان آن فرو میریزد.[3]
رابطه ریاضی به شکلی ظریف ساده است: امتیاز بریر برابر است با عدم قطعیت، به علاوه قابلیت اطمینان، منهای تفکیکپذیری. از آنجا که امتیاز بریر پایینتر نشاندهنده پیشبینی بهتر است، یک مدل باید خطای قابلیت اطمینان خود را به حداقل برساند (تطبیق احتمالات با واقعیت) در حالی که تفکیکپذیری خود را به حداکثر میرساند (دور کردن پیشبینیها از میانگین پایه تا حد امکان).[4]
در عمل، بستههای نرمافزاری مانند Stata و R این تجزیه را خودکار میکنند. دستور brier در Stata دقیقاً همین مؤلفهها را محاسبه میکند و به آماردانان اجازه میدهد تا دلیل شکست یک مدل را تشخیص دهند. اگر جریمه قابلیت اطمینان بالا باشد، مدل نیاز به کالیبراسیون مجدد دارد. اگر پاداش تفکیکپذیری پایین باشد، مدل فاقد ویژگیهای بنیادین برای تمایز بین نتایج است.[4][6]
این تجزیه به ویژه در پیشبینی خطرات بالینی حیاتی است. مقالهای در سال ۲۰۲۳ که در مرکز ملی اطلاعات زیستفناوری (NCBI) منتشر شد، باورهای غلط رایج درباره امتیاز بریر در مدلهای پیشبینی باینری را برجسته کرد. نویسندگان دریافتند که محققان پزشکی اغلب امتیاز تجمیعشده را اشتباه تفسیر میکنند و متوجه نمیشوند که مدلی با تفکیکپذیری عالی، اگر قابلیت اطمینان آن به سمت پیشبینی بیش از حد بیماریهای نادر و شدید متمایل باشد، ممکن است از نظر بالینی بیفایده باشد.[5]
برای رفع این مشکل، محققان اصلاحاتی مانند «امتیاز بریر وزندار» را پیشنهاد کردهاند. یک مطالعه در سال ۲۰۲۳ در مورد کاربرد بالینی نشان داد که تجزیه استاندارد با مثبت کاذب و منفی کاذب رفتار یکسانی دارد. با این حال، در پزشکی، پیشبینی احتمال ۱۰ درصدی سرطان در حالی که احتمال واقعی ۹۰٪ است، بسیار خطرناکتر از حالت برعکس است. با وزندهی به مؤلفهها، ارزیابان میتوانند جریمه ریاضی را با هزینه واقعی خطا در دنیای واقعی همسو کنند.[8]
این تجزیه بدون محدودیت هم نیست. مقالهای در سال ۲۰۰۸ در مجله پیشبینی و آبوهوا با عنوان «دو مؤلفه اضافی در تجزیه امتیاز بریر» استدلال کرد که تفکیک سهبخشی سنتی مورفی، زمانی که اندازه نمونهها کوچک است، این رابطه را بیش از حد ساده میکند. محققان نشان دادند که مجموعهدادههای محدود، نویز آماری ایجاد میکنند که میتواند به طور مصنوعی امتیاز تفکیکپذیری را متورم کرده و مدل را توانمندتر از آنچه واقعاً هست نشان دهد.[7]
این نویز یک آسیبپذیری قابلتوجه برای مدلهای یادگیری ماشین مدرن است که اغلب روی مجموعهدادههای عظیم اما به شدت تکهتکه عمل میکنند. وقتی یک فروشنده هوش مصنوعی ادعا میکند که مدل آنها به یک امتیاز بریر بیسابقه در یک مجموعهداده محک دست یافته است، ارزیابِ شکاک باید بخواهد تجزیه آن را ببیند. امتیاز پایینی که ناشی از عدم قطعیت پایه پایینِ یک مجموعهداده عظیم باشد، دلیلی بر برتری الگوریتمی نیست؛ بلکه صرفاً بازتابی از یک محیط به راحتی قابل پیشبینی است.[1][7]
تمایز بین آنچه یک مدل یاد میگیرد و آنچه صرفاً حفظ میکند، توسط معیار تفکیکپذیری آشکار میشود. قابلیت پیشبینی واقعی ایجاب میکند که مدل موضعگیری کند — از حاشیه امن میانگین تاریخی دور شود و خطر جریمه بالای قابلیت اطمینان را بپذیرد. تجزیه امتیاز بریر تضمین میکند که این خطر کمّیسازی شود و یک دفتر کل ریاضی ارائه میدهد که آیندهنگری واقعی را از توهم آماری جدا میکند.[2][5]
نکات کلیدی
- امتیاز بریر پیشبینیهای احتمالی را با اندازهگیری میانگین مجذور تفاوت بین احتمالات پیشبینیشده و نتایج واقعی ارزیابی میکند.
- تفکیک آلن مورفی در سال ۱۹۷۳ این امتیاز را به سه مؤلفه تقسیم کرد: قابلیت اطمینان، تفکیکپذیری و عدم قطعیت پایه.
- قابلیت اطمینان میزان تطابق احتمالات پیشبینیشده با فراوانیهای مشاهدهشده را میسنجد و اعتمادبهنفس کاذب را جریمه میکند.
- تفکیکپذیری به مدلهایی پاداش میدهد که به جای تکیه بر میانگینهای تاریخی، میتوانند با اطمینان نتایج مختلف را از هم متمایز کنند.
- کاربردهای بالینی مدرن به طور فزایندهای از «امتیاز بریر وزندار» استفاده میکنند تا هزینههای نابرابر مثبت کاذب و منفی کاذب را در نظر بگیرند.
بررسی عمیق دیدگاهها
طرفداران خلوص آماری
استدلال میکنند که تفکیک استاندارد مورفی تنها راه عینی و ریاضی برای ارزیابی یک پیشبینی است.
این گروه که ریشه در هواشناسی سنتی و نظریه احتمالات دارند، معتقدند که قدرت امتیاز بریر در بیطرفی دقیق ریاضی آن نهفته است. آنها استدلال میکنند که قابلیت اطمینان و تفکیکپذیری ویژگیهای بنیادین خود پیشبینی هستند، مستقل از اینکه پیشبینی چگونه استفاده خواهد شد. از این منظر، معرفی وزنهای کاربردی ذهنی، این معیار را مخدوش کرده و یک مقیاس حقیقت عینی را به مقیاسی از مصلحت موقعیتی تبدیل میکند.
مدلسازان ریسک بالینی
از وزندهی به تجزیه برای بازتاب هزینههای نامتقارن خطاهای دنیای واقعی حمایت میکنند.
محققانی که این مدلها را در مراقبتهای بهداشتی و مالی به کار میبرند، استدلال میکنند که امتیاز بریر بدون وزن در عمل خطرناک است. از دیدگاه آنها، مدلی که مثبت کاذب و منفی کاذب را کاملاً متعادل میکند، ممکن است به یک امتیاز قابلیت اطمینان بهینه از نظر ریاضی دست یابد، در حالی که همزمان مداخلات پزشکی فاجعهباری را توصیه میکند. آنها از امتیاز بریر وزندار حمایت میکنند و اصرار دارند که دقت یک پیشبینی را نمیتوان از پیامدهای خطاهای آن جدا کرد.
عملگرایان یادگیری ماشین
بر محدودیتهای محاسباتی تجزیه در مجموعهدادههای با ابعاد بالا و نمونههای کوچک تمرکز میکنند.
این دیدگاه آسیبپذیریهای تفکیک سنتی را در هنگام اعمال بر هوش مصنوعی مدرن برجسته میکند. آنها به تحقیقاتی اشاره میکنند که نشان میدهد اندازه نمونههای محدود میتواند مؤلفه تفکیکپذیری را به طور مصنوعی متورم کند و مدلهای بیشبرازششده را بسیار ماهر جلوه دهد. برای این متخصصان، امتیاز بریر یک ابزار تشخیصی مفید است، اما ابزاری که باید به شدت تنظیم و اعتبارسنجی متقاطع شود تا از جا زدن نویز ریاضی مجموعهدادههای کوچک به عنوان تفکیکپذیری پیشبینانه واقعی جلوگیری کند.
چرا مهم است
در شرایطی که هوش مصنوعی و مدلهای آماری بیش از پیش هدایت تصمیمگیریها در پزشکی، مالی و هواشناسی را بر عهده دارند، صرفاً دانستن نرخ خطای کلی یک مدل دیگر کافی نیست. تجزیه امتیاز بریر به ارزیابان اجازه میدهد تا دقیقاً نقطه ضعف یک سیستم پیشبینی را شناسایی کنند؛ اینکه آیا مدل فاقد تفکیکپذیری لازم برای تمایز بین رویدادهاست یا قابلیت اطمینان کافی برای تخصیص احتمالات درست را ندارد.
منابع
[1]Monthly Weather Reviewطرفداران خلوص آماریVERIFICATION OF FORECASTS EXPRESSED IN TERMS OF PROBABILITY
مطالعه در Monthly Weather Review →
[2]AMS Journalsعملگرایان یادگیری ماشینA New Vector Partition of the Probability Score
مطالعه در AMS Journals →
[3]CAWCRReliability and resolution - how are they different?
مطالعه در CAWCR →
[4]Statabrier — Brier score decomposition
مطالعه در Stata →
[5]PMCمدلسازان ریسک بالینیOn misconceptions about the Brier score in binary prediction models
مطالعه در PMC →
[6]RDocumentationBrierDecomp {SpecsVerification}, R Documentation
مطالعه در RDocumentation →
[7]AMS Journalsعملگرایان یادگیری ماشینTwo Extra Components in the Brier Score Decomposition
مطالعه در AMS Journals →
[8]PMCمدلسازان ریسک بالینیWeighted Brier Score - an Overall Summary Measure for Risk Prediction Models with Clinical Utility Consideration
مطالعه در PMC →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در متا
مشاهده همه →همسویی هوش مصنوعی
چگونه «بهینهسازی مستقیم ترجیحات» (DPO) در واقعیت مدلهای زبانی بزرگ را همسو میکند
4 منبع
روشهای آماری
مقیاسپذیری توان آماری: راهکار بنجامینی-هاچبرگ برای مشکل مقایسههای چندگانه
5 منبع
استانداردهای سختافزار
استاندارد IEC 60529: دو رقم گواهی IP واقعاً چگونه مقاومت در برابر آب و گردوغبار را تعریف میکنند؟
6 منبع
گزینش الگوریتمی
چگونه دادههای تجربی فرضیه «حباب فیلتر» را رد میکنند
5 منبع
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





