تابع لاگ-لاس: مدلهای امید گل (xG) چگونه احتمال گل شدن یک شوت را محاسبه میکنند؟
مدلهای امید گل برای سنجش دقت پیشبینیهای خود به «زیان لگاریتمی» (Log-loss) وابستهاند؛ معیاری که اعتمادبهنفس کاذب را جریمه و احتمالات دقیق و کالیبرهشده را تشویق میکند. تحلیلگران با مقایسه نمرات لاگ-لاس در ورزشهای مختلف، میتوانند ذات غیرقابلپیشبینی تبدیل شدن یک شوت به گل را به شکل کمی اندازهگیری کنند.
به قلم سپیده توکلی
این خبر را به اشتراک بگذارید
- حداکثرکنندگان دقت پیشبینی
- به حداقل رساندن لاگ-لاس را بالاتر از هر چیز دیگری در اولویت قرار میدهند و الگوریتمهای پیچیده یادگیری ماشین مانند XGBoost را ترجیح میدهند.
- مدافعان تفسیرپذیری
- استدلال میکنند که مدلها باید برای مربیان شفاف و قابل توضیح باشند و رگرسیون لجستیک را ترجیح میدهند.
دیدگاههایی که این گزارش پوشش نداده
- دانشمندان داده اختصاصی باشگاهها
- کادر فنی مربیان
نکات کلیدی
- زیان لگاریتمی (لاگ-لاس) معیار اصلی برای ارزیابی دقت مدلهای امید گل (xG) است.
- این معیار، مدلهایی را که در یک پیشبینی نادرست اعتمادبهنفس بالایی دارند به شدت جریمه میکند و الگوریتمها را مجبور میسازد تا کاملاً کالیبره بمانند.
- مدلهای xG هاکی به دلیل حجم شوت بالاتر و واریانس کمتر، معمولاً نمرات لاگ-لاس پایینتری نسبت به مدلهای فوتبال کسب میکنند.
- دانشمندان داده باید بین لاگ-لاس پایینِ مدلهای پیچیده XGBoost و تفسیرپذیری شفافِ رگرسیون لجستیک تعادل ایجاد کنند.
تیمهای علم داده در اتاق فکر باشگاههای نخبه فوتبال و هاکی، دقیقاً تعیین میکنند که کدام الگوریتمهای امید گل (xG) برای تاثیرگذاری بر نقلوانتقالات زنده بمانند؛ و آنها این قدرت را هر بار که دسته جدیدی از دادههای مسابقات، مدل را مجبور به بازآموزی میکند، اعمال میکنند. آنها این تصمیم را بر اساس تعداد شوتهایی که یک مدل درست حدس میزند، نمیگیرند. در عوض، به «زیان لگاریتمی» (Log-loss) تکیه میکنند؛ یک جریمه ریاضی برای اعتمادبهنفس کاذب که دقیقاً میسنجد یک الگوریتم وقتی پیشبینی اشتباهی میکند، چقدر غافلگیر میشود. این معیار، یک مدل پیشبینیکننده واقعی را از مدلی که صرفاً بدیهیات را حدس میزند جدا کرده و به عنوان داور نهایی حقیقت آماری در آنالیز ورزشی مدرن عمل میکند.[4]
امید گل به هر شوت زده شده احتمالی بین ۰ تا ۱ اختصاص میدهد که نشاندهنده شانس تبدیل شدن آن تلاش خاص به گل بر اساس دادههای تاریخی است. اما از آنجا که یک شوت یا گل میشود یا نمیشود، ارزیابی دقت این احتمالات اعشاری نیازمند یک قانون امتیازدهی خاص است. لاگ-لاس یا «زیان آنتروپی متقاطع»، به عنوان همین قانون عمل میکند و میزان انحراف بین احتمال پیشبینیشده و واقعیت صفر و یکیِ شوت را به شکل کمی درمیآورد. این همان موتور ریاضیاتی است که تضمین میکند یک الگوریتم نه تنها در مسیر درستی قرار دارد، بلکه دقیقاً با شانس واقعی رویداد کالیبره شده است.[1]
مکانیزم جریمه لاگ-لاس ذاتاً بیرحم طراحی شده است. اگر مدلی احتمال ۰.۸۰ را به شوتی از محوطه ششقدم اختصاص دهد و بازیکن گل بزند، لاگ-لاس در کمترین حد خود خواهد بود. اما اگر بازیکن توپ را از دست بدهد، مدل به خاطر اعتمادبهنفس بالایش در یک نتیجه شکستخورده، به شدت جریمه میشود. در مقابل، یک پیشبینی محتاطانه ۰.۵۵ فارغ از نتیجه، جریمهای متوسط در پی دارد. این مجازات نامتقارن، مدلها را مجبور میکند تا کاملاً کالیبره بمانند؛ الگوریتمهایی را که تنها در صورت توجیه واقعی دادههای پایه ابراز اطمینان میکنند پاداش میدهد و آنهایی را که دچار توهمِ اعتمادبهنفس هستند، نقرهداغ میکند.
در لیگ ملی هاکی (NHL)، جایی که حجم شوتها بالاست و متغیرها با دقت ردیابی میشوند، مدلهای عمومی به کالیبراسیون فوقالعادهای دست مییابند. مدل شرایط برابر «هاکی آلکمی» که روی ۱۶ فصل از ۲۰۱۰-۱۱ تا ۲۰۲۵-۲۶ و بیش از ۱.۶ میلیون تلاش برای شوتِ بلوکنشده آموزش دیده، لاگ-لاس اعتبارسنجی متقاطع ۰.۱۶۶ را ثبت کرده است. مدل پایه رگرسیون لجستیک «ایوالوینگ هاکی» نیز به طور مشابه به نمره تست لاگ-لاس ۰.۲۲۸ دست یافته است. این ارقام نشاندهنده استاندارد طلایی قدرت پیشبینی در یک ورزش سیال و پیوسته است و ثابت میکند که چگونه مجموعه دادههای عظیم میتوانند عدم قطعیت آماری را کاهش دهند.[2][3]
فوتبال اما یک چالش ریاضیاتی کاملاً متفاوت را پیش رو میگذارد. این ورزش شوتهای بسیار کمتری در هر مسابقه دارد و هندسه فضایی یک موقعیت گلزنی در معرض واریانس بسیار بالاتری است. ارزیابیهای آکادمیک از مدلهای xG فوتبال، مانند آنهایی که نرخهای معادل پواسون را برای پیشبینی حداقل یک گل تحلیل میکنند، ارقام لاگ-لاس را در حدود ۰.۴۸۵۰ گزارش میدهند. شکاف بین ۰.۱۶۶ هاکی و ۰.۴۸۵۰ فوتبال به این معنا نیست که تحلیلگران فوتبال در کارشان ضعیفترند؛ بلکه ذات غیرقابلپیشبینی بودن یک شوت در فوتبال را در مقایسه با هاکی کمیسازی میکند و بازتابی از طبیعت کمگل بودن این بازی جهانی است.[1][2]
فوتبال اما یک چالش ریاضیاتی کاملاً متفاوت را پیش رو میگذارد.
برای ساخت این مدلها، تحلیلگران معمولاً از رگرسیون لجستیک یا درختهای تقویتشده با گرادیان، مانند XGBoost استفاده میکنند. رگرسیون لجستیک ویژگیهایی مانند فاصله، زاویه و فشار دفاعی را با استفاده از یک تابع سیگموئید به احتمالات نگاشت میکند. این روش به دلیل شفافیت و سرعت بالا، همچنان خط پایه بسیاری از مدلهای تولیدی است. در همین حال، تقویت گرادیان روابط غیرخطی را مدیریت میکند - مانند تعامل بین موقعیت دقیق دروازهبان و سرعت پاس قبلی - که اغلب به قیمت کاهش تفسیرپذیری، لاگ-لاس پایینتری را به همراه دارد.[3]
هنگام بهینهسازی این الگوریتمها، دانشمندان داده هزاران تکرار را اجرا میکنند و هایپرپارامترها را برای به حداقل رساندن لاگ-لاس روی یک مجموعه داده اعتبارسنجی تنظیم میکنند. مدلی که در برابر یک خط پایه به دقت ۷۹.۹ درصدی میرسد ممکن است چشمگیر به نظر برسد، اما اگر لاگ-لاس آن بالا باشد، به این معنی است که مدل به درستی کالیبره نشده است - اغلب برای گلها ۰.۹۹ و برای از دست دادنها ۰.۰۱ پیشبینی میکند و هنگام رخ دادن یک شگفتی، متحمل جریمههای فاجعهباری میشود. لاگ-لاس تضمین میکند که یک مدل با دقت ۵۱ درصد اما کالیبراسیون بینقص، ارزش بیشتری نسبت به یک مدل ۵۳ درصدی دارد که به شکلی بیپروا اعتمادبهنفس کاذب دارد.[4]
ریسک درست درآوردن این ارزیابی برای هر باشگاه حرفهای بسیار بالاست. مدلی که از کالیبراسیون خارج میشود - و انتظار گلهایی را دارد که ساختارهای دفاعی مدرن دیگر اجازه آن را نمیدهند - شروع به اعتبار دادن اشتباه به شوتزنها و جریمه کردن نادرست دروازهبانها میکند. دپارتمانهای آنالیز با نظارت مداوم بر لاگ-لاس در برابر دادههای جدید مسابقات، میتوانند تغییر هندسه ورزش را تشخیص دهند و پیش از آنکه دادههای تاکتیکی و نقلوانتقالات چند میلیون دلاری باشگاه فاسد شود، الگوریتم را بازآموزی کنند.[2][4]
همانطور که تحلیلگران «جتس نیشن» در سال ۲۰۲۰ اشاره کردند: «با توجه به دادههای فعلی بازیبهبازی، xG به معنای واقعی کلمه مستقیمترین راه موجود برای اندازهگیری کیفیت شوت است.» از آنجا که این دادهها حاوی خطاها و حذفیات تصادفی هستند، مدلها باید عدم قطعیت را در نظر بگیرند. لاگ-لاس چارچوب ریاضیاتی لازم را فراهم میکند تا اطمینان حاصل شود که مدلها به دادههای نویزدار واکنش بیش از حد نشان نمیدهند، دیدگاهی متعادل از کیفیت شوت را در طول هزاران رویداد حفظ میکنند و از انحراف ارزیابی بازیکنان توسط ناهنجاریهای آماری جلوگیری میکنند.
جامعه آکادمیک همچنان به اصلاح این معیارها ادامه میدهد تا سیگنالهای بیشتری را از میان نویزها استخراج کند. محققانی که نرخهای معادل پواسون را در فوتبال ارزیابی میکنند، خاطرنشان میسازند که «این نتیجه نشان میدهد xG+ نرخ بهینه معادل پواسون از نظر لاگ-لاس برای پیشبینی رویداد به ثمر رساندن حداقل یک گل با معیار لاگ-لاس است.» این تحقیقات مداوم، نقش حیاتی لاگ-لاس را در جابجایی مرزهای آنالیز ورزشی برجسته میکند و تضمین میکند اعدادی که ورزش مدرن را هدایت میکنند، ریشه در واقعیتهای سختگیرانه آماری داشته باشند. در سال ۲۰۲۱، ایوالوینگ هاکی این عمل متعادلسازی را به شکلی بینقص خلاصه کرد: «از AUC برای آموزش و تنظیم پارامترهای نهایی مدل استفاده شد - لاگ-لاس برای ارجاع گنجانده شد.»[1][3]
منابع
[1]arXivحداکثرکنندگان دقت پیشبینیExplainable expected goal models for performance analysis in football analytics
مطالعه در arXiv →
[2]Hockey Alchemyحداکثرکنندگان دقت پیشبینیHow Our Expected Goals (xG) Model Works
مطالعه در Hockey Alchemy →
[3]Evolving Hockeyمدافعان تفسیرپذیریA New Expected Goals Model for Predicting Goals in the NHL
مطالعه در Evolving Hockey →
[4]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در ورزش
مشاهده همه →تایم تریل قهرمانی جهان
رکوردشکنی تاریخی رِمکو اِوِنپول: چهارمین قهرمانی متوالی در تایم تریل انفرادی قهرمانی جهان
3 منبع
ردهبندی قدرت
ردهبندی قدرت در دو و میدانی جهان: ۵ ستارهای که از پیست به تسخیر ماراتن میروند
5 منبع
مدیریت بوکس
چهار سازمان بزرگ بوکس و بازی قدرت آنها بر سر کمربندهای قهرمانی جهان
6 منبع
دسته سنگینوزن
نبرد سنگینوزنها بالاخره به خط پایان رسید؛ اعلام رسمی تقابل تایسون فیوری و آنتونی جاشوا در همین هفته
5 منبع
هر زاویه. هر روز.
دریافت ورزش اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





