رفتن به محتوای اصلی
توضیح کوهستانالگوریتم‌های همسان‌سازیتوضیح و تحلیل۸ شهریور ۱۴۰۵، ۱۶:۲۴· 6 دقیقه مطالعه

مکانیسم رتبه‌بندی همسان‌سازی: چگونه سیستم‌های الو، گلیکو و ترو اسکیل مهارت انسان را اندازه‌گیری می‌کنند

بازی‌های رقابتی مدرن برای محاسبه مهارت و عدم قطعیت، به الگوریتم‌های پیچیده بیزی متکی هستند و اولویت آن‌ها تطابق‌های عادلانه است، نه پاداش روانی صعود در رتبه‌ها.

به قلم نادر غفاری

معماران سیستم 40%بازیکنان رقابتی 40%طراحان بازی 20%
معماران سیستم
اولویت دادن به دقت ریاضی و عدالت مسابقه نسبت به پیشرفت بازیکن.
بازیکنان رقابتی
ارزش قائل شدن برای پیشرفت قابل مشاهده و اغلب سیستم‌های MMR سخت‌گیرانه را تنبیه‌کننده یا محدودکننده می‌دانند.
طراحان بازی
تلاش برای ایجاد تعادل بین سخت‌گیری ریاضی همسان‌سازی دقیق و نیاز روانی به پیشرفت پاداش‌دهنده.

خلاصه ماجرا به طرز وحشیانه‌ای ساده است: می‌برید، عددتان بالا می‌رود؛ می‌بازید، عددتان پایین می‌آید. اما زیر این تراکنش ابتدایی، یک مسابقه تسلیحاتی ریاضیاتی چند دهه‌ای برای اندازه‌گیری دقیق مهارت انسان نهفته است. سیستم‌های رتبه‌بندی همسان‌سازی مدرن (MMR) مانند گلیکو و ترو اسکیل فقط ردیابی نمی‌کنند که چقدر خوب هستید. آن‌ها ردیابی می‌کنند که سیستم از نظر ریاضی چقدر به خوب بودن شما اطمینان دارد، و در این میان، یکپارچگی رقابتی و مسابقات عادلانه را بر پاداش دوپامینی صعود مداوم در رتبه اولویت می‌دهند.[5]

اهمیت درست انجام دادن این کار برای صنعت بازی‌های ویدیویی حیاتی است. اگر الگوریتم همسان‌سازی یک بازی چندنفره شکست بخورد، بازی می‌میرد. له کردن حریفان بدون زحمت خسته‌کننده است؛ و مکرراً له شدن هم عذاب‌آور. الگوریتم همسان‌سازی به عنوان داور نامرئی اکوسیستم عمل می‌کند، وظیفه دارد ده غریبه را در سراسر جهان پیدا کند و اطمینان حاصل کند که وقتی آن‌ها با هم درگیر می‌شوند، نتیجه تا حد امکان از نظر ریاضی به پرتاب سکه نزدیک باشد.[5]

پایه و اساس تمام همسان‌سازی‌های مدرن از یک تخته فیزیکی شروع شد. در سال ۱۹۶۰، آرپاد الو، استاد فیزیک، سیستم رتبه‌بندی الو (Elo) را برای شطرنج طراحی کرد. این یک مکانیسم تبادل مجموع صفر و ظریف بود. اگر یک استاد بزرگ، یک مبتدی را شکست می‌داد، نتیجه مورد انتظار رخ داده بود و امتیازات بسیار کمی جابه‌جا می‌شد. اما اگر مبتدی یک پیروزی بزرگ و غیرمنتظره کسب می‌کرد، سیستم یک خطای محاسباتی جدی را تشخیص داده و مجموع عظیمی از امتیازات را از بازنده به برنده منتقل می‌کرد.[5]

سیستم اصلی الو بر اساس تبادل مجموع صفر و مبتنی بر نتایج مورد انتظار عمل می‌کند.

سیستم الو برای بازی‌های یک به یک و با اطلاعات کامل، فوق‌العاده بود، اما بازی‌های ویدیویی مدرن آن را کاملاً در هم شکستند. وقتی توسعه‌دهندگان تلاش کردند یک تبادل ساده مجموع صفر را به پویایی‌های تیمی پنج به پنج، نقش‌های متفاوت درون بازی و قطع شدن‌های اینترنت اعمال کنند، ریاضیات نتوانست سهم فردی بازیکنان را ثبت کند. یک بازیکن درخشان می‌توانست توسط یک تیم وحشتناک به پایین کشیده شود، و سیستم الو هر دوی آن‌ها را به یک اندازه مجازات می‌کرد.[4]

اولین تحول بزرگ در دهه ۱۹۹۰ توسط مارک گلیکمن رخ داد. او متوجه شد که سیستم الو فاقد یک بُعد حیاتی است: اطمینان. گلیکمن سیستم گلیکو (Glicko) را معرفی کرد که یک متغیر ثانویه به نام انحراف رتبه‌بندی (Rating Deviation یا RD) اضافه کرد. RD میزان عدم اطمینان سیستم نسبت به سطح مهارت واقعی شما را اندازه‌گیری می‌کند و نحوه اعطا و کسر امتیاز پس از مسابقه را به طور اساسی تغییر می‌دهد.[3]

اگر هر روز بازی کنید، انحراف رتبه‌بندی شما کاهش می‌یابد. سیستم به رتبه شما اطمینان بالایی پیدا می‌کند، به این معنی که رتبه شما پس از یک برد معمولی به سختی تغییر می‌کند. با این حال، اگر شش ماه وقفه بیندازید، RD شما جهش می‌کند. الگوریتم اعتراف می‌کند که دیگر نمی‌داند آیا مهارت‌های شما زنگ زده یا بهبود یافته است، و این باعث می‌شود چند مسابقه بعدی شما بسیار بی‌ثبات باشد، زیرا سیستم به سرعت تلاش می‌کند موقعیت واقعی شما را در جدول رتبه‌بندی مجدداً تنظیم کند.[3]

در حالی که گلیکو مشکل عدم فعالیت را حل کرد، بازی‌های مبتنی بر تیم همچنان مانعی بزرگ بودند. چگونه یک الگوریتم می‌تواند به طور دقیق به یک بازیکن پشتیبان (Support) بی‌نقص که تیمش به دلیل عملکرد ضعیف یک مهاجم (Striker) می‌بازد، رتبه دهد؟ ریاضیاتی که برای تجزیه تأثیر فردی از نتیجه جمعی لازم بود، نیازمند یک چارچوب کاملاً جدید بود.[5]

انحراف رتبه‌بندی (RD) گلیکو میزان اطمینان سیستم به رتبه یک بازیکن را ردیابی می‌کند.
در حالی که گلیکو مشکل عدم فعالیت را حل کرد، بازی‌های مبتنی بر تیم همچنان مانعی بزرگ بودند.

در سال ۲۰۰۵، مایکروسافت ریسرچ (Microsoft Research) با معرفی ترو اسکیل (TrueSkill)، که به طور خاص برای راه‌اندازی ایکس‌باکس لایو (Xbox Live) طراحی شده بود، اساساً چشم‌انداز را تغییر داد. ترو اسکیل تبادل مجموع صفر را به طور کامل کنار گذاشت و به نفع یک الگوریتم استنتاج بیزی عمل کرد. ترو اسکیل به جای در نظر گرفتن مهارت بازیکن به عنوان یک عدد ثابت واحد، آن را به عنوان یک منحنی زنگوله‌ای از احتمالات مدل‌سازی می‌کند.[2]

ترو اسکیل دو عدد متمایز را برای هر بازیکن ردیابی می‌کند: «مو» (Mu) که میانگین مهارت درک شده شما را نشان می‌دهد، و «سیگما» (Sigma) که نشان‌دهنده عدم قطعیت سیستم است. رتبه واقعی همسان‌سازی شما – عددی که بازی برای یافتن حریفان شما از آن استفاده می‌کند – معمولاً یک تخمین بسیار محافظه‌کارانه است که به صورت «مو منهای سه برابر سیگما» محاسبه می‌شود. سیستم بدترین سناریوی شما را فرض می‌کند تا زمانی که خلاف آن را ثابت کنید.[1]

آنچه ترو اسکیل را انقلابی کرد، توانایی آن در مدیریت محیط‌های چند تیمی و چند نفره بود. این سیستم احتمال هر نتیجه ممکن را حتی قبل از شروع مسابقه محاسبه می‌کند. وقتی مسابقه به پایان می‌رسد، «مو» و «سیگما» همه را به طور همزمان بر اساس نتیجه به‌روزرسانی می‌کند و عدم قطعیت فردی هر ده بازیکن حاضر در لابی را در نظر می‌گیرد.[1]

این ما را به تلاش رقابتی مدرن و شکایت جهانی بازیکنان از «گیر کردن در رتبه» (Hardstuck) می‌رساند. بازیکنان اغلب احساس می‌کنند که سیستم علیه آن‌ها دستکاری شده است، زمانی که سه بازی را می‌برند و ۱۵ امتیاز کسب می‌کنند، اما یک بازی را می‌بازند و ۲۰ امتیاز از دست می‌دهند. آن‌ها این را به عنوان یک الگوریتم خراب می‌بینند که فعالانه تلاش می‌کند آن‌ها را در یک رده پایین‌تر نگه دارد.[5]

ترو اسکیل مهارت بازیکن را به جای یک عدد ثابت، به عنوان یک منحنی احتمال مدل‌سازی می‌کند.

این یک اشکال (Bug) نیست؛ این ریاضیات بیزی است که دقیقاً طبق هدف کار می‌کند. وقتی «سیگما»ی شما به نزدیکی صفر می‌رسد، سیستم از نظر ریاضی متقاعد شده است که سقف مهارت دقیق شما را پیدا کرده است. سیستم به طور فعال در برابر حرکت شما به سمت رتبه‌های بالاتر مقاومت می‌کند، مگر اینکه افزایش پایدار و از نظر آماری معناداری در نرخ برد خود در برابر حریفان سخت‌تر ثابت کنید. سیستم در حال محافظت از یکپارچگی رتبه‌های بالاتر در برابر زنجیره‌های برد شانسی است.[1][5]

عناوین ورزش‌های الکترونیک مدرن از نسخه‌های اختصاصی و به شدت اصلاح شده این چارچوب‌ها استفاده می‌کنند. برای مثال، کانتر-استرایک (Counter-Strike) از یک اقتباس پیچیده از گلیکو-۲ استفاده می‌کرد که متغیرهای متعددی را در نقشه‌ها و حالت‌های مختلف ردیابی می‌کرد و به جای یک عدد کلی، یک پروفایل مهارت بسیار خاص برای هر بازیکن ایجاد می‌نمود.[4]

تنش در همسان‌سازی مدرن اساساً روانشناختی است. بازیکنان یک سیستم پیشرفت می‌خواهند – نردبانی برای صعود که سرمایه‌گذاری زمانی آن‌ها را با نشان‌های جدید و براق پاداش دهد. اما الگوریتم‌هایی مانند ترو اسکیل و گلیکو صراحتاً طراحی شده‌اند تا سطح مهارت دقیق شما را پیدا کرده و شما را در آنجا قفل کنند تا مسابقات عادلانه تضمین شود. آن‌ها مکانیسم‌های مرتب‌سازی هستند، نه سیستم‌های سطح‌بندی بازی‌های نقش‌آفرینی (RPG).[5]

در نهایت، رتبه‌بندی همسان‌سازی (MMR) یک آینه است. الگوریتم‌ها در اندازه‌گیری عملکرد انسان در فضاهای دیجیتال به طرز باورنکردنی ماهر شده‌اند. دفعه بعد که صفحه همسان‌سازی می‌چرخد، به یاد داشته باشید که ریاضیات قصد ندارد شما را عقب نگه دارد یا پیشرفتتان را مجازات کند؛ بلکه صرفاً تلاش می‌کند یک مبارزه عادلانه برای شما پیدا کند.[5]

نکات کلیدی

  • سیستم‌های همسان‌سازی مدرن از ریاضیات پیچیده برای ردیابی هم مهارت شما و هم اطمینان سیستم به آن مهارت استفاده می‌کنند.
  • سیستم الو (Elo) برای شطرنج ۱ به ۱ طراحی شده بود و در رتبه‌بندی دقیق بازیکنان انفرادی در بازی‌های تیمی ۵ به ۵ دچار مشکل است.
  • سیستم گلیکو (Glicko) «انحراف رتبه‌بندی» (Rating Deviation) را معرفی کرد تا زنگار گرفتن مهارت بازیکنانی که وقفه می‌اندازند را در نظر بگیرد.
  • ترو اسکیل (TrueSkill) مایکروسافت از استنتاج بیزی برای محاسبه احتمالات در مسابقات چند تیمی و چند نفره استفاده می‌کند.
  • احساس «گیر کردن» در یک رتبه به این معنی است که الگوریتم با اطمینان بسیار بالا، سقف مهارت دقیق شما را پیدا کرده است.

چرا مهم است

درک نحوه عملکرد واقعی سیستم‌های MMR، ابهام‌زدایی از تلاش رقابتی اغلب خسته‌کننده است. با آشکار شدن این حقیقت که رتبه‌های «ثابت‌شده» (Hardstuck) نه نقص سیستم، بلکه ویژگی قطعیت ریاضی هستند، بازیکنان می‌توانند تمرکز خود را از تعقیب امتیاز به سمت بهبود واقعی مهارت تغییر دهند.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

معماران سیستم 40%بازیکنان رقابتی 40%طراحان بازی 20%
  1. [1]Microsoft Researchمعماران سیستم

    TrueSkill(TM): A Bayesian Skill Rating System

    مطالعه در Microsoft Research
  2. [2]Microsoft Researchمعماران سیستم

    TrueSkill™ Ranking System

    مطالعه در Microsoft Research
  3. [3]Taylor & Francis Onlineمعماران سیستم

    Parameter estimation in large dynamic paired comparison experiments

    مطالعه در Taylor & Francis Online
  4. [4]arXivطراحان بازی

    An Analysis of CS:GO Skill Rating Systems

    مطالعه در arXiv
  5. [5]تیم سردبیری کوهستانبازیکنان رقابتی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت بازی و ورزش‌های الکترونیک اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.