مرتبسازی بر اساس اطمینان: بازه امتیاز ویلسون چگونه مشکل رتبهبندی پنجستاره را حل میکند
پلتفرمهای تجارت الکترونیک و شبکههای اجتماعی برای رتبهبندی محتوای کاربران با مشکل مواجهاند، چرا که میانگینهای خام به مواردی با حجم نمونه بسیار کوچک اجازه میدهند در صدر قرار بگیرند. راهحل این مشکل، یک فرمول آماری مربوط به سال ۱۹۲۷ است که موارد را به جای امتیاز خام، بر اساس میزان اطمینان مرتب میکند.
به قلم کاوان رامین
این خبر را به اشتراک بگذارید
- نابگرایان آماری
- استدلال میکنند که بازه ویلسون تنها راه از نظر ریاضی معتبر برای برآورد نسبتهای واقعی از نمونههای کوچک است و عملکرد بهتری نسبت به بازه والد دارد.
- مهندسان پلتفرم
- برای این الگوریتم به دلیل کاربرد عملی آن در مرتبسازی محتوای تولیدشده توسط کاربر و جلوگیری از تسلط پستهای اسپم یا کمارزش بر فیدها ارزش قائل هستند.
- مدیران جوامع آنلاین
- بر تجربه کاربری تمرکز دارند و خاطرنشان میکنند که اگرچه مرتبسازی بر اساس اطمینان محتوای باکیفیت را نمایان میکند، اما برای جلوگیری از ماندگاری محتوای کهنه باید با زوال زمانی همراه شود.
دیدگاههایی که این گزارش پوشش نداده
- صاحبان کسبوکارهای کوچکی که محصولاتشان به دلیل جریمه نمونههای کوچک، در رتبههای پایین دفن میشود.
- کاربرانی که مرتبسازی زمانی (کرونولوژیک) را به گزینش الگوریتمی ترجیح میدهند.
در سال ۱۹۲۷، ادوین بی. ویلسون، ریاضیدان آمریکایی، مقاله کوتاهی در مجله انجمن آماری آمریکا با عنوان «استنتاج محتمل، قانون توالی و استنتاج آماری» منتشر کرد. او در تلاش بود تا یک مشکل خاص در نسبتهای دوجملهای را حل کند: چگونه میتوان یک احتمال واقعی را زمانی که حجم نمونه بسیار کوچک است، به دقت برآورد کرد. روش استاندارد کتابهای درسی، معروف به بازه والد (Wald interval)، مرتباً با شکست مواجه میشد و گاهی نشان میداد که یک نسبت واقعی میتواند منفی باشد. ویلسون فرمول جدیدی استخراج کرد که آزمون امتیاز را معکوس میکرد و کرانها را دقیقاً بین صفر و یک نگه میداشت.[2]
به مدت ۸۰ سال، فرمول ویلسون به عنوان یک عنصر ثابت و بیسروصدا در گزارشهای کارآزمایی بالینی و آمار دانشگاهی باقی ماند. سپس، اینترنت یک مشکل عظیم در رتبهبندی ایجاد کرد. پلتفرمهای تجارت الکترونیک و شبکههای اجتماعی نیاز داشتند تا میلیونها مورد تولیدشده توسط کاربران — نظرات، محصولات و پستها — را بر اساس آرای مثبت و منفی مرتب کنند. رویکرد سادهلوحانه این بود که مرتبسازی بر اساس میانگین خام انجام شود. محصولی با یک نقد پنجستاره در جایگاه بینقص ۱۰۰ درصد قرار میگرفت و بالاتر از محصولی با ۹۵ نقد مثبت از مجموع ۱۰۰ نقد میایستاد.[1][5]
این توهم آماری به مواردی با حجم نمونه بسیار کوچک اجازه داد تا در روزهای اولیه وب بر جدولهای ردهبندی مسلط شوند. همانطور که ایوان میلر، توسعهدهنده نرمافزار، در مقاله پرمخاطب خود در سال ۲۰۰۹ با عنوان «چگونه بر اساس میانگین امتیاز مرتب نکنیم» اشاره کرد، رتبهبندی بر اساس درصدهای خام اساساً شکست میخورد زیرا وزن شواهد را نادیده میگیرد. یک نقد مثبت منفرد تقریباً هیچ چیزی درباره کیفیت واقعی و زیربنایی یک محصول به سیستم نمیگوید، در حالی که هزار نقد، سیگنالی بسیار قابلاعتماد ارائه میدهند که دستکاری یا جعل آن بسیار دشوارتر است.[1][4]
میلر یک راهحل ریاضی پیشنهاد داد که پلتفرمهایی مانند ردیت در نهایت برای رفع ایراد جدولهای ردهبندی خود آن را پذیرفتند: مرتبسازی موارد بر اساس کران پایین بازه امتیاز ویلسون. به جای پرسیدن این سوال سادهلوحانه که «میانگین امتیاز این مورد چقدر است؟»، الگوریتم سوال بسیار دقیقتری میپرسد: «با توجه به امتیازاتی که در حال حاضر داریم، حداقل کیفیتی که با اطمینان ۹۵ درصدی میتوانیم بگوییم این مورد واقعاً داراست، چقدر است؟» این تغییر در چارچوببندی، نحوه نمایش محتوا را کاملاً دگرگون میکند.[1][4]
ریاضیات زیربنایی این روش با اعمال یک جریمه عدم قطعیت کار میکند که نسبت معکوس با مقدار دادههای جمعآوریشده دارد. برای دیدن این عملکرد در عمل، دو رستوران فرضی را در نظر بگیرید که برای کسب جایگاه برتر در یک اپلیکیشن ارسال غذا رقابت میکنند. رستوران الف ۱۹ نقد مثبت از مجموع ۲۰ امتیاز دریافت کرده است که امتیاز خام ۹۵ درصد را به همراه دارد. رستوران ب ۹۵ نقد مثبت از مجموع ۱۰۰ امتیاز دریافت کرده است که آن هم دقیقاً برابر با ۹۵ درصد است. تحت یک سیستم مرتبسازی سادهلوحانه، این دو رستوران برای جایگاه اول مساوی میشوند.[1]
ریاضیات زیربنایی این روش با اعمال یک جریمه عدم قطعیت کار میکند که نسبت معکوس با مقدار دادههای جمعآوریشده دارد.
وقتی بازه امتیاز ویلسون در سطح اطمینان ۹۵ درصد — با استفاده از مقدار آماری استاندارد زد برابر با ۱.۹۶ — اعمال میشود، نتایج به شدت از هم فاصله میگیرند. برای رستوران الف، کمبود نسبی دادهها یک جریمه سنگین عدم قطعیت را فعال میکند و کران پایین اطمینان آن را به حدود ۷۶.۴ درصد کاهش میدهد. برای رستوران ب، حجم نمونه بسیار بزرگتر، این جریمه را به میزان قابلتوجهی کوچک میکند و کران پایین آن را روی ۸۸.۸ درصد نگه میدارد. رستوران ب به راحتی در رتبهبندی پیروز میشود زیرا سیستم اطمینان ریاضی بسیار بیشتری به کیفیت پایدار آن دارد.[1]
یک توسعهدهنده در تحلیل مکانیک این الگوریتم برای سایت Dev.to مینویسد: «بزرگترین بینش این است: امتیاز ویلسون کیفیت را اندازهگیری نمیکند. بلکه کیفیتی را اندازهگیری میکند که با میزان اطمینان تعدیل شده است.» این فرمول به عنوان یک محافظ در برابر ارتقای زودهنگام در اکوسیستمهای دیجیتال عمل میکند. «با درصد بالایی که شواهد بسیار کمی دارد، با احتیاط برخورد میشود. اما به درصد بالایی که شواهد زیادی دارد، اعتماد میشود.» این امر تضمین میکند که یک روند خوششانسی از نقدهای پنجستاره اولیه نتواند جایگاه بلندمدت یک محصول را در برابر رقبای تثبیتشده به طور مصنوعی متورم کند.[1]
خود فرمول روی کاغذ ترسناک به نظر میرسد؛ ترکیبی از نسبت نمونه، کل حجم نمونه و مقدار بحرانی زد در یک کسر پیچیده که از نظر ریاضی برآورد را به سمت ۰.۵ دوباره متمرکز میکند. اما اثر مکانیکی آن در یک پایگاه داده زنده، سرراست و بسیار مؤثر است. وقتی یک پست صفر رأی منفی و دو رأی مثبت دارد، کران پایین ویلسون امتیاز آن را عمداً پایین نگه میدارد. با انباشته شدن آرای مثبتِ بیشتر بدون آرای منفیِ متناظر، کران پایین به صورت مجانبی به سمت ۱۰۰ درصد بالا میرود و به اجماع پایدار پاداش میدهد.[2]
ردیت به طور مشهوری دقیقاً همین منطق را برای سیستم مرتبسازی نظرات «برترین» (Best) خود پیادهسازی کرد تا کیفیت رشتهبحثهای خود را بهبود بخشد. پیش از این تغییر، پلتفرم به شدت به یک الگوریتم «داغ» (Hot) متکی بود که زوال زمانی را در نظر میگرفت و رتبهبندیها را به شدت به سمت نظراتی که زودتر ارسال شده بودند، بدون توجه به عمق واقعی آنها، سوگیری میداد. با تغییر به کران پایین ویلسون، ردیت به نظراتی که دیرتر میرسیدند اما آرای مثبت بالایی داشتند اجازه داد تا به سرعت از نظرات اولیه و متوسط عبور کنند؛ تغییری که فرهنگ سایت را اساساً دگرگون کرد و به مشارکتهای باکیفیت پاداش داد.[4]
این الگوریتم در مهندسی نرمافزار مدرن بدون محدودیتهای عملی نیست. از آنجا که این روش آرا را به عنوان یک توزیع دوجملهای — یک نتیجه ساده بله یا خیر — در نظر میگیرد، ظرافت یک مقیاس سنتی ۱ تا ۵ ستاره را از بین میبرد، مگر اینکه سیستم به صراحت ورودیها را دوتایی (باینری) کند. مهندسان اغلب مجبورند رتبهبندیهای چندسطحی را در دستههای دوتایی قرار دهند، مثلاً ۴ و ۵ ستاره را به عنوان مثبت و ۱ تا ۳ ستاره را به عنوان منفی در نظر بگیرند تا ریاضیات زیربنایی به درستی عمل کند.[3][4]
علاوه بر این، این بازه به تنهایی زوال زمانی را در نظر نمیگیرد. یک نظر با رتبه بالا از پنج سال پیش، امتیاز ویلسون بالای خود را برای همیشه حفظ میکند، مگر اینکه یک ضریب زوال زمانی مجزا — مانند نیمهعمر ۳۰ روزه — مستقیماً روی کران اطمینان اعمال شود. برای پر کردن این شکاف، مهندسان پلتفرمهای مدرن به طور فزایندهای کران پایین ویلسون را با توابع زوال نمایی ترکیب میکنند تا اطمینان حاصل کنند که یک رتبهبندی بینقص از سال ۲۰۲۱ نمیتواند از نظر ریاضی بالاتر از یک اجماع بسیار مطمئن و ۸۸.۸ درصد مثبت که امروز صبح توسط کاربران ایجاد شده است، قرار بگیرد.[3][4][5]
نکات کلیدی
- رتبهبندی موارد بر اساس میانگین خام باعث میشود محصولاتی با تنها یک نقد پنجستاره، بالاتر از محصولاتی با هزاران رأی مثبت قرار بگیرند.
- بازه امتیاز ویلسون با محاسبه کران پایین یک بازه اطمینان، این مشکل را حل کرده و عملاً حجم نمونههای کوچک را جریمه میکند.
- یک امتیاز مثبت ۹۵ درصدی از ۲۰ نقد، به امتیاز اطمینان ۷۶.۴ درصد کاهش مییابد، در حالی که همین امتیاز از ۱۰۰ نقد تنها به ۸۸.۸ درصد افت میکند.
- پلتفرمهایی مانند ردیت از این رویکرد ریاضی استفاده میکنند تا مطمئن شوند ادعاهای خارقالعاده با شواهد خارقالعاده پشتیبانی میشوند.
چرا مهم است
هر بار که محصولی با رتبه بالا را در آمازون میخرید یا برترین نظر را در ردیت میخوانید، یک الگوریتم آماری در حال تصمیمگیری برای چیزی است که میبینید. درک اینکه این پلتفرمها چگونه رتبهبندیهای با نمونه کم را جریمه میکنند، به شما کمک میکند تا در اکوسیستمهای دیجیتال بهتر گشتوگذار کنید و متوجه شوید چه زمانی یک امتیاز پنجستاره، صرفاً یک توهم آماری است.
منابع
[1]Dev.toمهندسان پلتفرمUnderstanding Wilson Score, confidence intervals, and the mysterious 1.96
مطالعه در Dev.to →
[2]Statistics Fundamentalsنابگرایان آماریWilson Score Interval: Formula, Calculator & Examples
مطالعه در Statistics Fundamentals →
[3]Mediumمدیران جوامع آنلاینConfidence Isn't Optional
مطالعه در Medium →
[4]Shattered.ioمهندسان پلتفرمStep 6: Rank Heroes with the Wilson Score Interval
مطالعه در Shattered.io →
[5]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

