لگاریتم در مبنای دویی که موتورهای جستجو را مجبور میکند صفحه اول را در اولویت قرار دهند
الگوریتمهای جستجو برای سنجش کیفیت به معیار «بهره تجمعی تخفیفیافته نرمالشده» (NDCG) متکی هستند و از یک تابع زوال لگاریتمی برای مدلسازی سرعت افت توجه کاربر استفاده میکنند. این معیار با تفکیک ارتباط مطلق یک سند از جایگاه آن در نتایج، تضمین میکند که موتورهای جستجو به دلیل دفن کردن پاسخهای بینقص در زیر پاسخهای صرفاً خوب، به شدت جریمه شوند.
به قلم نیما موسوی
این خبر را به اشتراک بگذارید
- طرفداران اصالت بازیابی اطلاعات
- استدلال میکنند که NDCG تنها راه از نظر ریاضی معتبر برای ارزیابی ارتباط درجهبندیشده در میان مجموعههای متنوع پرسوجو است.
- فروشندگان تجاری جستجو
- به NDCG در درجه اول به عنوان یک معیار برای بازاریابی نگاه میکنند و بر امتیازات سطح بالا برای نشان دادن قابلیتهای بازیابی تمرکز دارند.
- پژوهشگران تجربه کاربری
- از زوال لگاریتمی خشک در مبنای ۲ انتقاد میکنند و استدلال میکنند که رابطهای مدرن فرض خطی بودن از بالا به پایین را نقض میکنند.
دیدگاههایی که این گزارش پوشش نداده
- فروشندگان تجارت الکترونیک که محصولاتشان رتبهبندی میشود
- کاربران نهایی که این معیار سعی در مدلسازی رفتار آنها دارد
نکات کلیدی
- معیار NDCG با استفاده از یک تابع تخفیف لگاریتمی، ارتباط مطلق یک سند را از جایگاه رتبه آن جدا میکند.
- لگاریتم در مبنای ۲ جریمه سنگینی برای دفن نتایج بسیار مرتبط ایجاد میکند که بازتابدهنده زوال سریع صبر کاربر است.
- این معیار با تقسیم امتیاز واقعی بر امتیاز ایدهآل، عملکرد را در مقیاس ۰٫۰ تا ۱٫۰ در میان پرسوجوهای مختلف نرمالسازی میکند.
- این معیار موتورهای جستجو را به خاطر نمایش اسناد نامرتبط جریمه نمیکند، بلکه تنها به دلیل عدم رتبهبندی بالای اسناد خوب جریمه میکند.
فروشندگان سیستمهای جستجوی سازمانی اغلب جدیدترین سیستمهای «تولید افزوده بازیابی» (RAG) خود را با این ادعا بازاریابی میکنند که هوش مصنوعی آنها قصد کاربر را بهتر از همیشه درک میکند. اما شواهدی که آنها برای اثبات این برتری ارائه میدهند - معیاری به نام «بهره تجمعی تخفیفیافته نرمالشده» (NDCG) - اصلاً درک معنایی را نمیسنجد. در عوض، همانطور که مستندات سال ۲۰۰۸ ویکیپدیا درباره این معیار نشان میدهد، این شاخص واقعیت بسیار سادهتر و خشنتری را اندازهگیری میکند: زوال ریاضیاتی صبر انسان.[1]
معیار NDCG استاندارد صنعت برای ارزیابی سیستمهای رتبهبندی است که توسط همه، از غولهای تجارت الکترونیک گرفته تا پژوهشگران دانشگاهی، استفاده میشود. این معیار بر اساس یک فرض بنیادین عمل میکند: یک سند بسیار مرتبط اگر در صفحه سوم ظاهر شود، بیفایده است. برای کمّی کردن این موضوع، این معیار کیفیت مطلق یک نتیجه - یعنی ارتباط درجهبندیشده آن - را از جایگاهی که موتور جستجو در واقع آن را قرار داده است، جدا میکند.
این مکانیزم بر یک عملیات ریاضی خاص متکی است: تخفیف لگاریتمی. بر اساس مستندات فنی سال ۲۰۲۴ از فروشنده پایگاه داده برداری Zilliz، این فرمول امتیاز ارتباط یک سند را بر لگاریتم در مبنای ۲ جایگاه رتبه آن به علاوه یک، تقسیم میکند. در مستندات Zilliz آمده است: «فرض DCG این است که اسناد بسیار مرتبطی که در پایین لیست نتایج جستجو ظاهر میشوند، باید جریمه شوند.»[3]
این جریمه خطی نیست. یک جریمه خطی، افت از جایگاه یک به جایگاه دو را دقیقاً مشابه افت از جایگاه نه به جایگاه ده در نظر میگیرد. در عوض، لگاریتم در مبنای ۲ یک سقوط اولیه تند ایجاد میکند که به مرور زمان مسطح میشود. یک نتیجه بینقص در جایگاه اول، ۱۰۰ درصد ارزش خود را حفظ میکند. در جایگاه دوم، این ارزش به ۶۳ درصد کاهش مییابد. تا جایگاه دهم، الگوریتم تنها ۲۸ درصد از ارزش واقعی آن سند را به موتور جستجو اختصاص میدهد.
برای درک اینکه چگونه این موضوع رفتار جستجو را شکل میدهد، صورت کسر این معادله را در نظر بگیرید. همانطور که پلتفرم یادگیری ماشین ApX Machine Learning در برنامه درسی سیستمهای توصیهگر خود توضیح میدهد، ارتباط یک مفهوم صفر و یکی نیست. یک سند صرفاً مرتبط یا نامرتبط نیست. بلکه در مقیاسی، معمولاً از صفر تا سه یا صفر تا چهار، درجهبندی میشود؛ جایی که سه نشاندهنده یک تطابق بینقص و صفر نشاندهنده یک خطای کامل است.[7]
در تهاجمیترین نسخه این فرمول، که توسط پژوهشگران مایکروسافت در اوایل دهه ۲۰۰۰ رواج یافت و در مستندات سال ۲۰۲۵ MetricGate به تفصیل شرح داده شده است، این ارتباط درجهبندیشده به توان میرسد. صورت کسر تبدیل میشود به ۲ به توان درجه ارتباط، منهای یک. درجه سه، صورت کسری برابر با هفت به دست میدهد، در حالی که درجه دو، صورت کسری برابر با سه تولید میکند. این مقیاسبندی نمایی، موتورهای جستجو را به خاطر بازیابی بهترین سند مطلق، به جای مشتی اسناد متوسط، به شدت پاداش میدهد.[4]
محاسبه «بهره تجمعی تخفیفیافته» (DCG) برای یک پرسوجوی واحد تنها نیمی از راه است. امتیاز خام DCG به شدت به خود پرسوجو بستگی دارد. جستجو برای یک عبارت بسیار خاص ممکن است تنها دو سند مرتبط در کل پایگاه داده داشته باشد، که حداکثر DCG ممکن را محدود میکند. در مقابل، یک جستجوی گسترده ممکن است هزاران تطابق مرتبط داشته باشد.
محاسبه «بهره تجمعی تخفیفیافته» (DCG) برای یک پرسوجوی واحد تنها نیمی از راه است.
این امر یک مشکل نرمالسازی ایجاد میکند. اگر یک مهندس بخواهد بداند که آیا یک الگوریتم جدید در کل یک مجموعه آزمایشی شامل ۱۰,۰۰۰ پرسوجو بهتر عمل میکند یا خیر، نمیتواند به سادگی میانگین امتیازات خام DCG را بگیرد. پرسوجوهای گسترده با امتیازات خام عظیم، پرسوجوهای خاص را کاملاً در خود غرق میکنند و ارزیابی را به سمت عبارات پرکاربرد منحرف کرده و عبارات خاصتر را نادیده میگیرند.
راهحل، همانطور که Evidently AI در راهنمای معیارهای رتبهبندی خود بیان کرده است، بخش «نرمالشده» در NDCG است. برای هر پرسوجو، سیستم «DCG ایدهآل» (IDCG) را محاسبه میکند. این امتیازی است که موتور جستجو در صورت رتبهبندی اسناد موجود به ترتیب نزولی و بینقصِ ارتباط، به دست میآورد.[5]
سپس DCG واقعی بر IDCG تقسیم میشود و یک امتیاز نهایی NDCG بین ۰٫۰ و ۱٫۰ تولید میکند. امتیاز ۱٫۰ به این معنی است که موتور جستجو رتبهبندی ریاضیاتی بینقصی را برای آن پرسوجوی خاص تولید کرده است. امتیاز ۰٫۰ به این معنی است که هیچ چیز ارزشمندی را بازیابی نکرده است. از آنجا که اکنون هر پرسوجو در همان مقیاس ۰٫۰ تا ۱٫۰ قرار دارد، مهندسان میتوانند میانگین آنها را برای ارزیابی کل سیستم محاسبه کنند.
وبلاگ مهندسی Redis در راهنمای خود برای ارزیابی بازیابی اطلاعات خاطرنشان میکند: «NDCG به ویژه مفید است زیرا سطوح چندگانه ارتباط را مدیریت کرده و امتیاز را نرمالسازی میکند، که این امر مقایسه عملکرد در میان پرسوجوهای مختلف را امکانپذیر میسازد.» همین قابلیت مقایسه بین پرسوجوها است که به فروشندگان اجازه میدهد هنگام معرفی یک پایگاه داده برداری جدید، ادعای بهبود ۵ درصدی در NDCG را داشته باشند.[6]
با این حال، این معیار محدودیتهای سختگیرانهای دارد که فروشندگان اغلب روی آنها سرپوش میگذارند. NDCG یک سیستم را به خاطر بازگرداندن اسناد بد جریمه نمیکند، بلکه تنها به دلیل عدم نمایش اسناد خوب در رتبههای بالا جریمه میکند. اگر یک موتور جستجو یک سند بینقص را در جایگاه اول، و نه سند کاملاً نامرتبط را در جایگاههای دوم تا دهم بازگرداند، امتیاز NDCG آن در جایگاه اول یک ۱٫۰ بینقص خواهد بود.
علاوه بر این، این معیار فرض میکند که کاربر نتایج را دقیقاً به ترتیب، از بالا به پایین و بدون پرش بررسی میکند. فرض بر این است که صبر کاربر دقیقاً مطابق با یک لگاریتم در مبنای ۲ کاهش مییابد. اگر یک رابط کاربری نتایج را در یک شبکه ارائه دهد، یا اگر کاربران به طور مکرر از نتیجه اول عبور کنند تا به نتیجه دوم نگاه کنند، این مدل ریاضی از واقعیت انسانی فاصله میگیرد.
انتخاب لگاریتم در مبنای ۲ به خودی خود بیشتر یک قرارداد صنعتی است تا یک قانون روانشناختی. در حالی که این مدل به طور مؤثری افت شدید نرخ کلیک مشاهدهشده در موتورهای جستجوی وب اولیه را مدلسازی میکند، رابطهای مدرن با اسکرول بینهایت یا خروجیهای هوش مصنوعی مکالمهای ممکن است برای بازتاب دقیق رفتار کاربر به توابع زوال متفاوتی نیاز داشته باشند.
با وجود این نقاط کور، NDCG همچنان مرکز ثقل صنعت جستجو باقی مانده است. هر بار که یک مدل رتبهبندی آموزش داده میشود، در حال بهینهسازی برای این منحنی ریاضی خاص است. این معیار مهندسان را مجبور میکند که روی سه جایگاه اول وسواس به خرج دهند و در مسیر جستجوی ارتباط، هر چیزی را که در پایین صفحه قرار میگیرد، به عنوان یک خطای گرد کردن در نظر بگیرند.
اصطلاحات کلیدی
- بهره تجمعی تخفیفیافته نرمالشده (NDCG)
- یک معیار استاندارد که برای ارزیابی کیفیت سیستمهای رتبهبندی با اندازهگیری سودمندی اسناد بر اساس جایگاه آنها در لیست نتایج استفاده میشود.
- ارتباط درجهبندیشده
- یک سیستم امتیازدهی که سطوح چندگانهای از سودمندی را به یک سند اختصاص میدهد (مانند بینقص، خوب، متوسط، بد) به جای یک انتخاب ساده بله/خیر.
- تخفیف لگاریتمی
- یک تابع ریاضی که ارزش یک سند را هر چه در لیست نتایج جستجو پایینتر میآید کاهش میدهد و افت توجه کاربر را مدلسازی میکند.
- DCG ایدهآل (IDCG)
- حداکثر امتیاز ممکن برای یک پرسوجوی خاص، که تنها در صورتی به دست میآید که موتور جستجو تمام اسناد موجود را به ترتیب نزولی و بینقص ارتباط رتبهبندی کند.
پرسشهای متداول
چرا موتورهای جستجو از لگاریتم در مبنای ۲ برای تخفیف استفاده میکنند؟
لگاریتم در مبنای ۲ یک افت اولیه شدید ایجاد میکند که به دقت مدلسازی میکند کاربران چقدر سریع نتایج جستجو را رها میکنند اگر آنچه را که نیاز دارند در صفحه اول پیدا نکنند.
آیا میتوان امتیازات NDCG را در میان مجموعه دادههای مختلف مقایسه کرد؟
خیر. در حالی که NDCG امتیازات را در میان پرسوجوهای مختلف در یک مجموعه داده نرمالسازی میکند، امتیازات مطلق را نمیتوان به طور معناداری در محیطهای جستجوی کاملاً متفاوت مقایسه کرد.
آیا NDCG یک سیستم را به خاطر نمایش نتایج بد جریمه میکند؟
خیر. این معیار تنها حضور اسناد بسیار مرتبط را پاداش میدهد. سیستمی که یک نتیجه بینقص و به دنبال آن نه نتیجه وحشتناک را نشان دهد، اگر نتیجه بینقص در صدر باشد، همچنان امتیاز بالایی کسب خواهد کرد.
منابع
[1]Wikipediaطرفداران اصالت بازیابی اطلاعاتDiscounted cumulative gain
مطالعه در Wikipedia →
[2]Emergent MindNDCG-Based Objectives
مطالعه در Emergent Mind →
[3]Zillizفروشندگان تجاری جستجوHow is Normalized Discounted Cumulative Gain (nDCG) calculated?
مطالعه در Zilliz →
[4]MetricGateفروشندگان تجاری جستجوNormalized Discounted Cumulative Gain (NDCG) Calculator
مطالعه در MetricGate →
[5]Evidently AIطرفداران اصالت بازیابی اطلاعاتNormalized Discounted Cumulative Gain (NDCG) explained
مطالعه در Evidently AI →
[6]Redisفروشندگان تجاری جستجوEvaluating information retrieval with NDCG@K & Redis
مطالعه در Redis →
[7]ApX Machine Learningطرفداران اصالت بازیابی اطلاعاتNormalized Discounted Cumulative Gain (NDCG)
مطالعه در ApX Machine Learning →
[8]تیم سردبیری کوهستانپژوهشگران تجربه کاربریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در متا
مشاهده همه →معماری پایگاه داده
چگونه OLTP سرعت نوشتن را به حداکثر میرساند، در حالی که OLAP برای تجمیع دادهها بهینهسازی شده است
5 منبع
ادبیات کلاسیک
مقایسه سبک شعری و مضامین فلسفی حافظ و سعدی: دو قله غزل فارسی
4 منبع
مهار هوش مصنوعی
مقایسه راهکارهای مهار هوش مصنوعی: کلید اضطراری فنی در برابر توافقهای شفافیت دیپلماتیک
3 منبع
مواد معدنی حیاتی
قطب جدید اقتصادی آفریقا: چگونه جمعیتشناسی و مواد معدنی حیاتی در حال بازنویسی رشد جهانی هستند
3 منبع
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





