رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعیارهای جستجوتشریح الگوریتم· 6 دقیقه مطالعه· در متا

لگاریتم در مبنای دویی که موتورهای جستجو را مجبور می‌کند صفحه اول را در اولویت قرار دهند

الگوریتم‌های جستجو برای سنجش کیفیت به معیار «بهره تجمعی تخفیف‌یافته نرمال‌شده» (NDCG) متکی هستند و از یک تابع زوال لگاریتمی برای مدل‌سازی سرعت افت توجه کاربر استفاده می‌کنند. این معیار با تفکیک ارتباط مطلق یک سند از جایگاه آن در نتایج، تضمین می‌کند که موتورهای جستجو به دلیل دفن کردن پاسخ‌های بی‌نقص در زیر پاسخ‌های صرفاً خوب، به شدت جریمه شوند.

به قلم نیما موسوی

طرفداران اصالت بازیابی اطلاعات 40%فروشندگان تجاری جستجو 35%پژوهشگران تجربه کاربری 25%
طرفداران اصالت بازیابی اطلاعات
استدلال می‌کنند که NDCG تنها راه از نظر ریاضی معتبر برای ارزیابی ارتباط درجه‌بندی‌شده در میان مجموعه‌های متنوع پرس‌وجو است.
فروشندگان تجاری جستجو
به NDCG در درجه اول به عنوان یک معیار برای بازاریابی نگاه می‌کنند و بر امتیازات سطح بالا برای نشان دادن قابلیت‌های بازیابی تمرکز دارند.
پژوهشگران تجربه کاربری
از زوال لگاریتمی خشک در مبنای ۲ انتقاد می‌کنند و استدلال می‌کنند که رابط‌های مدرن فرض خطی بودن از بالا به پایین را نقض می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • فروشندگان تجارت الکترونیک که محصولاتشان رتبه‌بندی می‌شود
  • کاربران نهایی که این معیار سعی در مدل‌سازی رفتار آنها دارد

نکات کلیدی

  • معیار NDCG با استفاده از یک تابع تخفیف لگاریتمی، ارتباط مطلق یک سند را از جایگاه رتبه آن جدا می‌کند.
  • لگاریتم در مبنای ۲ جریمه سنگینی برای دفن نتایج بسیار مرتبط ایجاد می‌کند که بازتاب‌دهنده زوال سریع صبر کاربر است.
  • این معیار با تقسیم امتیاز واقعی بر امتیاز ایده‌آل، عملکرد را در مقیاس ۰٫۰ تا ۱٫۰ در میان پرس‌وجوهای مختلف نرمال‌سازی می‌کند.
  • این معیار موتورهای جستجو را به خاطر نمایش اسناد نامرتبط جریمه نمی‌کند، بلکه تنها به دلیل عدم رتبه‌بندی بالای اسناد خوب جریمه می‌کند.

فروشندگان سیستم‌های جستجوی سازمانی اغلب جدیدترین سیستم‌های «تولید افزوده بازیابی» (RAG) خود را با این ادعا بازاریابی می‌کنند که هوش مصنوعی آن‌ها قصد کاربر را بهتر از همیشه درک می‌کند. اما شواهدی که آن‌ها برای اثبات این برتری ارائه می‌دهند - معیاری به نام «بهره تجمعی تخفیف‌یافته نرمال‌شده» (NDCG) - اصلاً درک معنایی را نمی‌سنجد. در عوض، همان‌طور که مستندات سال ۲۰۰۸ ویکی‌پدیا درباره این معیار نشان می‌دهد، این شاخص واقعیت بسیار ساده‌تر و خشن‌تری را اندازه‌گیری می‌کند: زوال ریاضیاتی صبر انسان.[1]

معیار NDCG استاندارد صنعت برای ارزیابی سیستم‌های رتبه‌بندی است که توسط همه، از غول‌های تجارت الکترونیک گرفته تا پژوهشگران دانشگاهی، استفاده می‌شود. این معیار بر اساس یک فرض بنیادین عمل می‌کند: یک سند بسیار مرتبط اگر در صفحه سوم ظاهر شود، بی‌فایده است. برای کمّی کردن این موضوع، این معیار کیفیت مطلق یک نتیجه - یعنی ارتباط درجه‌بندی‌شده آن - را از جایگاهی که موتور جستجو در واقع آن را قرار داده است، جدا می‌کند.

این مکانیزم بر یک عملیات ریاضی خاص متکی است: تخفیف لگاریتمی. بر اساس مستندات فنی سال ۲۰۲۴ از فروشنده پایگاه داده برداری Zilliz، این فرمول امتیاز ارتباط یک سند را بر لگاریتم در مبنای ۲ جایگاه رتبه آن به علاوه یک، تقسیم می‌کند. در مستندات Zilliz آمده است: «فرض DCG این است که اسناد بسیار مرتبطی که در پایین لیست نتایج جستجو ظاهر می‌شوند، باید جریمه شوند.»[3]

این جریمه خطی نیست. یک جریمه خطی، افت از جایگاه یک به جایگاه دو را دقیقاً مشابه افت از جایگاه نه به جایگاه ده در نظر می‌گیرد. در عوض، لگاریتم در مبنای ۲ یک سقوط اولیه تند ایجاد می‌کند که به مرور زمان مسطح می‌شود. یک نتیجه بی‌نقص در جایگاه اول، ۱۰۰ درصد ارزش خود را حفظ می‌کند. در جایگاه دوم، این ارزش به ۶۳ درصد کاهش می‌یابد. تا جایگاه دهم، الگوریتم تنها ۲۸ درصد از ارزش واقعی آن سند را به موتور جستجو اختصاص می‌دهد.

لگاریتم در مبنای ۲ جریمه سنگینی برای اسنادی که در رتبه‌های پایین‌تر نتایج جستجو قرار می‌گیرند، ایجاد می‌کند.

برای درک اینکه چگونه این موضوع رفتار جستجو را شکل می‌دهد، صورت کسر این معادله را در نظر بگیرید. همان‌طور که پلتفرم یادگیری ماشین ApX Machine Learning در برنامه درسی سیستم‌های توصیه‌گر خود توضیح می‌دهد، ارتباط یک مفهوم صفر و یکی نیست. یک سند صرفاً مرتبط یا نامرتبط نیست. بلکه در مقیاسی، معمولاً از صفر تا سه یا صفر تا چهار، درجه‌بندی می‌شود؛ جایی که سه نشان‌دهنده یک تطابق بی‌نقص و صفر نشان‌دهنده یک خطای کامل است.[7]

در تهاجمی‌ترین نسخه این فرمول، که توسط پژوهشگران مایکروسافت در اوایل دهه ۲۰۰۰ رواج یافت و در مستندات سال ۲۰۲۵ MetricGate به تفصیل شرح داده شده است، این ارتباط درجه‌بندی‌شده به توان می‌رسد. صورت کسر تبدیل می‌شود به ۲ به توان درجه ارتباط، منهای یک. درجه سه، صورت کسری برابر با هفت به دست می‌دهد، در حالی که درجه دو، صورت کسری برابر با سه تولید می‌کند. این مقیاس‌بندی نمایی، موتورهای جستجو را به خاطر بازیابی بهترین سند مطلق، به جای مشتی اسناد متوسط، به شدت پاداش می‌دهد.[4]

محاسبه «بهره تجمعی تخفیف‌یافته» (DCG) برای یک پرس‌وجوی واحد تنها نیمی از راه است. امتیاز خام DCG به شدت به خود پرس‌وجو بستگی دارد. جستجو برای یک عبارت بسیار خاص ممکن است تنها دو سند مرتبط در کل پایگاه داده داشته باشد، که حداکثر DCG ممکن را محدود می‌کند. در مقابل، یک جستجوی گسترده ممکن است هزاران تطابق مرتبط داشته باشد.

محاسبه «بهره تجمعی تخفیف‌یافته» (DCG) برای یک پرس‌وجوی واحد تنها نیمی از راه است.

این امر یک مشکل نرمال‌سازی ایجاد می‌کند. اگر یک مهندس بخواهد بداند که آیا یک الگوریتم جدید در کل یک مجموعه آزمایشی شامل ۱۰,۰۰۰ پرس‌وجو بهتر عمل می‌کند یا خیر، نمی‌تواند به سادگی میانگین امتیازات خام DCG را بگیرد. پرس‌وجوهای گسترده با امتیازات خام عظیم، پرس‌وجوهای خاص را کاملاً در خود غرق می‌کنند و ارزیابی را به سمت عبارات پرکاربرد منحرف کرده و عبارات خاص‌تر را نادیده می‌گیرند.

راه‌حل، همان‌طور که Evidently AI در راهنمای معیارهای رتبه‌بندی خود بیان کرده است، بخش «نرمال‌شده» در NDCG است. برای هر پرس‌وجو، سیستم «DCG ایده‌آل» (IDCG) را محاسبه می‌کند. این امتیازی است که موتور جستجو در صورت رتبه‌بندی اسناد موجود به ترتیب نزولی و بی‌نقصِ ارتباط، به دست می‌آورد.[5]

تقسیم امتیاز واقعی بر امتیاز ایده‌آل، این معیار را در میان پرس‌وجوهای مختلف نرمال‌سازی می‌کند.

سپس DCG واقعی بر IDCG تقسیم می‌شود و یک امتیاز نهایی NDCG بین ۰٫۰ و ۱٫۰ تولید می‌کند. امتیاز ۱٫۰ به این معنی است که موتور جستجو رتبه‌بندی ریاضیاتی بی‌نقصی را برای آن پرس‌وجوی خاص تولید کرده است. امتیاز ۰٫۰ به این معنی است که هیچ چیز ارزشمندی را بازیابی نکرده است. از آنجا که اکنون هر پرس‌وجو در همان مقیاس ۰٫۰ تا ۱٫۰ قرار دارد، مهندسان می‌توانند میانگین آن‌ها را برای ارزیابی کل سیستم محاسبه کنند.

وبلاگ مهندسی Redis در راهنمای خود برای ارزیابی بازیابی اطلاعات خاطرنشان می‌کند: «NDCG به ویژه مفید است زیرا سطوح چندگانه ارتباط را مدیریت کرده و امتیاز را نرمال‌سازی می‌کند، که این امر مقایسه عملکرد در میان پرس‌وجوهای مختلف را امکان‌پذیر می‌سازد.» همین قابلیت مقایسه بین پرس‌وجوها است که به فروشندگان اجازه می‌دهد هنگام معرفی یک پایگاه داده برداری جدید، ادعای بهبود ۵ درصدی در NDCG را داشته باشند.[6]

با این حال، این معیار محدودیت‌های سخت‌گیرانه‌ای دارد که فروشندگان اغلب روی آن‌ها سرپوش می‌گذارند. NDCG یک سیستم را به خاطر بازگرداندن اسناد بد جریمه نمی‌کند، بلکه تنها به دلیل عدم نمایش اسناد خوب در رتبه‌های بالا جریمه می‌کند. اگر یک موتور جستجو یک سند بی‌نقص را در جایگاه اول، و نه سند کاملاً نامرتبط را در جایگاه‌های دوم تا دهم بازگرداند، امتیاز NDCG آن در جایگاه اول یک ۱٫۰ بی‌نقص خواهد بود.

مهندسان از NDCG برای مقایسه عملکرد الگوریتم‌های مختلف بازیابی در میان هزاران پرس‌وجوی آزمایشی استفاده می‌کنند.

علاوه بر این، این معیار فرض می‌کند که کاربر نتایج را دقیقاً به ترتیب، از بالا به پایین و بدون پرش بررسی می‌کند. فرض بر این است که صبر کاربر دقیقاً مطابق با یک لگاریتم در مبنای ۲ کاهش می‌یابد. اگر یک رابط کاربری نتایج را در یک شبکه ارائه دهد، یا اگر کاربران به طور مکرر از نتیجه اول عبور کنند تا به نتیجه دوم نگاه کنند، این مدل ریاضی از واقعیت انسانی فاصله می‌گیرد.

انتخاب لگاریتم در مبنای ۲ به خودی خود بیشتر یک قرارداد صنعتی است تا یک قانون روان‌شناختی. در حالی که این مدل به طور مؤثری افت شدید نرخ کلیک مشاهده‌شده در موتورهای جستجوی وب اولیه را مدل‌سازی می‌کند، رابط‌های مدرن با اسکرول بی‌نهایت یا خروجی‌های هوش مصنوعی مکالمه‌ای ممکن است برای بازتاب دقیق رفتار کاربر به توابع زوال متفاوتی نیاز داشته باشند.

با وجود این نقاط کور، NDCG همچنان مرکز ثقل صنعت جستجو باقی مانده است. هر بار که یک مدل رتبه‌بندی آموزش داده می‌شود، در حال بهینه‌سازی برای این منحنی ریاضی خاص است. این معیار مهندسان را مجبور می‌کند که روی سه جایگاه اول وسواس به خرج دهند و در مسیر جستجوی ارتباط، هر چیزی را که در پایین صفحه قرار می‌گیرد، به عنوان یک خطای گرد کردن در نظر بگیرند.

اصطلاحات کلیدی

بهره تجمعی تخفیف‌یافته نرمال‌شده (NDCG)
یک معیار استاندارد که برای ارزیابی کیفیت سیستم‌های رتبه‌بندی با اندازه‌گیری سودمندی اسناد بر اساس جایگاه آن‌ها در لیست نتایج استفاده می‌شود.
ارتباط درجه‌بندی‌شده
یک سیستم امتیازدهی که سطوح چندگانه‌ای از سودمندی را به یک سند اختصاص می‌دهد (مانند بی‌نقص، خوب، متوسط، بد) به جای یک انتخاب ساده بله/خیر.
تخفیف لگاریتمی
یک تابع ریاضی که ارزش یک سند را هر چه در لیست نتایج جستجو پایین‌تر می‌آید کاهش می‌دهد و افت توجه کاربر را مدل‌سازی می‌کند.
DCG ایده‌آل (IDCG)
حداکثر امتیاز ممکن برای یک پرس‌وجوی خاص، که تنها در صورتی به دست می‌آید که موتور جستجو تمام اسناد موجود را به ترتیب نزولی و بی‌نقص ارتباط رتبه‌بندی کند.

پرسش‌های متداول

چرا موتورهای جستجو از لگاریتم در مبنای ۲ برای تخفیف استفاده می‌کنند؟

لگاریتم در مبنای ۲ یک افت اولیه شدید ایجاد می‌کند که به دقت مدل‌سازی می‌کند کاربران چقدر سریع نتایج جستجو را رها می‌کنند اگر آنچه را که نیاز دارند در صفحه اول پیدا نکنند.

آیا می‌توان امتیازات NDCG را در میان مجموعه داده‌های مختلف مقایسه کرد؟

خیر. در حالی که NDCG امتیازات را در میان پرس‌وجوهای مختلف در یک مجموعه داده نرمال‌سازی می‌کند، امتیازات مطلق را نمی‌توان به طور معناداری در محیط‌های جستجوی کاملاً متفاوت مقایسه کرد.

آیا NDCG یک سیستم را به خاطر نمایش نتایج بد جریمه می‌کند؟

خیر. این معیار تنها حضور اسناد بسیار مرتبط را پاداش می‌دهد. سیستمی که یک نتیجه بی‌نقص و به دنبال آن نه نتیجه وحشتناک را نشان دهد، اگر نتیجه بی‌نقص در صدر باشد، همچنان امتیاز بالایی کسب خواهد کرد.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

طرفداران اصالت بازیابی اطلاعات 40%فروشندگان تجاری جستجو 35%پژوهشگران تجربه کاربری 25%
  1. [1]Wikipediaطرفداران اصالت بازیابی اطلاعات

    Discounted cumulative gain

    مطالعه در Wikipedia
  2. [2]Emergent Mind

    NDCG-Based Objectives

    مطالعه در Emergent Mind
  3. [3]Zillizفروشندگان تجاری جستجو

    How is Normalized Discounted Cumulative Gain (nDCG) calculated?

    مطالعه در Zilliz
  4. [4]MetricGateفروشندگان تجاری جستجو

    Normalized Discounted Cumulative Gain (NDCG) Calculator

    مطالعه در MetricGate
  5. [5]Evidently AIطرفداران اصالت بازیابی اطلاعات

    Normalized Discounted Cumulative Gain (NDCG) explained

    مطالعه در Evidently AI
  6. [6]Redisفروشندگان تجاری جستجو

    Evaluating information retrieval with NDCG@K & Redis

    مطالعه در Redis
  7. [7]ApX Machine Learningطرفداران اصالت بازیابی اطلاعات

    Normalized Discounted Cumulative Gain (NDCG)

    مطالعه در ApX Machine Learning
  8. [8]تیم سردبیری کوهستانپژوهشگران تجربه کاربری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.