رفتن به محتوای اصلی
Koohestun
بررسی عمیق کوهستانالگوریتم‌های جستجوتحلیل توازن· 4 دقیقه مطالعه· در تحلیل داده

مقایسه BM25 و بازیابی متراکم: توازن بین دقت و تاخیر در رتبه‌بندی جستجو

در حالی که مدل‌های تعبیه‌سازی عصبی متراکم در بنچمارک‌های معنایی بدون شات (zero-shot) پیشتاز هستند، الگوریتم‌های سنتی واژگانی با عبور حجم داده‌های جستجو از مرز ۱۰ میلیون توکن، برتری چشمگیری در دقت به دست می‌آورند.

به قلم ساناز امامی

مهندسان سیستم‌های ترکیبی 40%سنت‌گرایان واژگانی 30%طرفداران بازیابی عصبی 30%
مهندسان سیستم‌های ترکیبی
متخصصانی که با وجود پیچیدگی بیشتر، خطوط لوله دوگانه را برای پوشش کامل توزیع پرس‌وجوها مستقر می‌کنند.
سنت‌گرایان واژگانی
مدافعان حفظ معماری‌های پراکنده و مبتنی بر کلمات کلیدی به دلیل سرعت و دقت بی‌نظیر آن‌ها.
طرفداران بازیابی عصبی
حامیان تعبیه‌سازی‌های متراکم که درک معنایی و تطابق مفهومی را در اولویت قرار می‌دهند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • فروشندگان سخت‌افزاری که زیرساخت‌های پردازنده گرافیکی (GPU) مورد نیاز برای اجرای پایگاه‌های داده برداری متراکم در مقیاس بزرگ را می‌فروشند
  • کاربران نهایی که تفاوت‌های تاخیر بین جستجوی واژگانی و عصبی را در برنامه‌های بلادرنگ تجربه می‌کنند

نکات کلیدی

  1. بازیابی برداری متراکم در بنچمارک‌های معنایی مقیاس کوچک، بیش از ۲۵ امتیاز از تطابق واژگانی پیشی می‌گیرد.
  2. الگوریتم BM25 همچنان برتری عظیمی در کارایی دارد و پرس‌وجوها را در چند میلی‌ثانیه پردازش می‌کند، در حالی که بازیابی متراکم هزینه‌های محاسباتی سنگینی دارد.
  3. با عبور حجم داده‌ها از مرز ۱۰ میلیون توکن، BM25 به دلیل نویز معنایی تا ۲۰ امتیاز از مدل‌های متراکم جلو می‌افتد.
  4. سیستم‌های عملیاتی به طور فزاینده‌ای به ترکیب رتبه متقابل (RRF) برای ادغام هر دو روش و به حداکثر رساندن فراخوانی (recall) متکی هستند.

در آوریل ۲۰۲۶، مدل Gemini Embedding 2 امتیاز ۶۷/۷۱ را در جدول امتیازات بنچمارک بازیابی اطلاعات (BEIR) به ثبت رساند. این رقم که با معیار «بهره تجمعی تخفیف‌یافته نرمال‌شده در رتبه ۱۰» (nDCG@10) اندازه‌گیری شده است، سقف فعلی بازیابی برداری متراکم را نشان می‌دهد؛ یک رویکرد عصبی که پرس‌وجوهای انسانی را به فضای ریاضی با ابعاد بالا نگاشت می‌کند. در همان جدول، الگوریتم واژگانی سنتی BM25 با امتیاز ۴۲/۰ با فاصله زیادی در رتبه پایین‌تری قرار دارد.

این فاصله ۲۵ امتیازی در بنچمارک تعبیه‌سازی متن عظیم (MTEB) نشان‌دهنده پیروزی کامل جستجوی معنایی بر تطابق دقیق کلمات کلیدی است. بازیابی متراکم از رمزگذارهای ترانسفورمر برای تبدیل متن به بردارهایی با ۷۶۸ تا ۱۵۳۶ بعد استفاده می‌کند. از آنجا که این روش شباهت کسینوسی بین این بردارها را اندازه‌گیری می‌کند، درک می‌کند کاربری که به دنبال «پزشک» می‌گردد، با سندی درباره «دکتر» راضی خواهد شد، حتی اگر آن رشته متنی دقیق هرگز در متن ظاهر نشود.

در مقابل، BM25 یک روش بازیابی پراکنده است که بر اساس «فراوانی اصطلاح-معکوس فراوانی سند» (TF-IDF) ساخته شده است. این روش به هم‌پوشانی دقیق واژگانی نیاز دارد. اگر کاربری عبارت «تعمیر دوچرخه» را جستجو کند و مجموعه داده فقط شامل عبارت «درست کردن یک دوچرخه» باشد، BM25 هیچ نتیجه‌ای برنمی‌گرداند. با این حال، با وجود این محدودیت سخت‌گیرانه، BM25 همچنان خط پایه اساسی برای تقریباً تمام سیستم‌های جستجوی عملیاتی در جهان باقی مانده است.[1]

مدل‌های بازیابی متراکم در بنچمارک‌های استاندارد معنایی بدون شات پیشتازی قاطعی دارند.

ماندگاری BM25 به روش‌های خاصی برمی‌گردد که در آن‌ها درک معنایی با شکست مواجه می‌شود. مدل‌های بازیابی متراکم روی متون عمومی آموزش دیده‌اند، که این امر آن‌ها را در تفسیر مفاهیم گسترده بسیار توانمند می‌سازد، اما در شناسایی رشته‌های دقیق و نادر به طرز قابل‌توجهی ضعیف عمل می‌کنند. وقتی کاربری به دنبال یک کد خطای خاص مانند «XYZ-1234» یا یک اصطلاح فنی خاص مانند «الگوریتم ضرب کاراتسوبا» می‌گردد، مدل‌های متراکم اغلب نتایجی را برمی‌گردانند که از نظر معنایی نزدیک اما از نظر واقعی نادرست هستند، مانند «XYZ-1235».

یک تحلیل در ماه مه ۲۰۲۶ توسط شرکت مهندسی داده Atlan خاطرنشان می‌کند: «نقاط قوت بازیابی پراکنده، آینه نقاط ضعف بازیابی متراکم است. تطابق دقیق کلمات کلیدی برای نام‌های قانونی، کدهای خطا، شناسه‌های محصول و اصطلاحات فنی به طور دقیقی کار می‌کند.»

یک تحلیل در ماه مه ۲۰۲۶ توسط شرکت مهندسی داده Atlan خاطرنشان می‌کند: «نقاط قوت بازیابی پراکنده، آینه نقاط ضعف بازیابی متراکم است.

سپس مسئله هزینه محاسباتی مطرح است. BM25 به نمایه‌های معکوس متکی است؛ ساختار داده‌ای که به آن اجازه می‌دهد میلیاردها سند را در چند میلی‌ثانیه جستجو کند. هزینه عملیاتی آن بین ۰/۰۱ تا ۰/۱۰ دلار به ازای هر یک میلیون پرس‌وجو است. در مقابل، بازیابی متراکم نیازمند تولید یک تعبیه‌سازی برای هر سند جدید است — فرآیندی که برای هر سند ۵۰ تا ۲۰۰ میلی‌ثانیه طول می‌کشد — و به نمایه‌های «نزدیک‌ترین همسایه تقریبی» (ANN) با مصرف حافظه بالا مانند HNSW یا FAISS نیاز دارد.

با رشد فضای جستجو، این توازن‌ها پیچیده‌تر می‌شوند. یک مطالعه کنترل‌شده در ژوئیه ۲۰۲۶، روش‌های بازیابی را در ۲۸ لایه مجموعه داده تودرتو آزمایش کرد و حجم داده‌ها را با ضریب ۴۵۰ افزایش داد. محققان دریافتند که اگرچه سیستم‌های بازیابی عاملی و متراکم در مجموعه داده‌های کوچک تسلط دارند، اما با بزرگ‌تر شدن حجم داده‌ها، دقت آن‌ها کاهش می‌یابد.

با گسترش فضای جستجو به بیش از ۱۰ میلیون توکن، تطابق واژگانی در دقت از مدل‌های معنایی پیشی می‌گیرد.

به محض اینکه مجموعه داده از مرز ۱۰ میلیون توکن عبور کرد، BM25 از مدل‌های عصبی پیشی گرفت. در بزرگ‌ترین مقیاس آزمایش‌شده، الگوریتم واژگانی سنتی با اختلافی نزدیک به ۲۰ امتیاز، بازیابی متراکم و عامل‌های خودمختار را شکست داد. با افزایش حجم متن، هم‌پوشانی معنایی بین اسناد نامرتبط افزایش می‌یابد و لنگر انداختن روی اصطلاحات دقیق برای فیلتر کردن نویز ضروری می‌شود.

از آنجا که این دو روش در دو انتهای متضاد طیف پرس‌وجو با شکست مواجه می‌شوند، سیستم‌های عملیاتی به طور فزاینده‌ای از انتخاب بین آن‌ها امتناع می‌ورزند. استاندارد فعلی صنعت، بازیابی ترکیبی (هیبریدی) است که هر دو خط لوله را به موازات هم اجرا کرده و نتایج را با استفاده از «ترکیب رتبه متقابل» (RRF) ادغام می‌کند.

الگوریتم RRF یک امتیاز ترکیبی را با استفاده از یک فرمول ریاضی ساده محاسبه می‌کند: معکوس یک عدد ثابت (معمولاً ۶۰) به علاوه رتبه سند در هر سیستم مربوطه. اگر سندی در BM25 رتبه اول و در بازیابی متراکم رتبه دهم را کسب کند، امتیاز ترکیبی آن ۱/۶۱ به علاوه ۱/۷۰ خواهد بود که برابر با ۰/۰۳۱ می‌شود. این ادغام تضمین می‌کند اسنادی که هم در تطابق دقیق و هم در ارتباط معنایی امتیاز بالایی کسب می‌کنند، به صدر نتایج بیایند.

ترکیب رتبه متقابل (RRF) به صورت ریاضی نقاط قوت هر دو روش بازیابی را متعادل می‌کند.

نتایج تجربی این رویکرد دوگانه قطعی است. در وظایف فراخوانی MS MARCO، ادغام وزن‌دار بازیابی متراکم و پراکنده، میزان فراخوانی را در مقایسه با رویکردهای تک‌روشی تا ۵۸۰ درصد بهبود می‌بخشد. برای رسیدن به آستانه فراخوانی ۰/۹۸ در ۱۰۰۰ نتیجه اول (recall@1,000)، وجود هر دو خط لوله کاملاً ضروری است؛ نه BM25 و نه بازیابی متراکم به تنهایی نمی‌توانند به این سطح از پوشش دست یابند.

چرا مهم است

انتخاب اشتباه الگوریتم بازیابی می‌تواند هزینه‌های زیرساخت را تا ۱۰۰ برابر افزایش دهد یا باعث از کار افتادن کامل یک برنامه کاربردی در پرس‌وجوهای تطابق دقیق شود. درک اینکه جستجوی معنایی در کجا با شکست مواجه می‌شود، به مهندسان اجازه می‌دهد تا خطوط لوله داده سریع‌تر و دقیق‌تری بسازند.

بررسی عمیق دیدگاه‌ها

BM25 (بازیابی واژگانی پراکنده)

رویکرد آماری سنتی که بر هم‌پوشانی دقیق کلمات کلیدی تکیه دارد.

**مزایا:** دقت بی‌نظیر در شناسه‌های دقیق، تاخیر چند میلی‌ثانیه‌ای و استفاده بسیار کارآمد از حافظه از طریق نمایه‌های معکوس. **معایب:** کاملاً نسبت به نیت معنایی نابینا است؛ زمانی که دایره واژگان کاربر با سند متفاوت باشد، با شکست مواجه می‌شود. **شواهد:** هزینه آن بین ۰/۰۱ تا ۰/۱۰ دلار به ازای هر میلیون پرس‌وجو است و زمانی که حجم داده‌ها از ۱۰ میلیون توکن فراتر می‌رود، برتری ۲۰ امتیازی در دقت نسبت به مدل‌های متراکم به دست می‌آورد. **مناسب برای زمانی که:** فضای جستجو عظیم است، محدودیت‌های تاخیر سخت‌گیرانه هستند و پرس‌وجوها شامل نام‌های دقیق، کدهای خطا یا شناسه‌های کالا (SKU) می‌شوند. **نامناسب برای زمانی که:** کاربران بر اساس مفاهیم گسترده، سوالات یا توضیحات جستجو می‌کنند.

بازیابی برداری متراکم

مدل‌های عصبی که متن را به فضای معنایی با ابعاد بالا نگاشت می‌کنند.

**مزایا:** درک عمیق بافتی، مصونیت در برابر عدم تطابق واژگان و عملکرد برتر در سوالات زبان طبیعی. **معایب:** بار محاسباتی بالا، عملکرد ضعیف در تطابق دقیق رشته‌ها و تمایل به بازیابی نتایج مرتبط از نظر معنایی اما نادرست از نظر واقعی. **شواهد:** دستیابی به امتیاز ۶۷/۷۱ در nDCG@10 در بنچمارک BEIR و پیشی گرفتن از BM25 با بیش از ۲۵ امتیاز در مجموعه داده‌های کوچک تا متوسط، اما نیازمند ۵۰ تا ۲۰۰ میلی‌ثانیه زمان به ازای هر سند برای تولید تعبیه‌سازی است. **مناسب برای زمانی که:** مجموعه داده از نظر معنایی همگن است، پرس‌وجوها محاوره‌ای هستند و بودجه زیرساخت می‌تواند از پایگاه‌های داده برداری پشتیبانی کند. **نامناسب برای زمانی که:** سیستم باید کدهای الفبایی-عددی خاصی را بازیابی کند یا تحت محدودیت‌های سخت‌گیرانه تاخیر زیر ۵۰ میلی‌ثانیه عمل کند.

جستجوی ترکیبی (ترکیب رتبه متقابل)

استقرار موازی هر دو خط لوله واژگانی و معنایی.

**مزایا:** کل توزیع پرس‌وجوها را با گرفتن همزمان تطابق‌های دقیق و نیت معنایی پوشش می‌دهد و به بالاترین میزان فراخوانی کلی دست می‌یابد. **معایب:** پیچیدگی زیرساخت را دو برابر می‌کند، نیازمند تنظیم وزن‌های ادغام است و حداقل تاخیر خط لوله کندتر متراکم را به ارث می‌برد. **شواهد:** فراخوانی را در وظایف MS MARCO تا ۵۸۰ درصد در مقایسه با رویکردهای تک‌روشی بهبود می‌بخشد و تنها پیکربندی قادر به رسیدن به آستانه ۰/۹۸ در recall@1,000 است. **مناسب برای زمانی که:** در حال ساخت سیستم‌های تولید افزوده با بازیابی (RAG) در سطح عملیاتی هستید که در آن‌ها از دست دادن یک سند مرتبط پرهزینه‌تر از بار محاسباتی است. **نامناسب برای زمانی که:** در حال نمونه‌سازی برنامه‌های اولیه هستید یا روی سخت‌افزار موبایل با محدودیت‌های شدید کار می‌کنید.

منابع

پوشش منابع

2 منبع

3 دیدگاه شناسایی‌شده

مهندسان سیستم‌های ترکیبی 40%سنت‌گرایان واژگانی 30%طرفداران بازیابی عصبی 30%
  1. [1]arXivطرفداران بازیابی عصبی

    BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models

    مطالعه در arXiv
  2. [2]Factlen Editorial Team

    Synthesis by Factlen editorial team

    مطالعه در Factlen Editorial Team

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.