مقایسه BM25 و بازیابی متراکم: توازن بین دقت و تاخیر در رتبهبندی جستجو
در حالی که مدلهای تعبیهسازی عصبی متراکم در بنچمارکهای معنایی بدون شات (zero-shot) پیشتاز هستند، الگوریتمهای سنتی واژگانی با عبور حجم دادههای جستجو از مرز ۱۰ میلیون توکن، برتری چشمگیری در دقت به دست میآورند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- مهندسان سیستمهای ترکیبی
- متخصصانی که با وجود پیچیدگی بیشتر، خطوط لوله دوگانه را برای پوشش کامل توزیع پرسوجوها مستقر میکنند.
- سنتگرایان واژگانی
- مدافعان حفظ معماریهای پراکنده و مبتنی بر کلمات کلیدی به دلیل سرعت و دقت بینظیر آنها.
- طرفداران بازیابی عصبی
- حامیان تعبیهسازیهای متراکم که درک معنایی و تطابق مفهومی را در اولویت قرار میدهند.
دیدگاههایی که این گزارش پوشش نداده
- فروشندگان سختافزاری که زیرساختهای پردازنده گرافیکی (GPU) مورد نیاز برای اجرای پایگاههای داده برداری متراکم در مقیاس بزرگ را میفروشند
- کاربران نهایی که تفاوتهای تاخیر بین جستجوی واژگانی و عصبی را در برنامههای بلادرنگ تجربه میکنند
نکات کلیدی
- بازیابی برداری متراکم در بنچمارکهای معنایی مقیاس کوچک، بیش از ۲۵ امتیاز از تطابق واژگانی پیشی میگیرد.
- الگوریتم BM25 همچنان برتری عظیمی در کارایی دارد و پرسوجوها را در چند میلیثانیه پردازش میکند، در حالی که بازیابی متراکم هزینههای محاسباتی سنگینی دارد.
- با عبور حجم دادهها از مرز ۱۰ میلیون توکن، BM25 به دلیل نویز معنایی تا ۲۰ امتیاز از مدلهای متراکم جلو میافتد.
- سیستمهای عملیاتی به طور فزایندهای به ترکیب رتبه متقابل (RRF) برای ادغام هر دو روش و به حداکثر رساندن فراخوانی (recall) متکی هستند.
در آوریل ۲۰۲۶، مدل Gemini Embedding 2 امتیاز ۶۷/۷۱ را در جدول امتیازات بنچمارک بازیابی اطلاعات (BEIR) به ثبت رساند. این رقم که با معیار «بهره تجمعی تخفیفیافته نرمالشده در رتبه ۱۰» (nDCG@10) اندازهگیری شده است، سقف فعلی بازیابی برداری متراکم را نشان میدهد؛ یک رویکرد عصبی که پرسوجوهای انسانی را به فضای ریاضی با ابعاد بالا نگاشت میکند. در همان جدول، الگوریتم واژگانی سنتی BM25 با امتیاز ۴۲/۰ با فاصله زیادی در رتبه پایینتری قرار دارد.
این فاصله ۲۵ امتیازی در بنچمارک تعبیهسازی متن عظیم (MTEB) نشاندهنده پیروزی کامل جستجوی معنایی بر تطابق دقیق کلمات کلیدی است. بازیابی متراکم از رمزگذارهای ترانسفورمر برای تبدیل متن به بردارهایی با ۷۶۸ تا ۱۵۳۶ بعد استفاده میکند. از آنجا که این روش شباهت کسینوسی بین این بردارها را اندازهگیری میکند، درک میکند کاربری که به دنبال «پزشک» میگردد، با سندی درباره «دکتر» راضی خواهد شد، حتی اگر آن رشته متنی دقیق هرگز در متن ظاهر نشود.
در مقابل، BM25 یک روش بازیابی پراکنده است که بر اساس «فراوانی اصطلاح-معکوس فراوانی سند» (TF-IDF) ساخته شده است. این روش به همپوشانی دقیق واژگانی نیاز دارد. اگر کاربری عبارت «تعمیر دوچرخه» را جستجو کند و مجموعه داده فقط شامل عبارت «درست کردن یک دوچرخه» باشد، BM25 هیچ نتیجهای برنمیگرداند. با این حال، با وجود این محدودیت سختگیرانه، BM25 همچنان خط پایه اساسی برای تقریباً تمام سیستمهای جستجوی عملیاتی در جهان باقی مانده است.[1]
ماندگاری BM25 به روشهای خاصی برمیگردد که در آنها درک معنایی با شکست مواجه میشود. مدلهای بازیابی متراکم روی متون عمومی آموزش دیدهاند، که این امر آنها را در تفسیر مفاهیم گسترده بسیار توانمند میسازد، اما در شناسایی رشتههای دقیق و نادر به طرز قابلتوجهی ضعیف عمل میکنند. وقتی کاربری به دنبال یک کد خطای خاص مانند «XYZ-1234» یا یک اصطلاح فنی خاص مانند «الگوریتم ضرب کاراتسوبا» میگردد، مدلهای متراکم اغلب نتایجی را برمیگردانند که از نظر معنایی نزدیک اما از نظر واقعی نادرست هستند، مانند «XYZ-1235».
یک تحلیل در ماه مه ۲۰۲۶ توسط شرکت مهندسی داده Atlan خاطرنشان میکند: «نقاط قوت بازیابی پراکنده، آینه نقاط ضعف بازیابی متراکم است. تطابق دقیق کلمات کلیدی برای نامهای قانونی، کدهای خطا، شناسههای محصول و اصطلاحات فنی به طور دقیقی کار میکند.»
یک تحلیل در ماه مه ۲۰۲۶ توسط شرکت مهندسی داده Atlan خاطرنشان میکند: «نقاط قوت بازیابی پراکنده، آینه نقاط ضعف بازیابی متراکم است.
سپس مسئله هزینه محاسباتی مطرح است. BM25 به نمایههای معکوس متکی است؛ ساختار دادهای که به آن اجازه میدهد میلیاردها سند را در چند میلیثانیه جستجو کند. هزینه عملیاتی آن بین ۰/۰۱ تا ۰/۱۰ دلار به ازای هر یک میلیون پرسوجو است. در مقابل، بازیابی متراکم نیازمند تولید یک تعبیهسازی برای هر سند جدید است — فرآیندی که برای هر سند ۵۰ تا ۲۰۰ میلیثانیه طول میکشد — و به نمایههای «نزدیکترین همسایه تقریبی» (ANN) با مصرف حافظه بالا مانند HNSW یا FAISS نیاز دارد.
با رشد فضای جستجو، این توازنها پیچیدهتر میشوند. یک مطالعه کنترلشده در ژوئیه ۲۰۲۶، روشهای بازیابی را در ۲۸ لایه مجموعه داده تودرتو آزمایش کرد و حجم دادهها را با ضریب ۴۵۰ افزایش داد. محققان دریافتند که اگرچه سیستمهای بازیابی عاملی و متراکم در مجموعه دادههای کوچک تسلط دارند، اما با بزرگتر شدن حجم دادهها، دقت آنها کاهش مییابد.
به محض اینکه مجموعه داده از مرز ۱۰ میلیون توکن عبور کرد، BM25 از مدلهای عصبی پیشی گرفت. در بزرگترین مقیاس آزمایششده، الگوریتم واژگانی سنتی با اختلافی نزدیک به ۲۰ امتیاز، بازیابی متراکم و عاملهای خودمختار را شکست داد. با افزایش حجم متن، همپوشانی معنایی بین اسناد نامرتبط افزایش مییابد و لنگر انداختن روی اصطلاحات دقیق برای فیلتر کردن نویز ضروری میشود.
از آنجا که این دو روش در دو انتهای متضاد طیف پرسوجو با شکست مواجه میشوند، سیستمهای عملیاتی به طور فزایندهای از انتخاب بین آنها امتناع میورزند. استاندارد فعلی صنعت، بازیابی ترکیبی (هیبریدی) است که هر دو خط لوله را به موازات هم اجرا کرده و نتایج را با استفاده از «ترکیب رتبه متقابل» (RRF) ادغام میکند.
الگوریتم RRF یک امتیاز ترکیبی را با استفاده از یک فرمول ریاضی ساده محاسبه میکند: معکوس یک عدد ثابت (معمولاً ۶۰) به علاوه رتبه سند در هر سیستم مربوطه. اگر سندی در BM25 رتبه اول و در بازیابی متراکم رتبه دهم را کسب کند، امتیاز ترکیبی آن ۱/۶۱ به علاوه ۱/۷۰ خواهد بود که برابر با ۰/۰۳۱ میشود. این ادغام تضمین میکند اسنادی که هم در تطابق دقیق و هم در ارتباط معنایی امتیاز بالایی کسب میکنند، به صدر نتایج بیایند.
نتایج تجربی این رویکرد دوگانه قطعی است. در وظایف فراخوانی MS MARCO، ادغام وزندار بازیابی متراکم و پراکنده، میزان فراخوانی را در مقایسه با رویکردهای تکروشی تا ۵۸۰ درصد بهبود میبخشد. برای رسیدن به آستانه فراخوانی ۰/۹۸ در ۱۰۰۰ نتیجه اول (recall@1,000)، وجود هر دو خط لوله کاملاً ضروری است؛ نه BM25 و نه بازیابی متراکم به تنهایی نمیتوانند به این سطح از پوشش دست یابند.
چرا مهم است
انتخاب اشتباه الگوریتم بازیابی میتواند هزینههای زیرساخت را تا ۱۰۰ برابر افزایش دهد یا باعث از کار افتادن کامل یک برنامه کاربردی در پرسوجوهای تطابق دقیق شود. درک اینکه جستجوی معنایی در کجا با شکست مواجه میشود، به مهندسان اجازه میدهد تا خطوط لوله داده سریعتر و دقیقتری بسازند.
بررسی عمیق دیدگاهها
BM25 (بازیابی واژگانی پراکنده)
رویکرد آماری سنتی که بر همپوشانی دقیق کلمات کلیدی تکیه دارد.
**مزایا:** دقت بینظیر در شناسههای دقیق، تاخیر چند میلیثانیهای و استفاده بسیار کارآمد از حافظه از طریق نمایههای معکوس. **معایب:** کاملاً نسبت به نیت معنایی نابینا است؛ زمانی که دایره واژگان کاربر با سند متفاوت باشد، با شکست مواجه میشود. **شواهد:** هزینه آن بین ۰/۰۱ تا ۰/۱۰ دلار به ازای هر میلیون پرسوجو است و زمانی که حجم دادهها از ۱۰ میلیون توکن فراتر میرود، برتری ۲۰ امتیازی در دقت نسبت به مدلهای متراکم به دست میآورد. **مناسب برای زمانی که:** فضای جستجو عظیم است، محدودیتهای تاخیر سختگیرانه هستند و پرسوجوها شامل نامهای دقیق، کدهای خطا یا شناسههای کالا (SKU) میشوند. **نامناسب برای زمانی که:** کاربران بر اساس مفاهیم گسترده، سوالات یا توضیحات جستجو میکنند.
بازیابی برداری متراکم
مدلهای عصبی که متن را به فضای معنایی با ابعاد بالا نگاشت میکنند.
**مزایا:** درک عمیق بافتی، مصونیت در برابر عدم تطابق واژگان و عملکرد برتر در سوالات زبان طبیعی. **معایب:** بار محاسباتی بالا، عملکرد ضعیف در تطابق دقیق رشتهها و تمایل به بازیابی نتایج مرتبط از نظر معنایی اما نادرست از نظر واقعی. **شواهد:** دستیابی به امتیاز ۶۷/۷۱ در nDCG@10 در بنچمارک BEIR و پیشی گرفتن از BM25 با بیش از ۲۵ امتیاز در مجموعه دادههای کوچک تا متوسط، اما نیازمند ۵۰ تا ۲۰۰ میلیثانیه زمان به ازای هر سند برای تولید تعبیهسازی است. **مناسب برای زمانی که:** مجموعه داده از نظر معنایی همگن است، پرسوجوها محاورهای هستند و بودجه زیرساخت میتواند از پایگاههای داده برداری پشتیبانی کند. **نامناسب برای زمانی که:** سیستم باید کدهای الفبایی-عددی خاصی را بازیابی کند یا تحت محدودیتهای سختگیرانه تاخیر زیر ۵۰ میلیثانیه عمل کند.
جستجوی ترکیبی (ترکیب رتبه متقابل)
استقرار موازی هر دو خط لوله واژگانی و معنایی.
**مزایا:** کل توزیع پرسوجوها را با گرفتن همزمان تطابقهای دقیق و نیت معنایی پوشش میدهد و به بالاترین میزان فراخوانی کلی دست مییابد. **معایب:** پیچیدگی زیرساخت را دو برابر میکند، نیازمند تنظیم وزنهای ادغام است و حداقل تاخیر خط لوله کندتر متراکم را به ارث میبرد. **شواهد:** فراخوانی را در وظایف MS MARCO تا ۵۸۰ درصد در مقایسه با رویکردهای تکروشی بهبود میبخشد و تنها پیکربندی قادر به رسیدن به آستانه ۰/۹۸ در recall@1,000 است. **مناسب برای زمانی که:** در حال ساخت سیستمهای تولید افزوده با بازیابی (RAG) در سطح عملیاتی هستید که در آنها از دست دادن یک سند مرتبط پرهزینهتر از بار محاسباتی است. **نامناسب برای زمانی که:** در حال نمونهسازی برنامههای اولیه هستید یا روی سختافزار موبایل با محدودیتهای شدید کار میکنید.
منابع
[1]arXivطرفداران بازیابی عصبیBEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models
مطالعه در arXiv →
[2]Factlen Editorial TeamSynthesis by Factlen editorial team
مطالعه در Factlen Editorial Team →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



