نفرین ابعاد: چرا فاصله اقلیدسی در پایگاههای داده برداری با ابعاد بالا در هم میشکند؟
با گسترش مدلهای امبدینگ هوش مصنوعی به هزاران بعد، محاسبات استاندارد فاصله هندسی عملا از کار میافتند. پایگاههای داده برداری در محیط عملیاتی مجبورند برای جلوگیری از فروپاشی دقت جستجو، اندازهگیریهای خط مستقیم را کنار بگذارند و به شباهت زاویهای روی بیاورند.
به قلم غزل بختیاری
این خبر را به اشتراک بگذارید
- دانشمندان علوم کامپیوتر نظری
- بر محدودیتهای ریاضیاتی هندسه در ابعاد بالا و اثباتهای بنیادینی که الگوریتمهای جستجو را محدود میکنند، تمرکز دارد.
- مهندسان کاربردی یادگیری ماشین
- راهکارهای عملی مانند شباهت کسینوسی و الگوریتمهای نزدیکترین همسایه تقریبی را برای ساخت سیستمهای کارآمد در اولویت قرار میدهد.
- ارائهدهندگان زیرساخت پایگاه داده
- بر سختافزار، هزینههای حافظه و بار پردازشی مورد نیاز برای مقیاسپذیری جستجوی برداری در محیطهای سازمانی تمرکز دارد.
چرا مهم است
هر سازمانی که از تولید تقویتشده با بازیابی (RAG) استفاده میکند، برای تغذیه دادههای دقیق به مدلهای زبانی به این محاسبات فاصله وابسته است. درک اینکه چرا معیارهای استاندارد شکست میخورند، نشان میدهد که چرا مقیاسپذیری این سیستمها به افزایش تصاعدی حافظه و توان پردازشی نیاز دارد.
دقت یک سیستم بازیابی هوش مصنوعی مدرن، تماماً در مرحله محاسبه فاصله تعیین میشود؛ همان گام ریاضیاتی که در آن یک پایگاه داده، فضای بین پرامپت کاربر و هزاران سند ذخیرهشده را اندازهگیری میکند. همین یک عملیات ساده مشخص میکند که آیا ابزار جستجوی سازمانی دقیقاً همان گزارش مالی درست را بالا میآورد یا یک پاسخ کاملاً نامربوط را توهم میزند. با این حال، در شرایطی که صنعت با عجله به سمت استقرار پایگاههای داده برداری عظیم برای قدرت بخشیدن به سیستمهای تولید تقویتشده با بازیابی (RAG) هجوم میآورد، هندسه زیربنایی این سیستمها در حال برخورد با یک دیوار ریاضیاتی است که به عنوان «نفرین ابعاد» شناخته میشود.[4]
بروشورهای بازاریابی پایگاههای داده برداری سازمانی، مرتباً وعده «درک معنایی» و «مقیاس بینهایت» را میدهند و طوری القا میکنند که گویی این سیستمها متن را دقیقاً مثل انسانها میفهمند. اما واقعیتی که در محیط عملیاتی تحویل داده شده بسیار سادهتر است: آنها صرفاً متن را به لیستی از اعداد به نام امبدینگ تبدیل کرده و فاصله بین آنها را محاسبه میکنند. با این حال، هرچه مدلها پیچیدهتر میشوند، مفاهیم را با استفاده از صدها یا هزاران بعد نشان میدهند. در این فضاهای اَبَر-بُعدی، شهود هندسی استاندارد ما کاملاً از کار میافتد.[3]
این فروپاشی به دلیل نحوه گسترش حجم در ابعاد بالا رخ میدهد. در یک اتاق استاندارد سهبعدی، یک نقطه میتواند به وضوح نزدیک به مرکز یا در گوشهای دورافتاده باشد. اما در یک فضای ۷۶۸ بعدی که خروجی پیشفرض بسیاری از مدلهای امبدینگ استاندارد است، حجم «گوشهها» چنان به شکل تصاعدی منبسط میشود که تقریباً تمام نقاط داده به پوسته بیرونی فضا رانده میشوند. وقتی هر نقطه روی لبهی انتهایی قرار میگیرد، فاصله بین هر دو نقطه تصادفی تقریباً یکسان میشود.[1][4]
شواهد بنیادین برای این پدیده در مقالهای در سال ۲۰۰۱ توسط پژوهشگران مرکز تحقیقاتی IBM T.J. Watson تثبیت شد. آنها ثابت کردند که با افزایش ابعاد، فاصله تا نزدیکترین همسایه و فاصله تا دورترین همسایه به هم همگرا میشوند. این پژوهشگران نشان دادند که نسبت تباین، یعنی همان تفاوت ریاضیاتی که به یک الگوریتم جستجو اجازه میدهد یک تطابق «خوب» را از یک تطابق «بد» تشخیص دهد، به صفر نزدیک میشود. همانطور که در این مقاله آمده است: «تحت شرایط کلی خاصی... فاصله تا نزدیکترین نقطه داده به فاصله تا دورترین نقطه داده میل میکند.»[1]
شواهد بنیادین برای این پدیده در مقالهای در سال ۲۰۰۱ توسط پژوهشگران مرکز تحقیقاتی IBM T.J.
با اعمال فرمول نسبت تباین پژوهشگران IBM روی امبدینگهای ۷۶۸ بعدی که توسط مدلهای تجاری مدرن استفاده میشوند، ابعاد واقعی این مشکل روشن میشود. در چنین سطحی از ابعاد، تفاوت ریاضی بین نزدیکترین تطابق معنایی ممکن و یک سند کاملاً تصادفی، به کمتر از ۰٫۰۵ درصد کاهش مییابد. اگر یک پایگاه داده بخواهد به فاصله استاندارد اقلیدسی، یعنی اندازهگیری شکاف خط مستقیم بین دو نقطه، تکیه کند، در واقع دارد حدس میزند؛ چرا که به نظر میرسد فاصله هر سند تا پرامپت کاربر کاملاً برابر است.[4]
به همین دلیل است که پایگاههای داده برداری در سطح عملیاتی، در واقعیت از فاصله خط مستقیم استفاده نمیکنند. در عوض، آنها به شباهت کسینوسی متکی هستند. شباهت کسینوسی به جای اندازهگیری فاصله دو نقطه در فضا، زاویه بین خطوطی که آن نقاط را به مبدأ متصل میکنند، اندازه میگیرد. اگر دو بردار دقیقاً در یک جهت باشند، شباهت کسینوسی آنها ۱ خواهد بود، فارغ از اینکه چقدر روی پوسته بیرونی دور باشند. مستندات مهندسی Pinecone اشاره میکند که «شباهت کسینوسی اغلب زمانی ترجیح داده میشود که بزرگی بردارها اهمیتی نداشته باشد و فقط جهت آنها مهم باشد.»[3]
با این حال، شباهت کسینوسی صرفاً یک راهکار موقت است، نه یک درمان قطعی. مستندات Scikit-learn صراحتاً هشدار میدهد که جستجوهای نزدیکترین همسایه در ابعاد بالا، از افت شدید عملکرد رنج میبرند. توسعهدهندگان این کتابخانه خاطرنشان میکنند که «با افزایش تعداد ویژگیها، تعداد نمونههای مورد نیاز برای تعمیم دقیق به صورت تصاعدی رشد میکند»؛ مسئلهای که الگوریتمها را مجبور میکند به جای محدود کردن کارآمد فضای جستجو، تقریباً هر نقطه در پایگاه داده را بررسی کنند.[2]
این افت عملکرد، سیستمهای سازمانی را مجبور میکند تا از الگوریتمهای نزدیکترین همسایه تقریبی (ANN) استفاده کنند؛ الگوریتمهایی که با نادیده گرفتن عمدی بخشهایی از پایگاه داده، دقت مطلق را فدای سرعت میکنند. یک بردار استاندارد float32 برای هر بعد ۴ بایت فضا میگیرد، به این معنی که یک امبدینگ ۷۶۸ بعدی به تنهایی ۳۰۷۲ بایت حافظه مصرف میکند. Pinecone گزارش میدهد که ایندکس کردن ۱ میلیارد بردار در این مقیاس، تقریباً به ۳ ترابایت رم نیاز دارد که ردپای زیرساختی عظیمی را صرفاً برای نگهداشتن مختصات در حافظه فعال ایجاد میکند.[3]
در شرایطی که شرکتها به سمت مدلهای بزرگتر حرکت میکنند، مانند text-embedding-3-large از OpenAI که خروجی ۳۰۷۲ بعدی دارد، هزینه محاسباتی برای محاسبه این زوایا در میان میلیاردها سند، به صورت خطی با ابعاد افزایش مییابد. سختافزار مورد نیاز برای حفظ زمان جستجوی زیر یک ثانیه به سرعت در حال رشد است. نقطه عطف قابلراستیآزمایی بعدی برای این صنعت، این خواهد بود که آیا کوانتیزاسیون باینری، یعنی فشردهسازی این بردارهای عظیم به رشتههای سادهای از صفر و یک، میتواند محاسبات زاویهای را بدون از بین بردن دقت معنایی که در وهله اول سیستم را کاربردی میکند، حفظ کند یا خیر.[4]
آنچه نمیدانیم
- آیا تکنیکهای کوانتیزاسیون باینری میتوانند بردارهای ۳۰۰۰ بعدی را بدون از بین بردن روابط زاویهای مورد نیاز برای بازیابی دقیق، فشرده کنند یا خیر.
- درجه دقیق خوشهبندی دادههای معنایی دنیای واقعی در منیفولدهای با ابعاد پایینتر که تا حدی نفرین نظری ابعاد را کاهش میدهد.
منابع
[1]Springerدانشمندان علوم کامپیوتر نظریOn the Surprising Behavior of Distance Metrics in High Dimensional Space
مطالعه در Springer →
[2]Scikit-learnمهندسان کاربردی یادگیری ماشین1.6. Nearest Neighbors
مطالعه در Scikit-learn →
[3]Pineconeارائهدهندگان زیرساخت پایگاه دادهVector Similarity Explained
مطالعه در Pinecone →
[4]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در فناوری
مشاهده همه →فناوری باتری
باتریهای خودروی الکتریکی LFP در برابر NMC: سبکسنگین کردن مسافت، عمر و هزینه
7 منبع
مهندسی آکوستیک
محدودیت تاخیر: چرا حذف فعال نویز نمیتواند فرکانسهای بالا را ساکت کند
4 منبع
پیچیدگی مدل
موازنه سوگیری-واریانس: چرا مدلهای ساده دچار کمبرازش و مدلهای پیچیده دچار بیشبرازش میشوند
7 منبع
زیرساخت اینترنت
کالبدشکافی اینترنت زیردریایی: نور واقعاً چگونه هزاران کیلومتر زیر اقیانوس بدون خاموش شدن سفر میکند؟
4 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





