مرحله تولید کاندیدا: فیدهای شبکههای اجتماعی چگونه میلیاردها پست را در چند میلیثانیه به صدها مورد کاهش میدهند؟
پیش از آنکه مدلهای پیچیده هوش مصنوعی فید شبکههای اجتماعی را رتبهبندی کنند، یک لایه بازیابی سبکوزن، ۹۹.۹ درصد از پستهای موجود را در کمتر از ۱۰۰ میلیثانیه دور میریزد. این مرحله که «تولید کاندیدا» نام دارد، با فدا کردن شخصیسازی عمیق در ازای سرعت پردازش خام، دقیقاً تعیین میکند که کاربران در نهایت چه چیزی را ببینند.
به قلم غزل بختیاری
این خبر را به اشتراک بگذارید
- مهندسان پلتفرم
- استدلال میکنند که بودجههای تأخیر سختگیرانه، استفاده از تولید کاندیدای سبکوزن را برای پاسخگو و آنلاین نگهداشتن سیستمها ضروری میسازد.
- پژوهشگران انصاف الگوریتمی
- بر این باورند که فیلترینگ در مراحل اولیه، سوگیری تاریخی را در سیستم نهادینه میکند که مدلهای رتبهبندیِ مراحل بعدی قادر به اصلاح آن نیستند.
- معماران زیرساخت
- بر محدودیتهای سختافزاری و حافظه تمرکز دارند که میزان هوشمندی قابلتزریق به لایه بازیابی را محدود میکند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان مستقل محتوا
- کاربران نهایی
مهندسان پلتفرمها استدلال میکنند که فیلتر کردن میلیاردها پست روزانه و رساندن آن به چند صد مورد در کمتر از ۱۰۰ میلیثانیه، نیازمند الگوریتمهای اکتشافی (heuristics) بیرحمانه و سبکی است که برای سرپا نگهداشتن سیستم، تعاملات گذشته کاربر را در اولویت قرار میدهند. در نقطه مقابل، پژوهشگران حوزه انصاف الگوریتمی بر این باورند که دقیقاً همین مرحله بازیابیِ بهینهشده برای سرعت، جهانبینی کاربر را برای همیشه محدود میکند و پیش از آنکه مدلهای رتبهبندیِ بهشدت تحتنظارت اصلاً محتوا را ببینند، سوگیری دادهها را در سیستم نهادینه میکند.[7]
مرکز این تنش، مرحلهای از یادگیری ماشین است که با نام «تولید کاندیدا» (candidate generation) شناخته میشود. وقتی کاربری اپلیکیشنی مانند اینستاگرام یا تیکتاک را باز میکند، پلتفرم تکتک محتواهای موجود را ارزیابی نمیکند. در عوض، یک لایه سریع و از نظر محاسباتی ارزان، مانند یک قیف عمل کرده و بیش از ۹۹.۹ درصد از موجودی محتوا را در لحظه دور میریزد.[5]
در حالی که بحثهای عمومی معمولاً روی الگوریتمهای سنگین رتبهبندی که فید نهایی را مرتب میکنند متمرکز است، این مدلها در واقع فقط به ۵۰۰ تا ۱۰۰۰ پستی امتیاز میدهند که از این فیلتر اولیه جان سالم به در بردهاند. مرحله تولید کاندیدا دقیقاً همان جایی است که مرزهای واقعی محیط دیجیتال یک کاربر، کاملاً در پشت صحنه، ترسیم میشود.[5]
برای درک ابعاد ماجرا، معماری تیکتاک را در نظر بگیرید. این پلتفرم روزانه میلیونها ویدیوی جدید دریافت میکند. بر اساس تحلیل معماری منتشرشده در سال ۲۰۲۳ توسط خبرنامه AiEdge، سیستم توصیهگر تیکتاک بر یک رویکرد چندقیفی متکی است که در آن، لایه اول به جای تحلیل عمیق ویدیو، صرفاً بر فیلترسازی مشارکتی (collaborative filtering) و برچسبهای کاربر تکیه دارد.[4]
این لایه اولیه باید در چارچوب یک «بودجه تأخیر» (latency budget) بسیار سختگیرانه عمل کند. اگر فرایند بازیابی بیش از چند صد میلیثانیه طول بکشد، کاربر با کندی مواجه شده و اپلیکیشن را میبندد. در نتیجه، سیستم برای یافتن خوشههای محتوایی مشابه با آنچه کاربر قبلاً پسندیده، از جستجوهای «نزدیکترین همسایه تقریبی» (ANN) استفاده میکند و دقت را فدای سرعت خام میکند.[4]
تیم مهندسی توییتر در مقاله پیشچاپ سال ۲۰۲۳ خود درباره چارچوب TwERC (بازیابی گروهی کاندیداها در توییتر)، دقیقاً به همین بدهبستان اشاره کرده است. این سیستم برای مدیریت توصیه تبلیغات از طریق ترکیب چند مدل سبکوزن طراحی شده بود تا اطمینان حاصل شود که استخر کاندیداها بدون تجاوز از محدودیتهای زمانی سختگیرانه در مزایدههای درنگدرنگ (real-time bidding) ایجاد میشود.[1]
معماری توییتر با استفاده از این الگوریتمهای اکتشافیِ ترکیبی، توانست حجم عظیمی از درخواستها را پردازش کند، اما ذاتاً کاندیداهایی را که با الگوهای تاریخی تثبیتشده مطابقت داشتند، به محتوای جدید یا خاص (niche) ترجیح میداد. این سیستم، حفظ توان عملیاتی (throughput) را بر ارتباط معنایی عمیق ارجح میدانست.[1]
این سیستم، حفظ توان عملیاتی (throughput) را بر ارتباط معنایی عمیق ارجح میدانست.
این اتکا به الگوهای تاریخی، آسیبپذیری اصلی مرحله بازیابی را رقم میزند: سوگیری مجموعه داده. مطالعهای در سال ۲۰۲۱ توسط پژوهشگران توییتر روی تولید کاندیدای مبتنی بر مدل نشان داد که چون این مدلهای سبکوزن بر اساس تعاملات گذشته کاربران آموزش میبینند، بهطور نامتناسبی مواردی را بازیابی میکنند که از قبل محبوب بودهاند یا بهشدت پروموت شدهاند.[3]
این پژوهشگران دریافتند که اگر کاندیداهای متنوع از همان ابتدا بازیابی نشوند، رفع این سوگیری در مرحله رتبهبندی از نظر ریاضی غیرممکن است. اگر تولیدکننده کاندیدا فقط پستهای وایرال را به مرحله بعد بفرستد، پیشرفتهترین الگوریتم رتبهبندی جهان هم تنها میتواند بهترینها را از میان یک نمونه سوگیرانه انتخاب کند.[3]
اینستاگرام نیز با واقعیت معماری مشابهی روبهرو است. تحلیل دسامبر ۲۰۲۵ توسط Brainforge درباره نحوه استفاده اینستاگرام از هوش مصنوعی برای رتبهبندی فیدها، نشان داد که این پلتفرم در واقع چندین خط لوله (pipeline) مجزا برای تولید کاندیدا را بهطور همزمان اجرا میکند؛ یکی برای حسابهایی که کاربر دنبال میکند، یکی برای هشتگهایی که با آنها تعامل دارد و دیگری برای کشف پیشبینانه.[2]
این خطوط لوله موازی تلاش میکنند پیش از آنکه مدل سنگین رتبهبندی وارد عمل شود، تنوع را به استخر کاندیداها تزریق کنند. سیستم اینستاگرام با استخراج ۱۰۰ پست از حسابهای دنبالشده و ۱۰۰ پست از خوشههای اکتشافی، الگوریتم رتبهبندی نهایی را مجبور میکند تا یک دسته ترکیبی را ارزیابی کند و از این طریق، بخشی از اثرات اتاق پژواک (echo-chamber) که ذاتِ فیلترسازی مشارکتیِ خالص است را کاهش دهد.[2]
با این حال، مکانیک زیربنایی همچنان در بند محدودیت ۱۰۰ میلیثانیهای گرفتار است. تحلیل سال ۲۰۲۰ لی هان چانگ (Lee Han Chung)، مهندس نرمافزار، از الگوریتم تیکتاک نشان داد که موفقیت اولیه این پلتفرم ناشی از سیستم برچسبگذاری تهاجمی آن بود؛ سیستمی که به تولیدکننده کاندیدا اجازه میداد پروفایل کاربران را تقریباً در لحظه با متادیتاهای ویدیو تطبیق دهد و نیاز به استنتاج پیچیده در لحظه را دور بزند.[6]
اکنون صنعت در تلاش است تا بدون شکستن بودجه تأخیر، هوشمندی بیشتری را به لایه بازیابی تزریق کند. شبکههای عصبی دوبرجی (Two-tower neural networks)، که در آنها امبدینگهای کاربر و آیتم از پیش محاسبه و در حافظه ذخیره میشوند، به پلتفرمها اجازه میدهند تا در طول درخواست بازیابی واقعی، تطبیقهای پیچیده را از طریق محاسبات ساده ضرب نقطهای (dot-product) انجام دهند.[5]
با این وجود، همزمان با استقرار این مدلهای دوبرجی، پلتفرمها با محدودیتهای حافظه سختافزاری مواجه میشوند. ذخیرهسازی میلیاردها امبدینگ با ابعاد بالا نیازمند سیستمهای کشینگ توزیعشده عظیمی است که گلوگاه سیستم را از تأخیر محاسباتی به پهنای باند شبکه و ظرفیت حافظه منتقل میکند.[4]
نقطه عطف قابلتأیید بعدی برای سیستمهای توصیهگر زمانی پدیدار میشود که شتابدهندههای سختافزاریِ طراحیشده مخصوص جستجوهای نزدیکترین همسایه تقریبی، به دیتاسنترها برسند. تا زمانی که این تراشهها در مقیاس وسیع مستقر نشوند، پلتفرمها همچنان مجبورند تنوع فیدهای خود را در برابر فیزیک سختگیرانه بازیابی هزار پست در یکدهم ثانیه، متوازن کنند.[7]
نکات کلیدی
- تولید کاندیدا میلیاردها پست را در کمتر از ۱۰۰ میلیثانیه به صدها مورد کاهش میدهد.
- این لایه اولیه بیش از ۹۹.۹ درصد از محتوای موجود را پیش از اعمال مدلهای سنگین رتبهبندی دور میریزد.
- بودجههای تأخیر سختگیرانه، پلتفرمها را مجبور میکند از الگوریتمهای اکتشافی سبکی استفاده کنند که تعاملات تاریخی را در اولویت قرار میدهند.
- پژوهشگران هشدار میدهند که این مرحله بازیابیِ بهینهشده برای سرعت، سوگیری مجموعه داده را در همان ابتدای قیف نهادینه میکند.
اصطلاحات کلیدی
- تولید کاندیدا
- مرحله اولیه فیلترینگ که زیرمجموعه کوچکی از آیتمهای مرتبط را از یک پایگاه داده عظیم بازیابی میکند.
- بودجه تأخیر
- محدودیت زمانی سختگیرانه (معمولاً در حد میلیثانیه) که یک سیستم برای بازگرداندن نتایج پیش از احساس کندی توسط کاربر در اختیار دارد.
- مدل دوبرجی
- یک معماری شبکه عصبی که دادههای کاربر و دادههای آیتم را بهطور جداگانه پردازش میکند تا شباهت آنها را بهسرعت محاسبه کند.
- نزدیکترین همسایه تقریبی (ANN)
- یک الگوریتم جستجو که برای یافتن سریع آیتمهای مشابه در مجموعه دادههای بزرگ، دقت کامل را فدای سرعت میکند.
منابع
[1]arXivپژوهشگران انصاف الگوریتمیTwERC: High Performance Ensembled Candidate Generation for Ads Recommendation at Twitter
مطالعه در arXiv →
[2]Brainforge Blogمعماران زیرساختHow Instagram Uses AI to Rank Your Feed
مطالعه در Brainforge Blog →
[3]arXivپژوهشگران انصاف الگوریتمیLessons Learned Addressing Dataset Bias in Model-Based Candidate Generation at Twitter
مطالعه در arXiv →
[4]Substackمهندسان پلتفرمDeep Dive: How to Build the TikTok Recommender System End-to-End!
مطالعه در Substack →
[5]Mediumمهندسان پلتفرمDesigning a Newsfeed Ranking System: How Social Media Decides What You See
مطالعه در Medium →
[6]Han, Not Soloمعماران زیرساختHow Tik-Tok Wins The Social Media Recommendation System War
مطالعه در Han, Not Solo →
[7]تیم سردبیری کوهستانپژوهشگران انصاف الگوریتمیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در فناوری
مشاهده همه →علم مواد
کالبدشکافی شیشههای مقاوم (Gorilla Glass): گوشی شما واقعاً چگونه در برابر سقوط روی آسفالت زنده میماند؟
3 منبع
رمزنگاری همومورفیک
محدودیت تاخیر: چرا رمزنگاری همومورفیک نمیتواند هوش مصنوعی تعاملی را اجرا کند
3 منبع
اقتصاد ابری
سازوکار هزینههای خروج داده از فضای ابری: چرا «گرانش داده» بار کاری سازمانها را به دام میاندازد؟
6 منبع
Widevine DRM
کالبدشکافی وایدواین: نتفلیکس واقعاً چگونه جلوی اسکرینشات گرفتن شما را میگیرد؟
5 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





