مرحله تولید کاندیدا: فیدهای شبکههای اجتماعی چگونه میلیاردها پست را در چند میلیثانیه به صدها مورد کاهش میدهند؟
پیش از آنکه مدلهای پیچیده هوش مصنوعی فید شبکههای اجتماعی را رتبهبندی کنند، یک لایه بازیابی سبکوزن، ۹۹.۹ درصد از پستهای موجود را در کمتر از ۱۰۰ میلیثانیه دور میریزد. این مرحله که «تولید کاندیدا» نام دارد، با فدا کردن شخصیسازی عمیق در ازای سرعت پردازش خام، دقیقاً تعیین میکند که کاربران در نهایت چه چیزی را ببینند.
به قلم غزل بختیاری
این خبر را به اشتراک بگذارید
بهطور خلاصه
- تولید کاندیدا میلیاردها پست را در کمتر از ۱۰۰ میلیثانیه به صدها مورد کاهش میدهد.
- این لایه اولیه بیش از ۹۹.۹ درصد از محتوای موجود را پیش از اعمال مدلهای سنگین رتبهبندی دور میریزد.
- بودجههای تأخیر سختگیرانه، پلتفرمها را مجبور میکند از الگوریتمهای اکتشافی سبکی استفاده کنند که تعاملات تاریخی را در اولویت قرار میدهند.
مهندسان پلتفرمها استدلال میکنند که فیلتر کردن میلیاردها پست روزانه و رساندن آن به چند صد مورد در کمتر از ۱۰۰ میلیثانیه، نیازمند الگوریتمهای اکتشافی (heuristics) بیرحمانه و سبکی است که برای سرپا نگهداشتن سیستم، تعاملات گذشته کاربر را در اولویت قرار میدهند. در نقطه مقابل، پژوهشگران حوزه انصاف الگوریتمی بر این باورند که دقیقاً همین مرحله بازیابیِ بهینهشده برای سرعت، جهانبینی کاربر را برای همیشه محدود میکند و پیش از آنکه مدلهای رتبهبندیِ بهشدت تحتنظارت اصلاً محتوا را ببینند، سوگیری دادهها را در سیستم نهادینه میکند.[7]
مرکز این تنش، مرحلهای از یادگیری ماشین است که با نام «تولید کاندیدا» (candidate generation) شناخته میشود. وقتی کاربری اپلیکیشنی مانند اینستاگرام یا تیکتاک را باز میکند، پلتفرم تکتک محتواهای موجود را ارزیابی نمیکند. در عوض، یک لایه سریع و از نظر محاسباتی ارزان، مانند یک قیف عمل کرده و بیش از ۹۹.۹ درصد از موجودی محتوا را در لحظه دور میریزد.[5]
در حالی که بحثهای عمومی معمولاً روی الگوریتمهای سنگین رتبهبندی که فید نهایی را مرتب میکنند متمرکز است، این مدلها در واقع فقط به ۵۰۰ تا ۱۰۰۰ پستی امتیاز میدهند که از این فیلتر اولیه جان سالم به در بردهاند. مرحله تولید کاندیدا دقیقاً همان جایی است که مرزهای واقعی محیط دیجیتال یک کاربر، کاملاً در پشت صحنه، ترسیم میشود.[5]
برای درک ابعاد ماجرا، معماری تیکتاک را در نظر بگیرید. این پلتفرم روزانه میلیونها ویدیوی جدید دریافت میکند. بر اساس تحلیل معماری منتشرشده در سال ۲۰۲۳ توسط خبرنامه AiEdge، سیستم توصیهگر تیکتاک بر یک رویکرد چندقیفی متکی است که در آن، لایه اول به جای تحلیل عمیق ویدیو، صرفاً بر فیلترسازی مشارکتی (collaborative filtering) و برچسبهای کاربر تکیه دارد.[4]
این لایه اولیه باید در چارچوب یک «بودجه تأخیر» (latency budget) بسیار سختگیرانه عمل کند. اگر فرایند بازیابی بیش از چند صد میلیثانیه طول بکشد، کاربر با کندی مواجه شده و اپلیکیشن را میبندد. در نتیجه، سیستم برای یافتن خوشههای محتوایی مشابه با آنچه کاربر قبلاً پسندیده، از جستجوهای «نزدیکترین همسایه تقریبی» (ANN) استفاده میکند و دقت را فدای سرعت خام میکند.[4]
تیم مهندسی توییتر در مقاله پیشچاپ سال ۲۰۲۳ خود درباره چارچوب TwERC (بازیابی گروهی کاندیداها در توییتر)، دقیقاً به همین بدهبستان اشاره کرده است. این سیستم برای مدیریت توصیه تبلیغات از طریق ترکیب چند مدل سبکوزن طراحی شده بود تا اطمینان حاصل شود که استخر کاندیداها بدون تجاوز از محدودیتهای زمانی سختگیرانه در مزایدههای درنگدرنگ (real-time bidding) ایجاد میشود.[1]
معماری توییتر با استفاده از این الگوریتمهای اکتشافیِ ترکیبی، توانست حجم عظیمی از درخواستها را پردازش کند، اما ذاتاً کاندیداهایی را که با الگوهای تاریخی تثبیتشده مطابقت داشتند، به محتوای جدید یا خاص (niche) ترجیح میداد. این سیستم، حفظ توان عملیاتی (throughput) را بر ارتباط معنایی عمیق ارجح میدانست.[1]
این اتکا به الگوهای تاریخی، آسیبپذیری اصلی مرحله بازیابی را رقم میزند: سوگیری مجموعه داده. مطالعهای در سال ۲۰۲۱ توسط پژوهشگران توییتر روی تولید کاندیدای مبتنی بر مدل نشان داد که چون این مدلهای سبکوزن بر اساس تعاملات گذشته کاربران آموزش میبینند، بهطور نامتناسبی مواردی را بازیابی میکنند که از قبل محبوب بودهاند یا بهشدت پروموت شدهاند.[3]
این پژوهشگران دریافتند که اگر کاندیداهای متنوع از همان ابتدا بازیابی نشوند، رفع این سوگیری در مرحله رتبهبندی از نظر ریاضی غیرممکن است. اگر تولیدکننده کاندیدا فقط پستهای وایرال را به مرحله بعد بفرستد، پیشرفتهترین الگوریتم رتبهبندی جهان هم تنها میتواند بهترینها را از میان یک نمونه سوگیرانه انتخاب کند.[3]
اینستاگرام نیز با واقعیت معماری مشابهی روبهرو است. تحلیل دسامبر ۲۰۲۵ توسط Brainforge درباره نحوه استفاده اینستاگرام از هوش مصنوعی برای رتبهبندی فیدها، نشان داد که این پلتفرم در واقع چندین خط لوله (pipeline) مجزا برای تولید کاندیدا را بهطور همزمان اجرا میکند؛ یکی برای حسابهایی که کاربر دنبال میکند، یکی برای هشتگهایی که با آنها تعامل دارد و دیگری برای کشف پیشبینانه.[2]
این خطوط لوله موازی تلاش میکنند پیش از آنکه مدل سنگین رتبهبندی وارد عمل شود، تنوع را به استخر کاندیداها تزریق کنند. سیستم اینستاگرام با استخراج ۱۰۰ پست از حسابهای دنبالشده و ۱۰۰ پست از خوشههای اکتشافی، الگوریتم رتبهبندی نهایی را مجبور میکند تا یک دسته ترکیبی را ارزیابی کند و از این طریق، بخشی از اثرات اتاق پژواک (echo-chamber) که ذاتِ فیلترسازی مشارکتیِ خالص است را کاهش دهد.[2]
با این حال، مکانیک زیربنایی همچنان در بند محدودیت ۱۰۰ میلیثانیهای گرفتار است. تحلیل سال ۲۰۲۰ لی هان چانگ (Lee Han Chung)، مهندس نرمافزار، از الگوریتم تیکتاک نشان داد که موفقیت اولیه این پلتفرم ناشی از سیستم برچسبگذاری تهاجمی آن بود؛ سیستمی که به تولیدکننده کاندیدا اجازه میداد پروفایل کاربران را تقریباً در لحظه با متادیتاهای ویدیو تطبیق دهد و نیاز به استنتاج پیچیده در لحظه را دور بزند.[6]
اکنون صنعت در تلاش است تا بدون شکستن بودجه تأخیر، هوشمندی بیشتری را به لایه بازیابی تزریق کند. شبکههای عصبی دوبرجی (Two-tower neural networks)، که در آنها امبدینگهای کاربر و آیتم از پیش محاسبه و در حافظه ذخیره میشوند، به پلتفرمها اجازه میدهند تا در طول درخواست بازیابی واقعی، تطبیقهای پیچیده را از طریق محاسبات ساده ضرب نقطهای (dot-product) انجام دهند.[5]
با این وجود، همزمان با استقرار این مدلهای دوبرجی، پلتفرمها با محدودیتهای حافظه سختافزاری مواجه میشوند. ذخیرهسازی میلیاردها امبدینگ با ابعاد بالا نیازمند سیستمهای کشینگ توزیعشده عظیمی است که گلوگاه سیستم را از تأخیر محاسباتی به پهنای باند شبکه و ظرفیت حافظه منتقل میکند.[4]
نقطه عطف قابلتأیید بعدی برای سیستمهای توصیهگر زمانی پدیدار میشود که شتابدهندههای سختافزاریِ طراحیشده مخصوص جستجوهای نزدیکترین همسایه تقریبی، به دیتاسنترها برسند. تا زمانی که این تراشهها در مقیاس وسیع مستقر نشوند، پلتفرمها همچنان مجبورند تنوع فیدهای خود را در برابر فیزیک سختگیرانه بازیابی هزار پست در یکدهم ثانیه، متوازن کنند.[7]
اصطلاحات کلیدی
- تولید کاندیدا
- مرحله اولیه فیلترینگ که زیرمجموعه کوچکی از آیتمهای مرتبط را از یک پایگاه داده عظیم بازیابی میکند.
- بودجه تأخیر
- محدودیت زمانی سختگیرانه (معمولاً در حد میلیثانیه) که یک سیستم برای بازگرداندن نتایج پیش از احساس کندی توسط کاربر در اختیار دارد.
- مدل دوبرجی
- یک معماری شبکه عصبی که دادههای کاربر و دادههای آیتم را بهطور جداگانه پردازش میکند تا شباهت آنها را بهسرعت محاسبه کند.
- نزدیکترین همسایه تقریبی (ANN)
- یک الگوریتم جستجو که برای یافتن سریع آیتمهای مشابه در مجموعه دادههای بزرگ، دقت کامل را فدای سرعت میکند.
پرسشهای متداول
تولید کاندیدا چیست؟
اولین مرحله از یک سیستم توصیهگر است که با استفاده از الگوریتمهای سبکوزن، میلیاردها پست را بهسرعت فیلتر کرده و به چند صد مورد کاهش میدهد.
چرا سیستم همه چیز را رتبهبندی نمیکند؟
ارزیابی میلیاردها پست با مدلهای سنگین هوش مصنوعی زمان زیادی میبرد، باعث کندی اپلیکیشن میشود و بودجههای تأخیر سختگیرانه را نقض میکند.
این مرحله چگونه باعث ایجاد سوگیری میشود؟
از آنجا که این مرحله برای عملکرد سریع به دادههای تاریخی ساده متکی است، تمایل دارد محتوایی را که از قبل محبوب بوده بازیابی کند و پستهای خاص یا جدیدتر را نادیده بگیرد.
بررسی عمیق دیدگاهها
مهندسان پلتفرم
استدلال میکنند که بودجههای تأخیر سختگیرانه، استفاده از تولید کاندیدای سبکوزن را برای پاسخگو نگهداشتن سیستمها ضروری میسازد.
برای مهندسانی که این سیستمها را میسازند، معیار اصلی موفقیت در مرحله تولید کاندیدا، توان عملیاتی (throughput) است. اگر یک مدل بازیابی به جای ۱۰۰ میلیثانیه، ۳۰۰ میلیثانیه طول بکشد، به دلیل احساس کندی در اپلیکیشن، تعامل کاربر بهشدت افت میکند. در نتیجه، آنها معماریهایی مانند جستجوهای نزدیکترین همسایه تقریبی و الگوریتمهای اکتشافی ترکیبی را که میتوانند حجم عظیمی از درخواستها را در لحظه پردازش کنند در اولویت قرار میدهند و میپذیرند که در مسیر رسیدن به سرعت، بخشی از محتوای مرتبط از دست برود.
پژوهشگران انصاف الگوریتمی
بر این باورند که فیلترینگ در مراحل اولیه، سوگیری را نهادینه میکند که رتبهبندی مراحل بعدی قادر به اصلاح آن نیست.
پژوهشگران حوزه انصاف به یک نقص ریاضی حیاتی در قیفهای توصیهگر مدرن اشاره میکنند: اگر محتوای متنوع یا خاص (niche) در مرحله تولید کاندیدا دور ریخته شود، مدلهای سنگین رتبهبندی هرگز فرصت ارزیابی آنها را پیدا نمیکنند. از آنجا که لایه بازیابی برای عملکرد سریع بهشدت به دادههای تعاملات تاریخی متکی است، ذاتاً به نفع تولیدکنندگان وایرال یا تثبیتشده عمل میکند و یک اتاق پژواک ساختاری ایجاد میکند که الگوریتمهای پاییندستی در اصلاح آن ناتواناند.
معماران زیرساخت
بر این موضوع تمرکز دارند که چگونه محدودیتهای سختافزاری، قابلیتهای نرمافزاری را در لایه بازیابی دیکته میکنند.
معماران این مشکل را از دریچه پهنای باند حافظه و کشینگ توزیعشده بررسی میکنند. در حالی که مهندسان نرمافزار میخواهند شبکههای عصبی دوبرجی هوشمندتری را برای تولید کاندیدا مستقر کنند، معماران خاطرنشان میکنند که ذخیرهسازی میلیاردها امبدینگ با ابعاد بالا نیازمند زیرساختهای عظیم و گرانقیمت است. تا زمانی که شتابدهندههای سختافزاری تخصصی در دیتاسنترها استاندارد نشوند، هوشمندی لایه بازیابی همچنان در گلوگاه محدودیتهای فیزیکی حافظه سرور گرفتار خواهد ماند.
- مهندسان پلتفرم
- استدلال میکنند که بودجههای تأخیر سختگیرانه، استفاده از تولید کاندیدای سبکوزن را برای پاسخگو و آنلاین نگهداشتن سیستمها ضروری میسازد.
- پژوهشگران انصاف الگوریتمی
- بر این باورند که فیلترینگ در مراحل اولیه، سوگیری تاریخی را در سیستم نهادینه میکند که مدلهای رتبهبندیِ مراحل بعدی قادر به اصلاح آن نیستند.
- معماران زیرساخت
- بر محدودیتهای سختافزاری و حافظه تمرکز دارند که میزان هوشمندی قابلتزریق به لایه بازیابی را محدود میکند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان مستقل محتوا
- کاربران نهایی
منابع
[1]arXivپژوهشگران انصاف الگوریتمیTwERC: High Performance Ensembled Candidate Generation for Ads Recommendation at Twitter
مطالعه در arXiv →
[2]Brainforge Blogمعماران زیرساختHow Instagram Uses AI to Rank Your Feed
مطالعه در Brainforge Blog →
[3]arXivپژوهشگران انصاف الگوریتمیLessons Learned Addressing Dataset Bias in Model-Based Candidate Generation at Twitter
مطالعه در arXiv →
[4]Substackمهندسان پلتفرمDeep Dive: How to Build the TikTok Recommender System End-to-End!
مطالعه در Substack →
[5]Mediumمهندسان پلتفرمDesigning a Newsfeed Ranking System: How Social Media Decides What You See
مطالعه در Medium →
[6]Han, Not Soloمعماران زیرساختHow Tik-Tok Wins The Social Media Recommendation System War
مطالعه در Han, Not Solo →
[7]تیم سردبیری کوهستانپژوهشگران انصاف الگوریتمیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در فناوری
مشاهده همه →نظارت الگوریتمی
چرا الگوریتم «یادداشتهای کاربران» برای انتشار یک راستیآزمایی به اجماع فراحزبی نیاز دارد؟
7 منبع
نظارت بر محتوا
نرخ تطبیق ۹۸.۹ درصدی: پایگاههای داده هشینگ ادراکی چگونه محتوای غیرقانونی شناختهشده را شناسایی و حذف میکنند
5 منبع
سلامت دیجیتال
شواهد علمی درباره شبکههای اجتماعی: مقایسه یافتههای مرورهای نظاممند درباره سلامت روان نوجوانان
5 منبع
تعدیل هوش مصنوعی
چگونه اسنپچت و لینکدین محتوای هوش مصنوعی را از فیدهای ارگانیک فیلتر میکنند و همزمان آن را در تبلیغات گسترش میدهند
5 منبع
نظرات
هر زاویه. هر روز.
اخبار فناوری با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





