کالبدشکافی الگوریتمهای رتبهبندی موتورهای جستجو: گوگل چگونه میلیاردها صفحه را در کسری از ثانیه مرتب میکند؟
گوگل برای پاسخ به هر جستجو، سه مرحله خزش، نمایهسازی و رتبهبندی را در کسری از ثانیه طی میکند. اما در پسِ ادعاهای بازاریابی درباره «هوش مصنوعی درککننده»، این سیستم همچنان بر اساس سیگنالهای ریاضی و الگوهای آماری کار میکند.
به قلم آیدا امینی
این خبر را به اشتراک بگذارید
- متخصصان سئو و تحلیلگران داده
- تلاش برای درک و بهینهسازی سیگنالهای رتبهبندی جهت کسب ترافیک تجاری.
- توسعهدهندگان و مهندسان سیستم
- تمرکز بر مقیاسپذیری، کاهش زمان پاسخگویی و بهبود مدلهای یادگیری ماشین.
- تحریریه و پژوهشگران مستقل
- تحلیل انتقادی شکاف میان ادعاهای بازاریابی هوش مصنوعی و مکانیک واقعی سیستم.
دیدگاههایی که این گزارش پوشش نداده
- کاربران عادی اینترنت
- تولیدکنندگان محتوای مستقل
نکات کلیدی
- گوگل اینترنت زنده را جستجو نمیکند، بلکه در پایگاه داده بایگانیشده خود (نمایه) میگردد.
- خزندههای وب (مانند گوگلبات) برای کشف صفحات جدید کاملاً به پیوندها (Links) وابستهاند.
- الگوریتمهای رتبهبندی در کسری از ثانیه صدها سیگنال از جمله اعتبار دامنه و نیت کاربر را ارزیابی میکنند.
- با وجود ادعاهای هوش مصنوعی، سیستم همچنان تخصص را از طریق سیگنالهای جایگزین مانند محبوبیت دامنه میسنجد.
نزدیکترین نمونه مشابه به موتور جستجوی گوگل، فهرستنویسی کارتهای یک کتابخانه فیزیکی است؛ با این تفاوت کلیدی که فهرست کتابخانه ثابت، عینی و بر اساس الفبا یا موضوع است، اما فهرست گوگل پویاست و در هر میلیثانیه بر اساس صدها متغیر پنهان برای هر کاربر بازنویسی میشود. وقتی شما عبارتی را جستجو میکنید، گوگل در آن لحظه کل اینترنت را نمیگردد؛ بلکه در پایگاه دادهای جستجو میکند که پیشتر آن را خوانده و طبقهبندی کرده است. این سیستم که در سال ۱۹۹۸ توسط سرگی برین (Sergey Brin) و لری پیج (Larry Page) در دانشگاه استنفورد با نمایهسازی تنها ۲۴ میلیون صفحه آغاز به کار کرد، اکنون صدها میلیارد صفحه را در خود جای داده و ۹۲.۲۴ درصد از سهم بازار جستجوی جهان را در اختیار دارد.[2][3]
پیش از آنکه هر رتبهبندی اتفاق بیفتد، محتوا باید کشف شود. این کار بر عهده برنامههای خودکاری به نام «خزندههای وب» (Web Crawlers) است که معروفترین آنها گوگلبات (Googlebot) نام دارد. گوگلبات اینترنت را از طریق پیوندها (Links) میپیماید؛ دقیقاً مانند عنکبوتی که روی تارهای یک شبکه حرکت میکند. اگر صفحهای هیچ پیوند ورودی از صفحات دیگر نداشته باشد (که در اصطلاح فنی به آن صفحه یتیم یا Orphan Page میگویند)، برای گوگل عملاً وجود خارجی ندارد. این خزندهها به طور مداوم در حال دانلود کدهای HTML، تصاویر و ویدیوها هستند، اما برخلاف تصور عمومی مبنی بر قدرت نامحدود سیستم، آنها محدودیتهای سختافزاری دارند و بر اساس «بودجه خزش» (Crawl Budget) تصمیم میگیرند که یک سایت را هر چند وقت یکبار بررسی کنند.[1][4]
پس از کشف، مرحله نمایهسازی (Indexing) آغاز میشود. در گذشته، این مرحله تنها شامل استخراج کلمات کلیدی بود، اما امروز گوگلبات صفحات را دقیقاً مانند یک مرورگر وب «رندر» (Render) میکند. این یعنی کدهای جاوااسکریپت (JavaScript) و CSS اجرا میشوند تا ماشین ببیند کاربر نهایی دقیقاً چه چیزی را تماشا میکند. سپس اطلاعات استخراجشده در پایگاه دادهای عظیم ذخیره میشود. با این حال، گوگل در مستندات توسعهدهندگان خود صراحتاً اعلام کرده است که «هر صفحه کشفشدهای خزش نمیشود و هر صفحه خزششدهای لزوماً در نمایه قرار نمیگیرد». اگر سیستم تشخیص دهد که محتوای شما تکراری، بیکیفیت یا فاقد ارزش افزوده است، آن را به سادگی نادیده میگیرد.[1][3]
جادوی اصلی و البته بحثبرانگیزترین بخش، الگوریتمهای رتبهبندی (Ranking Algorithms) هستند. وقتی کاربری در سال ۲۰۲۶ عبارتی را جستجو میکند، سیستمهای گوگل در کسری از ثانیه صدها فاکتور را برای مرتبسازی نتایج ارزیابی میکنند. هسته اولیه این سیستم، الگوریتم پیجرنک (PageRank) بود که اعتبار یک صفحه را بر اساس تعداد و کیفیت پیوندهایی که به آن داده شده بود، میسنجید. اما امروز، پیجرنک تنها یکی از صدها سیگنال است. گوگل ادعا میکند که از سیستمهای مبتنی بر هوش مصنوعی مانند برت (BERT - معرفی شده در سال ۲۰۱۹) برای «درک معنا و نیت کاربر» استفاده میکند. زبان بازاریابی شرکتها دوست دارد کلماتی مانند «درک کردن» و «فهمیدن» را به کار ببرد، اما در واقعیت، این مدلهای ترانسفورمر (Transformer) تنها الگوهای آماری کلمات را با دقت بسیار بالایی تطبیق میدهند و هیچ درک معنایی از حقیقت ندارند.[1][2][4]
جادوی اصلی و البته بحثبرانگیزترین بخش، الگوریتمهای رتبهبندی (Ranking Algorithms) هستند.
یکی از مفاهیمی که گوگل در سالهای اخیر به شدت روی آن مانور داده، مفهوم E-E-A-T (تجربه، تخصص، اعتبار و اعتماد) است. بر اساس مستندات رسمی، سیستم تلاش میکند تا محتوای تولید شده توسط متخصصان واقعی را در صدر قرار دهد. اما نگاهی بدبینانه و فنی به نتایج نشان میدهد که ماشینها نمیتوانند «تخصص» را بخوانند؛ آنها سیگنالهای جایگزین (Proxy Signals) را میخوانند. به همین دلیل است که در بسیاری از جستجوهای تخصصی، مقالهای سطحی از یک دامنه خبری غولپیکر یا یک انجمن پربازدید مانند ردیت (Reddit)، بالاتر از مقاله دقیق یک متخصص مستقل قرار میگیرد. الگوریتم، اعتبار کلی دامنه را به عنوان میانبری برای تخصص در نظر میگیرد، زیرا محاسبه آن برای ماشین ارزانتر و سریعتر است.[1][3]
در نهایت، تمام این معماری پیچیده برای خدمت به دو هدف اصلی طراحی شده است: کاهش تأخیر (Latency) و نمایش تبلیغات مرتبط. گوگل در مستندات خود تأکید میکند که «کاهش میلیثانیهها از زمان پاسخگویی» یک اولویت مطلق است. این سرعت خیرهکننده به این دلیل ممکن است که شما در حال جستجوی اینترنت زنده نیستید، بلکه در حال جستجوی نسخه کپیشده و بایگانیشده گوگل از اینترنت هستید. در حالی که مهندسان گوگل به طور مداوم در حال بهروزرسانی سیستمهایی مانند مبارزه با اسپم (Spam Detection) و ارتقای کیفیت هستند، ماهیت این موتور جستجو همچنان یک ماشین تطبیق الگوی بسیار سریع است که بر اساس رفتار کلیک کاربران و ساختار پیوندها بهینهسازی شده است، نه یک هوش مصنوعی همهچیزدان که حقیقت مطلق را میشناسد.[1][5]
تکامل موتورهای جستجو از شمارش کلمات کلیدی به تحلیل معنایی، نحوه دسترسی بشر به اطلاعات را بازنویسی کرده است. با این حال، مرز باریکی بین آنچه این سیستمها واقعاً انجام میدهند و آنچه بازاریابی شرکتها ادعا میکند وجود دارد. تا زمانی که معماری وب بر پایه پیوندها و سیگنالهای ترافیکی استوار است، الگوریتمهای رتبهبندی نیز بازتابی از همین ساختار خواهند بود؛ ساختاری که در آن «اعتبار» اغلب بر اساس محبوبیت سنجیده میشود، نه لزوماً دقت علمی. درک این تمایز برای هر کاربری که به دنبال اطلاعات موثق در عصر دیجیتال است، یک ضرورت محسوب میشود.[5]
درک این مکانیزمها نشان میدهد که چرا بهینهسازی موتور جستجو (SEO) به یک صنعت چند میلیارد دلاری تبدیل شده است. وقتی الگوریتمها بر اساس مجموعهای از قوانین قابل پیشبینی (مانند سرعت بارگذاری صفحه، ساختار پیوندهای داخلی و استفاده از کلمات کلیدی مرتبط) عمل میکنند، کسانی که این قوانین را بهتر درک کنند، میتوانند ترافیک بیشتری را به سمت خود هدایت کنند. این رقابت دائمی میان مهندسان جستجو که در تلاش برای بهبود کیفیت نتایج هستند و متخصصان سئو که به دنبال کسب بالاترین جایگاه میگردند، موتور محرک تکامل وب در دو دهه گذشته بوده است.[3][4]
اصطلاحات کلیدی
- خزنده وب (Web Crawler)
- برنامهای خودکار که با دنبال کردن پیوندها، صفحات جدید را در اینترنت کشف و دانلود میکند.
- نمایهسازی (Indexing)
- فرآیند تحلیل، رندر کردن و ذخیره اطلاعات یک صفحه وب در پایگاه داده موتور جستجو.
- پیجرنک (PageRank)
- الگوریتم اولیه گوگل که اعتبار یک صفحه را بر اساس تعداد و کیفیت پیوندهای ورودی به آن محاسبه میکند.
- بودجه خزش (Crawl Budget)
- محدودیت منابعی که موتور جستجو برای بررسی صفحات یک وبسایت خاص در یک بازه زمانی اختصاص میدهد.
- صفحه یتیم (Orphan Page)
- صفحهای در یک وبسایت که هیچ پیوند داخلی یا خارجی به آن داده نشده و در نتیجه توسط خزندهها کشف نمیشود.
پرسشهای متداول
آیا گوگل تمام صفحات اینترنت را در نتایج خود نشان میدهد؟
خیر. گوگل صراحتاً اعلام کرده است که بسیاری از صفحات کشفشده هرگز خزش نمیشوند و بسیاری از صفحات خزششده نیز به دلیل کیفیت پایین یا تکراری بودن در نمایه (Index) قرار نمیگیرند.
هوش مصنوعی چگونه رتبهبندی نتایج را تغییر داده است؟
سیستمهایی مانند BERT به گوگل کمک میکنند تا به جای تطبیق دقیق کلمات کلیدی، الگوهای زبانی و نیت پنهان در پشت جملات جستجو شده را بهتر تشخیص دهد.
چرا گاهی سایتهای نامرتبط اما بزرگ بالاتر از سایتهای تخصصی قرار میگیرند؟
زیرا الگوریتمها نمیتوانند تخصص واقعی را درک کنند و به جای آن از سیگنالهای جایگزین مانند اعتبار کلی دامنه (Domain Authority) و تاریخچه کلیک کاربران استفاده میکنند.
چرا مهم است
درک نحوه کارکرد موتورهای جستجو به ما نشان میدهد که چرا برخی اطلاعات دیده میشوند و برخی دیگر در تاریکی میمانند. وقتی بدانیم گوگل چگونه وب را میخواند، بهتر میتوانیم تفاوت بین «محتوای معتبر» و «محتوای بهینهشده برای ماشین» را تشخیص دهیم.
منابع
[1]Google Search Centralتوسعهدهندگان و مهندسان سیستمHow Google Search Works
مطالعه در Google Search Central →
[2]Stanford Universityتوسعهدهندگان و مهندسان سیستمThe Anatomy of a Large-Scale Hypertextual Web Search Engine
مطالعه در Stanford University →
[3]SEO.comمتخصصان سئو و تحلیلگران دادهHow Do Search Engines Work?
مطالعه در SEO.com →
[4]Firecrawlمتخصصان سئو و تحلیلگران دادهWhat Are Ranking Algorithms for Web Search APIs?
مطالعه در Firecrawl →
[5]تیم سردبیری کوهستانتحریریه و پژوهشگران مستقلتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در فناوری
مشاهده همه →حوزه قضایی GDPR
دو شرط در ماده ۳ که به قوانین GDPR دامنه فرامرزی میدهد
5 منبع
همجوشی تجاری
شرکت «کامانولث فیوژن سیستمز» برای تأمین مالی اولین راکتور تجاری خود، ۱ میلیارد دلار جذب کرد
7 منبع
فناوری باتری خودروی برقی
باتری خودروی برقی FAW هونگچی رونمایی شد: شارژ ۱۰ تا ۷۰ درصد در کمتر از چهار دقیقه
8 منبع
هوش مصنوعی منبع باز
علیبابا از مدل هوش مصنوعی ۲.۴ تریلیون پارامتری کیووِن ۳.۸-مکس رونمایی کرد و وزنهای آن را برای هوش مصنوعی سازمانی منبع باز نمود
8 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





