رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعماری وبگزارش تحلیلی· 9 دقیقه مطالعه· در متا

استاندارد robots.txt واقعاً چگونه خزنده‌های وب و اسکرپرهای هوش مصنوعی را کنترل می‌کند؟

پروتکل حذف ربات‌ها که در سال ۱۹۹۴ برای جلوگیری از اضافه‌بار سرورها طراحی شده بود، حالا به میدان نبرد اصلی اینترنت برای رضایت‌سنجی آموزش هوش مصنوعی تبدیل شده است.

به قلم کیان راد

ناشران وب 35%اپراتورهای موتورهای جستجو 25%توسعه‌دهندگان مدل‌های هوش مصنوعی 25%آرشیویست‌های دیجیتال 15%
ناشران وب
ناشران فایل robots.txt را به عنوان خط مقدم دفاع در برابر بلعیده شدن غیرمجاز داده‌ها توسط هوش مصنوعی می‌بینند.
اپراتورهای موتورهای جستجو
این پروتکل را عمدتاً به عنوان یک ابزار فنی برای مدیریت بار سرور و بهینه‌سازی بودجه خزش می‌دانند.
توسعه‌دهندگان مدل‌های هوش مصنوعی
برای پیمایش داده‌های عمومی به این پروتکل متکی هستند و در عین حال گزینه‌های انصراف دقیقی را ارائه می‌دهند.
آرشیویست‌های دیجیتال
استدلال می‌کنند که پایبندی سفت‌وسخت به robots.txt ناخواسته تاریخچه دیجیتال را پاک کرده و سوابق عمومی را تخریب می‌کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • پژوهشگران مستقلی که برای مطالعات دانشگاهی به استخراج داده از وب (وب اسکرپینگ) وابسته‌اند
  • متخصصان امنیت سایبری که فایروال‌های برنامه‌های تحت وب را مدیریت می‌کنند

در سپتامبر ۲۰۲۲، «کارگروه مهندسی اینترنت» به طور رسمی RFC 9309 را تصویب کرد و فایل متنی ساده‌ای را که از سال ۱۹۹۴ با اجماعی غیررسمی بر اینترنت حاکم بود، استانداردسازی کرد. «پروتکل حذف ربات‌ها» که همه‌جا با نام robots.txt شناخته می‌شود، بالاخره به یک استاندارد رسمی اینترنت تبدیل شد. اما زمان‌بندی این تصویب دقیقاً با عرضه هوش مصنوعی مولد مدرن تلاقی پیدا کرد. پروتکلی که در اصل برای جلوگیری از ازکارافتادن سرورهای شکننده توسط خزنده‌های اولیه وب طراحی شده بود، ناگهان مأمور شد تا در نبردی چند میلیارد دلاری بر سر مالکیت معنوی، آموزش مدل‌ها و جستجوی درنگ‌درنگ هوش مصنوعی داوری کند.[3]

خود این مکانیسم به طرز قابل‌توجهی ابتدایی است. یک فایل robots.txt در ریشه یک دامنه - مثلاً example.com/robots.txt - قرار می‌گیرد و فهرستی از قوانین را برای بازدیدکنندگان خودکار ارائه می‌دهد. این فایل از سینتکس ساده 'User-agent' برای شناسایی ربات استفاده می‌کند که به دنبال آن دستورات 'Allow' (مجاز) یا 'Disallow' (غیرمجاز) برای مسیرهای خاصی از URL می‌آیند. وقتی یک خزنده وبِ قانون‌مدار به دامنه‌ای می‌رسد، ابتدا این فایل را می‌خواند، گروه قوانینی که با نامش مطابقت دارد را پیدا می‌کند و از آن‌ها پیروی می‌کند. اگر هیچ قانون خاصی برای آن ربات وجود نداشته باشد، به قانون وایلدکارد (پیش‌فرض برای همه) رجوع می‌کند یا فرض را بر دسترسی کامل می‌گذارد.[3]

دهه‌ها این سیستم کار می‌کرد، چون انگیزه‌های صاحبان وب‌سایت‌ها و موتورهای جستجو هم‌راستا بود. Googlebot وب را می‌خزید تا صفحات را ایندکس کند و در ازای آن، جستجوی گوگل ترافیک انسانی را به آن وب‌سایت‌ها برمی‌گرداند. فایل robots.txt عمدتاً برای مدیریت «بودجه خزش» استفاده می‌شد - یعنی جلوگیری از اتلاف وقت گوگل در صفحات تکراری، پورتال‌های ورود مدیران یا دایرکتوری‌های عظیم PDF. مستندات Google Search Central توضیح می‌دهد: «یک فایل robots.txt به خزنده‌های موتور جستجو می‌گوید که به کدام URLها در سایت شما می‌توانند دسترسی داشته باشند. این فایل عمدتاً برای جلوگیری از اضافه‌بار درخواست‌ها روی سایت شما استفاده می‌شود؛ این یک مکانیسم برای دور نگه داشتن یک صفحه وب از گوگل نیست.»[1]

این محدودیت بنیادین، بدفهمیده‌ترین جنبه این پروتکل است. این فایل جلوی خزش را می‌گیرد، اما جلوی ایندکس شدن را نمی‌گیرد. اگر یک وب‌سایت خارجی به صفحه‌ای لینک دهد که در robots.txt غیرمجاز شده است، گوگل همچنان می‌تواند آن URL را ایندکس کرده و در نتایج جستجو نمایش دهد، هرچند بدون قطعه متن توضیحی (اسنیپت). از آنجا که خزنده از خواندن صفحه منع شده است، نمی‌تواند هیچ تگ 'noindex' قرار گرفته در هدر HTML را ببیند. برای حذف واقعی یک صفحه از نتایج جستجو، مدیران وب‌سایت‌ها باید صفحه را برای خزش باز بگذارند و از متاتگ 'noindex' استفاده کنند، یا محافظت سفت‌وسختِ رمز عبور در سمت سرور را پیاده‌سازی کنند.[1]

خزنده‌های وبِ قانون‌مدار پیش از دسترسی به سایر صفحات، دامنه ریشه را برای یافتن فایل robots.txt بررسی می‌کنند.

ظهور مدل‌های زبانی بزرگ، توافق بنیادین وبِ باز را در هم شکست. خزنده‌های هوش مصنوعی محتوا را استخراج نمی‌کنند تا آن را برای موتور جستجویی که ترافیک انسانی برمی‌گرداند ایندکس کنند، بلکه آن را می‌بلعند تا وارد مجموعه داده‌های آموزشی عظیمی کنند که نیروبخش محصولات مستقلی مانند ChatGPT یا Claude هستند. در واکنش به این موضوع، صاحبان وب‌سایت‌ها شروع به استفاده از فایل‌های robots.txt خود به عنوان سلاحی برای مسدود کردن کامل شرکت‌های هوش مصنوعی کردند و هدف این فایل را از مدیریت بار سرور به دفاع از مالکیت معنوی تغییر دادند. این فایل متنی به تنها اهرم در دسترس برای ناشرانی تبدیل شد که تلاش می‌کردند از تب داغ هوش مصنوعی مولد انصراف دهند.

شرکت OpenAI با درک واکنش منفی فزاینده ناشران، «یوزر ایجنت‌های» خاصی را معرفی کرد تا به مدیران وب‌سایت‌ها کنترل دقیقی بر نحوه مصرف داده‌هایشان بدهد. در مستندات این شرکت با لحنی بازاریابی‌گونه آمده است: «OpenAI از تگ‌های OAI-SearchBot و GPTBot در robots.txt استفاده می‌کند تا مدیران وب‌سایت‌ها بتوانند نحوه تعامل سایت و محتوای خود را با هوش مصنوعی مدیریت کنند.» ربات GPTBot داده‌ها را برای آموزش مدل‌های پایه هوش مصنوعی مولد جمع‌آوری می‌کند، در حالی که OAI-SearchBot صرفاً برای نمایش وب‌سایت‌ها در ویژگی‌های جستجوی درنگ‌درنگ ChatGPT استفاده می‌شود. این تفکیک به این واقعیت اذعان دارد که ایندکس شدن برای جستجو و بلعیده شدن برای آموزش مدل، دو مقوله کاملاً متفاوت هستند.[2]

این دوشاخه شدن، مدیران وب‌سایت‌ها را مجبور به یک انتخاب حساب‌شده می‌کند. یک سایت می‌تواند GPTBot را مسدود کند تا از ورود مقالاتش به نسخه‌های آینده GPT-4 جلوگیری کند، و در عین حال به OAI-SearchBot اجازه دهد تا مطمئن شود وقتی کاربری از ChatGPT سؤال مستقیمی می‌پرسد، به آن سایت ارجاع داده می‌شود. OpenAI خاطرنشان می‌کند: «هر تنظیمات مستقل از بقیه است.» این یعنی سایت‌ها می‌توانند بدون اهدای آرشیو خود به آموزش مدل، در نتایج جستجو ظاهر شوند. این استراتژی عملاً ناشران را مجبور می‌کند که اگر می‌خواهند دیده شوند، پارادایم جدید جستجوی هوش مصنوعی را بپذیرند، در حالی که مکانیسمی مؤدبانه برای محافظت از آرشیو تاریخی‌شان به آن‌ها می‌دهد.[2]

این دوشاخه شدن، مدیران وب‌سایت‌ها را مجبور به یک انتخاب حساب‌شده می‌کند.

با وجود این کنترل‌های دقیق، کل این سیستم منحصراً بر پایه سیستم «اعتماد و شرافت» استوار است. سند RFC 9309 صراحتاً اشاره می‌کند که این پروتکل جنبه توصیه‌ای دارد و بیان می‌کند که این قوانین نوعی مجوز دسترسی نیستند. این فایل متنی نه هویت بازدیدکنندگان را تأیید می‌کند و نه دسترسی را در سطح شبکه اعمال می‌کند. یک خزنده خوش‌رفتار فایل را می‌خواند و رعایت می‌کند؛ یک اسکرپر مخرب به سادگی آن را نادیده می‌گیرد و به هر حال HTML را دانلود می‌کند. از آنجا که این فایل در ریشه دامنه برای عموم قابل مشاهده است، کارشناسان امنیتی مرتباً هشدار می‌دهند که قرار دادن مسیرهای حساس مدیریتی در فایل robots.txt صرفاً نقشه راه مناسبی از آسیب‌پذیری‌های سرور را در اختیار مهاجمان قرار می‌دهد.[3]

تایم‌لاین و تأثیر پروتکل حذف ربات‌ها.

این ماهیت داوطلبانه منجر به اصطکاک قابل‌توجهی با پروژه‌های آرشیو دیجیتال شده است. در آوریل ۲۰۱۷، آرشیو اینترنت اعلام کرد که دیگر برای ماشین زمان خود (Wayback Machine) به طور سفت‌وسخت به دستورالعمل‌های robots.txt پایبند نخواهد بود. این سازمان مشاهده کرد که قوانینی که برای بهینه‌سازی موتورهای جستجو طراحی شده‌اند، ناخواسته در حال پاک کردن تاریخچه دیجیتال هستند. وقتی یک کسب‌وکار شکست می‌خورد و دامنه‌اش توسط مالک جدیدی پارک می‌شد، مالک جدید اغلب یک قانون مسدودسازی کلی (Disallow) اعمال می‌کرد تا سایت را از گوگل حذف کند. از آنجا که ماشین زمان قبلاً این قوانین را عطف به ماسبق رعایت می‌کرد، کل سابقه تاریخی سایتِ ازکارافتاده از آرشیو محو می‌شد.[4]

آرشیو اینترنت در به‌روزرسانی خط‌مشی خود اعلام کرد: «با گذشت زمان مشاهده کرده‌ایم که فایل‌های robots.txt که برای خزنده‌های موتورهای جستجو تنظیم شده‌اند، لزوماً در خدمت اهداف آرشیوی ما نیستند. هدف آرشیو اینترنت ایجاد اسنپ‌شات‌های کامل از صفحات وب است... ما آینده آرشیو وب را کمتر وابسته به اعلان‌های فایل robots.txt که برای موتورهای جستجو تنظیم شده‌اند، و بیشتر متکی بر بازنمایی وب به همان شکلی که واقعاً بود و هست، از دیدگاه کاربر می‌بینیم.» این تصمیم، حفظ سوابق عمومی را بر ترجیحات دسترسی موقت صاحبان دامنه‌ها اولویت داد.[4]

این تغییر رویه به این معنا بود که دامنه‌های پارک‌شده و کسب‌وکارهای تعطیل‌شده دیگر نمی‌توانستند صرفاً به خاطر اینکه مالک جدیدی یک قانون مسدودسازی کلی اضافه کرده، از سوابق تاریخی محو شوند. با این حال، این بدان معنا نیز بود که ناشرانی که سعی در محافظت از محتوای خود در برابر بلعیده شدن توسط هوش مصنوعی داشتند، متوجه شدند که سایت‌های آرشیوی می‌توانند به عنوان درِ پشتی برای اسکرپرها عمل کنند. اگر یک شرکت هوش مصنوعی به فایل robots.txt یک ناشر احترام بگذارد اما ماشین زمان را - که برای آرشیو کردن صفحه آن فایل را نادیده گرفته - اسکرپ کند، مالکیت معنوی ناشر باز هم سر از مجموعه داده‌های آموزشی درمی‌آورد. این خلأ، اعمال مرزهای دیجیتال را در سراسر وب مدرن به شدت پیچیده می‌کند.

امروزه، چشم‌انداز ترافیک خودکار وب بسیار پیچیده‌تر از آن چیزی است که استاندارد سال ۱۹۹۴ پیش‌بینی می‌کرد. ناشران بزرگ اکنون فایل‌های robots.txt گسترده‌ای را نگهداری می‌کنند که ده‌ها خزنده خاص هوش مصنوعی - از ClaudeBot متعلق به آنتروپیک گرفته تا Google-Extended و PerplexityBot - را فهرست می‌کنند. بر اساس ردیابی‌های اخیر صنعت، بیش از ۳.۵ درصد از وب‌سایت‌های برتر به طور فعال GPTBot را مسدود می‌کنند که آن را به محدودترین خزنده در اینترنت تبدیل کرده است. نگهداری از این فایل‌ها به یک شغل تمام‌وقت برای تیم‌های سئوی فنی تبدیل شده است که باید دائماً لاگ‌های سرور را برای شناسایی یوزر ایجنت‌های جدید بررسی کرده و لیست‌های محرومیت خود را بر اساس آن به‌روز کنند.

شرکت‌های هوش مصنوعی اکنون خزنده‌های جداگانه‌ای برای جستجوی درنگ‌درنگ و آموزش مدل اجرا می‌کنند.

با این حال، این پروتکل برای وظایفی که اکنون از آن خواسته می‌شود، ابزاری به شدت کُند و ناکارآمد باقی مانده است. این پروتکل نمی‌تواند بین خزنده‌ای که یک مدل تجاری هوش مصنوعی می‌سازد و پژوهشگر دانشگاهی که در حال جمع‌آوری دیتاست برای یک مطالعه است، تمایز قائل شود. نمی‌تواند درباره هزینه‌های صدور مجوز مذاکره کند، مرزهای کپی‌رایت را اعمال کند، یا هویت رباتی را که ادعا می‌کند یک یوزر ایجنت خاص است، تأیید کند. این فایل صرفاً از یک ماشین می‌خواهد که مؤدبانه روی برگرداند، و وقتی یک اسکرپر تصمیم می‌گیرد که ارزش داده‌ها بیشتر از قرارداد اجتماعی وب است، هیچ راهکار فنی‌ای ارائه نمی‌دهد.

در حالی که وب از اکوسیستمی از اسناد HTML لینک‌شده به مخزن عظیمی از داده‌های آموزشی خام در حال گذار است، نادیده گرفتن محدودیت‌های robots.txt غیرممکن می‌شود. متخصصان امنیت به طور فزاینده‌ای توصیه می‌کنند که داده‌های حساس باید توسط احراز هویت قوی و فایروال‌های برنامه‌های تحت وب محافظت شوند، نه درخواست‌های مؤدبانه. اگر ناشری واقعاً می‌خواهد از خواندن محتوایش توسط یک شرکت هوش مصنوعی جلوگیری کند، تنها روش تضمین‌شده این است که آن محتوا را پشت یک دیوار پرداخت (Paywall) سخت یا صفحه ورود قرار دهد، که این کار ماهیت باز اینترنت را اساساً تغییر می‌دهد.

آینده رضایت‌سنجی برای استخراج داده از وب احتمالاً به پروتکل‌های کاملاً جدیدی نیاز خواهد داشت که به طور خاص برای عصر هوش مصنوعی مولد طراحی شده باشند. پیشنهادهایی برای اصالت‌سنجی رمزنگاری‌شده، خزشِ احرازهویت‌شده و تگ‌های مجوز ماشین‌خوان به آرامی در میان نهادهای استانداردسازی و ناشران در حال جلب توجه هستند. هدف این سیستم‌ها جایگزینی سیستم «اعتماد و شرافت» با مکانیسم‌های رضایت‌سنجی قابل‌تأیید و امن از نظر رمزنگاری است. اما تا زمانی که این سیستم‌ها به طور کامل استاندارد و به طور گسترده پذیرفته نشوند، اینترنت کاملاً متکی به یک فایل متنی ساده ۳۰ ساله باقی می‌ماند که از پیشرفته‌ترین سیستم‌های هوش مصنوعی جهان می‌خواهد لطفاً قوانین را رعایت کنند.

نکات کلیدی

  • پروتکل حذف ربات‌ها (robots.txt) در سپتامبر ۲۰۲۲ به عنوان یک استاندارد رسمی اینترنت (RFC 9309) ثبت شد.
  • این فایل صرفاً یک درخواست مؤدبانه برای مدیریت بار سرور است؛ نه هویت بازدیدکنندگان را تأیید می‌کند و نه دسترسی را به صورت فیزیکی مسدود می‌کند.
  • مسدود کردن یک صفحه در robots.txt جلوی خزش را می‌گیرد، اما اگر سایت‌های دیگر به آن لینک دهند، مانع از ایندکس شدن URL توسط گوگل نمی‌شود.
  • شرکت OpenAI اکنون خزنده‌های جداگانه‌ای برای آموزش مدل (GPTBot) و جستجوی درنگ‌درنگ (OAI-SearchBot) اجرا می‌کند تا به مدیران وب‌سایت‌ها کنترل دقیق‌تری بدهد.
  • آرشیو اینترنت (Internet Archive) در سال ۲۰۱۷ برای جلوگیری از پاک شدن تاریخچه دیجیتال، پایبندی سفت‌وسخت به این پروتکل را متوقف کرد.

بررسی عمیق دیدگاه‌ها

ناشران وب

ناشران فایل robots.txt را به عنوان خط مقدم دفاع در برابر بلعیده شدن غیرمجاز داده‌ها توسط هوش مصنوعی می‌بینند.

برای تولیدکنندگان محتوا و سازمان‌های خبری، این پروتکل از یک ابزار فنی به یک ابزار حیاتی برای مالکیت معنوی تبدیل شده است. ناشران استدلال می‌کنند که اقدام شرکت‌های هوش مصنوعی در استخراج آرشیو آن‌ها برای آموزش مدل‌های تجاری بدون پرداخت غرامت، یک عمل استخراجی و سوءاستفاده‌گرانه است. آن‌ها با غیرمجاز کردن صریح ربات‌هایی مانند GPTBot و ClaudeBot، تلاش می‌کنند یک مرز دیجیتال ترسیم کنند، حتی با وجود اینکه اذعان دارند این فایل متنی به خودی خود هیچ مکانیسم اجرایی قانونی یا فنی ندارد.

توسعه‌دهندگان مدل‌های هوش مصنوعی

شرکت‌های هوش مصنوعی برای پیمایش داده‌های عمومی به این پروتکل متکی هستند و در عین حال گزینه‌های انصراف دقیقی را ارائه می‌دهند.

توسعه‌دهندگان مدل‌های پایه استدلال می‌کنند که خواندن صفحات وبِ در دسترس عموم، مصداق استفاده منصفانه (Fair Use) است. با این حال، شرکت‌هایی مانند OpenAI با درک واکنش منفی ناشران، خزنده‌های خود را دوشاخه کرده‌اند. آن‌ها با جداسازی آموزش مدل (GPTBot) از ایندکس کردن جستجوی درنگ‌درنگ (OAI-SearchBot)، به مدیران وب‌سایت‌ها اجازه می‌دهند از پیکره آموزشی انصراف دهند اما همچنان در محصولات جستجوی مبتنی بر هوش مصنوعی قابل مشاهده باشند. آن‌ها تأکید می‌کنند که به شدت به دستورالعمل‌های قرار گرفته در فایل‌های robots.txt احترام می‌گذارند.

آرشیویست‌های دیجیتال

آرشیویست‌ها استدلال می‌کنند که پایبندی سفت‌وسخت به این پروتکل، سوابق تاریخی را تخریب می‌کند.

سازمان‌هایی مانند آرشیو اینترنت، robots.txt را ابزاری می‌دانند که برای موتورهای جستجوی تجاری بهینه‌سازی شده است، نه برای حفظ تاریخ. آن‌ها خاطرنشان می‌کنند که وقتی کسب‌وکارها شکست می‌خورند، دامنه‌هایشان اغلب پارک شده و با قوانین کلی 'Disallow: /' پوشانده می‌شود، که از نظر تاریخی ماشین زمان را مجبور می‌کرد سال‌ها اسنپ‌شات آرشیوشده را پاک کند. آرشیویست‌ها با انتخاب دور زدن این قوانین، کامل بودن سوابق دیجیتال عمومی را بر ترجیحات دسترسی موقت صاحبان دامنه‌ها اولویت می‌دهند.

چرا مهم است

در حالی که شرکت‌های هوش مصنوعی مولد برای آموزش مدل‌هایشان وب عمومی را می‌خزند، فایل robots.txt در حال حاضر تنها ابزار استانداردی است که ناشران برای انصراف در اختیار دارند. درک محدودیت‌های این فایل برای هر کسی که به دنبال محافظت از مالکیت معنوی خود در فضای آنلاین است، حیاتی است.

منابع

پوشش منابع

5 منبع

4 دیدگاه شناسایی‌شده

ناشران وب 35%اپراتورهای موتورهای جستجو 25%توسعه‌دهندگان مدل‌های هوش مصنوعی 25%آرشیویست‌های دیجیتال 15%
  1. [1]Google Search Centralاپراتورهای موتورهای جستجو

    Introduction to robots.txt

    مطالعه در Google Search Central
  2. [2]OpenAIتوسعه‌دهندگان مدل‌های هوش مصنوعی

    OpenAI web crawlers and user agents

    مطالعه در OpenAI
  3. [3]RFC Editor

    RFC 9309: Robots Exclusion Protocol

    مطالعه در RFC Editor
  4. [4]Internet Archiveآرشیویست‌های دیجیتال

    Robots.txt meant for search engines don't work well for web archives

    مطالعه در Internet Archive
  5. [5]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.