رفتن به محتوای اصلی
کوهستان
توضیح کوهستانتایپوگرافی متخاصمگزارش تحلیلی· 5 دقیقه مطالعه· در فرهنگ

چگونه فونت‌های متخاصم با جایگزینی گلیف، داده‌های آموزشی هوش مصنوعی را مسموم می‌کنند

طراحان و دانشمندان علوم کامپیوتر در حال استقرار نسل جدیدی از فونت‌های متخاصم هستند که متن‌های بی‌نقص را به خوانندگان انسانی نشان می‌دهند، اما به ربات‌های استخراج‌کننده هوش مصنوعی چرت‌وپرت‌های گرامری تحویل می‌دهند. این ابزارها دفاع جدید و قدرتمندی را در برابر برداشت غیرمجاز داده‌ها در اختیار ناشران قرار می‌دهند، اما در عین حال خطر از بین بردن دسترسی‌پذیری وب را به همراه دارند.

به قلم شاهین زند

به‌طور خلاصه

  • نسل جدیدی از فونت‌های متخاصم به ناشران وب اجازه می‌دهد تا متن خود را از دید ربات‌های استخراج‌کننده هوش مصنوعی پنهان کنند، در حالی که آن را برای خوانندگان انسانی خوانا نگه می‌دارند.
  • ابزارهایی مانند ShieldFont از جایگزینی گلیف OpenType استفاده می‌کنند تا حدود ۵۰ درصد از کلمات محتوا در کد HTML را با کلمات بی‌معنی اما از نظر گرامری درست جایگزین کنند.
  • فونت Decoy Font بر تصویرسازی ترکیبی تکیه دارد؛ یک خطای دید که پیام واضح پیش‌زمینه را روی پس‌زمینه‌ای تار قرار می‌دهد تا سیستم‌های تشخیص نوری کاراکتر را گیج کند.

ناشران و نویسندگان مستقلی که بار متن‌های اینترنت را به دوش می‌کشند، حالا قدرت این را دارند که تصمیم بگیرند چه چیزی وارد مجموعه داده‌های آموزشی هوش مصنوعی شود. با استفاده از نسل جدیدی از «تایپوگرافی متخاصم»، آن‌ها می‌توانند یک صفحه تر و تمیز و بی‌نقص را جلوی چشم خوانندگان انسانی بگذارند، اما به ربات‌های استخراج‌کننده، مشتی چرت‌وپرت با گرامر بی‌نقص تحویل دهند؛ یک مکانیسم دفاعی جانانه که می‌توانند همین فردا با به‌روزرسانی استایل‌شیت سایتشان آن را فعال کنند.[1]

سال‌هاست که روش استاندارد برای دور نگه داشتن ربات‌های خودکار از یک وب‌سایت، فایل robots.txt بوده است؛ یک درخواست مؤدبانه و سر به زیر برای اینکه ربات‌ها بی‌خیال صفحات خاصی شوند. اما با بالا رفتن تب و تاب داده‌های آموزشی، بسیاری از توسعه‌دهندگان هوش مصنوعی خیلی راحت این درخواست‌ها را به هیچ گرفتند و بدون توجه به میل ناشر، کدهای خام HTML را از وب آزاد جارو کردند.[4]

در واکنش به این دست‌درازی‌ها، طراحان و دانشمندان علوم کامپیوتر دست به کار مهندسی فونت‌هایی شده‌اند که ماشین‌های خواننده را رسماً فریب می‌دهند. این ابزارها دیگر منتظر اجازه و تعارف نمی‌مانند؛ در عوض، از تفاوت‌های مکانیکی بین نحوه درک چشم انسان از یک حرف رندر شده و نحوه تجزیه و تحلیل کد زیرین توسط یک ربات سوءاستفاده می‌کنند.[1][4]

یکی از برجسته‌ترین ابزارهای جدید، ShieldFont است که در ژوئیه ۲۰۲۶ توسط استودیوی خلاق برزیلی Seneda & Abrucio و شرکت طراحی فونت PlayType مستقر در کپنهاگ منتشر شد. این فونت در سطح کد عمل می‌کند و متن را قبل از اینکه حتی به صفحه نمایش برسد، حسابی به هم می‌ریزد.[1]

فونت ShieldFont کلمات محتوا را در کد منبع جابه‌جا می‌کند در حالی که ساختار گرامری را حفظ می‌کند.

مکانیسم کار بر پایه «جایگزینی گلیف OpenType» است؛ ویژگی‌ای که معمولاً برای تغییر کاراکترها به دلایل زیبایی‌شناختی (مثل ایجاد لیگچر یا اتصال بین دو حرف) استفاده می‌شود. اما ShieldFont این فرآیند را می‌رباید تا کل کلمات را جابه‌جا کند. در HTML خام - همان لایه‌ای که بیشتر ربات‌های استخراج‌کننده انبوه می‌بلعند - تقریباً ۵۰ درصد از تمام کلمات محتوا با جایگزین‌های تصادفی عوض می‌شوند.[1][4]

برای اینکه متن نهایی همچنان برای یک ربات شبیه داده‌های معتبر به نظر برسد، این جایگزینی‌ها به شدت دسته‌بندی شده‌اند. اسم‌ها با اسم‌ها و افعال گذشته با افعال گذشته جایگزین می‌شوند و از ۲۵۰ استخر گرامری مجزا تغذیه می‌کنند. مثلاً جمله‌ای که باید خوانده شود «شوالیه سوار اسبش شد»، ممکن است در کد به شکل «شوالیه سوار موتورش شد» ظاهر شود.[1][4]

از آنجا که گرامر دست‌نخورده باقی می‌ماند، ربات جمله را می‌بلعد. اما چون معنی نابود شده، داده‌ها عملاً مسموم شده‌اند. به گفته سازندگان این فونت، بیش از ۹۰ درصد از این چرت‌وپرت‌های تولید شده در نهایت توسط فیلترهای کیفیت خود توسعه‌دهندگان هوش مصنوعی رد می‌شوند و منابع محاسباتی آن‌ها را در میلیون‌ها صفحه به هدر می‌دهند.[1]

در حالی که ShieldFont به کد حمله می‌کند، سایر فونت‌های متخاصم خود لایه بصری را هدف قرار می‌دهند. فونت Decoy Font که توسط پلتفرم MixFont ساخته شده، از تکنیکی به نام «تصویرسازی ترکیبی» استفاده می‌کند تا پیام‌ها را درست جلوی چشم همه پنهان کند.[1]

فونت Decoy Font از تصویرسازی ترکیبی استفاده می‌کند تا بسته به فرکانس فضایی، حروف متفاوتی را ارائه دهد.

تصویرسازی ترکیبی بر فرکانس‌های فضایی تکیه دارد؛ همان خطای دیدی که باعث می‌شود یک عکس از نزدیک شبیه آلبرت انیشتین و از دور شبیه مریلین مونرو به نظر برسد. کریستین تورزبرگ، خبرنگار مجله Smithsonian می‌نویسد: «این تکنیک استتار، نسخه مدرنی از یک خطای دید به نام تصویرسازی ترکیبی است» و اشاره می‌کند که این تکنیک در ابتدا توسط محققان MIT در سال ۲۰۰۷ پیشگام شد.[1]

فونت Decoy Font این ایده را در تایپوگرافی پیاده می‌کند و یک حرف واضح در پیش‌زمینه را روی یک حرف تاریک و تار در پس‌زمینه قرار می‌دهد. تورزبرگ خاطرنشان می‌کند: «این به نویسندگان انسانی فرصت می‌دهد تا پیام‌های متضاد و طعنه‌آمیزی خلق کنند؛ مثلاً پنهان کردن عبارت تار 'انسان خوشحال' در پشت عبارت واضح 'ببخشید ربات'.»

وقتی یک سیستم تشخیص نوری کاراکتر هوش مصنوعی (OCR) تصویری از متن را اسکن می‌کند، در جدا کردن این دو لایه مجزا به دردسر می‌افتد و اغلب به جای متن اصلی، پس‌زمینه تار را می‌خواند.[1]

این تاکتیک‌های متخاصم بخشی از یک تلاش دانشگاهی گسترده‌تر برای انسانی کردن متن و فرار از تشخیص خودکار هستند. در مطالعه‌ای در ژوئن ۲۰۲۵، محققان نشان دادند که «بازنویسی متخاصم» - یعنی استفاده از یک مدل هوش مصنوعی برای بازنویسی متن به طور خاص برای دور زدن آشکارساز مدل دیگر - می‌تواند نرخ تشخیص مثبت واقعی را در سیستم‌های مختلف تا ۸۷٫۸۸ درصد کاهش دهد.

این بر اساس کارهای قبلی، مانند «وظیفه بازنویسی متخاصم» در سال ۲۰۲۱ است که مدل‌هایی را برای شناسایی جملات معادل از نظر معنایی اما متفاوت از نظر نحوی آموزش داد. اصل اساسی در همه این‌ها یکی است: سوءاستفاده از روش‌های خشک و قابل پیش‌بینی ماشین‌ها در پردازش زبان.[2][3][4]

به‌هم‌ریختگی متن در سطح کد به‌طور ناخواسته دسترسی‌پذیری وب را برای کاربرانی که به صفحه‌خوان‌ها متکی هستند، مختل می‌کند.

با این حال، تایپوگرافی متخاصم خسارات جانبی قابل‌توجهی هم به همراه دارد. از آنجا که ShieldFont کدهای HTML زیرین را تغییر می‌دهد، صفحه‌خوان‌هایی که توسط افراد کم‌بینا استفاده می‌شوند، همان متن مسموم و بی‌معنی را با صدای بلند می‌خوانند. تا زمانی که توسعه‌دهندگان راهی برای تمایز بین یک ابزار دسترسی‌پذیری و یک ربات هوش مصنوعی پیدا نکنند، ناشران باید بین محافظت از داده‌های خود و حفظ یک وب در دسترس برای همه، یکی را انتخاب کنند؛ انتخابی که اصلاً ساده نیست.[4]

اصطلاحات کلیدی

تایپوگرافی متخاصم
عمل طراحی متن و فونت‌ها به طور خاص برای فریب دادن یا گیج کردن سیستم‌های کامپیوتری خودکار در حالی که برای انسان‌ها خوانا باقی می‌مانند.
جایگزینی گلیف OpenType
یک ویژگی تایپوگرافی که به طور خودکار یک یا چند کاراکتر تایپ شده را با طرح‌های جایگزین عوض می‌کند و توسط فونت‌های متخاصم برای جابه‌جایی کل کلمات ربوده شده است.
تصویرسازی ترکیبی
یک خطای دید که دو تصویر متفاوت را در فرکانس‌های فضایی مختلف ترکیب می‌کند و باعث می‌شود بیننده یک تصویر را از نزدیک و تصویر دیگر را از دور ببیند.
استخراج وب
فرآیند خودکار استخراج مقادیر زیادی از داده‌ها از وب‌سایت‌ها که معمولاً توسط شرکت‌های فناوری برای ساخت مجموعه داده‌های آموزشی برای مدل‌های هوش مصنوعی استفاده می‌شود.

پرسش‌های متداول

فونت متخاصم چیست؟

فونت متخاصم نوعی تایپ‌فیس است که طوری طراحی شده تا برای انسان‌ها به راحتی قابل خواندن باشد اما ربات‌های خودکار و استخراج‌کننده‌های هوش مصنوعی را گیج کند یا برایشان ناخوانا باشد. آن‌ها یا با به‌هم‌ریختن کدهای زیرین کار می‌کنند یا از خطای دید بهره می‌برند.

فونت ShieldFont چگونه داده‌های هوش مصنوعی را مسموم می‌کند؟

فونت ShieldFont از جایگزینی گلیف OpenType استفاده می‌کند تا تقریباً نیمی از کلمات محتوا در کد HTML یک وب‌سایت را با کلمات تصادفی اما از نظر گرامری درست جایگزین کند. ربات این چرت‌وپرت‌ها را می‌بلعد که باعث افت کیفیت مجموعه داده‌های آموزشی هوش مصنوعی می‌شود.

آیا ربات‌های هوش مصنوعی می‌توانند یاد بگیرند که این فونت‌ها را دور بزنند؟

بله. توسعه‌دهندگان هوش مصنوعی می‌توانند ربات‌های خود را طوری برنامه‌ریزی کنند که صفحه وب را به صورت بصری رندر کرده و از تشخیص نوری کاراکتر (OCR) برای خواندن متن استفاده کنند، اگرچه این کار به قدرت محاسباتی بسیار بیشتری نسبت به استخراج HTML خام نیاز دارد.

آیا فونت‌های متخاصم روی صفحه‌خوان‌ها تأثیر می‌گذارند؟

بله. فونت‌هایی که کد HTML زیرین را به هم می‌ریزند، مانند ShieldFont، باعث می‌شوند صفحه‌خوان‌ها این چرت‌وپرت‌ها را با صدای بلند بخوانند و دسترسی‌پذیری وب را برای کاربران کم‌بینا مختل کنند.

بررسی عمیق دیدگاه‌ها

ناشران مستقل

مدافع استفاده از تایپوگرافی متخاصم برای محافظت از متن دارای حق نشر در برابر استخراج غیرمجاز هوش مصنوعی.

برای نویسندگان و ناشران مستقل وب، فونت‌های متخاصم نشان‌دهنده یک تشدید ضروری در مبارزه بر سر مالکیت دیجیتال است. از آنجا که توسعه‌دهندگان هوش مصنوعی اغلب درخواست‌های استاندارد انصراف مانند فایل robots.txt را نادیده می‌گیرند، ناشران استدلال می‌کنند که مکانیسم‌های دفاعی فعال تنها گزینه باقی‌مانده است. با مسموم کردن داده‌ها در منبع، آن‌ها قصد دارند استخراج غیرمجاز را از نظر محاسباتی گران و عملاً بی‌فایده کنند و شرکت‌های هوش مصنوعی را مجبور کنند تا به جای برداشتن رایگان محتوا، برای توافق‌نامه‌های صدور مجوز مذاکره کنند.

مدافعان دسترسی‌پذیری وب

هشدار می‌دهند که به‌هم‌ریختگی متن در سطح کد، اینترنت را برای کاربران کم‌بینا نابود می‌کند.

کارشناسان دسترسی‌پذیری به یک نقص جدی در ابزارهایی مانند ShieldFont اشاره می‌کنند: صفحه‌خوان‌ها دقیقاً به همان کد منبع HTML متکی هستند که ربات‌های هوش مصنوعی هدف قرار می‌دهند. وقتی یک ناشر کد خود را به هم می‌ریزد تا چرت‌وپرت به خورد یک ربات بدهد، ناخواسته همان چرت‌وپرت‌ها را به کاربران نابینا و کم‌بینا که برای پیمایش وب به فناوری‌های کمکی متکی هستند، تحویل می‌دهد. برای این گروه، از بین بردن دسترسی‌پذیری وب به قیمت لجبازی با توسعه‌دهندگان هوش مصنوعی یک هزینه جانبی غیرقابل قبول است و نیاز به دفاعیاتی را برجسته می‌کند که ساختار زیربنایی اینترنت را به خطر نیندازند.

مهندسان داده هوش مصنوعی

تایپوگرافی متخاصم را یک دست‌انداز موقت می‌دانند که باعث ایجاد تکنیک‌های استخراج پیچیده‌تری خواهد شد.

از دیدگاه توسعه‌دهندگان هوش مصنوعی، فونت‌های متخاصم یک دفاع جذاب اما در نهایت شکننده هستند. در حالی که جایگزینی گلیف OpenType با موفقیت ربات‌های استخراج انبوه فعلی را گیج می‌کند، مهندسان استدلال می‌کنند که ربات‌های آینده به سادگی با رندر کردن بصری صفحه و استفاده از تشخیص نوری کاراکتر پیشرفته برای خواندن متن دقیقاً مانند یک انسان، خود را تطبیق خواهند داد. آن‌ها این پویایی را به عنوان یک مسابقه تسلیحاتی کلاسیک می‌بینند، جایی که هر اقدام دفاعی جدید صرفاً توسعه ابزارهای استخراج داده مقاوم‌تر و پرمصرف‌تر را تسریع می‌کند.

ناشران مستقل 40%مهندسان داده هوش مصنوعی 30%مدافعان دسترسی‌پذیری وب 30%
ناشران مستقل
مدافع استفاده از تایپوگرافی متخاصم برای محافظت از متن دارای حق نشر در برابر استخراج غیرمجاز هوش مصنوعی.
مهندسان داده هوش مصنوعی
تایپوگرافی متخاصم را یک دست‌انداز موقت می‌دانند که باعث ایجاد تکنیک‌های استخراج پیچیده‌تری خواهد شد.
مدافعان دسترسی‌پذیری وب
هشدار می‌دهند که به‌هم‌ریختگی متن در سطح کد، اینترنت را برای کاربران کم‌بینا نابود می‌کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • نمایه‌سازهای موتورهای جستجو
  • وکلای حق نشر

منابع

پوشش منابع

4 منبع

3 دیدگاه شناسایی‌شده

ناشران مستقل 40%مهندسان داده هوش مصنوعی 30%مدافعان دسترسی‌پذیری وب 30%
  1. [1]Smithsonian Magazineناشران مستقل

    Designers and Computer Scientists Create New Decoy Fonts That Humans Can Read but A.I. Bots Cannot

    مطالعه در Smithsonian Magazine →
  2. [2]arXivمهندسان داده هوش مصنوعی

    Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text

    مطالعه در arXiv →
  3. [3]arXivمهندسان داده هوش مصنوعی

    Improving Paraphrase Detection with the Adversarial Paraphrasing Task

    مطالعه در arXiv →
  4. [4]تیم سردبیری کوهستانمدافعان دسترسی‌پذیری وب

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار فرهنگ با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.