رفتن به محتوای اصلی
Koohestun
توضیح کوهستانتایپوگرافی متخاصمگزارش تحلیلی· 5 دقیقه مطالعه· در فرهنگ

چگونه فونت‌های متخاصم با جایگزینی گلیف، داده‌های آموزشی هوش مصنوعی را مسموم می‌کنند

طراحان و دانشمندان علوم کامپیوتر در حال استقرار نسل جدیدی از فونت‌های متخاصم هستند که متن‌های بی‌نقص را به خوانندگان انسانی نشان می‌دهند، اما به ربات‌های استخراج‌کننده هوش مصنوعی چرت‌وپرت‌های گرامری تحویل می‌دهند. این ابزارها دفاع جدید و قدرتمندی را در برابر برداشت غیرمجاز داده‌ها در اختیار ناشران قرار می‌دهند، اما در عین حال خطر از بین بردن دسترسی‌پذیری وب را به همراه دارند.

به قلم شاهین زند

ناشران مستقل 40%مهندسان داده هوش مصنوعی 30%مدافعان دسترسی‌پذیری وب 30%
ناشران مستقل
مدافع استفاده از تایپوگرافی متخاصم برای محافظت از متن دارای حق نشر در برابر استخراج غیرمجاز هوش مصنوعی.
مهندسان داده هوش مصنوعی
تایپوگرافی متخاصم را یک دست‌انداز موقت می‌دانند که باعث ایجاد تکنیک‌های استخراج پیچیده‌تری خواهد شد.
مدافعان دسترسی‌پذیری وب
هشدار می‌دهند که به‌هم‌ریختگی متن در سطح کد، اینترنت را برای کاربران کم‌بینا نابود می‌کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • نمایه‌سازهای موتورهای جستجو
  • وکلای حق نشر

نکات کلیدی

  • نسل جدیدی از فونت‌های متخاصم به ناشران وب اجازه می‌دهد تا متن خود را از دید ربات‌های استخراج‌کننده هوش مصنوعی پنهان کنند، در حالی که آن را برای خوانندگان انسانی خوانا نگه می‌دارند.
  • ابزارهایی مانند ShieldFont از جایگزینی گلیف OpenType استفاده می‌کنند تا حدود ۵۰ درصد از کلمات محتوا در کد HTML را با کلمات بی‌معنی اما از نظر گرامری درست جایگزین کنند.
  • فونت Decoy Font بر تصویرسازی ترکیبی تکیه دارد؛ یک خطای دید که پیام واضح پیش‌زمینه را روی پس‌زمینه‌ای تار قرار می‌دهد تا سیستم‌های تشخیص نوری کاراکتر را گیج کند.
  • در حالی که این فونت‌ها با موفقیت داده‌های آموزشی غیرمجاز را مسموم می‌کنند، به‌هم‌ریختگی متن در سطح کد به‌طور ناخواسته دسترسی‌پذیری وب را برای کاربران کم‌بینایی که به صفحه‌خوان‌ها متکی هستند، مختل می‌کند.

چرا مهم است

در شرایطی که شرکت‌های هوش مصنوعی درخواست‌های مؤدبانه برای توقف استخراج داده از وب آزاد را نادیده می‌گیرند، تایپوگرافی متخاصم سلاحی فنی به ناشران مستقل می‌دهد تا فعالانه از آثار دارای حق نشر خود دفاع کنند. با این حال، این مسابقه تسلیحاتی فزاینده زیرساخت‌های اصلی اینترنت را تهدید می‌کند و صاحبان سایت‌ها را مجبور می‌کند بین محافظت از داده‌هایشان و در دسترس نگه‌داشتن محتوای خود برای خوانندگان کم‌بینا یکی را انتخاب کنند.

ناشران و نویسندگان مستقلی که بار متن‌های اینترنت را به دوش می‌کشند، حالا قدرت این را دارند که تصمیم بگیرند چه چیزی وارد مجموعه داده‌های آموزشی هوش مصنوعی شود. با استفاده از نسل جدیدی از «تایپوگرافی متخاصم»، آن‌ها می‌توانند یک صفحه تر و تمیز و بی‌نقص را جلوی چشم خوانندگان انسانی بگذارند، اما به ربات‌های استخراج‌کننده، مشتی چرت‌وپرت با گرامر بی‌نقص تحویل دهند؛ یک مکانیسم دفاعی جانانه که می‌توانند همین فردا با به‌روزرسانی استایل‌شیت سایتشان آن را فعال کنند.[1]

سال‌هاست که روش استاندارد برای دور نگه داشتن ربات‌های خودکار از یک وب‌سایت، فایل robots.txt بوده است؛ یک درخواست مؤدبانه و سر به زیر برای اینکه ربات‌ها بی‌خیال صفحات خاصی شوند. اما با بالا رفتن تب و تاب داده‌های آموزشی، بسیاری از توسعه‌دهندگان هوش مصنوعی خیلی راحت این درخواست‌ها را به هیچ گرفتند و بدون توجه به میل ناشر، کدهای خام HTML را از وب آزاد جارو کردند.[4]

در واکنش به این دست‌درازی‌ها، طراحان و دانشمندان علوم کامپیوتر دست به کار مهندسی فونت‌هایی شده‌اند که ماشین‌های خواننده را رسماً فریب می‌دهند. این ابزارها دیگر منتظر اجازه و تعارف نمی‌مانند؛ در عوض، از تفاوت‌های مکانیکی بین نحوه درک چشم انسان از یک حرف رندر شده و نحوه تجزیه و تحلیل کد زیرین توسط یک ربات سوءاستفاده می‌کنند.[1][4]

یکی از برجسته‌ترین ابزارهای جدید، ShieldFont است که در ژوئیه ۲۰۲۶ توسط استودیوی خلاق برزیلی Seneda & Abrucio و شرکت طراحی فونت PlayType مستقر در کپنهاگ منتشر شد. این فونت در سطح کد عمل می‌کند و متن را قبل از اینکه حتی به صفحه نمایش برسد، حسابی به هم می‌ریزد.[1]

فونت ShieldFont کلمات محتوا را در کد منبع جابه‌جا می‌کند در حالی که ساختار گرامری را حفظ می‌کند.

مکانیسم کار بر پایه «جایگزینی گلیف OpenType» است؛ ویژگی‌ای که معمولاً برای تغییر کاراکترها به دلایل زیبایی‌شناختی (مثل ایجاد لیگچر یا اتصال بین دو حرف) استفاده می‌شود. اما ShieldFont این فرآیند را می‌رباید تا کل کلمات را جابه‌جا کند. در HTML خام - همان لایه‌ای که بیشتر ربات‌های استخراج‌کننده انبوه می‌بلعند - تقریباً ۵۰ درصد از تمام کلمات محتوا با جایگزین‌های تصادفی عوض می‌شوند.[1][4]

مکانیسم کار بر پایه «جایگزینی گلیف OpenType» است؛ ویژگی‌ای که معمولاً برای تغییر کاراکترها به دلایل زیبایی‌شناختی (مثل ایجاد لیگچر یا اتصال بین دو حرف) استفاده می‌شود.

برای اینکه متن نهایی همچنان برای یک ربات شبیه داده‌های معتبر به نظر برسد، این جایگزینی‌ها به شدت دسته‌بندی شده‌اند. اسم‌ها با اسم‌ها و افعال گذشته با افعال گذشته جایگزین می‌شوند و از ۲۵۰ استخر گرامری مجزا تغذیه می‌کنند. مثلاً جمله‌ای که باید خوانده شود «شوالیه سوار اسبش شد»، ممکن است در کد به شکل «شوالیه سوار موتورش شد» ظاهر شود.[1][4]

از آنجا که گرامر دست‌نخورده باقی می‌ماند، ربات جمله را می‌بلعد. اما چون معنی نابود شده، داده‌ها عملاً مسموم شده‌اند. به گفته سازندگان این فونت، بیش از ۹۰ درصد از این چرت‌وپرت‌های تولید شده در نهایت توسط فیلترهای کیفیت خود توسعه‌دهندگان هوش مصنوعی رد می‌شوند و منابع محاسباتی آن‌ها را در میلیون‌ها صفحه به هدر می‌دهند.[1]

در حالی که ShieldFont به کد حمله می‌کند، سایر فونت‌های متخاصم خود لایه بصری را هدف قرار می‌دهند. فونت Decoy Font که توسط پلتفرم MixFont ساخته شده، از تکنیکی به نام «تصویرسازی ترکیبی» استفاده می‌کند تا پیام‌ها را درست جلوی چشم همه پنهان کند.[1]

فونت Decoy Font از تصویرسازی ترکیبی استفاده می‌کند تا بسته به فرکانس فضایی، حروف متفاوتی را ارائه دهد.

تصویرسازی ترکیبی بر فرکانس‌های فضایی تکیه دارد؛ همان خطای دیدی که باعث می‌شود یک عکس از نزدیک شبیه آلبرت انیشتین و از دور شبیه مریلین مونرو به نظر برسد. کریستین تورزبرگ، خبرنگار مجله Smithsonian می‌نویسد: «این تکنیک استتار، نسخه مدرنی از یک خطای دید به نام تصویرسازی ترکیبی است» و اشاره می‌کند که این تکنیک در ابتدا توسط محققان MIT در سال ۲۰۰۷ پیشگام شد.[1]

فونت Decoy Font این ایده را در تایپوگرافی پیاده می‌کند و یک حرف واضح در پیش‌زمینه را روی یک حرف تاریک و تار در پس‌زمینه قرار می‌دهد. تورزبرگ خاطرنشان می‌کند: «این به نویسندگان انسانی فرصت می‌دهد تا پیام‌های متضاد و طعنه‌آمیزی خلق کنند؛ مثلاً پنهان کردن عبارت تار 'انسان خوشحال' در پشت عبارت واضح 'ببخشید ربات'.» وقتی یک سیستم تشخیص نوری کاراکتر هوش مصنوعی (OCR) تصویری از متن را اسکن می‌کند، در جدا کردن این دو لایه مجزا به دردسر می‌افتد و اغلب به جای متن اصلی، پس‌زمینه تار را می‌خواند.[1]

این تاکتیک‌های متخاصم بخشی از یک تلاش دانشگاهی گسترده‌تر برای انسانی کردن متن و فرار از تشخیص خودکار هستند. در مطالعه‌ای در ژوئن ۲۰۲۵، محققان نشان دادند که «بازنویسی متخاصم» - یعنی استفاده از یک مدل هوش مصنوعی برای بازنویسی متن به طور خاص برای دور زدن آشکارساز مدل دیگر - می‌تواند نرخ تشخیص مثبت واقعی را در سیستم‌های مختلف تا ۸۷٫۸۸ درصد کاهش دهد. این بر اساس کارهای قبلی، مانند «وظیفه بازنویسی متخاصم» در سال ۲۰۲۱ است که مدل‌هایی را برای شناسایی جملات معادل از نظر معنایی اما متفاوت از نظر نحوی آموزش داد. اصل اساسی در همه این‌ها یکی است: سوءاستفاده از روش‌های خشک و قابل پیش‌بینی ماشین‌ها در پردازش زبان.[2][3][4]

به‌هم‌ریختگی متن در سطح کد به‌طور ناخواسته دسترسی‌پذیری وب را برای کاربرانی که به صفحه‌خوان‌ها متکی هستند، مختل می‌کند.

با این حال، تایپوگرافی متخاصم خسارات جانبی قابل‌توجهی هم به همراه دارد. از آنجا که ShieldFont کدهای HTML زیرین را تغییر می‌دهد، صفحه‌خوان‌هایی که توسط افراد کم‌بینا استفاده می‌شوند، همان متن مسموم و بی‌معنی را با صدای بلند می‌خوانند. تا زمانی که توسعه‌دهندگان راهی برای تمایز بین یک ابزار دسترسی‌پذیری و یک ربات هوش مصنوعی پیدا نکنند، ناشران باید بین محافظت از داده‌های خود و حفظ یک وب در دسترس برای همه، یکی را انتخاب کنند؛ انتخابی که اصلاً ساده نیست.[4]

منابع

پوشش منابع

4 منبع

3 دیدگاه شناسایی‌شده

ناشران مستقل 40%مهندسان داده هوش مصنوعی 30%مدافعان دسترسی‌پذیری وب 30%
  1. [1]Smithsonian Magazineناشران مستقل

    Designers and Computer Scientists Create New Decoy Fonts That Humans Can Read but A.I. Bots Cannot

    مطالعه در Smithsonian Magazine
  2. [2]arXivمهندسان داده هوش مصنوعی

    Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text

    مطالعه در arXiv
  3. [3]arXivمهندسان داده هوش مصنوعی

    Improving Paraphrase Detection with the Adversarial Paraphrasing Task

    مطالعه در arXiv
  4. [4]تیم سردبیری کوهستانمدافعان دسترسی‌پذیری وب

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فرهنگ اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.