چگونه فونتهای متخاصم با جایگزینی گلیف، دادههای آموزشی هوش مصنوعی را مسموم میکنند
طراحان و دانشمندان علوم کامپیوتر در حال استقرار نسل جدیدی از فونتهای متخاصم هستند که متنهای بینقص را به خوانندگان انسانی نشان میدهند، اما به رباتهای استخراجکننده هوش مصنوعی چرتوپرتهای گرامری تحویل میدهند. این ابزارها دفاع جدید و قدرتمندی را در برابر برداشت غیرمجاز دادهها در اختیار ناشران قرار میدهند، اما در عین حال خطر از بین بردن دسترسیپذیری وب را به همراه دارند.
به قلم شاهین زند
این خبر را به اشتراک بگذارید
- ناشران مستقل
- مدافع استفاده از تایپوگرافی متخاصم برای محافظت از متن دارای حق نشر در برابر استخراج غیرمجاز هوش مصنوعی.
- مهندسان داده هوش مصنوعی
- تایپوگرافی متخاصم را یک دستانداز موقت میدانند که باعث ایجاد تکنیکهای استخراج پیچیدهتری خواهد شد.
- مدافعان دسترسیپذیری وب
- هشدار میدهند که بههمریختگی متن در سطح کد، اینترنت را برای کاربران کمبینا نابود میکند.
دیدگاههایی که این گزارش پوشش نداده
- نمایهسازهای موتورهای جستجو
- وکلای حق نشر
نکات کلیدی
- نسل جدیدی از فونتهای متخاصم به ناشران وب اجازه میدهد تا متن خود را از دید رباتهای استخراجکننده هوش مصنوعی پنهان کنند، در حالی که آن را برای خوانندگان انسانی خوانا نگه میدارند.
- ابزارهایی مانند ShieldFont از جایگزینی گلیف OpenType استفاده میکنند تا حدود ۵۰ درصد از کلمات محتوا در کد HTML را با کلمات بیمعنی اما از نظر گرامری درست جایگزین کنند.
- فونت Decoy Font بر تصویرسازی ترکیبی تکیه دارد؛ یک خطای دید که پیام واضح پیشزمینه را روی پسزمینهای تار قرار میدهد تا سیستمهای تشخیص نوری کاراکتر را گیج کند.
- در حالی که این فونتها با موفقیت دادههای آموزشی غیرمجاز را مسموم میکنند، بههمریختگی متن در سطح کد بهطور ناخواسته دسترسیپذیری وب را برای کاربران کمبینایی که به صفحهخوانها متکی هستند، مختل میکند.
چرا مهم است
در شرایطی که شرکتهای هوش مصنوعی درخواستهای مؤدبانه برای توقف استخراج داده از وب آزاد را نادیده میگیرند، تایپوگرافی متخاصم سلاحی فنی به ناشران مستقل میدهد تا فعالانه از آثار دارای حق نشر خود دفاع کنند. با این حال، این مسابقه تسلیحاتی فزاینده زیرساختهای اصلی اینترنت را تهدید میکند و صاحبان سایتها را مجبور میکند بین محافظت از دادههایشان و در دسترس نگهداشتن محتوای خود برای خوانندگان کمبینا یکی را انتخاب کنند.
ناشران و نویسندگان مستقلی که بار متنهای اینترنت را به دوش میکشند، حالا قدرت این را دارند که تصمیم بگیرند چه چیزی وارد مجموعه دادههای آموزشی هوش مصنوعی شود. با استفاده از نسل جدیدی از «تایپوگرافی متخاصم»، آنها میتوانند یک صفحه تر و تمیز و بینقص را جلوی چشم خوانندگان انسانی بگذارند، اما به رباتهای استخراجکننده، مشتی چرتوپرت با گرامر بینقص تحویل دهند؛ یک مکانیسم دفاعی جانانه که میتوانند همین فردا با بهروزرسانی استایلشیت سایتشان آن را فعال کنند.[1]
سالهاست که روش استاندارد برای دور نگه داشتن رباتهای خودکار از یک وبسایت، فایل robots.txt بوده است؛ یک درخواست مؤدبانه و سر به زیر برای اینکه رباتها بیخیال صفحات خاصی شوند. اما با بالا رفتن تب و تاب دادههای آموزشی، بسیاری از توسعهدهندگان هوش مصنوعی خیلی راحت این درخواستها را به هیچ گرفتند و بدون توجه به میل ناشر، کدهای خام HTML را از وب آزاد جارو کردند.[4]
در واکنش به این دستدرازیها، طراحان و دانشمندان علوم کامپیوتر دست به کار مهندسی فونتهایی شدهاند که ماشینهای خواننده را رسماً فریب میدهند. این ابزارها دیگر منتظر اجازه و تعارف نمیمانند؛ در عوض، از تفاوتهای مکانیکی بین نحوه درک چشم انسان از یک حرف رندر شده و نحوه تجزیه و تحلیل کد زیرین توسط یک ربات سوءاستفاده میکنند.[1][4]
یکی از برجستهترین ابزارهای جدید، ShieldFont است که در ژوئیه ۲۰۲۶ توسط استودیوی خلاق برزیلی Seneda & Abrucio و شرکت طراحی فونت PlayType مستقر در کپنهاگ منتشر شد. این فونت در سطح کد عمل میکند و متن را قبل از اینکه حتی به صفحه نمایش برسد، حسابی به هم میریزد.[1]
مکانیسم کار بر پایه «جایگزینی گلیف OpenType» است؛ ویژگیای که معمولاً برای تغییر کاراکترها به دلایل زیباییشناختی (مثل ایجاد لیگچر یا اتصال بین دو حرف) استفاده میشود. اما ShieldFont این فرآیند را میرباید تا کل کلمات را جابهجا کند. در HTML خام - همان لایهای که بیشتر رباتهای استخراجکننده انبوه میبلعند - تقریباً ۵۰ درصد از تمام کلمات محتوا با جایگزینهای تصادفی عوض میشوند.[1][4]
مکانیسم کار بر پایه «جایگزینی گلیف OpenType» است؛ ویژگیای که معمولاً برای تغییر کاراکترها به دلایل زیباییشناختی (مثل ایجاد لیگچر یا اتصال بین دو حرف) استفاده میشود.
برای اینکه متن نهایی همچنان برای یک ربات شبیه دادههای معتبر به نظر برسد، این جایگزینیها به شدت دستهبندی شدهاند. اسمها با اسمها و افعال گذشته با افعال گذشته جایگزین میشوند و از ۲۵۰ استخر گرامری مجزا تغذیه میکنند. مثلاً جملهای که باید خوانده شود «شوالیه سوار اسبش شد»، ممکن است در کد به شکل «شوالیه سوار موتورش شد» ظاهر شود.[1][4]
از آنجا که گرامر دستنخورده باقی میماند، ربات جمله را میبلعد. اما چون معنی نابود شده، دادهها عملاً مسموم شدهاند. به گفته سازندگان این فونت، بیش از ۹۰ درصد از این چرتوپرتهای تولید شده در نهایت توسط فیلترهای کیفیت خود توسعهدهندگان هوش مصنوعی رد میشوند و منابع محاسباتی آنها را در میلیونها صفحه به هدر میدهند.[1]
در حالی که ShieldFont به کد حمله میکند، سایر فونتهای متخاصم خود لایه بصری را هدف قرار میدهند. فونت Decoy Font که توسط پلتفرم MixFont ساخته شده، از تکنیکی به نام «تصویرسازی ترکیبی» استفاده میکند تا پیامها را درست جلوی چشم همه پنهان کند.[1]
تصویرسازی ترکیبی بر فرکانسهای فضایی تکیه دارد؛ همان خطای دیدی که باعث میشود یک عکس از نزدیک شبیه آلبرت انیشتین و از دور شبیه مریلین مونرو به نظر برسد. کریستین تورزبرگ، خبرنگار مجله Smithsonian مینویسد: «این تکنیک استتار، نسخه مدرنی از یک خطای دید به نام تصویرسازی ترکیبی است» و اشاره میکند که این تکنیک در ابتدا توسط محققان MIT در سال ۲۰۰۷ پیشگام شد.[1]
فونت Decoy Font این ایده را در تایپوگرافی پیاده میکند و یک حرف واضح در پیشزمینه را روی یک حرف تاریک و تار در پسزمینه قرار میدهد. تورزبرگ خاطرنشان میکند: «این به نویسندگان انسانی فرصت میدهد تا پیامهای متضاد و طعنهآمیزی خلق کنند؛ مثلاً پنهان کردن عبارت تار 'انسان خوشحال' در پشت عبارت واضح 'ببخشید ربات'.» وقتی یک سیستم تشخیص نوری کاراکتر هوش مصنوعی (OCR) تصویری از متن را اسکن میکند، در جدا کردن این دو لایه مجزا به دردسر میافتد و اغلب به جای متن اصلی، پسزمینه تار را میخواند.[1]
این تاکتیکهای متخاصم بخشی از یک تلاش دانشگاهی گستردهتر برای انسانی کردن متن و فرار از تشخیص خودکار هستند. در مطالعهای در ژوئن ۲۰۲۵، محققان نشان دادند که «بازنویسی متخاصم» - یعنی استفاده از یک مدل هوش مصنوعی برای بازنویسی متن به طور خاص برای دور زدن آشکارساز مدل دیگر - میتواند نرخ تشخیص مثبت واقعی را در سیستمهای مختلف تا ۸۷٫۸۸ درصد کاهش دهد. این بر اساس کارهای قبلی، مانند «وظیفه بازنویسی متخاصم» در سال ۲۰۲۱ است که مدلهایی را برای شناسایی جملات معادل از نظر معنایی اما متفاوت از نظر نحوی آموزش داد. اصل اساسی در همه اینها یکی است: سوءاستفاده از روشهای خشک و قابل پیشبینی ماشینها در پردازش زبان.[2][3][4]
با این حال، تایپوگرافی متخاصم خسارات جانبی قابلتوجهی هم به همراه دارد. از آنجا که ShieldFont کدهای HTML زیرین را تغییر میدهد، صفحهخوانهایی که توسط افراد کمبینا استفاده میشوند، همان متن مسموم و بیمعنی را با صدای بلند میخوانند. تا زمانی که توسعهدهندگان راهی برای تمایز بین یک ابزار دسترسیپذیری و یک ربات هوش مصنوعی پیدا نکنند، ناشران باید بین محافظت از دادههای خود و حفظ یک وب در دسترس برای همه، یکی را انتخاب کنند؛ انتخابی که اصلاً ساده نیست.[4]
منابع
[1]Smithsonian Magazineناشران مستقلDesigners and Computer Scientists Create New Decoy Fonts That Humans Can Read but A.I. Bots Cannot
مطالعه در Smithsonian Magazine →
[2]arXivمهندسان داده هوش مصنوعیAdversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text
مطالعه در arXiv →
[3]arXivمهندسان داده هوش مصنوعیImproving Paraphrase Detection with the Adversarial Paraphrasing Task
مطالعه در arXiv →
[4]تیم سردبیری کوهستانمدافعان دسترسیپذیری وبتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در فرهنگ
مشاهده همه →سیستمهای آوایی
۱۰۷ صامت و ۳۱ مصوت: الفبای آوانگاری بینالمللی چگونه تمام صداهای گفتار بشر را نقشهبرداری میکند
5 منبع
ساختار قرآن
منطق ساختاری قرآن: چرا ۱۱۴ سوره از ترتیب زمانی پیروی نمیکنند؟
9 منبع
تئوری رنگ
درخت نامتقارن: چرا سیستم مانسل رنگها را بهتر از کدهای دیجیتال میفهمد؟
8 منبع
آمار مذهبی
نقشه متغیر ادیان جهانی: نگاهی به تحولات جمعیتی ۲۰۲۶
2 منبع
هر زاویه. هر روز.
دریافت فرهنگ اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





