واترمارکهای نامرئی هوش مصنوعی واقعاً چگونه کار میکنند: پشتپردهی برچسبگذاری متون مصنوعی
با اجرایی شدن قوانین جدید اتحادیه اروپا، آزمایشگاههای بزرگ هوش مصنوعی در حال تعبیه امضاهای رمزنگاریشده و پنهان در متون تولیدی خود هستند. این فناوری کیفیت نگارش را حفظ میکند، اما پرسشهای تازهای درباره آزادی بیان ناشناس و نظارت دیجیتال به میان میآورد.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- آنتروپیک برای رعایت قانون هوش مصنوعی اتحادیه اروپا، یک واترمارک نامرئی و اجباری را روی تمام خروجیهای متنی کلود در سطح جهانی فعال کرده است.
- این سیستم از یک کلید رمزنگاری برای ایجاد سوگیری جزئی در انتخاب کلمات مدل استفاده میکند و یک امضای آماری میسازد.
- واترمارک در برابر کپی کردن و ویرایش سبک دوام میآورد، اما با بازنویسی سنگین یا ترجمه از بین میرود.
مدافعان حریم خصوصی، برچسبگذاری رمزنگاریشده و خاموشِ هر جمله تولیدی را یک خطر نظارتی میدانند که میتواند نوشتههای ناشناس را تا رسیدن به یک کاربر خاص ردیابی کند. در مقابل، پژوهشگران ایمنی هوش مصنوعی استدلال میکنند که بدون وجود یک روش معتبر ریاضی برای اثبات اینکه یک ماشین سندی را نوشته است، اینترنت در دریایی از متون مصنوعیِ غیرقابلتشخیص غرق خواهد شد.[4]
کاتالیزوری که این دو دیدگاه را در تقابل مستقیم با یکدیگر قرار داد، در آگوست ۲۰۲۶ از راه رسید. شرکت آنتروپیک (Anthropic) بیسروصدا یک واترمارک نامرئی را برای تمام متون تولیدشده توسط مدلهای کلود (Claude) در سراسر جهان فعال کرد؛ اقدامی که با اجرایی شدن قانون هوش مصنوعی اتحادیه اروپا در ۲ آگوست کلید خورد.[1][2]
این مقررات، بهویژه ماده ۵۰، ارائهدهندگان سیستمهای هوش مصنوعی مولد را ملزم میکند تا محتوای مصنوعی را بهگونهای علامتگذاری کنند که برای ماشینها قابلتشخیص باشد؛ تخطی از این قانون میتواند جریمههایی تا سقف ۱۵ میلیون یورو به همراه داشته باشد.[1]
پیادهسازی آنتروپیک بر پایهی تکنیکی استوار است که بهشدت از SynthID Text الهام گرفته است؛ یک معماری واترمارکینگ که در ابتدا توسط گوگل دیپمایند (Google DeepMind) توسعه یافت و اخیراً در کتابخانه متنباز Hugging Face Transformers ادغام شده است.[3]
برای درک اینکه چگونه یک علامت نامرئی در دل یک متن ساده زنده میماند، باید به نحوه تولید متن توسط یک مدل زبانی بزرگ نگاه کنیم. در هر مرحله، مدل هزاران کلمه بعدیِ ممکن (که به عنوان توکن شناخته میشوند) را بر اساس بافتار جمله امتیازدهی میکند.[3]
مدلها به جای اینکه هر بار کلمهای با بالاترین امتیاز مطلق را انتخاب کنند، از یک توزیع احتمالی نمونهبرداری میکنند. بسیاری از این امتیازها به هم نزدیک هستند، به این معنی که چندین کلمه مختلف میتوانند برای یک خواننده انسانی به یک اندازه طبیعی و روان به نظر برسند.[3]
سیستم واترمارکینگ دقیقاً در همین مرحله نمونهبرداری وارد عمل میشود. مستندات توسعهدهندگان گوگل اشاره میکند که این سیستم «لوجیتهای (logits) مدل را با استفاده از یک تابع g شبهتصادفی تقویت میکند تا اطلاعات واترمارک را رمزگذاری کند».
در عمل، سیستم از یک کلید رمزنگاری مخفی برای تغذیه یک تولیدکننده اعداد شبهتصادفی استفاده میکند. این تولیدکننده، دایره واژگان را برای همان لحظه خاص در جمله، به یک «لیست سبز» و یک «لیست قرمز» تقسیم میکند.
سپس مدل بهآرامی هدایت میشود تا کلمات لیست سبز را ترجیح دهد. از آنجا که در میان انبوهی از گزینههای معتبر، فضای زیادی برای مانور وجود دارد، این سوگیری آماریِ جزئی، کیفیت متن را کاهش نمیدهد.
برای یک خواننده انسانی، متن کاملاً عادی به نظر میرسد. اما یک ابزار تشخیص که همان کلید مخفی را در اختیار دارد، میتواند یک پاراگراف را تحلیل کرده، لیستهای سبز و قرمز را برای هر موقعیت بازسازی کند و تعداد تطابقها را بشمارد.[3]
اگر یک مقاله ۵۰۰ کلمهای حاوی تعداد غیرممکنی (از نظر آماری) از کلمات لیست سبز باشد، ابزار تشخیص تأیید میکند که متن توسط آن مدل خاص تولید شده است.[2]
اسکات آرونسون، دانشمند علوم کامپیوتر نظری که ریاضیات پایه این رویکرد را در سال ۲۰۲۲ در OpenAI توسعه داد، خاطرنشان کرد که این تکنیک صرفاً تصادفی بودنِ موجود در مدلهای زبانی را با شبهتصادفی بودن جایگزین میکند.
سیگنال بهدستآمده در برابر دستکاریهای معمولی مقاوم است. این سیگنال از کپی کردن، چسباندن، تغییر فرمت و تبدیل به متن ساده جان سالم به در میبرد و همین امر آن را بسیار بادوامتر از برچسبهای فراداده (metadata) متصل به یک فایل میکند.[2]
با این حال، این علامت ریاضی شکستناپذیر نیست. ویرایش سنگین، ترجمه متن به زبانی دیگر، یا درخواست از یک مدلِ متنبازِ بدون واترمارک برای بازنویسی خروجی، این سیگنال آماری را از بین خواهد برد.[2]
نگرانیهای مربوط به حریم خصوصی از دقت این تشخیص نشأت میگیرد. از آنجا که واترمارک ثابت میکند یک مدل خاص متن را تولید کرده است، منتقدان هشدار میدهند که اگر شرکتی ثبت کند کدام نشست کاربری دقیقاً چه توالی خاصی از کلمات لیست سبز را تولید کرده، متن میتواند تا رسیدن به انسانی که آن را درخواست کرده ردیابی شود.[4]
آنتروپیک اعلام کرده است که این ابزار در درجه اول برای شفافیت است و خاطرنشان کرده: «این راهی برای تعیین احتمال دخالت کلود در نوشتن متن است» و تأکید میکند که برنامهای برای ردیابی کاربران فردی ندارد.[1][4]
چشمانداز مدلهای متنباز نیز در حال تغییر است. گوگل اجزای واترمارکینگ متنی SynthID را تحت مجوز Apache 2.0 منتشر کرد و به توسعهدهندگانی که مدلها را به صورت محلی اجرا میکنند، اجازه داد تا همین ردیابی نامرئی را روی سرورهای خود پیادهسازی کنند.[3]
این امر به توسعهدهندگان مستقل اجازه میدهد تا کلیدهای تشخیص خود را خصوصی نگه دارند و لایه واترمارکینگ را از نسخه ۴.۴۶.۰ کتابخانه Hugging Face Transformers اجرا کنند.[3]
اصطلاحات کلیدی
- توکن (Token)
- بلوک سازنده اساسی متن (اغلب یک کلمه یا بخشی از یک کلمه) که یک مدل زبانی آن را پردازش و تولید میکند.
- لوجیتها (Logits)
- امتیازهای خام و نرمالنشدهای که یک شبکه عصبی پیش از تبدیل به احتمالات، به هر توکن بعدیِ ممکن اختصاص میدهد.
- شبهتصادفی (Pseudorandomness)
- دنبالهای از اعداد که از نظر آماری تصادفی به نظر میرسد، اما توسط یک الگوریتم قطعی و با استفاده از یک کلید مخفی تولید میشود.
- قانون هوش مصنوعی اتحادیه اروپا
- یک مقررات جامع در اتحادیه اروپا که استانداردهای شفافیت و ایمنی را برای سیستمهای هوش مصنوعی الزامی میکند.
پرسشهای متداول
آیا میتوانم واترمارک را در کلود غیرفعال کنم؟
خیر. آنتروپیک این واترمارک را به صورت جهانی روی تمام مدلهای منتشرشده در ۲ آگوست ۲۰۲۶ یا پس از آن اعمال کرده است و هیچ گزینهای برای غیرفعال کردن آن در هیچ طرحی وجود ندارد.
آیا واترمارک کیفیت نگارش را تغییر میدهد؟
خیر. این سیستم مدل را هدایت میکند تا از میان کلماتی که از نظر آماری تناسب بسیار خوبی با جمله دارند انتخاب کند و جریان طبیعی متن را حفظ میکند.
آیا در صورت ویرایش متن، واترمارک باقی میماند؟
در برابر ویرایشهای سبک، کپی کردن، چسباندن و تغییر فرمت دوام میآورد. با این حال، بازنویسی سنگین انسانی، ترجمه یا بازنویسی توسط هوش مصنوعی، این سیگنال را از بین میبرد.
آیا ابزار تشخیص برای عموم در دسترس است؟
در حال حاضر، کلیدهای تشخیص برای مدلهای تجاری مانند کلود خصوصی باقی ماندهاند. با این حال، گوگل اجزای متنی SynthID را برای توسعهدهندگان متنباز کرده است تا در مدلهای خود استفاده کنند.
بررسی عمیق دیدگاهها
دیدگاه ایمنی هوش مصنوعی
واترمارکینگ یک راهحل ریاضی ظریف برای مقابله با سیل متون مصنوعی است.
برای پژوهشگرانی که سالها تلاش کردهاند مدلهای زبانی را همسو کنند، واترمارک رمزنگاریشده یک برد دوطرفه و نادر است. از آنجا که مدلهای زبانی از میان انبوهی از کلماتِ به یک اندازه معتبر انتخاب میکنند، هدایت مدل به سمت یک «لیست سبز» به کیفیت خروجی آسیبی نمیرساند. این امر به پلتفرمها اجازه میدهد تا بدون نیاز به یک مدل تشخیص خارجیِ عظیم و مستعد خطا، به طور قطعی ثابت کنند که یک ماشین سندی را نوشته است.
دیدگاه مدافعان حریم خصوصی
سیگنالهای ردیابی نامرئی خطر شدیدی برای آزادی بیان ناشناس ایجاد میکنند.
گروههای حریم خصوصی استدلال میکنند که دقت واترمارک دقیقاً همان چیزی است که آن را خطرناک میکند. اگر یک ارائهدهنده هوش مصنوعی، هسته رمزنگاری خاصِ استفادهشده در طول نشست یک کاربر را ثبت کند، هر متنی که حاوی آن امضای آماری خاص باشد میتواند مستقیماً تا رسیدن به درخواستکننده ردیابی شود. این موضوع میتواند افشاگران، مخالفان یا هر کسی را که برای پیشنویس ارتباطات حساس به هوش مصنوعی متکی است، در معرض خطر قرار دهد.
دیدگاه تطبیق سازمانی
واترمارکینگ اکنون یک الزام زیرساختی اجباری است، نه یک آزمایش.
با اجرایی شدن قانون هوش مصنوعی اتحادیه اروپا، شرکتهایی که هوش مصنوعی مولد را مستقر میکنند در صورت عدم علامتگذاری محتوای مصنوعی با جریمههایی تا سقف ۱۵ میلیون یورو مواجه میشوند. برای تیمهای فناوری اطلاعات و حقوقی سازمانها، تمرکز کاملاً از اخلاقیات تئوریکِ واترمارکینگ به واقعیت عملیِ پیادهسازی آن در APIها، محیطهای ابری و ابزارهای داخلی تغییر کرده است تا از رعایت مقررات اطمینان حاصل کنند.
- پژوهشگران ایمنی هوش مصنوعی
- استدلال میکنند که واترمارک برای اثبات تولید ماشینی و حفظ اعتماد به اطلاعات دیجیتال، بدون کاهش کیفیت متن، ضروری است.
- مدافعان حریم خصوصی
- هشدار میدهند که واترمارکهای رمزنگاریشده میتوانند برای ردیابی متون مصنوعی ناشناس تا رسیدن به کاربران فردی مورد استفاده قرار گیرند و یک خطر نظارتی ایجاد کنند.
- تیمهای تطبیق مقررات
- تمرکزشان بر برآورده کردن الزامات قانونی قانون هوش مصنوعی اتحادیه اروپا از طریق استقرار ابزارهای منشأیابیِ قابلخواندن برای ماشین در تمام سیستمهای سازمانی است.
دیدگاههایی که این گزارش پوشش نداده
- توسعهدهندگان متنبازی که مدلهای بدون سانسور را نگهداری میکنند
- نویسندگان و دانشجویانی که آثار اصلی آنها ممکن است توسط ابزارهای تشخیصِ بیشازحد حساس، بهاشتباه علامتگذاری شود
منابع
[1]Shatteredتیمهای تطبیق مقرراتClaude Adds Text Watermarks as EU Fines Hit €15M [2026]
مطالعه در Shattered →
[2]ProofreaderProتیمهای تطبیق مقرراتClaude now embeds an invisible watermark in its text. How it works, what survives it, and what a positive detection actually proves.
مطالعه در ProofreaderPro →
[3]Layer3Labsپژوهشگران ایمنی هوش مصنوعیSynthID is a family of invisible watermarks built by Google DeepMind
مطالعه در Layer3Labs →
[4]Buttondownمدافعان حریم خصوصیAI watermarks could destroy anonymous writing
مطالعه در Buttondown →
[5]تیم سردبیری کوهستانپژوهشگران ایمنی هوش مصنوعیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →ارزیابی هوش مصنوعی
چگونه ابزار BenchMIRT هوش خام را از ایمنی در ارزیابی مدلهای زبانی بزرگ تفکیک میکند
5 منبع
اقتصاد کار و هوش مصنوعی
بیل گیتس مالیات بر توکنهای هوش مصنوعی و رباتها را برای کاهش آوارگی شغلی پیشنهاد میکند
8 منبع
ایمنی هوش مصنوعی
چگونه حمله «اچ-سیاوتی» سیستمهای ایمنی هوش مصنوعی پیشرو را با کمتر از ۲۰۰ دلار از بین میبرد
6 منبع
فراموشسازی ماشینی
«فراموشسازی ماشینی»: چگونه به مدلهای هوش مصنوعی آموزش داده میشود تا دادههای دارای حق نشر و خصوصی را فراموش کنند
6 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





