رفتن به محتوای اصلی
Koohestun
توضیح کوهستاناصالت هوش مصنوعیگزارش تشریحی· 6 دقیقه مطالعه· در متا

واترمارک‌های رمزنگاری‌شده هوش مصنوعی واقعاً چگونه سیگنال‌ها را در متن و تصویر جاسازی می‌کنند؟

گوگل و دیگر ارائه‌دهندگان هوش مصنوعی در حال پیاده‌سازی واترمارک‌های نامرئی رمزنگاری‌شده روی میلیاردها متن و تصویر تولیدشده هستند. اگرچه این فناوری اصالت قابل‌تأییدی را در محتوا جاسازی می‌کند، اما محدودیت‌های ساختاری به این معناست که واترمارک‌های متنی به‌راحتی با یک اسکرین‌شات از بین می‌روند و واترمارک‌های تصویری همچنان در برابر بازتولید پنهان (latent regeneration) آسیب‌پذیرند.

به قلم دلناز نورانی

مدافعان اصالت رمزنگاری‌شده 40%پژوهشگران امنیت منبع‌باز 35%حامیان شفافیت 25%
مدافعان اصالت رمزنگاری‌شده
سیگنال‌های آماری جاسازی‌شده تنها راه مقیاس‌پذیر برای ردیابی منشأ هوش مصنوعی بدون ذخیره پایگاه‌های داده عظیم از خروجی‌های کاربران هستند.
پژوهشگران امنیت منبع‌باز
قدرت واترمارک‌ها تنها به اندازه مقاومت آن‌ها در برابر حملات خصمانه است، که در حال حاضر آسیب‌پذیری‌های شدید و مختص به رسانه را آشکار می‌کنند.
حامیان شفافیت
نگهداری کلیدهای تشخیص در سیلوهای انحصاری، مانع از راستی‌آزمایی مستقل محتوای هوش مصنوعی توسط عموم مردم می‌شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کاربران نهایی که متن آن‌ها توسط آشکارسازهای شخص ثالث به‌اشتباه پرچم‌گذاری (falsely flagged) می‌شود.
  • تولیدکنندگان سخت‌افزاری که در حال پیاده‌سازی ردیابی اصالت در سطح سخت‌افزار هستند.

نکات کلیدی

  • سیستم SynthID متعلق به Google DeepMind اکنون در مقیاس اینترنت مستقر شده و واترمارک‌های رمزنگاری‌شده نامرئی را در میلیون‌ها پاسخ متنی و میلیاردها تصویر جاسازی می‌کند.
  • واترمارک‌های متنی با ایجاد سوگیری ظریف در انتخاب کلماتِ مدل زبانی در حین تولید عمل می‌کنند، که این امر آن‌ها را در برابر اسکرین‌شات و بازنویسی به‌شدت آسیب‌پذیر می‌سازد.
  • واترمارک‌های تصویری از یک رمزگذار پس‌رویدادی برای جاسازی سیگنال‌ها در فضای پنهان بصری استفاده می‌کنند، که به آن‌ها اجازه می‌دهد از اسکرین‌شات جان سالم به در ببرند اما در برابر بازتولید توسط رمزگذار خودکار آسیب‌پذیر باقی می‌مانند.
  • در حالی که پیاده‌سازی واترمارکینگ متنی منبع‌باز است، رمزگشاهای تصویر و ویدیو همچنان انحصاری هستند و مانع از راستی‌آزمایی مستقل توسط شخص ثالث می‌شوند.

اگر امروز پاراگرافی را که توسط Gemini گوگل یا Claude آنتروپیک تولید شده کپی کنید، در واقع در حال حمل یک امضای رمزنگاری‌شده هستید که در فواصل میان کلمات پنهان شده است. تا اواخر سال ۲۰۲۶، میلیون‌ها خروجی هوش مصنوعی حامل سوگیری‌های آماری نامرئی یا اختلالات در سطح پیکسل هستند که برای هر کسی که کلید رمزنگاری مناسب را در دست داشته باشد، هویت ماشینی آن‌ها را فاش می‌کند.[1][3]

اما اگر از همان متن دقیقاً یک اسکرین‌شات بگیرید، این امضا کاملاً محو می‌شود. فناوری‌ای که به‌عنوان راه‌حل قطعی برای اصالت‌سنجی هوش مصنوعی فروخته می‌شود — یعنی واترمارکینگ رمزنگاری‌شده — اکنون در مقیاس اینترنت در حال اجراست و سیگنال‌هایی را در ده‌ها میلیارد تصویر و پاسخ متنی جاسازی می‌کند. با این حال، سازوکارهایی که این سیستم‌ها را هدایت می‌کنند، چشم‌اندازی ازهم‌گسیخته را نشان می‌دهند که در آن بقای یک واترمارک کاملاً به رسانه‌ای که در آن قرار دارد وابسته است.[2][5]

استقرار این سیستم‌ها نشان‌دهنده گذار از تحقیقات نظری به واقعیت تولید است. سیستم SynthID-Text متعلق به Google DeepMind که در اکتبر ۲۰۲۴ منتشر شد و تا نسخه ۴.۴۶.۰ در Hugging Face Transformers ادغام گردید، اکنون در داخل Gemini و Gemini Advanced کار می‌کند. در یک نمونه اندازه‌گیری‌شده از نزدیک به ۲۰ میلیون پاسخ Gemini، گنجاندن این واترمارک هیچ تفاوت معنادار آماری در نرخ بازخورد کاربران ایجاد نکرد. این سیگنال برای خوانندگان انسانی کاملاً غیرقابل‌درک است و پایین‌تر از آستانه پردازش آگاهانه زبان عمل می‌کند.[1][2]

برای درک اینکه واترمارک متنی واقعاً چیست، باید ایده یک برچسب فایل پنهان یا امضای فراداده (metadata) را کنار بگذارید. فراداده‌ها، مانند استاندارد C2PA، شکننده هستند؛ به محض اینکه کاربر متنی را کپی کند یا از تصویری اسکرین‌شات بگیرد، این اطلاعات حذف می‌شوند. در عوض، واترمارک‌های زمان تولید (generation-time) مانند SynthID-Text، توزیع احتمال بنیادین مدل زبانی را در حین نوشتن تغییر می‌دهند.[2][4]

سیستم SynthID-Text چگونه توزیع احتمال یک مدل زبانی را در حین تولید تغییر می‌دهد.

مدل‌های زبانی بزرگ متن را توکن به توکن تولید می‌کنند و به هزاران کلمه بعدیِ احتمالی، یک امتیاز احتمال اختصاص می‌دهند. در حالت عادی، مدل بر اساس تنظیمات دما (temperature) از محتمل‌ترین گزینه‌ها نمونه‌برداری می‌کند. سیستم SynthID-Text دقیقاً در همین لحظه مداخله می‌کند. برای هر موقعیت توکن، یک تابع هش (hash function) چهار توکن قبلی و یک کلید رمزنگاری مخفی را می‌گیرد تا یک دانه شبه‌تصادفی (pseudorandom seed) تولید کند.[3]

این دانه وارد مجموعه‌ای از توابع امتیازدهی می‌شود — که در پیاده‌سازی DeepMind تعداد آن‌ها ۳۰ مورد است — و به‌طور مصنوعی احتمال انتخاب کلمات خاصی را نسبت به جایگزین‌های نزدیکشان افزایش می‌دهد. اگر مدل در حال انتخاب بین «امضا» و «نشان» باشد، الگوریتم بی‌سروصدا کفه ترازو را به سمت گزینه‌ای که با کلید مخفی همسو است سنگین می‌کند. در طول یک متن با طول کافی، این سوگیری به یک الگوی آماری قابل‌اندازه‌گیری تبدیل می‌شود که یک آشکارساز بیزی (Bayesian detector) می‌تواند با اطمینان بالا آن را شناسایی کند.[2][3]

با این حال، همین سازوکار محدودیت‌های ذاتی سیستم را دیکته می‌کند. از آنجا که واترمارک بر بهره‌برداری از انتخاب کلمات با احتمال نزدیک به هم متکی است، برای عملکرد خود به انعطاف‌پذیری زبانی نیاز دارد. گوگل صراحتاً اشاره می‌کند که این تکنیک «در پاسخ‌های مبتنی بر واقعیت (factual) اثربخشی کمتری دارد، زیرا فرصت کمتری برای دستکاری تولید بدون کاهش دقت وجود دارد.» اگر کاربری تاریخ خاصی یا یک شماره تلفن را بپرسد، مدل هیچ توکن جایگزینی برای انتخاب ندارد مگر اینکه دچار توهم (hallucination) شود، و در نتیجه هیچ فضایی برای جاسازی سیگنال باقی نمی‌ماند.[2]

با این حال، همین سازوکار محدودیت‌های ذاتی سیستم را دیکته می‌کند.

اتکا به طول متن و انتخاب‌های واژگانی همچنین یک آسیب‌پذیری آشکار ایجاد می‌کند: اسکرین‌شات. اسکرین‌شات گرفتن از متن تولیدشده توسط هوش مصنوعی، توکن‌های واژگانی را به شبکه‌ای از پیکسل‌ها تبدیل می‌کند و الگوی آماری انتخاب کلمات را کاملاً از بین می‌برد. متن برای انسان خوانا باقی می‌ماند، اما ارتباط با اصالت رمزنگاری‌شده برای همیشه قطع می‌شود.[2]

علاوه بر این، واترمارک متنی در برابر تغییراتی که معنا را حفظ می‌کنند به‌شدت آسیب‌پذیر است. اگر کاربری متن واترمارک‌شده را بگیرد و آن را از طریق یک مدل زبانی دیگر برای بازنویسی یا ترجمه به زبانی دیگر پردازش کند، توالی خاص توکن‌ها از بین می‌رود. محققانی که SynthID-Text را ارزیابی کردند دریافتند که حملات ترجمه معکوس (back-translation) سیگنال واترمارک را به‌شدت تضعیف می‌کند؛ موضوعی که باعث توسعه چارچوب‌های معنایی ترکیبی مانند SynGuard شده است تا تلاشی برای حفظ اصالت در طول ترجمه‌ها باشد.[1][4]

محدودیت‌های ساختاری بین واترمارک‌های متنیِ زمان تولید و واترمارک‌های تصویریِ پس‌رویدادی.

واترمارکینگ تصویر تحت یک پارادایم معماری کاملاً متفاوت عمل می‌کند و شکنندگی واژگانی را با جاسازی در سطح پیکسل معاوضه می‌کند. سیستم SynthID-Image، که گوگل گزارش می‌دهد روی بیش از ده میلیارد تصویر و فریم ویدیویی اعمال شده، یک سیستم پس‌رویدادی (post-hoc) است. برخلاف نسخه متنی که خود فرآیند تولید را تغییر می‌دهد، واترمارک تصویری پس از سنتز کامل تصویر اعمال می‌شود.[5]

این رویکرد پس‌رویدادی بر معماری رمزگذار-رمزگشا (encoder-decoder) متکی است. رمزگذار یک بازتولید ظریف از تصویر انجام می‌دهد و واترمارک را به‌جای اعمال یک پوشش پیکسلی ساده، در یک بازنمایی پنهان (latent representation) آموخته‌شده جاسازی می‌کند. این یکپارچگی عمیق به سیگنال اجازه می‌دهد تا از دستکاری‌های رایج و روزمره تصاویر جان سالم به در ببرد.[6]

سیستم SynthID-O نرخ تشخیص مثبت واقعی ۹۹٫۹۸ درصدی را در برابر تغییرات تصادفی تصویر حفظ می‌کند.

از آنجا که واترمارک SynthID-Image کاملاً درون داده‌های بصری زندگی می‌کند، دقیقاً از همان حمله‌ای که واترمارک‌های متنی را شکست می‌دهد جان سالم به در می‌برد: اسکرین‌شات. برش زدن، تغییر اندازه و فشرده‌سازی ملایم JPEG نیز نمی‌توانند سیگنال را از بین ببرند، زیرا اختلال در فضای پنهان (latent-space) همچنان از نظر ریاضی در پیکسل‌های باقی‌مانده قابل‌تشخیص است. در آزمایش‌های بنچمارک در برابر تغییرات تصادفی تهاجمی، نسخه خارجی SynthID-O نرخ تشخیص مثبت واقعی (true positive) ۹۹٫۹۸ درصدی را حفظ کرد، که محققان خاطرنشان کردند «۹٫۳۶ واحد درصد بالاتر از بهترین روش بعدی» بود.[2][5]

با این وجود، معماری تصویر نیز نقطه کور مرگبار خود را دارد. در حالی که این روش از آسیب‌های پیکسلی سطحی جان سالم به در می‌برد، در برابر بازتولید فضای پنهان به‌شدت آسیب‌پذیر است. اگر یک مهاجم تصویر واترمارک‌شده را از یک رمزگذار خودکار (autoencoder) دیگر عبور دهد — که عملاً تصویر را به یک فضای پنهان متفاوت بازتاب داده و سپس آن را دوباره به پیکسل‌ها رمزگشایی می‌کند — واترمارک کاملاً شسته و پاک می‌شود.[6]

این امر یک واقعیت ازهم‌گسیخته برای اصالت‌سنجی هوش مصنوعی ایجاد می‌کند. انتخاب معماری برای محل جاسازی سیگنال، نحوه شکست آن را دیکته می‌کند. واترمارک‌های متنی از کپی‌پیست جان سالم به در می‌برند اما با اسکرین‌شات و بازنویسی می‌میرند؛ واترمارک‌های تصویری از اسکرین‌شات جان سالم به در می‌برند اما با بازتولید پنهان از بین می‌روند. هیچ «واترمارک هوش مصنوعی» جهان‌شمولی وجود ندارد که در تمام رسانه‌ها رفتار یکسانی داشته باشد.[4][6][7]

استقرار این سیستم‌ها همچنین یک عدم تقارن حیاتی را در راستی‌آزمایی برجسته می‌کند. در حالی که DeepMind پیاده‌سازی SynthID-Text را تحت مجوز Apache 2.0 منبع‌باز کرد و به توسعه‌دهندگان خارجی اجازه داد تا پردازنده لوجیت‌ها (logits processor) و آشکارساز بیزی را در مدل‌های خود ادغام کنند، نسخه‌های تصویر، ویدیو و صدا همچنان بسته باقی مانده‌اند. مدل‌های رمزگذار و رمزگشا برای رسانه‌های بصری منحصراً در اختیار گوگل هستند.[2]

این بدان معناست که برای میلیاردها تصویر واترمارک‌شده توسط SynthID، راستی‌آزمایی مستقل غیرممکن است. عموم مردم برای تأیید اصالت باید کاملاً به ابزارهای تشخیص انحصاری گوگل تکیه کنند. در شرایطی که قانون‌گذاران و پلتفرم‌ها به‌طور فزاینده‌ای برچسب‌گذاری هوش مصنوعی را الزامی می‌کنند، زیرساخت حقیقت بر روی کلیدهای رمزنگاری‌شده‌ای بنا می‌شود که همچنان تحت کنترل شدید سازندگان مدل‌ها قرار دارند و اکوسیستم گسترده‌تر را وابسته به همکاری مستمر آن‌ها رها می‌کنند.[6]

چرا مهم است

در حالی که محتوای تولیدشده توسط هوش مصنوعی اینترنت را فرا گرفته است، واترمارک‌های رمزنگاری‌شده در مقیاس وسیع به کار گرفته می‌شوند تا ساخته‌های انسانی را از خروجی‌های ماشینی جدا کنند. درک اینکه این سیگنال‌های نامرئی چگونه کار می‌کنند — و دقیقاً چقدر راحت شکسته می‌شوند — برای هر کسی که برای تأیید اصالت اسناد، تصاویر یا اخبار به آن‌ها متکی است، ضروری است.

بررسی عمیق دیدگاه‌ها

دیدگاه مدافعان اصالت

واترمارک‌های جاسازی‌شده تنها مسیر عملی برای شناسایی هوش مصنوعی در مقیاس اینترنت هستند.

مدافعان واترمارکینگ رمزنگاری‌شده استدلال می‌کنند که حجم عظیم تولیدات هوش مصنوعی، تطبیق سنتی با پایگاه داده را غیرممکن می‌سازد. با جاسازی مستقیم سیگنال در توزیع آماری متن یا فضای پنهان تصویر، پلتفرم‌ها می‌توانند اصالت را بدون ذخیره پرامپت‌های کاربران یا نقض حریم خصوصی تأیید کنند. آن‌ها آسیب‌پذیری‌ها را می‌پذیرند اما واترمارکینگ را به‌عنوان یک لایه اصطکاک ضروری می‌بینند که جلوی اطلاعات نادرستِ تصادفی را می‌گیرد، حتی اگر بازیگران دولتی باانگیزه بتوانند آن را دور بزنند.

دیدگاه پژوهشگران امنیت

واترمارک‌ها در برابر تغییرات خصمانه هدفمند اساساً شکننده هستند.

پژوهشگران امنیت بر محدودیت‌های ریاضیِ تبادل بین کیفیت و استحکام تمرکز دارند. آن‌ها اشاره می‌کنند که چون واترمارک‌های متنی به انتخاب‌های واژگانی متکی هستند، به‌راحتی توسط حملات حفظ‌کننده معنا مانند ترجمه معکوس یا اسکرین‌شات‌های ساده شکست می‌خورند. در مورد تصاویر، محققان تأکید می‌کنند که هر واترمارک پس‌رویدادی را می‌توان با عبور دادن تصویر از یک رمزگذار خودکار ثانویه پاک کرد. از این منظر، واترمارک‌ها بیشتر یک سرعت‌گیر موقت هستند تا یک تضمین رمزنگاری‌شده بادوام.

دیدگاه حامیان شفافیت

کلیدهای تشخیص انحصاری، قدرت تعیین حقیقت را متمرکز می‌کنند.

این گروه نگرانی‌هایی را در مورد استقرار نامتقارن ابزارهای راستی‌آزمایی مطرح می‌کند. در حالی که DeepMind نسخه متنی SynthID را منبع‌باز کرد، رمزگشاهای تصویر و ویدیو همچنان بسته هستند. حامیان شفافیت استدلال می‌کنند که اگر عموم مردم نتوانند به‌طور مستقل اصالت یک تصویر را تأیید کنند، این سیستم صرفاً اعتماد را از خود تصویر به نهاد شرکتیِ دارنده کلیدهای API منتقل می‌کند. آن‌ها خواهان پروتکل‌های تشخیص مبتنی بر استانداردهای باز و جهان‌شمول هستند تا ابزارهای شرکتیِ سیلوشده.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

مدافعان اصالت رمزنگاری‌شده 40%پژوهشگران امنیت منبع‌باز 35%حامیان شفافیت 25%
  1. [1]AI Weeklyمدافعان اصالت رمزنگاری‌شده

    Google DeepMind deployed SynthID-Text inside Gemini

    مطالعه در AI Weekly
  2. [2]Layer3 Labsحامیان شفافیت

    How does SynthID work for text?

    مطالعه در Layer3 Labs
  3. [3]Towards AIحامیان شفافیت

    The paper that started this: Scalable watermarking for identifying large language model outputs

    مطالعه در Towards AI
  4. [4]arXivپژوهشگران امنیت منبع‌باز

    SynGuard: An Enhanced SynthID-Text Watermarking

    مطالعه در arXiv
  5. [5]alphaXivمدافعان اصالت رمزنگاری‌شده

    SynthID-Image: Image watermarking at internet scale

    مطالعه در alphaXiv
  6. [6]Mediumپژوهشگران امنیت منبع‌باز

    SynthID Image Watermark Research Report

    مطالعه در Medium
  7. [7]تیم سردبیری کوهستانحامیان شفافیت

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.