رفتن به محتوای اصلی
کوهستان
مقررات هوش مصنوعیاتحادیه اروپا· 5 دقیقه مطالعه· در هوش مصنوعی

اجرای واترمارک «textGrain» توسط OpenAI برای انطباق با قوانین شفافیت اتحادیه اروپا

شرکت OpenAI با هدف پایبندی به قانون هوش مصنوعی اتحادیه اروپا، تعبیه واترمارک‌های پنهان رمزنگاری‌شده در متون خروجی ChatGPT برای کاربران اروپایی را آغاز کرد. سامانه «textGrain» با تغییر اندک در احتمال انتخاب توکن‌ها، ردپایی ریاضیاتی برجای می‌گذارد که نخستین استقرار گسترده ردیابی اصالت متن توسط یک توسعه‌دهنده بزرگ هوش مصنوعی محسوب می‌شود.

به قلم الوین شادمهر

هنگامی که مولدهای تصویر مانند DALL-E و Midjourney برای نشانه‌گذاری عکس‌های تولیدشده رو به فراداده‌های نامرئی آوردند، دستکاری را روی پیکسل‌هایی انجام دادند که چشم انسان توان تمایز آن‌ها را ندارد. در تولید متن اما چنین بستر پنهانی در دسترس نیست و توسعه‌دهندگان ناچارند برای ثبت هرگونه ردیابی، در واژگان انتخابی مدل دست ببرند.

شرکت OpenAI روز دوشنبه سامانه‌ای موسوم به «textGrain» را فعال کرد که دقیقاً همین سازوکار را برای میلیون‌ها کاربر اروپایی پیاده می‌کند؛ رویکردی که یک امضای رمزنگاری‌شده را مستقیماً درون واژگان و نحو جملات خروجی ChatGPT می‌نشاند.[1][3]

این اقدام پاسخی مستقیم به قانون هوش مصنوعی اتحادیه اروپا است؛ قانونی که ارائه‌دهندگان مدل‌های هوش مصنوعی چندمنظوره را ملزم می‌کند خروجی‌های ساختگی خود را به نحوی طراحی کنند که توسط ماشین‌ها قابل خواندن و شناسایی باشند. با این حال، OpenAI اجرای این مصوبه را از نظر جغرافیایی تفکیک کرده و الزام واترمارک را صرفاً به درخواست‌هایی که از مبدأ اتحادیه اروپا ثبت می‌شوند محدود ساخته است.[1][6]

شرکت OpenAI در اطلاعیه معرفی این قابلیت اعلام کرد: «رویکرد منطقه‌ای به ما فرصت می‌دهد تا از کاربردهای واقعی و بازخورد کاربران بیاموزیم.» این شرکت همچنین خاطرنشان کرد در حالی که کاربران اروپایی متن‌ها را به شکل خودکار همراه با واترمارک دریافت می‌کنند، توسعه‌دهندگان جهانی که از API استفاده می‌کنند می‌توانند به دلخواه خود این قابلیت را فعال نمایند.[1][5]

مکانیسم عملکرد textGrain

برای بررسی سازوکار درونی textGrain، پیش از هر چیز باید شیوه جمله‌بندی مدل‌های زبانی بزرگ را مد نظر قرار داد. این مدل‌ها پاسخ‌های از پیش نوشته‌شده را بازخوانی نمی‌کنند؛ بلکه با محاسبات ریاضی برآورد می‌کنند که پس از کلمه پیشین، کدام توکن (یا جزء کلمه) بیشترین احتمال وقوع منطقی را دارد.[2]

در یک خروجی معمولی، مدل ممکن است تشخیص دهد که کلمه «سیب» ۴۰ درصد شانس حضور در جایگاه بعدی را دارد و واژه «میوه» ۳۰ درصد. سپس مدل از میان بالاترین احتمالات نمونه‌برداری می‌کند تا نثری طبیعی و روان خلق شود.[2]

فناوری textGrain دقیقاً در لحظه همین گزینش وارد مدار می‌شود. این سامانه با استفاده از یک کلید رمزنگاری، واژگان دردسترس مدل را پیش از تولید هر توکن به شکل شبه‌تصادفی به دو دسته «فهرست سبز» و «فهرست قرمز» تقسیم می‌کند.[2]

سامانه واترمارک با مداخله آماری، احتمال گزینش توکن‌های حاضر در «فهرست سبز» را هنگام نگارش افزایش می‌دهد.

سپس الگوریتم به‌طور مصنوعی شانس انتخاب واژه‌های حاضر در فهرست سبز را بالا می‌برد. با تداوم تولید کلمات در طول یک بند، مدل واژگان فهرست سبز را به میزانی به مراتب بیشتر از احتمالات آماری طبیعی به کار می‌گیرد.[2]

در مقاله فنی منتشرشده توسط OpenAI تحت عنوان «واترمارک کالیبره‌شده با آنتروپی برای متون مدل‌های زبانی»، توضیح داده شده که این تمایل مهندسی‌شده برای خواننده انسانی کاملاً نامحسوس است. با این حال، ابزار تشخیصی مجهز به کلید رمزنگاری صحیح می‌تواند تراکم غیرطبیعی توکن‌های فهرست سبز را بلافاصله شناسایی کند.[2]

فشارهای قانونی و چشم‌انداز استقرار جهانی

هرچه متن تولیدی طولانی‌تر باشد، ضریب اطمینان این محاسبه ریاضیاتی بالاتر می‌رود. مستندات فنی OpenAI نشان می‌دهد سامانه به حدود ۱۰۰ تا ۲۰۰ توکن — یعنی متنی در ابعاد یک بند کوتاه — نیاز دارد تا اصالت هوش مصنوعی را با اطمینان بالا احراز کند.[2]

قانون هوش مصنوعی اتحادیه اروپا که اجرای آن از سال جاری آغاز شده، به‌طور مستقیم ردیابی منشأ محتوای مصنوعی را نشانه گرفته است. تدوین‌کنندگان این مقررات در پی آن بودند تا پیش از آنکه دیپ‌فیک‌ها و اطلاعات گمراه‌کننده خودکار فضاهای عمومی را فرا بگیرند، سپری نظارتی ایجاد کنند.[6]

به گزارش انگجت، تصمیم OpenAI مبنی بر محدودسازی جغرافیایی اجرای این قانون، مشابه راهبردهای دیگر غول‌های فناوری در مواجهه با قوانین اتحادیه اروپا است. این شرکت با جداسازی بازار اروپا می‌تواند سربار محاسباتی سامانه را بدون به خطر انداختن عملکرد جهانی زیر بار ترافیکی واقعی بیازماید.[3]

اجرای اجباری واترمارک در شرایط فعلی تنها به درخواست‌هایی محدود است که از قلمرو کشورهای عضو اتحادیه اروپا ثبت می‌شوند.

آنتروپیک، رقیب اصلی OpenAI، اخیراً واترمارک نامرئی مشابهی را برای مدل‌های Claude مستقر کرده است. پی‌سی‌مگ اشاره می‌کند که هر دو شرکت از این پنجره انطباق منطقه‌ای بهره می‌برند تا ابزارهای کشف و اعتبارسنجی خود را پیش از الزام احتمالی نهادهای قانون‌گذار در آمریکا یا بریتانیا صیقل دهند.[5]

هزینه محاسباتی این مداخله آماری به هیچ وجه ناچیز نیست. محاسبه هم‌زمان فهرست‌های سبز و قرمز برای تک‌تک توکن‌ها، تأخیر نامحسوسی در تولید پاسخ‌ها پدید می‌آورد؛ متغیری که با در نظر گرفتن میلیون‌ها پرسش روزانه کاربران اروپایی، با حساسیت بالا زیر ذره‌بین OpenAI قرار دارد.[1][3]

آسیب‌پذیری‌ها و تاکتیک‌های گریز از ردیابی

اگرچه مبانی ریاضیاتی textGrain استوار است، اما این روش در برابر دستکاری‌ها آسیب‌ناپذیر نیست. امضای رمزنگاری به‌گونه‌ای طراحی شده که ویرایش‌های اندک را تاب بیاورد؛ بدین معنا که کاربر با جابه‌جا کردن چند صفت نمی‌تواند واترمارک را از میان ببرد.[2]

با وجود این، حملات ساختاری همچنان به شدت اثربخش هستند. اگر کاربری مقاله تولیدشده توسط ChatGPT را بردارد و از یک مدل متن‌باز دیگر که به واترمارک مجهز نیست بخواهد آن را بازنویسی (پارافریز) کند، چینش آماری توکن‌های فهرست سبز به‌کلی در هم می‌ریزد.[4]

نشریه The Decoder به همین رخنه ساختاری اشاره کرده و می‌نویسد سودجویان می‌توانند به آسانی متن‌های ساختگی را از طریق مدل‌های ثانویه سفیدشویی کنند. از آنجا که دوام واترمارک به توالی دقیق کلمات وابسته است، ترجمه رادیکال یا خلاصه‌سازی سنگین، ردپای ریاضیاتی آن را محو می‌سازد.[4]

مدل‌های بازنویسی ثانویه می‌توانند امضای ریاضیاتی تعبیه‌شده توسط textGrain را به‌طور کامل از بین ببرند.

علاوه بر این، ابزار اعتبارسنجی این امضاها همچنان به شکل اختصاصی و محدود نگهداری می‌شود. شرکت OpenAI محیط کاربری عمومی برای استفاده خبرنگاران یا مراکز آموزشی ارائه نکرده و دسترسی را صرفاً به محققان و پلتفرم‌های تاییدشده محدود ساخته تا از مهندسی معکوس کلیدهای رمزنگاری جلوگیری شود.[1][6]

پایگاه خبری PYMNTS گزارش می‌دهد که این اکوسیستم بسته، کارآمدی عینی واترمارک را برای عموم جامعه محدود کرده است. تا زمانی که یک رابط برنامه‌نویسی استاندارد و فراگیر برای اعتبارسنجی ارائه نشود، بار اثبات هویت ماشینی متن‌ها در انحصار سازوکارهای پشت‌درهای‌بسته شرکت‌ها باقی خواهد ماند.[6]

پایداری عملیاتی textGrain اکنون در مواجهه با چالش ویرایش‌های پیش‌بینی‌ناپذیر کاربران در دنیای واقعی آزموده می‌شود. هم‌زمان با فشارهای قانونی اتحادیه اروپا بر صنعت فناوری، ماه‌های آینده مشخص خواهد کرد که آیا واترمارک‌های مبتنی بر احتمال ریاضی تاب فرار از بازنویسی‌های ثانویه را دارند یا صرفاً برای رفع تکلیف قانونی به کار گرفته شده‌اند.[3][5]

نکات کلیدی

  • سامانه textGrain با ایجاد تغییری ظریف در احتمال انتخاب واژگان هنگام نگارش متن، یک امضای ریاضیاتی قابل اعتبارسنجی خلق می‌کند.
  • این واترمارک در حال حاضر تنها برای کاربران ChatGPT در محدوده اتحادیه اروپا فعال است تا شفافیت تعیین‌شده در قانون هوش مصنوعی این بلوک تأمین شود.
  • کاربران رابط برنامه‌نویسی (API) در سراسر جهان می‌توانند این سامانه را فعال کنند، اما در کاربردهای تجاری خارج از اروپا به صورت پیش‌فرض خاموش است.
  • این امضای رمزنگاری‌شده در برابر ویرایش‌های جزیی پایدار می‌ماند، ولی محققان نشان داده‌اند که عبور دادن متن از یک مدل بازنویسی ثانویه بدون واترمارک می‌تواند آن را به‌کلی بی‌اثر کند.

آنچه نمی‌دانیم

  • اینکه آیا OpenAI ابزار شناسایی عمومی در اختیار معلمان و روزنامه‌نگاران برای راستی‌آزمایی امضاهای textGrain قرار خواهد داد یا خیر و زمان احتمالی آن چه خواهد بود.
  • میزان تأخیری که تفکیک رمزنگاری‌شده توکن‌ها در ترافیک‌های بالا به سرعت پاسخ‌دهی استاندارد ChatGPT تحمیل می‌کند چقدر است.
  • اینکه آیا اتحادیه اروپا سامانه‌های انحصاری و غیرعمومی تشخیص را برای انطباق کافی با مقررات شفافیت خود خواهد پذیرفت یا خیر.

روند رویداد

  1. اوت ۲۰۲۶

    اجرای قانون هوش مصنوعی اتحادیه اروپا آغاز شد که بر اساس آن مدل‌های هوش مصنوعی چندمنظوره ملزم به اجرای سیستم‌های ماشینی ردیابی منشأ شدند.

  2. سپتامبر ۲۰۲۶

    شرکت آنتروپیک سامانه واترمارک متنی نامرئی خود را برای انطباق با مقررات شفافیت اروپا فعال کرد.

  3. ۵ اکتبر ۲۰۲۶

    شرکت OpenAI سامانه textGrain را برای تمامی کاربران ChatGPT در اتحادیه اروپا راه‌اندازی کرد.

حامیان انطباق با قوانین 40%منتقدان فنی 35%عمل‌گرایان صنعت فناوری 25%
حامیان انطباق با قوانین
استدلال می‌کنند که واترمارک‌گذاری اجباری برای جلوگیری از گسترش مهارنشدنی جعل داده‌ها و کلاهبرداری‌های سایبری امری حیاتی است.
منتقدان فنی
تاکید دارند که واترمارک متنی ذاتا شکننده بوده و به سادگی توسط مدل‌های بازنویسی ثانویه خنثی می‌شود.
عمل‌گرایان صنعت فناوری
از راه‌اندازی تدریجی و محدودشده به مرزهای جغرافیایی حمایت می‌کنند تا میان الزامات قانونی و هزینه‌های محاسباتی توکن‌ها تعادل برقرار شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آموزگاران و موسسات دانشگاهی که نیاز مبرمی به دسترسی عمومی به ابزارهای تشخیص این واترمارک‌ها دارند.
  • توسعه‌دهندگان مدل‌های متن‌باز هوش مصنوعی که ابزارهایشان به ابزاری برای زدودن این نشانه‌های انحصاری بدل شده است.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

حامیان انطباق با قوانین 40%منتقدان فنی 35%عمل‌گرایان صنعت فناوری 25%
  1. [1]OpenAIعمل‌گرایان صنعت فناوری

    Our approach to EU text provenance rules

    مطالعه در OpenAI →
  2. [2]OpenAIعمل‌گرایان صنعت فناوری

    textGrain: Entropy-Calibrated Watermarking for Language Model Text

    مطالعه در OpenAI →
  3. [3]Engadgetعمل‌گرایان صنعت فناوری

    OpenAI will add a digital watermark to text and code generated in the EU

    مطالعه در Engadget →
  4. [4]The Decoderمنتقدان فنی

    OpenAI is adding invisible watermarks to ChatGPT text to comply with EU rules

    مطالعه در The Decoder →
  5. [5]PCMagحامیان انطباق با قوانین

    Like Anthropic, OpenAI is adding an 'invisible watermark' to comply with EU regulations, but says a 'regional approach gives us room to learn from real-world use and feedback.'

    مطالعه در PCMag →
  6. [6]PYMNTSحامیان انطباق با قوانین

    OpenAI Begins Text Watermarking Rollout Under EU AI Act

    مطالعه در PYMNTS →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.