اجرای واترمارک «textGrain» توسط OpenAI برای انطباق با قوانین شفافیت اتحادیه اروپا
شرکت OpenAI با هدف پایبندی به قانون هوش مصنوعی اتحادیه اروپا، تعبیه واترمارکهای پنهان رمزنگاریشده در متون خروجی ChatGPT برای کاربران اروپایی را آغاز کرد. سامانه «textGrain» با تغییر اندک در احتمال انتخاب توکنها، ردپایی ریاضیاتی برجای میگذارد که نخستین استقرار گسترده ردیابی اصالت متن توسط یک توسعهدهنده بزرگ هوش مصنوعی محسوب میشود.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
هنگامی که مولدهای تصویر مانند DALL-E و Midjourney برای نشانهگذاری عکسهای تولیدشده رو به فرادادههای نامرئی آوردند، دستکاری را روی پیکسلهایی انجام دادند که چشم انسان توان تمایز آنها را ندارد. در تولید متن اما چنین بستر پنهانی در دسترس نیست و توسعهدهندگان ناچارند برای ثبت هرگونه ردیابی، در واژگان انتخابی مدل دست ببرند.
شرکت OpenAI روز دوشنبه سامانهای موسوم به «textGrain» را فعال کرد که دقیقاً همین سازوکار را برای میلیونها کاربر اروپایی پیاده میکند؛ رویکردی که یک امضای رمزنگاریشده را مستقیماً درون واژگان و نحو جملات خروجی ChatGPT مینشاند.[1][3]
این اقدام پاسخی مستقیم به قانون هوش مصنوعی اتحادیه اروپا است؛ قانونی که ارائهدهندگان مدلهای هوش مصنوعی چندمنظوره را ملزم میکند خروجیهای ساختگی خود را به نحوی طراحی کنند که توسط ماشینها قابل خواندن و شناسایی باشند. با این حال، OpenAI اجرای این مصوبه را از نظر جغرافیایی تفکیک کرده و الزام واترمارک را صرفاً به درخواستهایی که از مبدأ اتحادیه اروپا ثبت میشوند محدود ساخته است.[1][6]
شرکت OpenAI در اطلاعیه معرفی این قابلیت اعلام کرد: «رویکرد منطقهای به ما فرصت میدهد تا از کاربردهای واقعی و بازخورد کاربران بیاموزیم.» این شرکت همچنین خاطرنشان کرد در حالی که کاربران اروپایی متنها را به شکل خودکار همراه با واترمارک دریافت میکنند، توسعهدهندگان جهانی که از API استفاده میکنند میتوانند به دلخواه خود این قابلیت را فعال نمایند.[1][5]
مکانیسم عملکرد textGrain
برای بررسی سازوکار درونی textGrain، پیش از هر چیز باید شیوه جملهبندی مدلهای زبانی بزرگ را مد نظر قرار داد. این مدلها پاسخهای از پیش نوشتهشده را بازخوانی نمیکنند؛ بلکه با محاسبات ریاضی برآورد میکنند که پس از کلمه پیشین، کدام توکن (یا جزء کلمه) بیشترین احتمال وقوع منطقی را دارد.[2]
در یک خروجی معمولی، مدل ممکن است تشخیص دهد که کلمه «سیب» ۴۰ درصد شانس حضور در جایگاه بعدی را دارد و واژه «میوه» ۳۰ درصد. سپس مدل از میان بالاترین احتمالات نمونهبرداری میکند تا نثری طبیعی و روان خلق شود.[2]
فناوری textGrain دقیقاً در لحظه همین گزینش وارد مدار میشود. این سامانه با استفاده از یک کلید رمزنگاری، واژگان دردسترس مدل را پیش از تولید هر توکن به شکل شبهتصادفی به دو دسته «فهرست سبز» و «فهرست قرمز» تقسیم میکند.[2]
سپس الگوریتم بهطور مصنوعی شانس انتخاب واژههای حاضر در فهرست سبز را بالا میبرد. با تداوم تولید کلمات در طول یک بند، مدل واژگان فهرست سبز را به میزانی به مراتب بیشتر از احتمالات آماری طبیعی به کار میگیرد.[2]
در مقاله فنی منتشرشده توسط OpenAI تحت عنوان «واترمارک کالیبرهشده با آنتروپی برای متون مدلهای زبانی»، توضیح داده شده که این تمایل مهندسیشده برای خواننده انسانی کاملاً نامحسوس است. با این حال، ابزار تشخیصی مجهز به کلید رمزنگاری صحیح میتواند تراکم غیرطبیعی توکنهای فهرست سبز را بلافاصله شناسایی کند.[2]
فشارهای قانونی و چشمانداز استقرار جهانی
هرچه متن تولیدی طولانیتر باشد، ضریب اطمینان این محاسبه ریاضیاتی بالاتر میرود. مستندات فنی OpenAI نشان میدهد سامانه به حدود ۱۰۰ تا ۲۰۰ توکن — یعنی متنی در ابعاد یک بند کوتاه — نیاز دارد تا اصالت هوش مصنوعی را با اطمینان بالا احراز کند.[2]
قانون هوش مصنوعی اتحادیه اروپا که اجرای آن از سال جاری آغاز شده، بهطور مستقیم ردیابی منشأ محتوای مصنوعی را نشانه گرفته است. تدوینکنندگان این مقررات در پی آن بودند تا پیش از آنکه دیپفیکها و اطلاعات گمراهکننده خودکار فضاهای عمومی را فرا بگیرند، سپری نظارتی ایجاد کنند.[6]
به گزارش انگجت، تصمیم OpenAI مبنی بر محدودسازی جغرافیایی اجرای این قانون، مشابه راهبردهای دیگر غولهای فناوری در مواجهه با قوانین اتحادیه اروپا است. این شرکت با جداسازی بازار اروپا میتواند سربار محاسباتی سامانه را بدون به خطر انداختن عملکرد جهانی زیر بار ترافیکی واقعی بیازماید.[3]
آنتروپیک، رقیب اصلی OpenAI، اخیراً واترمارک نامرئی مشابهی را برای مدلهای Claude مستقر کرده است. پیسیمگ اشاره میکند که هر دو شرکت از این پنجره انطباق منطقهای بهره میبرند تا ابزارهای کشف و اعتبارسنجی خود را پیش از الزام احتمالی نهادهای قانونگذار در آمریکا یا بریتانیا صیقل دهند.[5]
هزینه محاسباتی این مداخله آماری به هیچ وجه ناچیز نیست. محاسبه همزمان فهرستهای سبز و قرمز برای تکتک توکنها، تأخیر نامحسوسی در تولید پاسخها پدید میآورد؛ متغیری که با در نظر گرفتن میلیونها پرسش روزانه کاربران اروپایی، با حساسیت بالا زیر ذرهبین OpenAI قرار دارد.[1][3]
آسیبپذیریها و تاکتیکهای گریز از ردیابی
اگرچه مبانی ریاضیاتی textGrain استوار است، اما این روش در برابر دستکاریها آسیبناپذیر نیست. امضای رمزنگاری بهگونهای طراحی شده که ویرایشهای اندک را تاب بیاورد؛ بدین معنا که کاربر با جابهجا کردن چند صفت نمیتواند واترمارک را از میان ببرد.[2]
با وجود این، حملات ساختاری همچنان به شدت اثربخش هستند. اگر کاربری مقاله تولیدشده توسط ChatGPT را بردارد و از یک مدل متنباز دیگر که به واترمارک مجهز نیست بخواهد آن را بازنویسی (پارافریز) کند، چینش آماری توکنهای فهرست سبز بهکلی در هم میریزد.[4]
نشریه The Decoder به همین رخنه ساختاری اشاره کرده و مینویسد سودجویان میتوانند به آسانی متنهای ساختگی را از طریق مدلهای ثانویه سفیدشویی کنند. از آنجا که دوام واترمارک به توالی دقیق کلمات وابسته است، ترجمه رادیکال یا خلاصهسازی سنگین، ردپای ریاضیاتی آن را محو میسازد.[4]
علاوه بر این، ابزار اعتبارسنجی این امضاها همچنان به شکل اختصاصی و محدود نگهداری میشود. شرکت OpenAI محیط کاربری عمومی برای استفاده خبرنگاران یا مراکز آموزشی ارائه نکرده و دسترسی را صرفاً به محققان و پلتفرمهای تاییدشده محدود ساخته تا از مهندسی معکوس کلیدهای رمزنگاری جلوگیری شود.[1][6]
پایگاه خبری PYMNTS گزارش میدهد که این اکوسیستم بسته، کارآمدی عینی واترمارک را برای عموم جامعه محدود کرده است. تا زمانی که یک رابط برنامهنویسی استاندارد و فراگیر برای اعتبارسنجی ارائه نشود، بار اثبات هویت ماشینی متنها در انحصار سازوکارهای پشتدرهایبسته شرکتها باقی خواهد ماند.[6]
پایداری عملیاتی textGrain اکنون در مواجهه با چالش ویرایشهای پیشبینیناپذیر کاربران در دنیای واقعی آزموده میشود. همزمان با فشارهای قانونی اتحادیه اروپا بر صنعت فناوری، ماههای آینده مشخص خواهد کرد که آیا واترمارکهای مبتنی بر احتمال ریاضی تاب فرار از بازنویسیهای ثانویه را دارند یا صرفاً برای رفع تکلیف قانونی به کار گرفته شدهاند.[3][5]
نکات کلیدی
- سامانه textGrain با ایجاد تغییری ظریف در احتمال انتخاب واژگان هنگام نگارش متن، یک امضای ریاضیاتی قابل اعتبارسنجی خلق میکند.
- این واترمارک در حال حاضر تنها برای کاربران ChatGPT در محدوده اتحادیه اروپا فعال است تا شفافیت تعیینشده در قانون هوش مصنوعی این بلوک تأمین شود.
- کاربران رابط برنامهنویسی (API) در سراسر جهان میتوانند این سامانه را فعال کنند، اما در کاربردهای تجاری خارج از اروپا به صورت پیشفرض خاموش است.
- این امضای رمزنگاریشده در برابر ویرایشهای جزیی پایدار میماند، ولی محققان نشان دادهاند که عبور دادن متن از یک مدل بازنویسی ثانویه بدون واترمارک میتواند آن را بهکلی بیاثر کند.
آنچه نمیدانیم
- اینکه آیا OpenAI ابزار شناسایی عمومی در اختیار معلمان و روزنامهنگاران برای راستیآزمایی امضاهای textGrain قرار خواهد داد یا خیر و زمان احتمالی آن چه خواهد بود.
- میزان تأخیری که تفکیک رمزنگاریشده توکنها در ترافیکهای بالا به سرعت پاسخدهی استاندارد ChatGPT تحمیل میکند چقدر است.
- اینکه آیا اتحادیه اروپا سامانههای انحصاری و غیرعمومی تشخیص را برای انطباق کافی با مقررات شفافیت خود خواهد پذیرفت یا خیر.
روند رویداد
اوت ۲۰۲۶
اجرای قانون هوش مصنوعی اتحادیه اروپا آغاز شد که بر اساس آن مدلهای هوش مصنوعی چندمنظوره ملزم به اجرای سیستمهای ماشینی ردیابی منشأ شدند.
سپتامبر ۲۰۲۶
شرکت آنتروپیک سامانه واترمارک متنی نامرئی خود را برای انطباق با مقررات شفافیت اروپا فعال کرد.
۵ اکتبر ۲۰۲۶
شرکت OpenAI سامانه textGrain را برای تمامی کاربران ChatGPT در اتحادیه اروپا راهاندازی کرد.
- حامیان انطباق با قوانین
- استدلال میکنند که واترمارکگذاری اجباری برای جلوگیری از گسترش مهارنشدنی جعل دادهها و کلاهبرداریهای سایبری امری حیاتی است.
- منتقدان فنی
- تاکید دارند که واترمارک متنی ذاتا شکننده بوده و به سادگی توسط مدلهای بازنویسی ثانویه خنثی میشود.
- عملگرایان صنعت فناوری
- از راهاندازی تدریجی و محدودشده به مرزهای جغرافیایی حمایت میکنند تا میان الزامات قانونی و هزینههای محاسباتی توکنها تعادل برقرار شود.
دیدگاههایی که این گزارش پوشش نداده
- آموزگاران و موسسات دانشگاهی که نیاز مبرمی به دسترسی عمومی به ابزارهای تشخیص این واترمارکها دارند.
- توسعهدهندگان مدلهای متنباز هوش مصنوعی که ابزارهایشان به ابزاری برای زدودن این نشانههای انحصاری بدل شده است.
منابع
[1]OpenAIعملگرایان صنعت فناوریOur approach to EU text provenance rules
مطالعه در OpenAI →
[2]OpenAIعملگرایان صنعت فناوریtextGrain: Entropy-Calibrated Watermarking for Language Model Text
مطالعه در OpenAI →
[3]Engadgetعملگرایان صنعت فناوریOpenAI will add a digital watermark to text and code generated in the EU
مطالعه در Engadget →
[4]The Decoderمنتقدان فنیOpenAI is adding invisible watermarks to ChatGPT text to comply with EU rules
مطالعه در The Decoder →
[5]PCMagحامیان انطباق با قوانینLike Anthropic, OpenAI is adding an 'invisible watermark' to comply with EU regulations, but says a 'regional approach gives us room to learn from real-world use and feedback.'
مطالعه در PCMag →
[6]PYMNTSحامیان انطباق با قوانینOpenAI Begins Text Watermarking Rollout Under EU AI Act
مطالعه در PYMNTS →
بیشتر در هوش مصنوعی
مشاهده همه →مقررات هوش مصنوعی
قانون هوش مصنوعی اتحادیه اروپا ممنوعیتهای جدیدی برای تصاویر صمیمی و سوءاستفاده جنسی تولیدشده توسط هوش مصنوعی وضع کرد؛ جریمه تا ۳۵ میلیون یورو
7 منبع
مقررات هوش مصنوعی
اتحادیه اروپا اجرای قوانین هوش مصنوعی «پرخطر» را ۱۴ ماه به تعویق انداخت
5 منبع
اثرات هوش مصنوعی زایشی
ردپای مادی هوش مصنوعی: برآورد هزینههای انرژی، آب و نیروی کار مدلهای زایشی
4 منبع
انطباقپذیری هوش مصنوعی
پنج گام ارزیابی پیامدهای الگوریتمی؛ چگونه نهادهای ناظر ریسک هوش مصنوعی را مهار میکنند
3 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





