رفتن به محتوای اصلی
توضیح کوهستانایمنی هوش مصنوعیتحلیل و توضیح۲۹ مرداد ۱۴۰۵، ۱۷:۲۵· 7 دقیقه مطالعه· در هوش مصنوعی

چرا واترمارکینگ هوش مصنوعی باعث توهم‌زایی در مدل‌های پزشکی می‌شود؟

سازوکارهای آماری که برای ردیابی متون تولید شده توسط هوش مصنوعی به کار می‌روند، با اصطلاحات دقیق مورد نیاز در پزشکی تضاد اساسی دارند و این امر منجر به افزایش ناگهانی تشخیص‌های ساختگی و استدلال‌های بالینی معیوب شده است.

به قلم آرش رضایی

محققان هوش مصنوعی بالینی 65%تحلیلگران حاکمیت هوش مصنوعی 35%
محققان هوش مصنوعی بالینی
هشدار می‌دهند که واترمارک‌های آماری با هدف عمومی، عملکرد خاص حوزه را کاهش داده و خطرات غیرقابل قبولی برای ایمنی بیمار ایجاد می‌کنند.
تحلیلگران حاکمیت هوش مصنوعی
تنش بین دستورات نظارتی گسترده برای ردیابی هوش مصنوعی و واقعیت‌های ریاضی دقت خاص حوزه را بررسی می‌کنند.

هنگامی که از یک مدل زبان پزشکی خواسته می‌شود بیماری را تشخیص دهد یا خلاصه‌ای از سابقه بالینی ارائه کند، اصطلاحات صحیح معمولاً بسیار قابل پیش‌بینی هستند. در نظریه اطلاعات، کلمه‌ای که تقریباً مطمئن است پس از کلمه‌ای دیگر می‌آید – مانند کلمه «فشار» پس از «خون بالا» – به عنوان یک توکن با «آنتروپی پایین» شناخته می‌شود. برای یک مدل استاندارد هوش مصنوعی، انتخاب این کلمات دقیق و قابل پیش‌بینی، اساس مطلق دقت بالینی است. اما از آنجایی که نهادهای نظارتی و شرکت‌های فناوری به طور فزاینده‌ای دستور می‌دهند که متون تولید شده توسط هوش مصنوعی دارای واترمارک‌های آماری پنهان برای اثبات منشأ خود باشند، این قابلیت پیش‌بینی به یک آسیب‌پذیری حیاتی تبدیل شده است. همان سازوکارهایی که برای ایمن و قابل ردیابی کردن سیستم‌های هوش مصنوعی طراحی شده‌اند، فعالانه قابلیت اطمینان واقعی آن‌ها را هنگام استقرار در حوزه‌های تخصصی مانند مراقبت‌های بهداشتی، کاهش می‌دهند.

واترمارکینگ با تغییر ظریف نحوه انتخاب کلمات توسط یک مدل زبان بزرگ کار می‌کند. در هر مرحله از تولید متن، الگوریتم واترمارکینگ از یک دنباله شبه تصادفی برای تقسیم کل واژگان مدل به «فهرست سبز» و «فهرست قرمز» استفاده می‌کند. برای ایجاد یک امضای قابل تشخیص ریاضی که ثابت کند متن توسط یک ماشین تولید شده است، سیستم به طور مصنوعی احتمال انتخاب کلمات فهرست سبز توسط مدل را افزایش می‌دهد. با طولانی‌تر شدن متن، چگالی غیرطبیعی کلمات فهرست سبز به یک واترمارک رمزنگاری تبدیل می‌شود که نرم‌افزار تشخیص تخصصی می‌تواند به راحتی آن را شناسایی کند.

برای درک اینکه چرا این روش در محیط‌های بالینی شکست می‌خورد، باید به ریاضیات «بازوزن‌دهی لاجیت» (logit reweighting) نگاه کرد. هنگامی که یک مدل زبان کلمه بعدی را محاسبه می‌کند، یک امتیاز احتمال – یک لاجیت – به هر کلمه ممکن در واژگان خود اختصاص می‌دهد. الگوریتم واترمارک این امتیازات را درست قبل از انتخاب نهایی رهگیری می‌کند و به طور مصنوعی لاجیت‌های کلمات فهرست سبز را افزایش می‌دهد. مدل به لحاظ ریاضی مجبور می‌شود کلماتی را انتخاب کند که با الگوی پنهان مطابقت دارند، حتی اگر دقیق‌ترین یا منطقی‌ترین انتخاب بر اساس درخواست کاربر نباشند.

الگوریتم‌های واترمارکینگ مدل‌های زبان را مجبور می‌کنند تا کلمات خاصی را برای ایجاد یک الگوی آماری قابل ردیابی انتخاب کنند.

در نویسندگی خلاق، متون بازاریابی یا مکالمات روزمره، این تلنگر آماری کاملاً بی‌ضرر است. اگر یک مدل واترمارک‌دار کلمه «خوشحال» را با «شادمان» عوض کند، زیرا «شادمان» برای آن جمله خاص در فهرست سبز قرار دارد، معنای کلی متن کاملاً حفظ می‌شود در حالی که کد ردیابی لازم جاسازی شده است. انعطاف‌پذیری زبان طبیعی انسان، دستکاری آماری را که در زیر سطح اتفاق می‌افتد، پنهان می‌کند.

با این حال، در پزشکی به ندرت مترادف‌های ایمن وجود دارد. جایگزینی «هیپوگلیسمی» (افت قند خون) با «هیپرگلیسمی» (افزایش قند خون) یک آرایه سبکی نیست، بلکه یک خطای بالینی بالقوه کشنده است. از آنجایی که اصطلاحات پزشکی سخت و غیرقابل انعطاف هستند، مجبور کردن یک مدل زبان به انتخاب کلمه‌ای با قابلیت پیش‌بینی کمتر برای ارضای الگوریتم واترمارک، تقریباً تضمین می‌کند که مدل کلمه اشتباهی را انتخاب خواهد کرد. ارزیابی‌های مستقل اخیر دقیقاً نشان داده‌اند که این پویایی چقدر برای استدلال بالینی مخرب است.

یک مطالعه جامع به رهبری محققان در دانشگاه فنی فدرال زوریخ (ETH Zurich) و مؤسسه بهداشت برلین در شاریته (Charité)، به طور سیستماتیک پنج طرح برجسته واترمارکینگ را در ۱۱ مدل زبان مختلف و هفت مدل زبان-بینایی ارزیابی کرد. یافته‌ها که در پیش‌انتشار سال ۲۰۲۶ منتشر شد، نشان داد که واترمارکینگ باعث تخریب قابل توجهی در حالت‌های شکست متعدد در زمینه‌های پزشکی می‌شود. محققان فساد شدید واژگانی را مشاهده کردند، جایی که مدل‌ها اصطلاحات را توهم‌زایی کرده و انتساب نادرست یافته‌های تصویربرداری پزشکی را تشدید کردند.[1]

یافته‌ها که در پیش‌انتشار سال ۲۰۲۶ منتشر شد، نشان داد که واترمارکینگ باعث تخریب قابل توجهی در حالت‌های شکست متعدد در زمینه‌های پزشکی می‌شود.

مقیاس تخریب مشاهده شده در مطالعه ETH زوریخ قابل توجه است. تحت پیکربندی‌های خاص واترمارکینگ، مانند نوع تحریف‌کننده الگوریتم SynthID، نرخ پاسخ‌های صحیح که با استدلال معیوب پشتیبانی می‌شدند، در مدل‌هایی مانند Phi-4-14B بیش از دو برابر شد و از ۱۱.۴ درصد به ۲۶.۳ درصد رسید. در برخی از مدل‌های تخصصی حوزه، تزریق موجودیت‌های پزشکی ساختگی تا ۳۹.۲ واحد درصد افزایش یافت و اساساً کاربرد بالینی متن تولید شده را فاسد کرد.[1]

هنگامی که یک واترمارک یک اصطلاح پزشکی بسیار قابل پیش‌بینی را سرکوب می‌کند، مدل مجبور به بداهه‌پردازی می‌شود و اغلب یک جایگزین نادرست از نظر واقعی تولید می‌کند.

یک تحقیق موازی توسط محققان دانشگاه فلوریدای مرکزی (University of Central Florida) این مکانیسم‌ها را تأیید کرد. گردش کار ارزیابی آن‌ها، که دقت واقعی را بر صرفاً انسجام معنایی اولویت می‌داد، نشان داد که واترمارک‌های زمان تولید، توزیع آنتروپی توکن‌ها را به طور اساسی تغییر می‌دهند. از آنجایی که اصطلاحات حیاتی پزشکی اغلب متکی بر توکن‌های با آنتروپی پایین و بسیار قابل پیش‌بینی هستند، بازوزن‌دهی آماری مورد نیاز واترمارک‌ها به طور نامتناسبی این کلمات دقیق را هدف قرار داده و تحریف می‌کند.[2]

تیم UCF خاطرنشان کرد که جابجایی این توکن‌های با آنتروپی پایین باعث عدم دقت مستقیم و توهم‌زایی می‌شود. هنگامی که الگوریتم واترمارک مدل را مجبور می‌کند از یک اصطلاح پزشکی در فهرست قرمز اجتناب کند، مدل مجبور به بداهه‌پردازی می‌شود و جایگزینی تولید می‌کند که از نظر پزشکی مرتبط اما از نظر واقعی نادرست است. این تغییر آنتروپی، نمایش موجودیت‌های پزشکی را کاهش می‌دهد، یکپارچگی واقعی کل خروجی را به خطر می‌اندازد و خطراتی را معرفی می‌کند که معیارهای عمومی قبلی کاملاً در ثبت آن‌ها شکست خورده بودند.[2]

شاید نگران‌کننده‌ترین یافته از مطالعه ETH زوریخ این باشد که این شکست‌های حیاتی تا حد زیادی برای معیارهای استاندارد ارزیابی هوش مصنوعی نامرئی هستند. هنگامی که محققان یک مدل واترمارک‌دار را با استفاده از معیارهای عمومی یا آزمون‌های استاندارد پزشکی چند گزینه‌ای آزمایش می‌کنند، امتیازات دقت کلی اغلب ثابت می‌مانند. مدل ممکن است همچنان پاسخ نهایی صحیح – مانند «گزینه ج» – را انتخاب کند، حتی در حالی که رد استدلالی که برای توجیه آن پاسخ تولید می‌کند، مملو از اظهارات تشخیصی متناقض و علائم ساختگی است.[1]

ارزیابی‌های مستقل نشان می‌دهند که مدل‌های واترمارک‌دار در مقایسه با مدل‌های پایه بدون واترمارک، نرخ استدلال معیوب به طور قابل توجهی بالاتری از خود نشان می‌دهند.

این امر یک نقطه کور خطرناک برای بخش‌های فناوری اطلاعات بیمارستان و تیم‌های استقرار بالینی ایجاد می‌کند. پزشکی که به خروجی واترمارک‌دار تکیه می‌کند، ممکن است مدلی را ببیند که در یک معیار نمره عالی کسب کرده است، در حالی که کاملاً بی‌اطلاع است که متن زیربنایی حاوی اصطلاحات توهم‌زایی شده است. عدم وجود تحلیل‌های خاص حوزه، به معیارهای کلی اجازه می‌دهد تا به طور سیستماتیک تخریب‌های عملی ناشی از واترمارک را پنهان کنند و به ارائه‌دهندگان مراقبت‌های بهداشتی حس امنیت کاذب بدهند.[1]

این تضاد، تنش فزاینده‌ای را بین حاکمیت عمومی هوش مصنوعی و ایمنی خاص حوزه برجسته می‌کند. نهادهای نظارتی در سراسر جهان برای مبارزه با دیپ‌فیک‌ها، تقلب دانشگاهی و اطلاعات نادرست خودکار، واترمارکینگ اجباری را ترویج می‌کنند. با این حال، اعمال این دستورات گسترده در زمینه‌های تخصصی بدون چارچوب‌های ارزیابی متناسب، خطر معرفی آسیب‌های جدید و دشوارتر برای تشخیص را به زیرساخت‌های حیاتی به همراه دارد.[3]

محققان اکنون خواستار توسعه تکنیک‌های واترمارکینگ آگاه به حوزه هستند. این سیستم‌های نظری اصطلاحات پزشکی با آنتروپی پایین را تشخیص می‌دهند و آن توکن‌های خاص را از بازوزن‌دهی آماری معاف می‌کنند، در نتیجه یکپارچگی واقعی را حفظ کرده و در عین حال یک سیگنال قابل ردیابی را در جای دیگری از متن نگه می‌دارند. تیم‌های دیگر در حال بررسی واترمارک‌های چندبیتی «بدون اعوجاج» هستند که تلاش می‌کنند سیگنال‌ها را بدون تغییر توزیع احتمال اساسی خروجی مدل جاسازی کنند.[2]

تا زمانی که چنین واترمارک‌های بدون اعوجاج یا حساس به حوزه کامل شوند، استقرار مدل‌های هوش مصنوعی ردیابی شده در محیط‌های بالینی همچنان پرخطر است. اجماع علمی کنونی حکم می‌کند که ارزیابی خاص حوزه یک پیش‌نیاز مطلق برای استقرار ایمن است و هشدار می‌دهد که در غیر این صورت، معیارهای عمومی همچنان شکست‌های بالینی مهم را پنهن خواهند کرد. برای صنعت هوش مصنوعی پزشکی، دستور کار روشن است: ابزارهای ایمنی نباید همان استدلالی را که قرار است از آن محافظت کنند، از بین ببرند.[1][3]

نکات کلیدی

  1. واترمارکینگ هوش مصنوعی با تغییر انتخاب کلمات توسط مدل زبان در حین تولید متن، سیگنال‌های آماری قابل ردیابی را جاسازی می‌کند.
  2. اصطلاحات پزشکی متکی بر کلمات بسیار قابل پیش‌بینی و با «آنتروپی پایین» هستند که الگوریتم‌های واترمارکینگ برای حفظ امضای آماری خود اغلب آن‌ها را سرکوب می‌کنند.
  3. مطالعات مستقل نشان می‌دهند که واترمارکینگ می‌تواند نرخ استدلال معیوب در مدل‌های هوش مصنوعی پزشکی را بیش از دو برابر کند.
  4. معیارهای استاندارد دقت هوش مصنوعی اغلب در شناسایی این جعل‌های ناشی از واترمارک شکست می‌خورند و نقطه کوری برای تیم‌های فناوری اطلاعات بالینی ایجاد می‌کنند.
  5. محققان خواستار توسعه واترمارک‌های آگاه به حوزه (Domain-aware) هستند که اصطلاحات حیاتی پزشکی را از دستکاری آماری معاف کنند.

اصطلاحات کلیدی

واترمارکینگ
تکنیکی که با تغییر احتمال انتخاب کلمات خاص، یک سیگنال آماری پنهان را در متن تولید شده توسط هوش مصنوعی جاسازی می‌کند.
آنتروپی
در مدل‌های زبان، معیاری برای قابلیت پیش‌بینی؛ یک کلمه بسیار قابل پیش‌بینی دارای آنتروپی پایین است، در حالی که یک کلمه غیرقابل پیش‌بینی دارای آنتروپی بالا است.
بازوزن‌دهی لاجیت
فرآیند ریاضی مورد استفاده توسط واترمارک‌ها برای افزایش مصنوعی احتمال انتخاب کلمات خاص «فهرست سبز» توسط مدل نسبت به کلمات دیگر.
توهم‌زایی
زمانی که یک مدل هوش مصنوعی اطلاعات غلط، ساختگی یا بی‌معنی را به عنوان واقعیت تولید می‌کند.

منابع

پوشش منابع

3 منبع

2 دیدگاه شناسایی‌شده

محققان هوش مصنوعی بالینی 65%تحلیلگران حاکمیت هوش مصنوعی 35%
  1. [1]arXivمحققان هوش مصنوعی بالینی

    Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

    مطالعه در arXiv
  2. [2]arXivمحققان هوش مصنوعی بالینی

    Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts

    مطالعه در arXiv
  3. [3]تیم سردبیری کوهستانتحلیلگران حاکمیت هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.