رفتن به محتوای اصلی
کوهستان
توضیح کوهستانایمنی هوش مصنوعیتحلیل و توضیح· 7 دقیقه مطالعه· در هوش مصنوعی

چرا واترمارکینگ هوش مصنوعی باعث توهم‌زایی در مدل‌های پزشکی می‌شود؟

سازوکارهای آماری که برای ردیابی متون تولید شده توسط هوش مصنوعی به کار می‌روند، با اصطلاحات دقیق مورد نیاز در پزشکی تضاد اساسی دارند و این امر منجر به افزایش ناگهانی تشخیص‌های ساختگی و استدلال‌های بالینی معیوب شده است.

به قلم ندا وزیری

به‌طور خلاصه

  1. واترمارکینگ هوش مصنوعی با تغییر انتخاب کلمات توسط مدل زبان در حین تولید متن، سیگنال‌های آماری قابل ردیابی را جاسازی می‌کند.
  2. اصطلاحات پزشکی متکی بر کلمات بسیار قابل پیش‌بینی و با «آنتروپی پایین» هستند که الگوریتم‌های واترمارکینگ برای حفظ امضای آماری خود اغلب آن‌ها را سرکوب می‌کنند.
  3. مطالعات مستقل نشان می‌دهند که واترمارکینگ می‌تواند نرخ استدلال معیوب در مدل‌های هوش مصنوعی پزشکی را بیش از دو برابر کند.

هنگامی که از یک مدل زبان پزشکی خواسته می‌شود بیماری را تشخیص دهد یا خلاصه‌ای از سابقه بالینی ارائه کند، اصطلاحات صحیح معمولاً بسیار قابل پیش‌بینی هستند. در نظریه اطلاعات، کلمه‌ای که تقریباً مطمئن است پس از کلمه‌ای دیگر می‌آید – مانند کلمه «فشار» پس از «خون بالا» – به عنوان یک توکن با «آنتروپی پایین» شناخته می‌شود. برای یک مدل استاندارد هوش مصنوعی، انتخاب این کلمات دقیق و قابل پیش‌بینی، اساس مطلق دقت بالینی است.

اما از آنجایی که نهادهای نظارتی و شرکت‌های فناوری به طور فزاینده‌ای دستور می‌دهند که متون تولید شده توسط هوش مصنوعی دارای واترمارک‌های آماری پنهان برای اثبات منشأ خود باشند، این قابلیت پیش‌بینی به یک آسیب‌پذیری حیاتی تبدیل شده است. همان سازوکارهایی که برای ایمن و قابل ردیابی کردن سیستم‌های هوش مصنوعی طراحی شده‌اند، فعالانه قابلیت اطمینان واقعی آن‌ها را هنگام استقرار در حوزه‌های تخصصی مانند مراقبت‌های بهداشتی، کاهش می‌دهند.

واترمارکینگ با تغییر ظریف نحوه انتخاب کلمات توسط یک مدل زبان بزرگ کار می‌کند. در هر مرحله از تولید متن، الگوریتم واترمارکینگ از یک دنباله شبه تصادفی برای تقسیم کل واژگان مدل به «فهرست سبز» و «فهرست قرمز» استفاده می‌کند.

برای ایجاد یک امضای قابل تشخیص ریاضی که ثابت کند متن توسط یک ماشین تولید شده است، سیستم به طور مصنوعی احتمال انتخاب کلمات فهرست سبز توسط مدل را افزایش می‌دهد. با طولانی‌تر شدن متن، چگالی غیرطبیعی کلمات فهرست سبز به یک واترمارک رمزنگاری تبدیل می‌شود که نرم‌افزار تشخیص تخصصی می‌تواند به راحتی آن را شناسایی کند.

برای درک اینکه چرا این روش در محیط‌های بالینی شکست می‌خورد، باید به ریاضیات «بازوزن‌دهی لاجیت» (logit reweighting) نگاه کرد. هنگامی که یک مدل زبان کلمه بعدی را محاسبه می‌کند، یک امتیاز احتمال – یک لاجیت – به هر کلمه ممکن در واژگان خود اختصاص می‌دهد.

الگوریتم واترمارک این امتیازات را درست قبل از انتخاب نهایی رهگیری می‌کند و به طور مصنوعی لاجیت‌های کلمات فهرست سبز را افزایش می‌دهد. مدل به لحاظ ریاضی مجبور می‌شود کلماتی را انتخاب کند که با الگوی پنهان مطابقت دارند، حتی اگر دقیق‌ترین یا منطقی‌ترین انتخاب بر اساس درخواست کاربر نباشند.

الگوریتم‌های واترمارکینگ مدل‌های زبان را مجبور می‌کنند تا کلمات خاصی را برای ایجاد یک الگوی آماری قابل ردیابی انتخاب کنند.

در نویسندگی خلاق، متون بازاریابی یا مکالمات روزمره، این تلنگر آماری کاملاً بی‌ضرر است. اگر یک مدل واترمارک‌دار کلمه «خوشحال» را با «شادمان» عوض کند، زیرا «شادمان» برای آن جمله خاص در فهرست سبز قرار دارد، معنای کلی متن کاملاً حفظ می‌شود در حالی که کد ردیابی لازم جاسازی شده است. انعطاف‌پذیری زبان طبیعی انسان، دستکاری آماری را که در زیر سطح اتفاق می‌افتد، پنهان می‌کند.

با این حال، در پزشکی به ندرت مترادف‌های ایمن وجود دارد. جایگزینی «هیپوگلیسمی» (افت قند خون) با «هیپرگلیسمی» (افزایش قند خون) یک آرایه سبکی نیست، بلکه یک خطای بالینی بالقوه کشنده است. از آنجایی که اصطلاحات پزشکی سخت و غیرقابل انعطاف هستند، مجبور کردن یک مدل زبان به انتخاب کلمه‌ای با قابلیت پیش‌بینی کمتر برای ارضای الگوریتم واترمارک، تقریباً تضمین می‌کند که مدل کلمه اشتباهی را انتخاب خواهد کرد. ارزیابی‌های مستقل اخیر دقیقاً نشان داده‌اند که این پویایی چقدر برای استدلال بالینی مخرب است.

یک مطالعه جامع به رهبری محققان در دانشگاه فنی فدرال زوریخ (ETH Zurich) و مؤسسه بهداشت برلین در شاریته (Charité)، به طور سیستماتیک پنج طرح برجسته واترمارکینگ را در ۱۱ مدل زبان مختلف و هفت مدل زبان-بینایی ارزیابی کرد. یافته‌ها که در پیش‌انتشار سال ۲۰۲۶ منتشر شد، نشان داد که واترمارکینگ باعث تخریب قابل توجهی در حالت‌های شکست متعدد در زمینه‌های پزشکی می‌شود. محققان فساد شدید واژگانی را مشاهده کردند، جایی که مدل‌ها اصطلاحات را توهم‌زایی کرده و انتساب نادرست یافته‌های تصویربرداری پزشکی را تشدید کردند.[1]

مقیاس تخریب مشاهده شده در مطالعه ETH زوریخ قابل توجه است. تحت پیکربندی‌های خاص واترمارکینگ، مانند نوع تحریف‌کننده الگوریتم SynthID، نرخ پاسخ‌های صحیح که با استدلال معیوب پشتیبانی می‌شدند، در مدل‌هایی مانند Phi-4-14B بیش از دو برابر شد و از ۱۱.۴ درصد به ۲۶.۳ درصد رسید. در برخی از مدل‌های تخصصی حوزه، تزریق موجودیت‌های پزشکی ساختگی تا ۳۹.۲ واحد درصد افزایش یافت و اساساً کاربرد بالینی متن تولید شده را فاسد کرد.[1]

هنگامی که یک واترمارک یک اصطلاح پزشکی بسیار قابل پیش‌بینی را سرکوب می‌کند، مدل مجبور به بداهه‌پردازی می‌شود و اغلب یک جایگزین نادرست از نظر واقعی تولید می‌کند.

یک تحقیق موازی توسط محققان دانشگاه فلوریدای مرکزی (University of Central Florida) این مکانیسم‌ها را تأیید کرد. گردش کار ارزیابی آن‌ها، که دقت واقعی را بر صرفاً انسجام معنایی اولویت می‌داد، نشان داد که واترمارک‌های زمان تولید، توزیع آنتروپی توکن‌ها را به طور اساسی تغییر می‌دهند. از آنجایی که اصطلاحات حیاتی پزشکی اغلب متکی بر توکن‌های با آنتروپی پایین و بسیار قابل پیش‌بینی هستند، بازوزن‌دهی آماری مورد نیاز واترمارک‌ها به طور نامتناسبی این کلمات دقیق را هدف قرار داده و تحریف می‌کند.[2]

تیم UCF خاطرنشان کرد که جابجایی این توکن‌های با آنتروپی پایین باعث عدم دقت مستقیم و توهم‌زایی می‌شود. هنگامی که الگوریتم واترمارک مدل را مجبور می‌کند از یک اصطلاح پزشکی در فهرست قرمز اجتناب کند، مدل مجبور به بداهه‌پردازی می‌شود و جایگزینی تولید می‌کند که از نظر پزشکی مرتبط اما از نظر واقعی نادرست است. این تغییر آنتروپی، نمایش موجودیت‌های پزشکی را کاهش می‌دهد، یکپارچگی واقعی کل خروجی را به خطر می‌اندازد و خطراتی را معرفی می‌کند که معیارهای عمومی قبلی کاملاً در ثبت آن‌ها شکست خورده بودند.[2]

شاید نگران‌کننده‌ترین یافته از مطالعه ETH زوریخ این باشد که این شکست‌های حیاتی تا حد زیادی برای معیارهای استاندارد ارزیابی هوش مصنوعی نامرئی هستند. هنگامی که محققان یک مدل واترمارک‌دار را با استفاده از معیارهای عمومی یا آزمون‌های استاندارد پزشکی چند گزینه‌ای آزمایش می‌کنند، امتیازات دقت کلی اغلب ثابت می‌مانند. مدل ممکن است همچنان پاسخ نهایی صحیح – مانند «گزینه ج» – را انتخاب کند، حتی در حالی که رد استدلالی که برای توجیه آن پاسخ تولید می‌کند، مملو از اظهارات تشخیصی متناقض و علائم ساختگی است.[1]

ارزیابی‌های مستقل نشان می‌دهند که مدل‌های واترمارک‌دار در مقایسه با مدل‌های پایه بدون واترمارک، نرخ استدلال معیوب به طور قابل توجهی بالاتری از خود نشان می‌دهند.

این امر یک نقطه کور خطرناک برای بخش‌های فناوری اطلاعات بیمارستان و تیم‌های استقرار بالینی ایجاد می‌کند. پزشکی که به خروجی واترمارک‌دار تکیه می‌کند، ممکن است مدلی را ببیند که در یک معیار نمره عالی کسب کرده است، در حالی که کاملاً بی‌اطلاع است که متن زیربنایی حاوی اصطلاحات توهم‌زایی شده است. عدم وجود تحلیل‌های خاص حوزه، به معیارهای کلی اجازه می‌دهد تا به طور سیستماتیک تخریب‌های عملی ناشی از واترمارک را پنهان کنند و به ارائه‌دهندگان مراقبت‌های بهداشتی حس امنیت کاذب بدهند.[1]

این تضاد، تنش فزاینده‌ای را بین حاکمیت عمومی هوش مصنوعی و ایمنی خاص حوزه برجسته می‌کند. نهادهای نظارتی در سراسر جهان برای مبارزه با دیپ‌فیک‌ها، تقلب دانشگاهی و اطلاعات نادرست خودکار، واترمارکینگ اجباری را ترویج می‌کنند. با این حال، اعمال این دستورات گسترده در زمینه‌های تخصصی بدون چارچوب‌های ارزیابی متناسب، خطر معرفی آسیب‌های جدید و دشوارتر برای تشخیص را به زیرساخت‌های حیاتی به همراه دارد.[3]

محققان اکنون خواستار توسعه تکنیک‌های واترمارکینگ آگاه به حوزه هستند. این سیستم‌های نظری اصطلاحات پزشکی با آنتروپی پایین را تشخیص می‌دهند و آن توکن‌های خاص را از بازوزن‌دهی آماری معاف می‌کنند، در نتیجه یکپارچگی واقعی را حفظ کرده و در عین حال یک سیگنال قابل ردیابی را در جای دیگری از متن نگه می‌دارند. تیم‌های دیگر در حال بررسی واترمارک‌های چندبیتی «بدون اعوجاج» هستند که تلاش می‌کنند سیگنال‌ها را بدون تغییر توزیع احتمال اساسی خروجی مدل جاسازی کنند.[2]

تا زمانی که چنین واترمارک‌های بدون اعوجاج یا حساس به حوزه کامل شوند، استقرار مدل‌های هوش مصنوعی ردیابی شده در محیط‌های بالینی همچنان پرخطر است. اجماع علمی کنونی حکم می‌کند که ارزیابی خاص حوزه یک پیش‌نیاز مطلق برای استقرار ایمن است و هشدار می‌دهد که در غیر این صورت، معیارهای عمومی همچنان شکست‌های بالینی مهم را پنهن خواهند کرد. برای صنعت هوش مصنوعی پزشکی، دستور کار روشن است: ابزارهای ایمنی نباید همان استدلالی را که قرار است از آن محافظت کنند، از بین ببرند.[1][3]

اصطلاحات کلیدی

واترمارکینگ
تکنیکی که با تغییر احتمال انتخاب کلمات خاص، یک سیگنال آماری پنهان را در متن تولید شده توسط هوش مصنوعی جاسازی می‌کند.
آنتروپی
در مدل‌های زبان، معیاری برای قابلیت پیش‌بینی؛ یک کلمه بسیار قابل پیش‌بینی دارای آنتروپی پایین است، در حالی که یک کلمه غیرقابل پیش‌بینی دارای آنتروپی بالا است.
بازوزن‌دهی لاجیت
فرآیند ریاضی مورد استفاده توسط واترمارک‌ها برای افزایش مصنوعی احتمال انتخاب کلمات خاص «فهرست سبز» توسط مدل نسبت به کلمات دیگر.
توهم‌زایی
زمانی که یک مدل هوش مصنوعی اطلاعات غلط، ساختگی یا بی‌معنی را به عنوان واقعیت تولید می‌کند.

پرسش‌های متداول

واترمارک مدل زبان بزرگ (LLM) چیست؟

این یک الگوی آماری است که با تغییر جزئی انتخاب کلمات توسط مدل، در متن تولید شده توسط هوش مصنوعی جاسازی می‌شود و متن را برای نرم‌افزارهای تخصصی قابل ردیابی می‌کند.

چرا واترمارکینگ باعث خطاهای پزشکی می‌شود؟

اصطلاحات پزشکی بسیار خاص هستند. هنگامی که یک واترمارک مدل را مجبور می‌کند برای حفظ یک الگوی آماری از کلمات جایگزین استفاده کند، اغلب اصطلاحات پزشکی صحیح را با اصطلاحات نادرست جایگزین می‌کند.

آیا آزمون‌های استاندارد هوش مصنوعی این خطاها را تشخیص می‌دهند؟

اغلب خیر. مطالعات نشان می‌دهند که مدل‌های واترمارک‌دار همچنان می‌توانند پاسخ نهایی صحیح را در آزمون‌های چند گزینه‌ای انتخاب کنند، حتی زمانی که استدلال زیربنایی آن‌ها حاوی ادعاهای پزشکی ساختگی باشد.

بررسی عمیق دیدگاه‌ها

فشار نظارتی برای اثبات منشأ

چرا سیاست‌گذاران واترمارک را در سراسر سیستم‌های هوش مصنوعی اجباری می‌کنند.

از آنجایی که هوش مصنوعی مولد از خروجی انسان غیرقابل تشخیص می‌شود، نهادهای نظارتی در سراسر جهان واترمارکینگ را به عنوان محافظ نهایی در برابر دیپ‌فیک‌ها، تقلب دانشگاهی و اطلاعات نادرست خودکار می‌بینند. با جاسازی یک امضای رمزنگاری در خود متن، مقامات امیدوارند اطمینان حاصل کنند که هر قطعه رسانه مصنوعی را می‌توان به مدل منبع آن ردیابی کرد. برای طرفداران حاکمیت، این قابلیت ردیابی یک الزام غیرقابل مذاکره برای اعتماد عمومی به اکوسیستم هوش مصنوعی است.

هشدار ایمنی بالینی

چرا محققان پزشکی استدلال می‌کنند که دستکاری آماری متن ذاتاً خطرناک است.

محققان بالینی استدلال می‌کنند که مکانیک اساسی واترمارکینگ با دقت مورد نیاز در مراقبت‌های بهداشتی ناسازگار است. از آنجایی که واترمارک‌ها متکی بر مجبور کردن مدل به انتخاب کلمات کمتر قابل پیش‌بینی هستند، فعالانه مسیرهای با آنتروپی پایین را که اصطلاحات پزشکی دقیق را تعریف می‌کنند، از بین می‌برند. برای این کارشناسان، اعمال دستکاری آماری عمومی بر تشخیص‌های بالینی، دستورالعملی برای خطاهای پزشکی خاموش و سیستماتیک است که معیارهای استاندارد برای تشخیص آن‌ها مجهز نیستند.

مصالحه مهندسی

چگونه توسعه‌دهندگان در تلاشند تا قابلیت ردیابی را با دقت واقعی آشتی دهند.

توسعه‌دهندگان هوش مصنوعی بین دستورات نظارتی و الزامات ایمنی خاص حوزه گرفتار شده‌اند. در پاسخ به کاهش کیفیت متن پزشکی، تیم‌های مهندسی در حال بررسی واترمارک‌های «آگاه به حوزه» هستند که می‌توانند اصطلاحات حیاتی را تشخیص داده و آن‌ها را از بازوزن‌دهی آماری معاف کنند. دیگران در حال تحقیق بر روی طرح‌های واترمارکینگ چندبیتی و بدون اعوجاج هستند که تلاش می‌کنند سیگنال‌های منشأ را بدون تغییر توزیع احتمال اساسی خروجی مدل جاسازی کنند، اگرچه این موارد در مقیاس بزرگ عمدتاً نظری باقی می‌مانند.

محققان هوش مصنوعی بالینی 65%تحلیلگران حاکمیت هوش مصنوعی 35%
محققان هوش مصنوعی بالینی
هشدار می‌دهند که واترمارک‌های آماری با هدف عمومی، عملکرد خاص حوزه را کاهش داده و خطرات غیرقابل قبولی برای ایمنی بیمار ایجاد می‌کنند.
تحلیلگران حاکمیت هوش مصنوعی
تنش بین دستورات نظارتی گسترده برای ردیابی هوش مصنوعی و واقعیت‌های ریاضی دقت خاص حوزه را بررسی می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • پزشکان خط مقدم
  • شرکت‌های بیمه سوء عملکرد پزشکی

منابع

پوشش منابع

3 منبع

2 دیدگاه شناسایی‌شده

محققان هوش مصنوعی بالینی 65%تحلیلگران حاکمیت هوش مصنوعی 35%
  1. [1]arXivمحققان هوش مصنوعی بالینی

    Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

    مطالعه در arXiv →
  2. [2]arXivمحققان هوش مصنوعی بالینی

    Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts

    مطالعه در arXiv →
  3. [3]تیم سردبیری کوهستانتحلیلگران حاکمیت هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.