رفتن به محتوای اصلی
قابلیت اطمینان هوش مصنوعیبسته شواهد۱۱ مرداد ۱۴۰۵، ۱۰:۲۰· 8 دقیقه مطالعه· در ورزش

بر اساس ممیزی BMJ، چت‌بات‌های هوش مصنوعی اغلب در پاسخ به سوالات ورزشی و تغذیه شکست می‌خورند

یک ممیزی دقیق از پنج چت‌بات محبوب هوش مصنوعی نشان داد که تقریباً نیمی از پاسخ‌های آن‌ها در مورد سلامت مشکل‌ساز بوده است و بدترین عملکرد در پاسخ به پرسش‌های مربوط به عملکرد ورزشی و تغذیه مشاهده شده است.

به قلم سپیده توکلی

متخصصان مبتنی بر شواهد 40%مدافعان سلامت عمومی 35%خوش‌بینان فناوری 25%
متخصصان مبتنی بر شواهد
استدلال می‌کنند که هوش مصنوعی نمی‌تواند جایگزین تخصص انسانی در علوم ورزشی شود، زیرا قادر به فیلتر کردن شبه‌علم تجاری نیست.
مدافعان سلامت عمومی
بر خطرات گسترده‌تر اطلاعات غلط سلامتی ناشی از هوش مصنوعی و نیاز به نظارت نظارتی و آموزش کاربران تمرکز می‌کنند.
خوش‌بینان فناوری
معتقدند که در حالی که مدل‌های فعلی منابع جعلی تولید می‌کنند، تکرارهای سریع و هوش مصنوعی پزشکی تخصصی به زودی شکاف دقت را پر خواهند کرد.

نکات کلیدی

  • ممیزی پنج چت‌بات اصلی هوش مصنوعی نشان داد که ۴۹.۶ درصد از پاسخ‌های آن‌ها به پرسش‌های سلامتی مشکل‌ساز بوده است.
  • این مدل‌ها بدترین عملکرد را در دسته‌بندی‌های عملکرد ورزشی و تغذیه داشتند و در فیلتر کردن شبه‌علم آنلاین دچار مشکل شدند.
  • چت‌بات‌ها به ندرت از پاسخ دادن به سؤالات خودداری کردند و توصیه‌های نادرست را با اعتماد به نفس بالا ارائه دادند.
  • هیچ چت‌باتی نتوانست فهرست کاملی از منابع علمی دقیق ارائه دهد و اغلب به طور مکرر منابع جعلی (توهم) تولید می‌کرد.
  • سؤالات باز منجر به اطلاعات غلط بسیار بیشتری نسبت به سؤالات بسته (بله/خیر) شد.

هوش مصنوعی مولد به سرعت به ابزاری فراگیر برای حل مشکلات روزمره تبدیل شده است، به طوری که میلیون‌ها کاربر برای نوشتن ایمیل، کدنویسی و خلاصه‌سازی اسناد به چت‌بات‌ها متکی هستند. در دنیای ورزش، ورزشکاران و مربیان به طور فزاینده‌ای به این پلتفرم‌ها روی می‌آورند تا برنامه‌های تمرینی ماراتن تولید کنند، نسبت‌های درشت‌مغذی‌ها را بهینه سازند و در مورد ریکاوری پس از آسیب مشاوره بگیرند. جذابیت این ابزارها واضح است: چت‌بات‌ها پاسخ‌های فوری، شیوا و بسیار سفارشی‌شده‌ای ارائه می‌دهند که لحن یک مشاور حرفه‌ای را تقلید می‌کند. با این حال، یک ممیزی دقیق جدید، آسیب‌پذیری آشکاری را در این انقلاب تکنولوژیک آشکار می‌کند. وقتی صحبت از علوم ورزشی می‌شود، پاسخ‌های روان اغلب پنهان‌کننده نادرستی‌های خطرناکی هستند.[3]

این مطالعه جامع که در مجله داوری‌شده BMJ Open منتشر شده است، توسط دکتر نیکلاس بی. تیلر (Dr. Nicholas B. Tiller) در مؤسسه نوآوری زیست‌پزشکی لاندکوئیست در مرکز پزشکی هاربر-یو‌سی‌ال‌ای رهبری شد. تیم تحقیقاتی تصمیم گرفتند یک آزمون استرس سیستماتیک بر روی محبوب‌ترین مدل‌های هوش مصنوعی عمومی جهان انجام دهند. آن‌ها پنج چت‌بات اصلی را ممیزی کردند: چت‌جی‌پی‌تی (ChatGPT) از اوپن‌ای‌آی (OpenAI)، جیمینای (Gemini) از گوگل، متا ای‌آی (Meta AI)، گروک (Grok) از ایکس‌ای‌آی (xAI) و دیپ‌سیک (DeepSeek) از های-فلایر (High-Flyer)، و توانایی آن‌ها را در مدیریت پرسش‌های پیچیده، روزمره و پزشکی ارزیابی کردند.[1][4]

برای سنجش دقیق قابلیت اطمینان مدل‌ها، محققان یک چارچوب خصمانه را به کار گرفتند که برای تقلید از نحوه جستجوی اطلاعات توسط کاربران واقعی طراحی شده بود. آن‌ها ۲۵۰ سؤال را در پنج دسته‌بندی که مستعد اطلاعات غلط آنلاین هستند، به چت‌بات‌ها دادند: سرطان، واکسن‌ها، سلول‌های بنیادی، تغذیه و عملکرد ورزشی. این سؤالات شامل ترکیبی از پرسش‌های بسته (که نیاز به پاسخ‌های مشخص و مورد توافق داشتند) و پرسش‌های باز (که مدل‌ها را به تولید فهرست یا توضیح مفاهیم گسترده‌تر دعوت می‌کرد) بود.[1][5]

یافته‌های اصلی یک واقعیت تلخ را برای هر کسی که برای راهنمایی‌های سلامتی به هوش مصنوعی متکی است، آشکار می‌کند. بر اساس ارزیابی کارشناسان مستقل موضوعی که خروجی‌ها را بررسی کردند، ۴۹.۶ درصد از کل پاسخ‌های چت‌بات‌ها مشکل‌ساز ارزیابی شدند. با جزئی‌تر شدن این آمار، ۳۰ درصد از پاسخ‌ها به دلیل کمبود زمینه یا چارچوب‌بندی ضعیف «تا حدودی مشکل‌ساز» تلقی شدند، در حالی که ۱۹.۶ درصد «بسیار مشکل‌ساز» طبقه‌بندی شدند—به این معنی که حاوی اطلاعات غلط صریح یا توصیه‌های متناقضی بودند که در صورت عمل کردن به آن‌ها، به طور بالقوه می‌توانستند آسیب ایجاد کنند.[1][6]

تقریباً نیمی از پاسخ‌های چت‌بات‌های هوش مصنوعی به پرسش‌های سلامت و پزشکی توسط متخصصان موضوعی به عنوان مشکل‌ساز علامت‌گذاری شدند.

جالب اینجاست که مدل‌های هوش مصنوعی در همه موضوعات به طور یکسان شکست نخوردند. چت‌بات‌ها در پاسخ به سؤالات مربوط به واکسن‌ها و سرطان عملکرد نسبتاً خوبی داشتند. این حوزه‌ها با مجموعه‌های عظیم و ساختاریافته از تحقیقات دانشگاهی و اجماع علمی روشن مشخص می‌شوند. از آنجایی که داده‌های بنیادی در این زمینه‌ها قوی، به شدت تعدیل‌شده و مکرراً در منابع معتبر اینترنتی تقویت شده‌اند، مدل‌ها بهتر توانستند محتوای دقیق و مبتنی بر شواهد را بدون تولید منابع جعلی بازتولید کنند. همچنین، محدودیت‌هایی که توسعه‌دهندگان هوش مصنوعی برای این موضوعات پزشکی با ریسک بالا اعمال کرده‌اند، احتمالاً به عملکرد قوی‌تر آن‌ها کمک کرده است.[1][2]

با این حال، چت‌بات‌ها هنگام پرسش در مورد عملکرد ورزشی و تغذیه دچار فروپاشی شدند. این دو دسته بیشترین فراوانی پاسخ‌های مشکل‌ساز و کمترین تعداد پاسخ‌های دقیق را تولید کردند که نشان‌دهنده یک نقطه کور بزرگ در الگوریتم‌ها است. برای ورزشکاران، مربیان و علاقه‌مندان به تناسب اندام که هوش مصنوعی را جایگزینی ارزان و در دسترس برای یک متخصص تغذیه یا مربی قدرت معتبر می‌دانند، این آسیب‌پذیری خاص مهم‌ترین و عملی‌ترین نتیجه این ممیزی جامع است. مدل‌ها به طور مداوم در ارائه راهنمایی ایمن و قابل اعتماد، به ویژه در مورد استراتژی‌های تغذیه‌ای ظریف یا پروتکل‌های تمرینی پیشرفته، شکست خوردند.[1][3]

علت اصلی این شکست در نحوه آموزش مدل‌های زبان بزرگ نهفته است. تغذیه ورزشی و تناسب اندام حوزه‌هایی هستند که به شدت با ادعاهای تجاری، حکایات اینفلوئنسرها، رژیم‌های غذایی مد روز و شبه‌علم محض اشباع شده‌اند. از آنجایی که چت‌بات‌ها الگوها را از گستره وسیع و فیلترنشده اینترنت تطبیق می‌دهند، در جدا کردن کینزیولوژی دقیق و داوری‌شده از بازاریابی تهاجمی مکمل‌ها مشکل دارند. مدل‌ها به سادگی بازتابی از نویز موجود در داده‌های آموزشی خود هستند و افسانه‌های رایج تناسب اندام را به گونه‌ای بازگو می‌کنند که گویی حقایق فیزیولوژیکی تثبیت‌شده‌ای هستند.[3]

چت‌بات‌ها بیشترین مشکل را با علوم ورزشی و تغذیه داشتند، حوزه‌هایی که به شدت با شبه‌علم آنلاین اشباع شده‌اند.
علت اصلی این شکست در نحوه آموزش مدل‌های زبان بزرگ نهفته است.

آنچه خطر این اطلاعات غلط را تشدید می‌کند، قطعیت تزلزل‌ناپذیری است که با آن ارائه می‌شوند. با وجود دقت پایین در علوم ورزشی، چت‌بات‌ها تقریباً هرگز اعتراف نکردند که از عمق موضوع بی‌اطلاع هستند. از ۲۵۰ سؤال سلامتی و پزشکی مطرح شده در طول این مطالعه، تنها دو مورد وجود داشت که یک مدل از پاسخ دادن خودداری کرد—هر دو توسط متا ای‌آی در پاسخ به پرسش‌هایی درباره استروئیدهای آنابولیک و درمان‌های جایگزین سرطان. در بقیه موارد، هوش مصنوعی توصیه‌های ناقص را با اعتماد به نفس مطلق ارائه داد.[1][4]

این اعتماد به نفس اغلب با ظاهری از دقت علمی تقویت می‌شود، که این مطالعه آن را به عنوان یک توهم خطرناک افشا کرد. هنگامی که محققان از چت‌بات‌ها خواستند منابع علمی برای پشتیبانی از ادعاهای خود ارائه دهند، مدل‌ها تحت بررسی دقیق از هم پاشیدند. میانگین امتیاز کامل بودن منابع تولید شده تنها ۴۰ درصد بود، به این معنی که اکثریت قریب به اتفاق شواهد ارائه شده اساساً ناقص، ناکامل یا کاملاً بی‌ربط به ادعاهای واقعی مطرح شده در متن تولید شده بودند. این فقدان منبع قابل تأیید، اعتبار علمی توصیه را از بین می‌برد.[1][2]

در واقع، حتی یک چت‌بات هم نتوانست در کل ممیزی، فهرست منابع کاملاً دقیقی ارائه دهد. مدل‌ها مکرراً درگیر «توهم منبع‌دهی» شدند—اختراع نام‌های جعلی نویسندگان، تولید لینک‌های DOI شکسته، یا استناد به مقالاتی که اصلاً وجود نداشتند. برای یک فرد عادی، این منابع ساختگی کاملاً واقعی به نظر می‌رسند و پوششی کاذب از اعتبار علمی ایجاد می‌کنند که شک و تردید طبیعی کاربر را دور می‌زند.[1][3]

این ممیزی همچنین یک مشکل فراگیر با «توازن کاذب» را برجسته کرد. هنگامی که در مورد درمان‌های بحث‌برانگیز یا اثبات‌نشده سؤال می‌شد، چت‌بات‌ها اغلب مکمل‌های غیرعلمی یا رژیم‌های غذایی مد روز را در کنار روش‌های مبتنی بر شواهد ارائه می‌دادند و وزن یکسانی به آن‌ها در متن تولید شده می‌دادند. مدل‌ها با عدم تأکید بر اجماع علمی قاطع یا نبود آزمایش‌های بالینی، ناخواسته به شبه‌علم مشروعیت می‌بخشند. این تعادل کاذب می‌تواند به راحتی ورزشکاری را که به دنبال برتری رقابتی یا مزیت جزئی است، گمراه کند و او را به سمت مداخلات ناکارآمد یا بالقوه مضر سوق دهد.[1][3]

مدل‌های هوش مصنوعی مکرراً استنادات علمی ساختگی ارائه می‌دهند و پوششی خطرناک از اعتبار مبتنی بر شواهد ایجاد می‌کنند.

ساختار سؤال کاربر نیز نقش بزرگی در احتمال دریافت توصیه‌های بد داشت. محققان دریافتند که پرسش‌های باز—مانند «بهترین مکمل‌ها برای سلامت عمومی کدامند؟»—در ۳۲ درصد مواقع منجر به پاسخ‌های بسیار مشکل‌ساز شدند. در مقابل، سؤالات بسته (بله/خیر) تنها در ۷ درصد مواقع پاسخ‌های بسیار مشکل‌ساز را به دنبال داشتند. این نشان می‌دهد که وقتی به هوش مصنوعی آزادی عمل داده می‌شود تا توضیح دهد، احتمال بیشتری دارد که به قلمرو اطلاعات غلط سرگردان شود.[1][2]

حتی زمانی که چت‌بات‌ها موفق به ارائه اطلاعات دقیق می‌شدند، اغلب در انتقال مؤثر آن به مخاطبان عمومی شکست می‌خوردند. این مطالعه سطح خوانایی تمام خروجی‌های چت‌بات‌ها را درجه‌بندی کرد و دریافت که آن‌ها به طور کلی در دسته «دشوار» طبقه‌بندی می‌شوند. زبان مورد استفاده معادل سطح خواندن سال دوم تا چهارم دانشگاه بود، که هضم و اجرای صحیح توصیه‌ها را برای کاربر معمولی که به دنبال راهنمایی‌های ساده سلامتی است، دشوار می‌سازد. این پیچیدگی زبانی بالا، کاربرانی را که پیش‌زمینه‌ای در علوم ورزشی یا پزشکی ندارند، بیشتر بیگانه می‌کند.[1][5]

در حالی که عملکرد کلی در همه مدل‌ها به طور مشابه دارای نقص بود، تفاوت‌های جزئی بین مدل‌ها وجود داشت. گروک (Grok) بالاترین نرخ پاسخ‌های بسیار مشکل‌ساز را تولید کرد، به طوری که ۵۸ درصد از پاسخ‌های کلی آن علامت‌گذاری شدند. با این حال، محققان تأکید کردند که شیوع بالای محتوای مشکل‌ساز، محدودیت‌های بنیادی و گسترده‌تر فناوری کنونی مدل‌های زبان بزرگ (LLM) را منعکس می‌کند، نه شکست یک شرکت خاص. هیچ مدلی که مورد آزمایش قرار گرفت، در حال حاضر برای ارائه توصیه‌های سلامتی تأیید نشده ایمن نیست.[2][4]

برای دنیای ورزش، مفاهیم این مطالعه واضح و فوری است. هوش مصنوعی ابزاری قدرتمند برای خلاصه‌سازی مفاهیم شناخته شده، تدوین برنامه‌های اولیه یا طوفان فکری ایده‌ها باقی می‌ماند، اما به سادگی نمی‌تواند جایگزین تخصص انسانی شود. ورزشکاران، مربیان و متخصصان باید با چت‌بات‌ها به عنوان دستیاران ناقص رفتار کنند تا منابع قطعی حقیقت. برای اطمینان از ایمنی و کارایی، کاربران باید همیشه برنامه‌های تمرینی و تغذیه‌ای تولید شده توسط هوش مصنوعی را با متخصصان واجد شرایطی که می‌توانند توصیه‌ها را زمینه‌سازی کرده و توهمات الگوریتمی را فیلتر کنند، تأیید نمایند.[3]

تا زمانی که مدل‌های هوش مصنوعی مولد به طور خاص جدا نشده و منحصراً بر روی پایگاه‌های داده علوم ورزشی داوری‌شده آموزش نبینند، همچنان با اقیانوس وسیع نویز تناسب اندام در اینترنت دست و پنجه نرم خواهند کرد. مدافعان سلامت عمومی و محققان اکنون خواستار نظارت سخت‌گیرانه‌تر، کمپین‌های آموزشی عمومی قوی و هشدارهای اجباری تعبیه‌شده در نرم‌افزار هستند. آن‌ها هشدار می‌دهند که پذیرش بدون نقد این ابزارها خطر تقویت اطلاعات غلط پزشکی و تغذیه‌ای را در مقیاسی بی‌سابقه به دنبال دارد و در نهایت به همان افرادی آسیب می‌رساند که به دنبال بهبود سلامت و عملکرد خود هستند.[1][3]

۴۹.۶%
پاسخ‌های سلامتی مشکل‌ساز
۱۹.۶%
پاسخ‌های بسیار مشکل‌ساز
۴۰%
میانگین کامل بودن منبع‌دهی
۰.۸%
نرخ خودداری از پاسخگویی

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

متخصصان مبتنی بر شواهد 40%مدافعان سلامت عمومی 35%خوش‌بینان فناوری 25%
  1. [1]BMJ Openمتخصصان مبتنی بر شواهد

    Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit

    مطالعه در BMJ Open
  2. [2]The Independentمدافعان سلامت عمومی

    AI chatbots often hallucinate and give inaccurate medical information, study finds

    مطالعه در The Independent
  3. [3]MySportScienceمتخصصان مبتنی بر شواهد

    AI chatbots and sports nutrition: fluent answers are not always accurate

    مطالعه در MySportScience
  4. [4]PsyPostمدافعان سلامت عمومی

    Audit of AI chatbots reveals 49.6% of health responses are problematic

    مطالعه در PsyPost
  5. [5]The Straits Timesمدافعان سلامت عمومی

    AI chatbots give problematic medical advice half the time: Study

    مطالعه در The Straits Times
  6. [6]News-Medicalخوش‌بینان فناوری

    Study finds popular AI chatbots often give problematic health advice

    مطالعه در News-Medical

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت ورزش اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.