Skip to main content
قابلیت اطمینان هوش مصنوعیبسته شواهد۱۱ مرداد ۱۴۰۵، ۱۰:۲۰· 8 دقیقه مطالعه· #1 از 5 در ورزش

بر اساس ممیزی BMJ، چت‌بات‌های هوش مصنوعی اغلب در پاسخ به سوالات ورزشی و تغذیه شکست می‌خورند

یک ممیزی دقیق از پنج چت‌بات محبوب هوش مصنوعی نشان داد که تقریباً نیمی از پاسخ‌های آن‌ها در مورد سلامت مشکل‌ساز بوده است و بدترین عملکرد در پاسخ به پرسش‌های مربوط به عملکرد ورزشی و تغذیه مشاهده شده است.

به قلم Sepideh Tavakoli

متخصصان مبتنی بر شواهد 40%مدافعان سلامت عمومی 35%خوش‌بینان فناوری 25%
متخصصان مبتنی بر شواهد
استدلال می‌کنند که هوش مصنوعی نمی‌تواند جایگزین تخصص انسانی در علوم ورزشی شود، زیرا قادر به فیلتر کردن شبه‌علم تجاری نیست.
مدافعان سلامت عمومی
بر خطرات گسترده‌تر اطلاعات غلط سلامتی ناشی از هوش مصنوعی و نیاز به نظارت نظارتی و آموزش کاربران تمرکز می‌کنند.
خوش‌بینان فناوری
معتقدند که در حالی که مدل‌های فعلی منابع جعلی تولید می‌کنند، تکرارهای سریع و هوش مصنوعی پزشکی تخصصی به زودی شکاف دقت را پر خواهند کرد.

چرا مهم است

از آنجایی که ورزشکاران و علاقه‌مندان به تناسب اندام به طور فزاینده‌ای برای برنامه‌های تمرینی و رژیم غذایی خود به هوش مصنوعی مولد متکی هستند، این تحقیق نشان می‌دهد که این ابزارها با اطمینان کامل منابع جعلی تولید می‌کنند و در حوزه علوم ورزشی بیشترین مشکل را دارند. این بدان معناست که کاربران باید توصیه‌های هوش مصنوعی را توسط متخصصان انسانی تأیید کنند.

نکات کلیدی

  • ممیزی پنج چت‌بات اصلی هوش مصنوعی نشان داد که ۴۹.۶ درصد از پاسخ‌های آن‌ها به پرسش‌های سلامتی مشکل‌ساز بوده است.
  • این مدل‌ها بدترین عملکرد را در دسته‌بندی‌های عملکرد ورزشی و تغذیه داشتند و در فیلتر کردن شبه‌علم آنلاین دچار مشکل شدند.
  • چت‌بات‌ها به ندرت از پاسخ دادن به سؤالات خودداری کردند و توصیه‌های نادرست را با اعتماد به نفس بالا ارائه دادند.
  • هیچ چت‌باتی نتوانست فهرست کاملی از منابع علمی دقیق ارائه دهد و اغلب به طور مکرر منابع جعلی (توهم) تولید می‌کرد.
  • سؤالات باز منجر به اطلاعات غلط بسیار بیشتری نسبت به سؤالات بسته (بله/خیر) شد.
49.6%
پاسخ‌های سلامتی مشکل‌ساز
19.6%
پاسخ‌های بسیار مشکل‌ساز
40%
میانگین کامل بودن منبع‌دهی
0.8%
نرخ خودداری از پاسخگویی

هوش مصنوعی مولد به سرعت به ابزاری فراگیر برای حل مشکلات روزمره تبدیل شده است، به طوری که میلیون‌ها کاربر برای نوشتن ایمیل، کدنویسی و خلاصه‌سازی اسناد به چت‌بات‌ها متکی هستند. در دنیای ورزش، ورزشکاران و مربیان به طور فزاینده‌ای به این پلتفرم‌ها روی می‌آورند تا برنامه‌های تمرینی ماراتن تولید کنند، نسبت‌های درشت‌مغذی‌ها را بهینه سازند و در مورد ریکاوری پس از آسیب مشاوره بگیرند. جذابیت این ابزارها واضح است: چت‌بات‌ها پاسخ‌های فوری، شیوا و بسیار سفارشی‌شده‌ای ارائه می‌دهند که لحن یک مشاور حرفه‌ای را تقلید می‌کند. با این حال، یک ممیزی دقیق جدید، آسیب‌پذیری آشکاری را در این انقلاب تکنولوژیک آشکار می‌کند. وقتی صحبت از علوم ورزشی می‌شود، پاسخ‌های روان اغلب پنهان‌کننده نادرستی‌های خطرناکی هستند.[3]

این مطالعه جامع که در مجله داوری‌شده BMJ Open منتشر شده است، توسط دکتر نیکلاس بی. تیلر (Dr. Nicholas B. Tiller) در مؤسسه نوآوری زیست‌پزشکی لاندکوئیست در مرکز پزشکی هاربر-یو‌سی‌ال‌ای رهبری شد. تیم تحقیقاتی تصمیم گرفتند یک آزمون استرس سیستماتیک بر روی محبوب‌ترین مدل‌های هوش مصنوعی عمومی جهان انجام دهند. آن‌ها پنج چت‌بات اصلی را ممیزی کردند: چت‌جی‌پی‌تی (ChatGPT) از اوپن‌ای‌آی (OpenAI)، جیمینای (Gemini) از گوگل، متا ای‌آی (Meta AI)، گروک (Grok) از ایکس‌ای‌آی (xAI) و دیپ‌سیک (DeepSeek) از های-فلایر (High-Flyer)، و توانایی آن‌ها را در مدیریت پرسش‌های پیچیده، روزمره و پزشکی ارزیابی کردند.[1][4]

برای سنجش دقیق قابلیت اطمینان مدل‌ها، محققان یک چارچوب خصمانه را به کار گرفتند که برای تقلید از نحوه جستجوی اطلاعات توسط کاربران واقعی طراحی شده بود. آن‌ها ۲۵۰ سؤال را در پنج دسته‌بندی که مستعد اطلاعات غلط آنلاین هستند، به چت‌بات‌ها دادند: سرطان، واکسن‌ها، سلول‌های بنیادی، تغذیه و عملکرد ورزشی. این سؤالات شامل ترکیبی از پرسش‌های بسته (که نیاز به پاسخ‌های مشخص و مورد توافق داشتند) و پرسش‌های باز (که مدل‌ها را به تولید فهرست یا توضیح مفاهیم گسترده‌تر دعوت می‌کرد) بود.[1][5]

یافته‌های اصلی یک واقعیت تلخ را برای هر کسی که برای راهنمایی‌های سلامتی به هوش مصنوعی متکی است، آشکار می‌کند. بر اساس ارزیابی کارشناسان مستقل موضوعی که خروجی‌ها را بررسی کردند، ۴۹.۶ درصد از کل پاسخ‌های چت‌بات‌ها مشکل‌ساز ارزیابی شدند. با جزئی‌تر شدن این آمار، ۳۰ درصد از پاسخ‌ها به دلیل کمبود زمینه یا چارچوب‌بندی ضعیف «تا حدودی مشکل‌ساز» تلقی شدند، در حالی که ۱۹.۶ درصد «بسیار مشکل‌ساز» طبقه‌بندی شدند—به این معنی که حاوی اطلاعات غلط صریح یا توصیه‌های متناقضی بودند که در صورت عمل کردن به آن‌ها، به طور بالقوه می‌توانستند آسیب ایجاد کنند.[1][6]

جالب اینجاست که مدل‌های هوش مصنوعی در همه موضوعات به طور یکسان شکست نخوردند. چت‌بات‌ها در پاسخ به سؤالات مربوط به واکسن‌ها و سرطان عملکرد نسبتاً خوبی داشتند. این حوزه‌ها با مجموعه‌های عظیم و ساختاریافته از تحقیقات دانشگاهی و اجماع علمی روشن مشخص می‌شوند. از آنجایی که داده‌های بنیادی در این زمینه‌ها قوی، به شدت تعدیل‌شده و مکرراً در منابع معتبر اینترنتی تقویت شده‌اند، مدل‌ها بهتر توانستند محتوای دقیق و مبتنی بر شواهد را بدون تولید منابع جعلی بازتولید کنند. همچنین، محدودیت‌هایی که توسعه‌دهندگان هوش مصنوعی برای این موضوعات پزشکی با ریسک بالا اعمال کرده‌اند، احتمالاً به عملکرد قوی‌تر آن‌ها کمک کرده است.[1][2]

با این حال، چت‌بات‌ها هنگام پرسش در مورد عملکرد ورزشی و تغذیه دچار فروپاشی شدند. این دو دسته بیشترین فراوانی پاسخ‌های مشکل‌ساز و کمترین تعداد پاسخ‌های دقیق را تولید کردند که نشان‌دهنده یک نقطه کور بزرگ در الگوریتم‌ها است. برای ورزشکاران، مربیان و علاقه‌مندان به تناسب اندام که هوش مصنوعی را جایگزینی ارزان و در دسترس برای یک متخصص تغذیه یا مربی قدرت معتبر می‌دانند، این آسیب‌پذیری خاص مهم‌ترین و عملی‌ترین نتیجه این ممیزی جامع است. مدل‌ها به طور مداوم در ارائه راهنمایی ایمن و قابل اعتماد، به ویژه در مورد استراتژی‌های تغذیه‌ای ظریف یا پروتکل‌های تمرینی پیشرفته، شکست خوردند.[1][3]

علت اصلی این شکست در نحوه آموزش مدل‌های زبان بزرگ نهفته است. تغذیه ورزشی و تناسب اندام حوزه‌هایی هستند که به شدت با ادعاهای تجاری، حکایات اینفلوئنسرها، رژیم‌های غذایی مد روز و شبه‌علم محض اشباع شده‌اند. از آنجایی که چت‌بات‌ها الگوها را از گستره وسیع و فیلترنشده اینترنت تطبیق می‌دهند، در جدا کردن کینزیولوژی دقیق و داوری‌شده از بازاریابی تهاجمی مکمل‌ها مشکل دارند. مدل‌ها به سادگی بازتابی از نویز موجود در داده‌های آموزشی خود هستند و افسانه‌های رایج تناسب اندام را به گونه‌ای بازگو می‌کنند که گویی حقایق فیزیولوژیکی تثبیت‌شده‌ای هستند.[3]

علت اصلی این شکست در نحوه آموزش مدل‌های زبان بزرگ نهفته است.

آنچه خطر این اطلاعات غلط را تشدید می‌کند، قطعیت تزلزل‌ناپذیری است که با آن ارائه می‌شوند. با وجود دقت پایین در علوم ورزشی، چت‌بات‌ها تقریباً هرگز اعتراف نکردند که از عمق موضوع بی‌اطلاع هستند. از ۲۵۰ سؤال سلامتی و پزشکی مطرح شده در طول این مطالعه، تنها دو مورد وجود داشت که یک مدل از پاسخ دادن خودداری کرد—هر دو توسط متا ای‌آی در پاسخ به پرسش‌هایی درباره استروئیدهای آنابولیک و درمان‌های جایگزین سرطان. در بقیه موارد، هوش مصنوعی توصیه‌های ناقص را با اعتماد به نفس مطلق ارائه داد.[1][4]

این اعتماد به نفس اغلب با ظاهری از دقت علمی تقویت می‌شود، که این مطالعه آن را به عنوان یک توهم خطرناک افشا کرد. هنگامی که محققان از چت‌بات‌ها خواستند منابع علمی برای پشتیبانی از ادعاهای خود ارائه دهند، مدل‌ها تحت بررسی دقیق از هم پاشیدند. میانگین امتیاز کامل بودن منابع تولید شده تنها ۴۰ درصد بود، به این معنی که اکثریت قریب به اتفاق شواهد ارائه شده اساساً ناقص، ناکامل یا کاملاً بی‌ربط به ادعاهای واقعی مطرح شده در متن تولید شده بودند. این فقدان منبع قابل تأیید، اعتبار علمی توصیه را از بین می‌برد.[1][2]

در واقع، حتی یک چت‌بات هم نتوانست در کل ممیزی، فهرست منابع کاملاً دقیقی ارائه دهد. مدل‌ها مکرراً درگیر «توهم منبع‌دهی» شدند—اختراع نام‌های جعلی نویسندگان، تولید لینک‌های DOI شکسته، یا استناد به مقالاتی که اصلاً وجود نداشتند. برای یک فرد عادی، این منابع ساختگی کاملاً واقعی به نظر می‌رسند و پوششی کاذب از اعتبار علمی ایجاد می‌کنند که شک و تردید طبیعی کاربر را دور می‌زند.[1][3]

این ممیزی همچنین یک مشکل فراگیر با «توازن کاذب» را برجسته کرد. هنگامی که در مورد درمان‌های بحث‌برانگیز یا اثبات‌نشده سؤال می‌شد، چت‌بات‌ها اغلب مکمل‌های غیرعلمی یا رژیم‌های غذایی مد روز را در کنار روش‌های مبتنی بر شواهد ارائه می‌دادند و وزن یکسانی به آن‌ها در متن تولید شده می‌دادند. مدل‌ها با عدم تأکید بر اجماع علمی قاطع یا نبود آزمایش‌های بالینی، ناخواسته به شبه‌علم مشروعیت می‌بخشند. این تعادل کاذب می‌تواند به راحتی ورزشکاری را که به دنبال برتری رقابتی یا مزیت جزئی است، گمراه کند و او را به سمت مداخلات ناکارآمد یا بالقوه مضر سوق دهد.[1][3]

ساختار سؤال کاربر نیز نقش بزرگی در احتمال دریافت توصیه‌های بد داشت. محققان دریافتند که پرسش‌های باز—مانند «بهترین مکمل‌ها برای سلامت عمومی کدامند؟»—در ۳۲ درصد مواقع منجر به پاسخ‌های بسیار مشکل‌ساز شدند. در مقابل، سؤالات بسته (بله/خیر) تنها در ۷ درصد مواقع پاسخ‌های بسیار مشکل‌ساز را به دنبال داشتند. این نشان می‌دهد که وقتی به هوش مصنوعی آزادی عمل داده می‌شود تا توضیح دهد، احتمال بیشتری دارد که به قلمرو اطلاعات غلط سرگردان شود.[1][2]

حتی زمانی که چت‌بات‌ها موفق به ارائه اطلاعات دقیق می‌شدند، اغلب در انتقال مؤثر آن به مخاطبان عمومی شکست می‌خوردند. این مطالعه سطح خوانایی تمام خروجی‌های چت‌بات‌ها را درجه‌بندی کرد و دریافت که آن‌ها به طور کلی در دسته «دشوار» طبقه‌بندی می‌شوند. زبان مورد استفاده معادل سطح خواندن سال دوم تا چهارم دانشگاه بود، که هضم و اجرای صحیح توصیه‌ها را برای کاربر معمولی که به دنبال راهنمایی‌های ساده سلامتی است، دشوار می‌سازد. این پیچیدگی زبانی بالا، کاربرانی را که پیش‌زمینه‌ای در علوم ورزشی یا پزشکی ندارند، بیشتر بیگانه می‌کند.[1][5]

در حالی که عملکرد کلی در همه مدل‌ها به طور مشابه دارای نقص بود، تفاوت‌های جزئی بین مدل‌ها وجود داشت. گروک (Grok) بالاترین نرخ پاسخ‌های بسیار مشکل‌ساز را تولید کرد، به طوری که ۵۸ درصد از پاسخ‌های کلی آن علامت‌گذاری شدند. با این حال، محققان تأکید کردند که شیوع بالای محتوای مشکل‌ساز، محدودیت‌های بنیادی و گسترده‌تر فناوری کنونی مدل‌های زبان بزرگ (LLM) را منعکس می‌کند، نه شکست یک شرکت خاص. هیچ مدلی که مورد آزمایش قرار گرفت، در حال حاضر برای ارائه توصیه‌های سلامتی تأیید نشده ایمن نیست.[2][4]

برای دنیای ورزش، مفاهیم این مطالعه واضح و فوری است. هوش مصنوعی ابزاری قدرتمند برای خلاصه‌سازی مفاهیم شناخته شده، تدوین برنامه‌های اولیه یا طوفان فکری ایده‌ها باقی می‌ماند، اما به سادگی نمی‌تواند جایگزین تخصص انسانی شود. ورزشکاران، مربیان و متخصصان باید با چت‌بات‌ها به عنوان دستیاران ناقص رفتار کنند تا منابع قطعی حقیقت. برای اطمینان از ایمنی و کارایی، کاربران باید همیشه برنامه‌های تمرینی و تغذیه‌ای تولید شده توسط هوش مصنوعی را با متخصصان واجد شرایطی که می‌توانند توصیه‌ها را زمینه‌سازی کرده و توهمات الگوریتمی را فیلتر کنند، تأیید نمایند.[3]

تا زمانی که مدل‌های هوش مصنوعی مولد به طور خاص جدا نشده و منحصراً بر روی پایگاه‌های داده علوم ورزشی داوری‌شده آموزش نبینند، همچنان با اقیانوس وسیع نویز تناسب اندام در اینترنت دست و پنجه نرم خواهند کرد. مدافعان سلامت عمومی و محققان اکنون خواستار نظارت سخت‌گیرانه‌تر، کمپین‌های آموزشی عمومی قوی و هشدارهای اجباری تعبیه‌شده در نرم‌افزار هستند. آن‌ها هشدار می‌دهند که پذیرش بدون نقد این ابزارها خطر تقویت اطلاعات غلط پزشکی و تغذیه‌ای را در مقیاسی بی‌سابقه به دنبال دارد و در نهایت به همان افرادی آسیب می‌رساند که به دنبال بهبود سلامت و عملکرد خود هستند.[1][3]

روند رویداد

  1. ۲۰۲۳–۲۰۲۴

    چت‌بات‌های هوش مصنوعی مولد با پذیرش عمومی انفجاری مواجه می‌شوند و میلیون‌ها کاربر شروع به استفاده از آن‌ها به عنوان موتورهای جستجوی اصلی برای مشاوره سلامتی و تناسب اندام می‌کنند.

  2. فوریه ۲۰۲۵

    محققان ممیزی را انجام می‌دهند و چت‌جی‌پی‌تی، جیمینای، متا ای‌آی، گروک و دیپ‌سیک را با ۲۵۰ سؤال سلامتی که برای آزمون استرس دقت آن‌ها طراحی شده‌اند، آزمایش می‌کنند.

  3. آوریل ۲۰۲۶

    یافته‌ها در BMJ Open منتشر می‌شود و نشان می‌دهد که تقریباً نیمی از پاسخ‌های چت‌بات‌ها به پرسش‌های پزشکی و تغذیه‌ای مشکل‌ساز هستند.

بررسی عمیق دیدگاه‌ها

محققان علوم ورزشی

استدلال می‌کنند که اشباع اینترنت از شبه‌علم تناسب اندام، مدل‌های عمومی هوش مصنوعی را ذاتاً برای توصیه‌های ورزشی غیرقابل اعتماد می‌سازد.

محققان اشاره می‌کنند که برخلاف انکولوژی یا ویروس‌شناسی، تغذیه ورزشی تحت سلطه بازاریابی تجاری، حکایات اینفلوئنسرها و رژیم‌های غذایی مد روز و متناقض است. از آنجایی که مدل‌های زبان بزرگ بر اساس این داده‌های وب گسترده و فیلترنشده آموزش می‌بینند، به طور طبیعی نویز را بازتولید می‌کنند. کارشناسان استدلال می‌کنند تا زمانی که ابزارهای هوش مصنوعی جدا نشده و منحصراً بر روی پایگاه‌های داده کینزیولوژی و تغذیه داوری‌شده آموزش نبینند، همچنان رژیم‌های غذایی مد روز و مکمل‌های اثبات‌نشده را با همان اطمینانی که اصول فیزیولوژیکی تثبیت‌شده را ارائه می‌دهند، نمایش خواهند داد.

مدافعان سلامت عمومی

هشدار می‌دهند که ترکیب لحن مقتدرانه هوش مصنوعی و منابع ساختگی، خطر منحصر به فردی برای سواد سلامت ایجاد می‌کند.

متخصصان سلامت عمومی به ویژه از پدیده «توهم منبع‌دهی» نگران هستند. هنگامی که یک چت‌بات پاسخی مطمئن را که با یک مقاله مجله ساختگی و یک لینک DOI جعلی پشتیبانی می‌شود، ارائه می‌دهد، شک و تردید طبیعی کاربر را دور می‌زند. مدافعان استدلال می‌کنند که شرکت‌های هوش مصنوعی باید محدودیت‌های سخت‌گیرانه‌تری اعمال کنند، از جمله نرخ‌های بالاتر خودداری از پاسخگویی برای پرسش‌های پزشکی و هشدارهای اجباری که کاربران را مجبور می‌کند قبل از تغییر رژیم غذایی یا برنامه‌های تمرینی خود، با متخصصان انسانی دارای مجوز مشورت کنند.

توسعه‌دهندگان و خوش‌بینان هوش مصنوعی

معتقدند که نقص‌های فعلی موقتی هستند و مدل‌های پزشکی تخصصی به زودی این مشکلات توهم را حل خواهند کرد.

مدافعان فناوری نرخ خطای بالا در مدل‌های عمومی فعلی را تأیید می‌کنند، اما آن‌ها را به جای نقص‌های دائمی، به عنوان دردهای رشد می‌بینند. آن‌ها تأکید می‌کنند که چت‌بات‌های عمومی برای دستگاه‌های پزشکی طراحی نشده‌اند. با این حال، آن‌ها به توسعه سریع مدل‌های تخصصی و تنظیم‌شده پزشکی اشاره می‌کنند که در حال حاضر به دقت بالایی در آزمون‌های بالینی دست یافته‌اند. خوش‌بینان معتقدند که با بهبود تولید تقویت‌شده با بازیابی (RAG)، چت‌بات‌های آینده با موفقیت پاسخ‌های خود را به ادبیات علمی تأیید شده متصل خواهند کرد و «توازن کاذب» مشاهده شده امروز را از بین خواهند برد.

آنچه نمی‌دانیم

  • هنوز مشخص نیست که توسعه‌دهندگان هوش مصنوعی با چه سرعتی می‌توانند موانع حفاظتی مؤثری را برای جلوگیری از تولید منابع علمی جعلی توسط چت‌بات‌ها پیاده‌سازی کنند.
  • محققان هنوز تأثیر کامل و واقعی این اطلاعات غلط را بر نتایج سلامتی و تمرینی واقعی ورزشکارانی که به هوش مصنوعی متکی هستند، نمی‌دانند.
  • مشخص نیست که آیا مدل‌های هوش مصنوعی تخصصی و تنظیم‌شده پزشکی در نهایت به صورت رایگان در دسترس عموم قرار خواهند گرفت یا خیر.

اصطلاحات کلیدی

مدل زبان بزرگ (LLM)
نوعی هوش مصنوعی که بر روی حجم وسیعی از داده‌های متنی آموزش دیده است تا الگوها را تشخیص داده و پاسخ‌های متنی شبیه به انسان تولید کند.
توهم (Hallucination)
حالتی که در آن یک مدل هوش مصنوعی با اطمینان اطلاعات غلط، ساختگی یا بی‌معنی تولید می‌کند، مانند اختراع یک مطالعه علمی جعلی.
توازن کاذب (False Balance)
سوگیری رسانه‌ای که در آن دو دیدگاه متضاد به عنوان دارای اعتبار یکسان ارائه می‌شوند، حتی زمانی که یکی توسط اجماع علمی قاطع حمایت می‌شود و دیگری خیر.
پرسش‌دهی خصمانه (Adversarial Prompting)
روش آزمایشی که در آن محققان عمداً سؤالاتی را طراحی می‌کنند تا مدل هوش مصنوعی را فریب دهند یا تحت فشار قرار دهند تا توصیه‌های نادرست یا مضر تولید کند.

پرسش‌های متداول

کدام چت‌بات هوش مصنوعی در این مطالعه بهترین عملکرد را داشت؟

در حالی که عملکرد کمی متفاوت بود، دقت کلی بین مدل‌ها تفاوت معنی‌داری نداشت. گروک (Grok) بالاترین نرخ پاسخ‌های مشکل‌ساز را تولید کرد، اما هر پنج چت‌بات (از جمله چت‌جی‌پی‌تی، جیمینای، متا ای‌آی و دیپ‌سیک) در ارائه اطلاعات سلامتی قابل اعتماد و مداوم شکست خوردند.

چرا چت‌بات‌ها در مورد تغذیه ورزشی تا این حد مشکل داشتند؟

تغذیه ورزشی حوزه‌ای است که به شدت مستعد اطلاعات غلط آنلاین، ادعاهای تجاری و رژیم‌های غذایی مد روز است. چت‌بات‌ها در جدا کردن علوم ورزشی دقیق و داوری‌شده از حجم عظیمی از نویز بازاریابی که بر اساس آن آموزش دیده‌اند، دچار مشکل شدند.

آیا چت‌بات‌ها اعتراف کردند که پاسخ سؤالی را نمی‌دانند؟

به ندرت. از ۲۵۰ سؤال سلامتی و پزشکی، چت‌بات‌ها تنها دو بار از پاسخ دادن خودداری کردند (هر دو توسط متا ای‌آی). آن‌ها به طور مداوم اطلاعات نادرست را با درجه بالایی از اعتماد به نفس ارائه دادند.

آیا می‌توان به منابع علمی ارائه شده توسط هوش مصنوعی اعتماد کرد؟

خیر. این مطالعه نشان داد که میانگین کامل بودن منابع تنها ۴۰ درصد بوده و هیچ چت‌باتی فهرست منابع کاملاً دقیقی ارائه نداد. بسیاری از مدل‌ها نام نویسندگان را جعل کردند یا لینک‌هایی به مقالات غیرموجود ارائه دادند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

متخصصان مبتنی بر شواهد 40%مدافعان سلامت عمومی 35%خوش‌بینان فناوری 25%
  1. [1]BMJ Openمتخصصان مبتنی بر شواهد

    Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit

    مطالعه در BMJ Open
  2. [2]The Independentمدافعان سلامت عمومی

    AI chatbots often hallucinate and give inaccurate medical information, study finds

    مطالعه در The Independent
  3. [3]MySportScienceمتخصصان مبتنی بر شواهد

    AI chatbots and sports nutrition: fluent answers are not always accurate

    مطالعه در MySportScience
  4. [4]PsyPostمدافعان سلامت عمومی

    Audit of AI chatbots reveals 49.6% of health responses are problematic

    مطالعه در PsyPost
  5. [5]The Straits Timesمدافعان سلامت عمومی

    AI chatbots give problematic medical advice half the time: Study

    مطالعه در The Straits Times
  6. [6]News-Medicalخوش‌بینان فناوری

    Study finds popular AI chatbots often give problematic health advice

    مطالعه در News-Medical
همیشه در جریان باشید

هر زاویه. هر روز.

دریافت ورزش اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.