رفتن به محتوای اصلی
پژوهش کوهستانقابلیت‌های هوش مصنوعیبسته شواهد۱ شهریور ۱۴۰۵، ۱۱:۲۳· 5 دقیقه مطالعه· در تحلیل داده

تحلیل داده‌ها نشان می‌دهد که سیستم‌های هوش مصنوعی در تریاژ و نگارش مقالات داوری‌شده، از پزشکان بهتر عمل می‌کنند

مطالعات اخیر نشان می‌دهد که هوش مصنوعی می‌تواند موارد پیچیده پزشکی را دقیق‌تر از پزشکان اورژانس تشخیص دهد و به‌طور خودکار تحقیقات علمی تولید کند که از داوری آکادمیک عبور می‌کند. با این حال، فراتحلیل‌ها حاکی از آن است که این سیستم‌ها همچنان در وظایف تخصصی و نامحدود، از متخصصان انسانی عقب‌تر هستند.

به قلم الوین شادمهر

خوش‌بینان فناوری 40%واقع‌گرایان بالینی 35%شکاکان آکادمیک 25%
خوش‌بینان فناوری
معتقدند هوش مصنوعی با تسریع کشف و کاهش خطاها، علم و پزشکی را متحول خواهد کرد.
واقع‌گرایان بالینی
پتانسیل هوش مصنوعی را به عنوان یک ابزار پشتیبانی تأیید می‌کنند اما بر نقش غیرقابل جایگزین قضاوت و تخصص انسانی تأکید دارند.
شکاکان آکادمیک
هشدار می‌دهند که تحقیقات خودکار هوش مصنوعی می‌تواند ادبیات علمی را با مقالات تقلیدی پر کند و یکپارچگی علمی را به خطر اندازد.

نکات کلیدی

  • مطالعات اخیر نشان می‌دهد که مدل‌های هوش مصنوعی در سناریوهای تشخیصی خاص، به ویژه در تریاژ اورژانس، از پزشکان انسانی بهتر عمل می‌کنند.
  • مدل o1 اوپن‌ای‌آی در شبیه‌سازی‌های اورژانس به دقت ۶۷٪ دست یافت، در حالی که این رقم برای پزشکان معالج ۵۰ تا ۵۵٪ بود.
  • یک سیستم خودکار به نام «دانشمند هوش مصنوعی» با موفقیت مقاله‌ای در زمینه یادگیری ماشین تولید کرد که از داوری همتای دوسوکور عبور کرد.
  • با وجود این نقاط عطف، فراتحلیل‌ها نشان می‌دهند که هوش مصنوعی در دقت تشخیصی کلی، همچنان تقریباً ۱۶ واحد درصد از متخصصان انسانی عقب‌تر است.
  • شواهد حاکی از آن است که هوش مصنوعی در حال حاضر بیشتر به عنوان یک دستیار سریع تطبیق الگو عمل می‌کند تا یک متخصص مستقل.

چرا مهم است

از آنجایی که هوش مصنوعی شروع به برابری یا پیشی گرفتن از عملکرد انسان در وظایف پرمخاطره‌ای مانند تشخیص پزشکی و تحقیقات علمی کرده است، مرزهای تخصص انسانی در حال تغییر است. درک اینکه هوش مصنوعی در کجا برتری دارد و در کجا هنوز کمبود دارد، برای ادغام ایمن این ابزارها در سیستم‌های بهداشتی و آکادمیک که زندگی ما را شکل می‌دهند، حیاتی است.

در یک شبیه‌سازی اتاق اورژانس، بیماری با علائم پراکنده، سابقه ناقص و سرنخ‌های ظریف مراجعه می‌کند. پزشکان معالج، تنها با چند جمله از پرستاران تریاژ و سوابق الکترونیکی سلامت، وضعیت زمینه‌ای را در ۵۰ تا ۵۵ درصد مواقع به درستی تشخیص دادند. هنگامی که مدل o1 اوپن‌ای‌آی (OpenAI) با همان داده‌های دقیق تغذیه شد، به دقت ۶۷ درصد دست یافت.[1]

برای دهه‌ها، چالش‌های پیچیده مبتنی بر مورد، معیار طلایی برای قضاوت در مورد اینکه آیا ماشین‌ها می‌توانند واقعاً مانند پزشکان «فکر کنند» بوده‌اند. توانایی اتصال نقاط داده‌ای پراکنده تحت فشار شدید زمانی، ویژگی بارز پزشکی اورژانس است. یافته‌های اخیر منتشر شده در مجله Science نشان می‌دهد که در این محیط‌های خاص و پرمخاطره، مدل‌های زبان بزرگ در حال پیشی گرفتن از متخصصان عمومی انسانی هستند.[1]

اما حوزه پزشکی تنها قلمرویی نیست که هوش مصنوعی در آن از آستانه‌های تاریخی عبور می‌کند. در قلمرو تحقیقات آکادمیک، یک سیستم خودکار با موفقیت فرآیند داوری علمی که به سخت‌گیری مشهور است را پشت سر گذاشته است.[2]

در سناریوهای شبیه‌سازی شده اورژانس، مدل‌های پیشرفته هوش مصنوعی در شناسایی شرایط پیچیده از پزشکان معالج بهتر عمل کردند.

«دانشمند هوش مصنوعی» (The AI Scientist) که توسط محققانی در ساکانا ای‌آی (Sakana AI)، دانشگاه آکسفورد و دانشگاه بریتیش کلمبیا توسعه یافته، یک چارچوب جامع است که برای خودکارسازی کل چرخه عمر تحقیقات طراحی شده است. این سیستم ایده‌های جدیدی تولید می‌کند، کد می‌نویسد، آزمایش‌ها را اجرا می‌کند، نتایج را بصری‌سازی می‌کند و پیش‌نویس کامل مقالات علمی را در قالب لاتک (LaTeX) تهیه می‌کند.[2]

این سیستم از طریق یک فرآیند ساختاریافته و چند مرحله‌ای عمل می‌کند. ابتدا با طوفان فکری در مورد مسیرهای تحقیقاتی در یک حوزه تعریف شده شروع می‌کند و سپس آن ایده‌ها را در برابر ادبیات موجود با استفاده از پایگاه‌های داده آکادمیک فیلتر می‌کند تا از تکرار جلوگیری شود. سپس آزمایش‌ها را طراحی و اجرا می‌کند، چه با استفاده از الگوهای از پیش تعریف شده و چه رویکردهای انعطاف‌پذیرتر، و نتایج را قبل از تولید یک مقاله کامل مکتوب، بصری‌سازی می‌کند.[2]

برای آزمایش قابلیت‌های آن، محققان مقالاتی را که کاملاً توسط «دانشمند هوش مصنوعی» تولید شده بود، به کارگاهی در کنفرانس بین‌المللی بازنمایی‌های یادگیری ۲۰۲۵ (ICLR) ارسال کردند که یک مکان برجسته برای تحقیقات یادگیری ماشین است. یکی از این مقالات به نمراتی بالاتر از آستانه پذیرش معمول دست یافت، که نشان می‌دهد یک مقاله کاملاً تولید شده توسط هوش مصنوعی می‌تواند معیارهای مورد استفاده داوران انسانی در یک محیط آکادمیک زنده را برآورده کند.[2]

پیامدهای اقتصادی این نقطه عطف قابل توجه است. «دانشمند هوش مصنوعی» می‌تواند یک مقاله تحقیقاتی کامل و با کیفیت قابل انتشار را با هزینه‌ای در حدود ۱۵ دلار برای محاسبات تولید کند. این سطح از مقرون به صرفه بودن، نشان‌دهنده پتانسیل دموکراتیزه شدن قابلیت‌های تحقیقاتی است و به مؤسسات با منابع محدود امکان می‌دهد تا در تحقیقات علمی با توان عملیاتی بالا مشارکت کنند.[2]

«دانشمند هوش مصنوعی» می‌تواند یک مقاله تحقیقاتی کامل و با کیفیت قابل انتشار را با هزینه‌ای در حدود ۱۵ دلار برای محاسبات تولید کند.

با این حال، بررسی دقیق‌تر داده‌های گسترده‌تر، تمایز حیاتی بین تطبیق سریع الگوها و استدلال عمیق تخصصی را آشکار می‌کند. در حالی که سیستم‌های هوش مصنوعی در محیط‌های محدود یا هنگام تولید مقالات در سطح کارگاهی برتری دارند، عملکرد آن‌ها در مقایسه با متخصصان انسانی در حوزه‌های بسیار تخصصی، ضعیف‌تر است.[3][4]

یک فراتحلیل در سال ۲۰۲۵ که در مجله Nature Digital Medicine منتشر شد، دقت تشخیصی مدل‌های هوش مصنوعی مولد را در ۸۳ مطالعه مختلف ارزیابی کرد. محققان دریافتند که چت‌بات‌های هوش مصنوعی در طیف گسترده‌ای از سناریوهای پزشکی، به دقت تشخیصی کلی ۵۲.۱ درصد دست یافتند.[3]

در مقایسه با متخصصان عمومی مراقبت‌های بهداشتی، مدل‌های هوش مصنوعی اغلب عملکرد برتری از خود نشان دادند. اما در مقابل پزشکان متخصص – متخصصانی که در حوزه کاری خاص و محدود خود فعالیت می‌کنند – مدل‌های هوش مصنوعی به طور قابل توجهی پایین‌تر بودند و با اختلاف ۱۵.۸ درصد از متخصصان انسانی عقب ماندند.[3]

در حالی که هوش مصنوعی در وظایف عمومی برتری دارد، فراتحلیل‌ها نشان می‌دهند که همچنان تقریباً ۱۶ واحد درصد از متخصصان عقب‌تر است.

این شکاف عملکرد، محدودیت‌های فعلی هوش مصنوعی را در حوزه‌های پرمخاطره برجسته می‌کند. مدل‌های هوش مصنوعی در ترکیب حجم عظیمی از داده‌ها و شناسایی الگوهایی که ممکن است از دید یک متخصص عمومی تحت فشار زمانی پنهان بماند، بسیار ماهر هستند. اما آن‌ها فاقد قضاوت بالینی ظریف و درک عمیق زمینه‌ای هستند که یک متخصص در طول دهه‌ها تمرین اختصاصی به دست می‌آورد.[3][4]

در شبیه‌سازی اورژانس، موفقیت هوش مصنوعی ناشی از توانایی آن در پردازش سریع داده‌های ناقص و پیشنهاد یک تشخیص افتراقی گسترده بود. این سیستم به عنوان یک شبکه شناختی پیشرفته عمل می‌کند و شرایط نادری را که ممکن است یک پزشک تریاژ در هرج و مرج بخش اورژانس نادیده بگیرد، تشخیص می‌دهد.[1]

به طور مشابه، «دانشمند هوش مصنوعی» در ترکیب روش‌شناسی‌های موجود و ایجاد بهبودهای تدریجی برتری دارد. اما متخصصانی که مقالات تولید شده توسط هوش مصنوعی را بررسی کردند، خاطرنشان کردند که در حالی که ساختار و قالب‌بندی بی‌عیب و نقص بود، مشارکت‌های علمی واقعی اغلب به عنوان متوسط یا تقلیدی توصیف می‌شد.[2][4]

شواهد نشان می‌دهد که ما در حال ورود به عصر تخصص با کمک هوش مصنوعی هستیم، نه استقلال کامل هوش مصنوعی. در پزشکی، مؤثرترین کاربرد این مدل‌ها احتمالاً به عنوان یک ابزار مشارکتی خواهد بود. هنگامی که پزشکان از هوش مصنوعی در کنار قضاوت خود استفاده می‌کنند، دقت تشخیصی بهبود می‌یابد و خطر نادیده گرفتن یک وضعیت حیاتی کاهش می‌یابد.[1][4]

سیستم‌های خودکار اکنون می‌توانند دست‌نوشته‌های علمی کاملی تولید کنند که از داوری همتا در سطح کارگاهی عبور می‌کنند.

در محیط آکادمیک، گسترش تحقیقات تولید شده توسط هوش مصنوعی، سؤالات عمیقی را در مورد آینده انتشارات علمی مطرح می‌کند. اگر یک هوش مصنوعی بتواند مقاله‌ای را با ۱۵ دلار تولید کند که از داوری همتا عبور کند، جامعه علمی باید با پتانسیل هجوم متوسط بودن خودکار که می‌تواند داوران انسانی را تحت فشار قرار دهد و اکتشافات واقعاً پیشگامانه را مبهم سازد، دست و پنجه نرم کند.[2][4]

چالش پیش رو، ادغام این ابزارهای قدرتمند به گونه‌ای خواهد بود که قابلیت‌های انسانی را تقویت کند، بدون اینکه استانداردهای سخت‌گیرانه عملکرد علمی و پزشکی را تضعیف کند. داده‌ها واضح هستند: هوش مصنوعی می‌تواند مقاله بنویسد و تشخیص را پیشنهاد دهد، اما قضاوت نهایی همچنان نیازمند یک متخصص انسانی است.[4]

بررسی عمیق دیدگاه‌ها

خوش‌بینان فناوری

معتقدند هوش مصنوعی با تسریع کشف و کاهش خطاها، علم و پزشکی را متحول خواهد کرد.

طرفداران ادغام سریع هوش مصنوعی استدلال می‌کنند که توانایی این فناوری در پردازش مجموعه‌های داده عظیم و شناسایی الگوها بسیار فراتر از ظرفیت انسان است. در پزشکی، آن‌ها به داده‌های شبیه‌سازی اورژانس به عنوان اثباتی اشاره می‌کنند که هوش مصنوعی می‌تواند به عنوان یک شبکه ایمنی حیاتی عمل کند و تشخیص‌های نادری را که ممکن است پزشکان تریاژ تحت فشار کاری نادیده بگیرند، شناسایی کند. در محیط آکادمیک، آن‌ها سیستم‌هایی مانند «دانشمند هوش مصنوعی» را به عنوان یک نیروی دموکراتیک‌کننده می‌بینند که به محققان اجازه می‌دهد فرضیه‌ها را با سرعت‌های بی‌سابقه‌ای آزمایش کنند و در نهایت سرعت کشف علمی جهانی را تسریع بخشند.

واقع‌گرایان بالینی

پتانسیل هوش مصنوعی را به عنوان یک ابزار پشتیبانی تأیید می‌کنند اما بر نقش غیرقابل جایگزین قضاوت انسانی تأکید دارند.

متخصصان پزشکی و محققان بالینی تأکید می‌کنند که دقت تشخیصی در یک شبیه‌سازی مبتنی بر متن، کاملاً به واقعیت آشفته مراقبت از بیمار منتقل نمی‌شود. آن‌ها شکاف ۱۵.۸ واحد درصدی بین هوش مصنوعی و متخصصان را به عنوان شواهدی برجسته می‌کنند که قضاوت بالینی عمیق و زمینه‌ای هنوز قابل خودکارسازی نیست. برای این گروه، بهترین استفاده از هوش مصنوعی به عنوان یک «نظر دوم» پیشرفته یا دستیار شناختی است که تشخیص افتراقی را گسترش می‌دهد در حالی که تصمیمات نهایی درمان را قاطعانه در دست پزشکان انسانی آموزش‌دیده باقی می‌گذارد.

شکاکان آکادمیک

هشدار می‌دهند که تحقیقات خودکار هوش مصنوعی می‌تواند ادبیات علمی را با مقالات تقلیدی پر کند و یکپارچگی علمی را به خطر اندازد.

منتقدان در جامعه علمی نگرانی عمیقی در مورد پیامدهای مقالات تحقیقاتی تولید شده توسط هوش مصنوعی با هزینه ۱۵ دلار ابراز می‌کنند. آن‌ها استدلال می‌کنند که در حالی که این سیستم‌ها می‌توانند ساختار و لحن نگارش آکادمیک را به اندازه‌ای خوب تقلید کنند که از داوری همتا در سطح کارگاهی عبور کنند، اغلب کارهای متوسط و تدریجی تولید می‌کنند. این گروه هشدار می‌دهد که هجوم مقالات خودکار می‌تواند سیستم داوری همتای تحت فشار را تحت الشعاع قرار دهد و شناسایی پیشرفت‌های واقعاً نوآورانه را برای دانشمندان انسانی دشوارتر سازد و به طور بالقوه کیفیت کلی سوابق علمی را کاهش دهد.

منابع

پوشش منابع

4 منبع

3 دیدگاه شناسایی‌شده

خوش‌بینان فناوری 40%واقع‌گرایان بالینی 35%شکاکان آکادمیک 25%
  1. [1]Scienceخوش‌بینان فناوری

    AI is starting to beat doctors at making correct diagnoses

    مطالعه در Science
  2. [2]Sakana AIخوش‌بینان فناوری

    The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery

    مطالعه در Sakana AI
  3. [3]Nature Digital Medicineواقع‌گرایان بالینی

    Diagnostic accuracy of generative artificial intelligence versus physicians: a systematic review and meta-analysis

    مطالعه در Nature Digital Medicine
  4. [4]تیم سردبیری کوهستانشکاکان آکادمیک

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.