چگونه مدلهای هوش مصنوعی در استدلال بالینی با پزشکان برابری میکنند
معیارهای اخیر نشان میدهند که مدلهای استدلالی پیشرفته در دقت تشخیص از پزشکان انسانی پیشی میگیرند. در اینجا نحوه پردازش دادههای بالینی توسط هوش مصنوعی و چرایی بازنگری جامعه پزشکی در نقش خود در مراقبت از بیمار آمده است.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
- محققان هوش مصنوعی بالینی
- بر معیارهای تجربی و پتانسیل هوش مصنوعی برای خدمت به عنوان یک شبکه ایمنی تشخیصی سطح بالا تمرکز دارند.
- پزشکان فعال
- بر شکاف بین استدلال مبتنی بر متن و واقعیتهای فیزیکی و دلسوزانه مراقبت از بیمار تأکید میکنند.
- مدافعان ایمنی بیمار
- قبل از ادغام بالینی گسترده، آزمایشهای دقیق در دنیای واقعی، شفافیت و پاسخگویی را در اولویت قرار میدهند.
اصطلاحات کلیدی
- استدلال بالینی
- فرآیند شناختی که طی آن متخصصان پزشکی دادههای بیمار را ترکیب میکنند، احتمالات را میسنجند و تصمیمات تشخیصی و درمانی میگیرند.
- تریاژ
- فرآیند تعیین اولویت درمان بیماران بر اساس شدت وضعیت آنها، که اغلب با اطلاعات اولیه محدود انجام میشود.
- تشخیص افتراقی
- یک روش سیستماتیک که توسط ارائهدهندگان مراقبتهای بهداشتی برای شناسایی یک بیماری یا وضعیت با سنجش احتمال یک بیماری در مقابل سایر بیماریها استفاده میشود.
- پردازش زنجیره فکری
- یک روش هوش مصنوعی که در آن مدل قبل از تولید پاسخ نهایی، مسائل پیچیده را به مجموعهای از مراحل منطقی میانی تقسیم میکند.
- سوابق الکترونیکی سلامت (EHR)
- نسخه دیجیتالی پرونده کاغذی بیمار، حاوی سابقه پزشکی، تشخیصها، داروها، برنامههای درمانی و نتایج آزمایشها.
نکات کلیدی
- مدلهای پیشرفته هوش مصنوعی اکنون در معیارهای استدلال بالینی پیچیده با پزشکان انسانی برابری میکنند یا از آنها فراتر میروند.
- در مطالعهای بر روی ۷۶ مورد اورژانس واقعی، مدل o1 در تریاژ اولیه به دقت تشخیصی ۶۷٪ دست یافت.
- هوش مصنوعی در وظایف استدلال مدیریتی، مانند توصیه آنتیبیوتیکها و برنامههای مراقبتی، به طور متوسط ۸۶٪ امتیاز کسب کرد.
- ارزیابان پزشک کور نتوانستند به طور قابل اعتماد استدلال تشخیصی هوش مصنوعی را از پزشکان انسانی تشخیص دهند.
- محققان تأکید میکنند که هوش مصنوعی به عنوان یک ابزار پشتیبانی تصمیمگیری مشارکتی عمل خواهد کرد، نه جایگزینی برای متخصصان بالینی انسانی.
تصور رایج در مورد هوش مصنوعی در پزشکی این است که این سیستم به عنوان یک دایرةالمعارف پزشکی پیشرفته عمل میکند؛ سیستمی که میتواند حقایق را بازیابی کند اما نمیتواند واقعاً در مورد یک مورد پیچیده و نامنظم بیمار «فکر» کند. برای دههها، اجماع بر این بود که استدلال بالینی – توانایی ترکیب اطلاعات پراکنده، سنجش احتمالات متضاد و گرفتن تصمیمات پرمخاطره در شرایط عدم قطعیت – یک حوزه منحصراً انسانی است. اما شواهد اخیر نشان میدهد که این مرز شکسته شده است و درک ما از آنچه هوش ماشینی میتواند در مراقبتهای بهداشتی به دست آورد، به طور اساسی به چالش کشیده شده است. ما در حال ورود به دورانی هستیم که الگوریتمها فقط به دنبال پاسخها نمیگردند؛ بلکه آنها را استنتاج میکنند.[4]
این تغییر صرفاً تئوری نیست. در یک ارزیابی جامع که در مجله «ساینس» منتشر شد، محققان دانشکده پزشکی هاروارد و مرکز پزشکی «بث اسرائیل دیکونس» نشان دادند که مدلهای استدلالی پیشرفته اکنون میتوانند با دقت تشخیصی پزشکان معالج برابری کنند و در برخی موارد از آن فراتر روند. این مطالعه به طور خاص بر روی مدل o1 شرکت OpenAI متمرکز بود، سیستمی که برای پردازش اطلاعات از طریق استدلال گام به گام طراحی شده است، نه تطبیق الگوی فوری. محققان با آزمایش این مدل در برابر صدها پزشک در معیارهای مختلف، یک خط پایه جدید برای هوش مصنوعی بالینی ایجاد کردند.[1][3]
برای درک نحوه عملکرد این سیستم در عمل، لازم است به مکانیک تریاژ بالینی نگاه کنیم. هنگامی که بیماری به بخش اورژانس میرسد، پزشکان به ندرت تصویر کامل یا منسجمی از وضعیت سلامتی او دارند. آنها چند جمله از پرستار تریاژ، دادههای اولیه جمعیتی و علائم حیاتی اولیه را دریافت میکنند. این لحظه شاید پرمخاطرهترین لحظه در مراقبتهای پزشکی باشد که نیاز به تصمیمگیری سریع با حداقل اطلاعات دارد تا مشخص شود چه کسی نیاز به مداخله فوری نجاتبخش دارد و چه کسی میتواند با خیال راحت منتظر آزمایشهای بیشتر بماند.[4]
در مطالعه هاروارد، محققان هوش مصنوعی را در برابر همین سناریو با استفاده از ۷۶ مورد واقعی از یک اتاق اورژانس بزرگ در بوستون آزمایش کردند. آنها سوابق الکترونیکی سلامت خام و پردازش نشده را به مدل o1 دادند – سوابقی که شامل نویز، عوامل حواسپرتی و دادههای ناقصی بودند که مشخصه عملکرد روزمره پزشکی است. هدف اصلی این بود که ببینند آیا مدل میتواند واقعیت آشفته پذیرش بیمارستان را با موفقیت تجزیه و تحلیل کند، نه اینکه فقط پازلهای پزشکی مرتبی را که برای یادگیری کتابهای درسی و امتحانات هیئت مدیره طراحی شدهاند، حل کند.[1][2]
نتایج خیرهکننده بود. در مرحله تریاژ اولیه، مدل o1 در ۶۷ درصد موارد، تشخیص دقیق یا بسیار نزدیک را ارائه کرد. در مقایسه، دو پزشک معالج متخصص که دادههای مشابه را ارزیابی میکردند، به ترتیب به نرخ دقت ۵۵ درصد و ۵۰ درصد دست یافتند. هوش مصنوعی فقط اطلاعات را بازیابی نکرد؛ بلکه سرنخهای پراکنده را مؤثرتر از متخصصان انسانی ترکیب کرد و قدرت متمایزی را در شرایط عدم قطعیت شدید که قضاوت سریع کاملاً حیاتی است، نشان داد.[1][3]
مکانیسم پشت این عملکرد در نحوه معماری مدلهایی مانند o1 نهفته است. برخلاف مدلهای زبان بزرگ قبلی که با پیشبینی محتملترین کلمه بعدی پاسخها را تولید میکردند، مدلهای استدلالی از فرآیند عمدی «زنجیره فکری» استفاده میکنند. قبل از ارائه خروجی، سیستم چندین استراتژی تشخیصی را بررسی میکند، منطق خود را برای یافتن ناسازگاریها بررسی میکند و فرضیههای داخلی خود را بازبینی میکند. این امر به مدل اجازه میدهد تا قبل از تعهد به ارزیابی نهایی، مکث کرده و نظریههای متضاد را ارزیابی کند و به طور چشمگیری احتمال نتیجهگیریهای زودهنگام را کاهش دهد.[4]
مکانیسم پشت این عملکرد در نحوه معماری مدلهایی مانند o1 نهفته است.
این پردازش تکراری شباهت زیادی به روش تشخیص افتراقی دارد که در دانشکدههای پزشکی آموزش داده میشود. هنگامی که بیماری با مشکلات تنفسی و سابقه لوپوس ارائه میشود، مدل فقط به شایعترین علت التهاب ریه نمیپردازد. بلکه به طور سیستماتیک ارزیابی میکند که چگونه وضعیت خودایمنی زمینهای ممکن است با علائم فعلی تعامل داشته باشد و به آن اجازه میدهد عوارض نادری را که ممکن است یک پزشک انسانی عجول در یک بخش اورژانس شلوغ نادیده بگیرد، تشخیص دهد.[1]
این مطالعه همچنین «استدلال مدیریتی» را ارزیابی کرد، که شامل تصمیمگیری در مورد اینکه دقیقاً پس از مشکوک شدن به یک تشخیص چه کاری باید انجام داد، میشود. این شامل دستور دادن آزمایشهای آزمایشگاهی مناسب، انتخاب آنتیبیوتیکهای مناسب و مدیریت اهداف مراقبتی پیچیده، مانند گفتگوهای پایان زندگی است. در مورد روایتهای بالینی که این وظایف مدیریتی حیاتی را ارزیابی میکردند، مدل o1 به طور متوسط ۸۶ درصد امتیاز کسب کرد. این ثابت میکند که کاربرد آن بسیار فراتر از صرفاً شناسایی یک بیماری است و به آن اجازه میدهد تا یک استراتژی درمانی جامع و عملی را برای بیمار در زمان واقعی تدوین کند.[1][2]
در مقابل، پزشکان انسانی که از منابع متعارف مانند موتورهای جستجو و پایگاههای داده پزشکی استفاده میکردند، در همان معیارهای استدلال مدیریتی زیر ۴۵ درصد امتیاز کسب کردند. این شکاف قابل توجه، یک تغییر اساسی در قابلیتهای فناوری را برجسته میکند: هوش مصنوعی دیگر فقط یک ابزار مرجع برای پزشکان نیست که دوزهای دارو یا علائم اولیه را از آن بپرسند. در عوض، کاملاً قادر به تولید برنامههای مراقبتی پیچیده و چند مرحلهای است که سابقه پزشکی منحصر به فرد بیمار و وضعیت فیزیولوژیکی فعلی او را در نظر میگیرد.[1]
شاید گویاترین جزئیات این تحقیق، ارزیابی کور نتایج باشد. از دو پزشک معالج مستقل خواسته شد تا ارزیابیهای تشخیصی را بدون اطلاع از اینکه آیا توسط یک پزشک انسانی یا مدل هوش مصنوعی نوشته شدهاند، بررسی کنند. در اکثریت قریب به اتفاق موارد – بیش از ۸۳ درصد برای یک ارزیاب و ۹۴ درصد برای دیگری – ارزیابان نتوانستند به طور قابل اعتماد استدلال بالینی ماشین را از همکاران انسانی خود تشخیص دهند، که نشاندهنده تسلط سیستم بر زبان طبیعی است.[1][3]
با وجود این قابلیتهای بیسابقه، محققان تأکید میکنند که این فناوری به هیچ وجه جایگزین پزشکان انسانی نیست. مدلهای فعلی کاملاً به ورودیهای مبتنی بر متن متکی هستند. آنها نمیتوانند به بیمار نگاه کنند تا رنگ پوست او را ارزیابی کنند، به ظرافتهای تنفس او گوش دهند، یا نشانههای عاطفی را که اغلب راهنمای شهود بالینی هستند، بخوانند. پزشکی یک رشته عمیقاً چندوجهی است و متن به تنهایی تنها بخشی از تجربه جامع بیمار را که برای مراقبت دلسوزانه و کامل مورد نیاز است، در بر میگیرد.[2][4]
علاوه بر این، قبولی در آزمونهای معیار و تجزیه و تحلیل فایلهای متنی اساساً با عمل فیزیکی و دلسوزانه پزشکی متفاوت است. هوش مصنوعی نمیتواند معاینه فیزیکی انجام دهد، خانواده داغدار را تسلی دهد، یا اعتمادی را که برای رضایت بیمار به یک برنامه درمانی دشوار لازم است، ایجاد کند. عنصر انسانی هسته غیرقابل جایگزین ارائه مراقبتهای بهداشتی باقی میماند و تضمین میکند که با بیماران با کرامت و شفقت رفتار میشود، نه اینکه صرفاً به عنوان نقاط داده انتزاعی در یک سیستم کامپیوتری پردازش شوند.[4]
در عوض، شواهد به سمت آیندهای مشارکتی اشاره دارند. محققان به شدت از آزمایشهای بالینی آیندهنگر حمایت میکنند تا ارزیابی شود که چگونه این سیستمها میتوانند به عنوان ابزارهای پشتیبانی تصمیمگیری در مراقبتهای دنیای واقعی ادغام شوند. اگر یک هوش مصنوعی بتواند به طور مداوم یک نظر دوم بسیار دقیق را در محیط آشفته تریاژ اورژانس ارائه دهد، میتواند به عنوان یک شبکه ایمنی حیاتی برای کارکنان پزشکی که تحت فشار هستند، عمل کند و سرنخهای ظریفی را که ممکن است در شلوغی شیفت کاری نادیده گرفته شوند، تشخیص دهد.[1][2]
با تشخیص خطاهای تشخیصی احتمالی در مراحل اولیه و پیشنهاد برنامههای مدیریتی جایگزین، مدلهای استدلالی میتوانند به کاهش تأخیر در مراقبت کمک کرده و نتایج بیماران را به طور قابل توجهی بهبود بخشند. این فناوری در حال حرکت از قلمرو علوم کامپیوتر تجربی به کاربرد بالینی عملی است و نوع جدیدی از مشارکت بین تخصص انسانی و هوش ماشینی را ارائه میدهد. این همکاری نویدبخش ارتقای استاندارد مراقبت در سطح جهانی است و تضمین میکند که پزشکان بهترین ابزارهای ممکن را برای نجات جان انسانها در لحظاتی که بیشترین اهمیت را دارند، در اختیار داشته باشند.[4]
چرا مهم است
خطاهای تشخیصی در محیطهای اورژانس میتواند منجر به عوارض شدید یا مرگ شود. اگر هوش مصنوعی بتواند به طور مداوم یک نظر دوم بسیار دقیق و بلادرنگ را در طول فرآیند پر هرج و مرج تریاژ ارائه دهد، پتانسیل کاهش قابل توجه خطاهای پزشکی و بهبود نتایج بیماران را دارد.
آنچه نمیدانیم
- این مدلهای هوش مصنوعی چگونه در آزمایشهای بالینی آیندهنگر و بلادرنگ که تصمیمات مستقیماً بر مراقبت از بیمار زنده تأثیر میگذارند، عمل خواهند کرد.
- آیا ادغام ابزارهای پشتیبانی تصمیمگیری هوش مصنوعی ناخواسته باعث میشود پزشکان بیش از حد به تشخیصهای تولید شده توسط ماشین وابسته شوند.
- اگر پزشکی از توصیه هوش مصنوعی پیروی کند که در نهایت منجر به نتیجه منفی برای بیمار شود، ساختار مسئولیت و پاسخگویی چگونه خواهد بود.
منابع
[1]Scienceمحققان هوش مصنوعی بالینی
Performance of a large language model on the reasoning tasks of a physician
مطالعه در Science →[2]PubMedپزشکان فعال
Performance of a large language model on the reasoning tasks of a physician
مطالعه در PubMed →[3]arXivمحققان هوش مصنوعی بالینی
Superhuman performance of a large language model on the reasoning tasks of a physician
مطالعه در arXiv →[4]تیم سردبیری کوهستانمدافعان ایمنی بیمار
تحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه 4 خبر →هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.








