چگونه برچسبگذاری دادهها، هوش مصنوعی نظارتشده، بدون نظارت و نیمهنظارتشده را از هم متمایز میکند
مدلهای یادگیری ماشین بسته به اینکه دادههای آموزشی آنها شامل پاسخهای ارائهشده توسط انسان باشد یا خیر، به روشهای متفاوتی یاد میگیرند. تفاوت بین یادگیری نظارتشده، بدون نظارت و نیمهنظارتشده اساساً به حجم و حضور این برچسبهای دستی برمیگردد.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- جامعه تحقیقاتی هوش مصنوعی
- بر توسعه روشهای بدون نظارت و نیمهنظارتشده برای دور زدن گلوگاه کار انسانی تمرکز دارد.
- صنعت برچسبگذاری داده
- استدلال میکند که برچسبهای انسانی با کیفیت بالا همچنان استاندارد طلایی برای دقت و ایمنی مدل هستند.
- پذیرندگان سازمانی
- مقرونبهصرفه بودن و استقرار عملی را در اولویت قرار میدهد و رویکردهای نیمهنظارتشده را برای دادههای اختصاصی ترجیح میدهد.
دیدگاههایی که این گزارش پوشش نداده
- توسعهدهندگان مدلهای متنباز
نکات کلیدی
- یادگیری نظارتشده کاملاً به دادههای برچسبگذاریشده توسط انسان متکی است و دقت بالایی را ارائه میدهد اما با هزینه لجستیکی عظیم.
- یادگیری بدون نظارت از دادههای خام و بدون برچسب برای یافتن مستقل الگوهای پنهان استفاده میکند، اما خروجیهای آن میتواند غیرقابل پیشبینی باشد.
- یادگیری نیمهنظارتشده این شکاف را با استفاده از بخش کوچکی از دادههای برچسبگذاریشده برای تولید «شبهبرچسبها» برای یک مجموعهداده عظیم بدون برچسب پر میکند.
- انتخاب پارادایم، هزینه مالی، مقیاسپذیری و معماری یک سیستم هوش مصنوعی را دیکته میکند.
چرا مهم است
درک نحوه آموزش مدلها نشان میدهد که چرا برخی از سیستمهای هوش مصنوعی به میلیونها دلار کار انسانی نیاز دارند، در حالی که برخی دیگر میتوانند مستقیماً از دادههای خام و بدون ساختار یاد بگیرند. این تمایز، هزینه، مقیاسپذیری و قابلیت نهایی هر ابزار هوش مصنوعی که امروزه به کار گرفته میشود را تعیین میکند.
تفاوت بین یادگیری ماشین نظارتشده، بدون نظارت و نیمهنظارتشده کاملاً با حضور برچسبهای ارائهشده توسط انسان در دادههای آموزشی تعیین میشود. اگر دادهها دارای پاسخهای پیوستشده باشند، مدل با مثال یاد میگیرد؛ اگر فاقد پاسخ باشند، مدل با یافتن الگوها یاد میگیرد؛ و اگر ترکیبی از هر دو باشد، از معدود پاسخهای شناختهشده برای سازماندهی بقیه استفاده میکند. همین یک متغیر - یعنی برچسب انسانی - معماری، هزینه و قابلیت هوش مصنوعی مدرن را دیکته میکند.[1][6]
در معماری یادگیری ماشین، «برچسب» به سادگی همان پاسخ صحیحی است که به یک قطعه داده خام ضمیمه میشود. برای تصویر یک گربه، برچسب کلمه «گربه» است. برای یک تراکنش مالی، برچسب ممکن است «کلاهبرداری» یا «قانونی» باشد. فرآیند پیوست کردن این پاسخها به عنوان حاشیهنویسی یا برچسبگذاری دادهها شناخته میشود و خط فاصلی بین سه پارادایم اصلی آموزش مدل را تشکیل میدهد.[3][9]
یادگیری نظارتشده از نظر تاریخی غالبترین و سرراستترین رویکرد را نشان میدهد. در این پارادایم، ۱۰۰ درصد دادههای آموزشی برچسبگذاری شدهاند. به مدل هزاران یا میلیونها مثال داده میشود که هر کدام با خروجی صحیح خود جفت شدهاند، و سپس مدل رابطه ریاضی بین ورودی و پاسخ را محاسبه میکند.[3][7]
همانطور که مستندات فنی سال ۲۰۲۵ شرکت IBM بیان میکند، یادگیری نظارتشده «از یک مجموعه آموزشی برای آموزش مدلها جهت تولید خروجی مطلوب استفاده میکند.» از آنجا که مدل یک «حقیقت پایه» قطعی برای مقایسه پیشبینیهای خود با آن دارد، میتواند دقت خود را اندازهگیری کرده و وزنهای داخلی خود را در طول فرآیند آموزش بر این اساس تنظیم کند.[3]
با این حال، یادگیری نظارتشده بار لجستیکی عظیمی به همراه دارد. هر نقطه داده باید قبل از اینکه مدل بتواند از آن یاد بگیرد، به صورت دستی توسط یک نیروی انسانی برچسبگذاری شود. شرکت Scale AI، یکی از ارائهدهندگان بزرگ برچسبگذاری دادهها، خاطرنشان میکند که ساخت این مجموعهدادهها به هزاران ساعت کار انسانی نیاز دارد، که یادگیری نظارتشده را برای وظایف پیچیده و ظریف به شدت گران و مقیاسپذیری آن را دشوار میسازد.[9]
یادگیری بدون نظارت دقیقاً در انتهای مقابل این طیف قرار دارد و روی مجموعهدادههایی کار میکند که حاوی صفر برچسب انسانی هستند. به جای اینکه به الگوریتم گفته شود به دنبال چه چیزی بگردد، دادههای خام و بدون ساختار به آن داده میشود و وظیفه دارد ساختارها، الگوها یا گروهبندیهای ذاتی را به تنهایی و بدون مداخله انسان پیدا کند.[6][7]
یادگیری بدون نظارت دقیقاً در انتهای مقابل این طیف قرار دارد و روی مجموعهدادههایی کار میکند که حاوی صفر برچسب انسانی هستند.
شرکت Databricks توضیح میدهد که الگوریتمهای یادگیری بدون نظارت عمدتاً برای خوشهبندی و کشف ارتباطات استفاده میشوند. به عنوان مثال، به یک مدل بدون نظارت که رفتار خرید مشتریان را تجزیه و تحلیل میکند، گفته نمیشود کدام مشتریان «با ارزش» هستند. در عوض، به طور خودکار مشتریانی را که محصولات مشابهی را در زمانهای مشابه خریداری میکنند گروهبندی میکند و تفسیر معنای این خوشهها را به تحلیلگران انسانی واگذار میکند.[7]
در حالی که یادگیری بدون نظارت گلوگاه برچسبگذاری انسانی را از بین میبرد، مشکل دیگری را معرفی میکند: غیرقابل پیشبینی بودن. از آنجا که هیچ حقیقت پایهای وجود ندارد، ارزیابی ریاضی این موضوع که آیا یک مدل بدون نظارت به درستی عمل میکند یا صرفاً در حال یافتن همبستگیهای کاذب در نویز مجموعهداده است، دشوار است.[1][10]
این تنش بین هزینه بالای یادگیری نظارتشده و غیرقابل پیشبینی بودن یادگیری بدون نظارت، پارادایم سوم را به وجود آورد: یادگیری نیمهنظارتشده. این رویکرد از مجموعهدادهای استفاده میکند که در آن تنها بخش کوچکی - اغلب بین ۵ تا ۲۰ درصد - برچسبگذاری شده است، در حالی که اکثریت قریب به اتفاق آن کاملاً بدون برچسب باقی میماند.[5][8]
تحلیل سال ۲۰۲۴ شرکت Oracle از این حوزه، یادگیری نیمهنظارتشده را به عنوان یک تکنیک ترکیبی تعریف میکند که از نقاط قوت هر دو رویکرد افراطی بهره میبرد. مدل ابتدا روی مجموعه کوچکی از دادههای برچسبگذاریشده آموزش میبیند و پارامترهای اساسی وظیفه را دقیقاً همانطور که در یک محیط کاملاً نظارتشده انجام میدهد، یاد میگیرد.[5]
هنگامی که مدل یک درک پایه ایجاد کرد، شروع به بررسی مجموعه عظیم دادههای بدون برچسب میکند. این مدل از آموزش اولیه خود برای تولید «شبهبرچسبها» برای دادههای خام استفاده میکند و در واقع پاسخها را حدس میزند. سپس با حدسهای با اطمینان بالای خود طوری رفتار میکند که گویی برچسبهای انسانی هستند و خود را روی مجموعهداده تازه گسترشیافته دوباره آموزش میدهد.[2][8]
این مکانیسم شبهبرچسبگذاری به توسعهدهندگان اجازه میدهد تا با کسری از هزینه به دقتی در سطح یادگیری نظارتشده دست یابند. مقالهای در سال ۲۰۲۱ که در Proceedings of Machine Learning Research منتشر شد، نشان داد که خطوط لوله برچسبگذاری نیمهخودکار میتوانند ساعات کار انسانی مورد نیاز برای ساخت مدلهای قوی را به شدت کاهش دهند و شکاف بین حجم دادههای خام و نظارت انسانی را پر کنند.[2]
خطر ذاتی در یادگیری نیمهنظارتشده، سوگیری تأییدی است. اگر آموزش اولیه مدل روی مجموعهداده کوچک برچسبگذاریشده دارای نقص باشد، شبهبرچسبهای نادرستی برای دادههای بدون برچسب تولید خواهد کرد. از آنجا که سپس روی اشتباهات خود آموزش میبیند، خطاها به طور تصاعدی ترکیب میشوند و عملکرد مدل را در پدیدهای به نام «رانش معنایی» کاهش میدهند.[1][8]
در نهایت، انتخاب بین این سه پارادایم یک محاسبه اقتصادی و عملی است. با رشد مجموعهدادهها به مقیاس پتابایت، یادگیری کاملاً نظارتشده به طور فزایندهای غیرقابل دفاع میشود و صنعت هوش مصنوعی را به سمت معماریهای نیمهنظارتشده و بدون نظارت سوق میدهد که میتوانند از دادههای خامی که جهان به طور طبیعی تولید میکند، معنا استخراج کنند.[4][10]
اصطلاحات کلیدی
- حقیقت پایه (Ground Truth)
- پاسخ یا برچسب عینی و صحیح برای یک قطعه داده که معمولاً توسط انسان ارائه میشود و پیشبینیهای مدل در برابر آن سنجیده میشود.
- شبهبرچسبگذاری (Pseudo-labeling)
- تکنیکی که در آن یک مدل تا حدی آموزشدیده، برچسبهای خود را برای دادههای خام تولید میکند که سپس طوری استفاده میشوند که گویی برچسبهای انسانی برای آموزش بیشتر هستند.
- خوشهبندی (Clustering)
- یک تکنیک یادگیری بدون نظارت که در آن الگوریتم به طور خودکار نقاط داده بدون برچسب را بر اساس شباهتها یا الگوهای پنهان گروهبندی میکند.
- رانش معنایی (Semantic Drift)
- یک حالت شکست در یادگیری نیمهنظارتشده که در آن اشتباهات اولیه در شبهبرچسبگذاری در طول زمان ترکیب میشوند و باعث میشوند مدل الگوهای نادرستی را یاد بگیرد.
آنچه نمیدانیم
- آستانه دقیق دادههای برچسبگذاریشده مورد نیاز برای جلوگیری از رانش معنایی در مدلهای نیمهنظارتشده در صنایع مختلف.
- اینکه چگونه چارچوبهای نظارتی آینده ممکن است نسبتهای خاصی از دادههای برچسبگذاریشده توسط انسان را برای کاربردهای پرخطر هوش مصنوعی الزامی کنند.
منابع
[1]arXivجامعه تحقیقاتی هوش مصنوعیData Collection and Labeling Techniques for Machine Learning
مطالعه در arXiv →
[2]Proceedings of Machine Learning Researchجامعه تحقیقاتی هوش مصنوعیSemi-Automated Data Labeling
مطالعه در Proceedings of Machine Learning Research →
[3]IBMپذیرندگان سازمانیWhat Is Data Labeling?
مطالعه در IBM →
[4]AWSصنعت برچسبگذاری دادهWhat is Data Labeling?
مطالعه در AWS →
[5]Oracleپذیرندگان سازمانیSemi-Supervised Learning Explained
مطالعه در Oracle →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[10]IFoA Data Scienceجامعه تحقیقاتی هوش مصنوعیComparison of Supervised, Unsupervised, Semi-Supervised and Reinforcement
مطالعه در IFoA Data Science →
[11]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

