رفتن به محتوای اصلی
Koohestun
توضیح کوهستانبصری‌سازی دادهتوضیح روش‌شناسی· 5 دقیقه مطالعه· در تحلیل داده

چگونه نمودارهای ویولن، چندوجهی‌های پنهانی را که آمار خلاصه حذف می‌کند، آشکار می‌سازند

مجموعه «دیتاسور دوزن» (Datasaurus Dozen) ثابت می‌کند که آمارهای خلاصه یکسان می‌توانند توزیع‌های هندسی کاملاً متفاوتی را پنهان کنند. تخمین چگالی کرنل (KDE) این مشکل را با بصری‌سازی شکل واقعی داده‌ها حل می‌کند، اما یک آسیب‌پذیری جدید به نام «انتخاب پهنای باند» (bandwidth selection) را معرفی می‌نماید.

به قلم الوین شادمهر

بصری‌سازان داده 40%سنت‌گرایان آماری 30%عمل‌گرایان الگوریتمی 30%
بصری‌سازان داده
طرفدار رسم داده‌های خام قبل از اعمال هرگونه مدل آماری.
سنت‌گرایان آماری
بر ضرورت آزمون‌های ناپارامتریک قوی به جای تفسیر بصری ذهنی تأکید دارند.
عمل‌گرایان الگوریتمی
بر خودکارسازی انتخاب پهنای باند برای خطوط لوله داده در مقیاس بزرگ تمرکز می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مهندسان یادگیری ماشین
  • تحلیلگران داده‌های با ابعاد بالا

بررسی عمیق دیدگاه‌ها

بصری‌سازان داده

طرفدار رسم داده‌های خام قبل از اعمال هرگونه مدل آماری.

این گروه استدلال می‌کند که آمارهای خلاصه ذاتاً کاهنده هستند و در صورت استفاده مجزا خطرناک‌اند. آنها با اشاره به چهارگانه اَنسکومب و دیتاسور دوزن، نشان می‌دهند که الگوریتم‌ها نمی‌توانند ناهنجاری‌های هندسی مانند نقاط پرت شدید، خوشه‌بندی یا روابط غیرخطی را تشخیص دهند. از نظر بصری‌سازان، اولین گام هر تحلیل داده دقیق باید رسم نقاط خام باشد، زیرا تشخیص بصری انسان می‌تواند فوراً الگوهایی را شناسایی کند که خلاصه‌های ریاضی آنها را محو می‌کنند.

سنت‌گرایان آماری

بر ضرورت آزمون‌های ناپارامتریک قوی به جای تفسیر بصری ذهنی تأکید دارند.

در حالی که آماردانان سنتی ارزش بصری‌سازی را تأیید می‌کنند، هشدار می‌دهند که تکیه کامل بر نمودارها، سوگیری انسانی و حساسیت پارامتری را وارد می‌کند. آنها اشاره می‌کنند که تخمین چگالی کرنل به شدت به پهنای باند انتخابی وابسته است، به این معنی که یک تحلیلگر می‌تواند ناخواسته یک بصری‌سازی را برای نشان دادن نتیجه دلخواه «تنظیم» کند. این گروه به جای تکیه بر نمودارهای ذهنی، از آزمون‌های آماری ناپارامتریک قوی حمایت می‌کند که توزیع نرمال را فرض نمی‌کنند و تضمین می‌کنند که یافته‌ها به جای صرفاً بصری، از نظر ریاضی قابل اثبات باشند.

عمل‌گرایان الگوریتمی

بر خودکارسازی انتخاب پهنای باند برای خطوط لوله داده در مقیاس بزرگ تمرکز می‌کنند.

در محیط‌های مدرن یادگیری ماشین و داده‌های بزرگ، بازرسی دستی نمودارهای پراکندگی برای میلیون‌ها متغیر غیرممکن است. این گروه بر توسعه قوانین الگوریتمی—مانند قانون اسکات یا قانون سیلورمن—برای انتخاب خودکار پهنای باند بهینه KDE تمرکز دارد. آنها استدلال می‌کنند که اگرچه هموارسازی خودکار ممکن است گاهی اوقات منجر به بیش‌برازش یا کم‌برازش موارد حاشیه‌ای شود، استانداردسازی انتخاب پارامتر تنها راه برای مقیاس‌بندی تخمین چگالی در مجموعه‌های داده عظیم و با ابعاد بالا است که بازرسی بصری انسانی به آنها دسترسی ندارد.

چرا مهم است

هنگامی که تحلیلگران صرفاً به آمارهای خلاصه یا الگوریتم‌های هموارسازی خودکار تکیه می‌کنند، در معرض خطر ساخت مدل‌های معیوب بر اساس داده‌هایی قرار می‌گیرند که حاوی نقاط پرت شدید، خوشه‌بندی یا روابط غیرخطی پنهان هستند. درک این توهمات ریاضی تنها راه جلوگیری از تثبیت سوگیری الگوریتمی در سیستم‌های عملیاتی است.

محدودیت اصلی آمارهای خلاصه—مانند میانگین، واریانس و ضریب همبستگی—این است که داده‌های زیربنایی باید تک‌وجهی (unimodal) و تقریباً متقارن باشند. وقتی این شرط برقرار باشد، چند عدد می‌توانند رفتار یک جامعه آماری را به خوبی توصیف کنند. اما وقتی این شرط نقض می‌شود، همان اعداد دقیقاً به یک توهم ریاضی تبدیل می‌شوند و قله‌های چندوجهی، کج‌شدگی شدید یا زیرگروه‌های خوشه‌ای را پنهان می‌کنند. در تحلیل داده‌های مدرن، این محدودیت به طور معمول نقض می‌شود، و این امر بصری‌سازی را به تنها ابزار تشخیصی قابل اعتماد برای تعیین دروغ‌گویی آمار تبدیل می‌کند. بدون بررسی بصری، تحلیلگران ریسک ساخت مدل‌هایی را می‌پذیرند که در یک صفحه گسترده عادی به نظر می‌رسند اما در واقعیت رفتاری نامنظم دارند.[7]

مشهورترین اثبات این شکست در سال ۱۹۷۳ با آماردانی به نام فرانسیس اَنسکومب (Francis Anscombe) آغاز شد، که «چهارگانه اَنسکومب» (Anscombe's Quartet) را منتشر کرد تا نشان دهد چگونه چهار مجموعه داده کاملاً متفاوت می‌توانند ویژگی‌های آماری یکسانی داشته باشند. این درس در سال ۲۰۱۶ برای علم داده مدرن به‌روزرسانی شد، زمانی که طراح آلبرتو کایرو (Alberto Cairo) مجموعه‌ای از ۱۴۲ مشاهده را ایجاد کرد. مجموعه داده کایرو دارای آمارهای خلاصه استاندارد و معمولی بود، اما وقتی روی نمودار پراکندگی رسم شد، نقاط شکل متمایز یک دایناسور تی‌رکس (Tyrannosaurus rex) را تشکیل دادند. محققان اتودسک (Autodesk)، جاستین ماتیکا (Justin Matejka) و جورج فیتزموریس (George Fitzmaurice)، با الهام از این ترفند بصری، در سال ۲۰۱۷ «دیتاسور دوزن» (Datasaurus Dozen) را منتشر کردند و این مفهوم را به نهایت ریاضی خود رساندند.[1][2]

تیم اتودسک از یک الگوریتم بهینه‌سازی به نام «آنیلینگ شبیه‌سازی‌شده» (Simulated Annealing) استفاده کرد تا ۱۲ مجموعه داده اضافی ایجاد کند که با معیارهای دایناسور مطابقت داشته باشند. همانطور که آنها در مقاله سال ۲۰۱۷ خود نوشتند، «مجموعه‌های داده جدید به صورت تکراری از یک مجموعه داده اولیه، از طریق اغتشاشات تصادفی نقاط داده منفرد تولید می‌شوند.» ۱۳ مجموعه داده حاصل، آمارهای خلاصه یکسانی را تا دو رقم اعشار به اشتراک می‌گذارند: میانگین متغیر x دقیقاً ۵۴.۲۶ است، میانگین متغیر y برابر با ۴۷.۸۳ است، و همبستگی بین آنها ۰.۰۶- است. ضریب تعیین رگرسیون خطی ($R^2$) در تمام موارد ۰.۰۰۴ ثابت است و واریانس نمونه برای x روی ۱۶.۷۶ قفل شده است.[1][2]

سیزده مجموعه داده متمایز، آمارهای خلاصه یکسانی را تا دو رقم اعشار به اشتراک می‌گذارند.

اگر صرفاً به این اعداد تکیه کنیم، یک مدل یادگیری ماشین یا یک خلاصه آماری هر ۱۳ مجموعه داده را کاملاً یکسان در نظر می‌گیرد. با این حال، وقتی به صورت بصری رسم می‌شوند، یک مجموعه داده شکل یک ستاره پنج‌پر، دیگری شکل هدف (bullseye) و سومی خطوط افقی موازی را تشکیل می‌دهد. آمارهای خلاصه، هندسه داده‌ها را به طور کامل محو می‌کنند. برای حل این مشکل پنهان‌سازی در داده‌های پیوسته تک‌بعدی، تحلیلگران به طور فزاینده‌ای به «تخمین چگالی کرنل» (KDE) و نمودارهای ویولن روی می‌آورند تا شکل واقعی یک توزیع را قبل از اعمال هرگونه مدل‌سازی پیش‌بینی‌کننده، بصری‌سازی کنند.[1][2][4]

اگر صرفاً به این اعداد تکیه کنیم، یک مدل یادگیری ماشین یا یک خلاصه آماری هر ۱۳ مجموعه داده را کاملاً یکسان در نظر می‌گیرد.

یک نمودار جعبه‌ای سنتی (box plot) تنها خلاصه پنج‌عددی—حداقل، چارک اول، میانه، چارک سوم و حداکثر—را نمایش می‌دهد. از آنجا که این نمودار کاملاً به این معیارهای خلاصه متکی است، نمی‌تواند نشان دهد که آیا داده‌ها در چندین قله خوشه‌بندی شده‌اند یا خیر؛ یک توزیع دوقله‌ای (bimodal) دقیقاً شبیه به یک توزیع نرمال با واریانس گسترده به نظر می‌رسد. اینجا است که نمودار ویولن وارد می‌شود. این نمودار با آینه‌ای کردن یک منحنی چگالی در دو طرف یک محور مرکزی، دقیقاً نشان می‌دهد که مقادیر کجا خوشه‌بندی شده‌اند. همانطور که محققان در «اورنج دیتا ماینینگ» (Orange Data Mining) توضیح می‌دهند: «جایی که ویولن چاق‌تر است، نقاط داده بیشتری در آن ناحیه وجود دارد. و جایی که نازک‌تر است، نقاط کمتری وجود دارد.»[3][6]

نمودار ویولن این وضوح را با اعمال «تخمین چگالی کرنل» (KDE) به دست می‌آورد. KDE با قرار دادن یک منحنی هموار، که به عنوان تابع کرنل (معمولاً یک منحنی زنگوله‌ای گوسی) شناخته می‌شود، روی هر نقطه داده و جمع‌بندی آنها، یک تابع چگالی احتمال پیوسته ایجاد می‌کند. به جای تقسیم داده‌ها به سطل‌های (bins) سخت و دلخواه مانند یک هیستوگرام سنتی، KDE یک تخمین روان از محل تمرکز بیشتر مقادیر ارائه می‌دهد. این هموارسازی ریاضی به راحتی توزیع‌های دوقله‌ای یا چندقله‌ای را آشکار می‌کند که در غیر این صورت در داخل معیار انحراف معیار استاندارد پنهان می‌ماندند.[3][4]

با این حال، KDE محدودیت اصلی خود را معرفی می‌کند: پارامتر پهنای باند (bandwidth parameter)، که اغلب به صورت ریاضی با $h$ نمایش داده می‌شود. پهنای باند عرض توابع کرنل منفردی را که روی هر یک از ۱۴۲ نقطه داده قرار می‌گیرند، کنترل می‌کند. اگر پهنای باند خیلی کوچک تنظیم شود، نمودار چگالی حاصل به شدت «کم‌هموار» (undersmoothed) می‌شود. این نمودار به صورت مجموعه‌ای پر از دست‌انداز و نویزی از قله‌های منفرد ظاهر می‌شود که بیش‌برازش (overfit) نقاط نمونه خاص را نشان می‌دهد، در تعمیم روند گسترده‌تر شکست می‌خورد و قله‌های کاذبی ایجاد می‌کند که در جمعیت گسترده‌تر وجود ندارند.[4][5]

انتخاب پهنای باند تعیین می‌کند که آیا KDE شکل واقعی داده‌ها را آشکار می‌کند یا آن را محو می‌سازد.

برعکس، اگر پهنای باند بیش از حد بزرگ باشد، نمودار «بیش‌هموار» (oversmoothed) می‌شود، که خطرناک‌ترین حالت شکست در تحلیل اکتشافی داده‌ها است. یک KDE بیش‌هموار، قله‌های متمایز را با هم ادغام می‌کند و توزیع دوقله‌ای را مجبور می‌کند شبیه یک منحنی زنگوله‌ای تک‌وجهی، پهن و هموار به نظر برسد. با این کار، یک KDE که به درستی تنظیم نشده است، دقیقاً همان مشکلی را که قرار بود حل کند، بازسازی می‌کند: شکل واقعی داده‌ها را پشت یک فرض الگوریتمی پنهان می‌کند و همان چندوجهی بودن را که تحلیلگر در جستجوی آن بود، می‌پوشاند.[5]

این وضعیت یک پارادوکس در تحلیل داده مبتنی بر شواهد ایجاد می‌کند. آمارهای خلاصه کاملاً عینی هستند اما به راحتی توسط هندسه فریب می‌خورند، در حالی که KDE هندسه را آشکار می‌کند اما به یک پارامتر پهنای باند ذهنی متکی است. در حالی که الگوریتم‌هایی مانند «قانون اسکات» (Scott’s rule) یا «قانون سیلورمن» (Silverman’s rule) تلاش می‌کنند انتخاب پهنای باند را خودکار کنند، شواهد نشان می‌دهد که نه آمارهای خلاصه و نه نمودارهای چگالی خودکار را نمی‌توان به صورت مجزا مورد اعتماد قرار داد. تنها رویکرد قوی این است که نقاط داده خام را در کنار تخمین چگالی رسم کنیم و چندین پهنای باند را آزمایش کنیم تا مطمئن شویم شکل بصری، خاصیت خود داده‌ها است، نه یک مصنوع ناشی از پارامتر هموارسازی.[4][7]

نکات کلیدی

  • مجموعه دیتاسور دوزن شامل ۱۳ مجموعه داده متمایز است که میانگین‌ها، واریانس‌ها و همبستگی‌های یکسانی را تا دو رقم اعشار به اشتراک می‌گذارند.
  • آمارهای خلاصه در توصیف دقیق داده‌ها شکست می‌خورند، زمانی که توزیع زیربنایی فرض تک‌وجهی و تقارن را نقض کند.
  • نمودارهای ویولن از تخمین چگالی کرنل (KDE) برای آشکارسازی قله‌های چندوجهی استفاده می‌کنند که نمودارهای جعبه‌ای سنتی آنها را پنهان می‌کنند.
  • KDE به پارامتر پهنای باند متکی است؛ اگر این پارامتر بیش از حد بالا تنظیم شود، داده‌ها را بیش‌هموار می‌کند و داده‌های چندوجهی را به اشتباه به صورت یک منحنی زنگوله‌ای واحد نمایش می‌دهد.

روند رویداد

  1. ۱۹۷۳

    فرانسیس اَنسکومب، آماردان، «چهارگانه اَنسکومب» را منتشر می‌کند تا محدودیت‌های آمارهای خلاصه را نشان دهد.

  2. ۲۰۱۶

    آلبرتو کایرو، طراح، مجموعه داده اصلی دیتاسور را ایجاد می‌کند تا این درس را برای بصری‌سازی داده مدرن به‌روز کند.

  3. ۲۰۱۷

    محققان اتودسک «دیتاسور دوزن» را منتشر می‌کنند و با استفاده از آنیلینگ شبیه‌سازی‌شده، ۱۲ مجموعه داده دیگر با آمارهای یکسان تولید می‌کنند.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

بصری‌سازان داده 40%سنت‌گرایان آماری 30%عمل‌گرایان الگوریتمی 30%
  1. [1]Mediumبصری‌سازان داده

    The Datasaurus Dozen: Why Summary Statistics Are Not Enough

    مطالعه در Medium →
  2. [2]Wikipediaسنت‌گرایان آماری

    Datasaurus dozen

    مطالعه در Wikipedia →
  3. [3]GeeksforGeeks

    Violin Plot vs Box Plot

    مطالعه در GeeksforGeeks →
  4. [4]DataCampعمل‌گرایان الگوریتمی

    Kernel Density Estimation: From Theory to Practice

    مطالعه در DataCamp →
  5. [5]Andrey Akinshinعمل‌گرایان الگوریتمی

    How bandwidth selection affects plot smoothness

    مطالعه در Andrey Akinshin →
  6. [6]Orange Data Miningبصری‌سازان داده

    Violin Plot

    مطالعه در Orange Data Mining →
  7. [7]تیم سردبیری کوهستانسنت‌گرایان آماری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.