دوگانهسازی متغیرهای پیوسته ۳۶ درصد اطلاعات را دور میریزد: چرا تقسیم بر اساس میانه برآوردها را مخدوش میکند؟
تبدیل متغیرهای پیوسته به دستههای دوگانه، توان آماری را از بین میبرد و بهطور فعال نتایج مثبت کاذب تولید میکند. با وجود هشدارهای روششناختی چند دهه گذشته، تقسیم بر اساس میانه همچنان یک خطای تحلیلی رایج در رشتههای مختلف علمی است.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- تقسیم متغیر پیوسته از نقطه میانه، از نظر ریاضی ۳۶ درصد از واریانس و توان آماری دادهها را نابود میسازد.
- دستهبندی متغیرهای همبسته بهطور فعال تعاملهای مثبت کاذب میآفریند و توهم کشف پدیدههای ناموجود را دامن میزند.
- نرمافزارهای آماری نوین جایگزینهای مناسبی چون اسپلاینهای مکعبی محدودشده دارند که روابط غیرخطی را بدون حذف دادهها تحلیل میکنند.
در این مطلب
در یک کارآزمایی بالینی، فشار خون دقیق ۱۰٬۰۰۰ بیمار برای بررسی یک مداخله قلبیعروقی جدید اندازهگیری میشود. پیش از آغاز تحلیل، پژوهشگر ارشد خطی فرضی در میانه دادهها رسم میکند و بیماران را به دو گروه مساوی «بالا» و «پایین» تقسیم میکند.
تنها با یک حرکت، این مطالعه عملاً معادل آماری دادههای ۳٬۶۰۰ بیمار را به سطل زباله ریخته است. این شیوه که به «دوگانهسازی» یا «تقسیم بر اساس میانه» مشهور است، یکی از رایجترین و مخربترین عادتها در تحلیل مدرن دادهها به شمار میرود.
تحلیلگران با تبدیل یک متغیر پیوسته به یک دسته دوگانه، تفاوتهای ظریف و معنادار میان بیماری که کمی بالاتر از میانه قرار دارد و بیماری که در نقطه اوج طیف است را پاک میکنند. جریمه آماری این سادهسازی ظاهری، سنگین و از نظر ریاضی اجتنابناپذیر است.
دههها پژوهش روششناختی نشان میدهد که تقسیم یک متغیر پیشبین پیوسته از نقطه میانه، تقریباً ۳۶ درصد از کل اطلاعات نهفته در آن متغیر را نابود میکند. افت واریانس ناشی از این کار، اساساً توانایی مدل در شناسایی روابط واقعی میان پدیدهها را کاهش میدهد.[1][9]
پژوهشگران در یک بررسی روششناختی برجسته در نشریه BMJ خاطرنشان کردند: «دوگانهسازی یک متغیر پیوسته معادل دور ریختن یکسوم از کل دادههاست.» این شیوه، تنوع طبیعی دادهها را به بلوکهای ساختگی و یکدست بدل میکند.[1]
ریاضیات پشت افت اطلاعات
برای درک چرایی این افت ۳۶ درصدی، باید به سازوکار واریانس آماری نگاه کنیم. واریانس همان موتور محرکه ریاضی است که به کشف روابط میانجامد؛ سیگنالی بنیادین که اثر واقعی را از نوفه و خطای تصادفی پسزمینه در مجموعه دادهها جدا میسازد.
دوگانهسازی عمداً این واریانس را متلاشی میکند و تمام دادهها را به سمت مرکز دستساز دسته جدید میکشاند؛ بهطوریکه یک فرد ۴۰ ساله و یک فرد ۸۰ ساله، اگر در دسته جمعیتی «مسنتر» بیفتند، در محاسبات ریاضی دقیقاً یکسان فرض میشوند.
وقتی واریانس فشرده میشود، خطای معیار برآوردها به شکل چشمگیری متورم خواهد شد. در چنین شرایطی، برای دستیابی به همان توان آماری متناظر با متغیر پیوسته، یک مطالعه مبتنی بر تقسیم بر میانه ناچار است حجم نمونه خود را نزدیک به ۵۰ درصد افزایش دهد.[1]
برای یک کارآزمایی بالینی که هزینه هر شرکتکننده در آن سرسامآور است، این افت توان یک خطای مالی و علمی سنگین است که به سادگی قابل پیشگیری بود. از دست رفتن توان آماری، مستقیماً ریسک خطای نوع دوم را بالا میبرد و اثرات واقعی را از چشم پژوهشگران پنهان میکند.[2]
ساخت تعاملهای ساختگی در دادهها
تخریب ناشی از دوگانهسازی به کاهش توان آماری و از دست رفتن اثرات محدود نمیشود. در شرایطی مشخص، دستهبندی متغیرهای پیوسته نتایج مثبت کاذب تولید میکند و توهمی از کشف علمی پدید میآورد که در دنیای واقعی وجود خارجی ندارد.[5]
این رخداد به ویژه در مدلهای رگرسیون چندگانه که در آنها دو یا چند متغیر پیشبین پیوسته با یکدیگر همبستگی دارند، رخ مینماید. هنگامی که یکی از این متغیرهای همبسته دوگانه میشود، واریانس پسماند به سادگی از معادله محو نمیشود.[9]
در عوض، اطلاعات باقیمانده به دیگر متغیرهای مدل نشت میکند. این نشت اطلاعات میتواند یک اثر تعاملی ساختگی بسازد و محققان را به این نتیجه نادرست برساند که یک پدیده خاص، تنها تحت شرایط دستهبندیشده خاصی رخ میدهد.[5]
روششناسان حوزه روانشناسی مصرفکننده این پدیده افزایش خطای نوع اول را در مقالهای در سال ۲۰۱۵ در پایگاه ScienceDirect مستند کردند. آنان نشان دادند که تقسیم بر میانه پیوسته تعاملهای کاذب پدید میآورد و ادبیات پژوهشی را با نتایجی پر میکند که تکرارپذیر نیستند.[8]
گروه مدلسازی آماری دانشگاه کلمبیا تأکید کرده است که اگر دستهبندی دادهها صرفاً برای اهداف نمایشی گریزناپذیر باشد، تقسیم دادهها به سه بخش مساوی بسیار کمضررتر از تقسیم بر اساس میانه است.[6]
پژوهشگران با مقایسه یکسوم بالایی و یکسوم پایینی و نادیده گرفتن بخش میانی، میتوانند بدون ایجاد همان حجم از تعاملهای کاذب، اثرات حدی را بررسی کنند؛ هرچند حفظ متغیر در حالت پیوسته همواره انتخاب بهینه ریاضی است.[6]
پیامدهای بالینی و اکولوژیک
تبعات این اعوجاج آماری در علوم کاربردی کاملاً آشکار است. در نورورادیولوژی، پژوهشگرانی که تاریخچه طبیعی آنوریسمهای مغزی پارهنشده را مطالعه میکردند دریافتند که دستهبندی متغیرهای پیوسته به ارزیابیهای کاملاً نادرست از ریسک انجامیده است.[3]
مدلهای بالینی با قرار دادن اندازه آنوریسم در بازههای بسته، نتوانستند رشد نمایی خطر پارگی همگام با افزایش اندازه فیزیکی را بازتاب دهند. مدل دوگانه گستره وسیعی از آنوریسمهای پرخطر را صرفاً به عنوان موردی با اندازه یکسان «بزرگ» ثبت میکرد.[3]
نشریه آمریکایی نورورادیولوژی صراحتاً هشدار داد که تحلیل دادهها از طریق دستهبندی متغیرهای پیوسته «غیرقابل توصیه» است و متذکر شد که ممکن است یک بیمار با آنوریسم ۹ میلیمتری در همان طبقه ریسک بیماری با آنوریسم ۵ میلیمتری قرار گیرد.[3]
بومشناسی و زیستشناسی فرگشتی نیز از خطاهای روششناختی مشابهی رنج میبرند. یک مرور در نشریه Proceedings of the Royal Society B نشان داد چگونه دستهبندی ویژگیهای پیوسته نظیر وزن بدن یا دما، شیبهای نامحسوسی را که رانشهای انتخاب طبیعی هستند میپوشاند.[4]
وقتی بومشناسان تنوع پیوسته زیستی را در طبقهبندیهای گسسته حبس میکنند، محرکهای اصلی بقا را نادرست تفسیر میکنند. پاسخ گونهها به تغییر اقلیم یک کلید قطع و وصل دوگانه نیست، بلکه یک منحنی پیوسته است که دستهبندی از درک آن عاجز است.[4]
توهم کارایی در مصارف بالینی
مهمترین توجیه طرفداران دوگانهسازی، کاربرد بالینی یا عملیاتی آن است. پزشکان بر مبنای یک تابع پیوسته دارو تجویز نمیکنند؛ آنها بر پایه آستانههای تشخیصی تصمیم میگیرند بیمار را درمان کنند یا خیر.
بنابراین، این استدلال مطرح میشود که مدل آماری نیز باید از همان ابتدا منعکسکننده این نقاط تصمیمگیری دوگانه باشد؛ فرضی که هدف بنیادین مدلسازی آماری را با هدف مجزای کاربرد بالینی خلط میکند.[10]
هدف یک مدل آماری، توصیف دقیق روابط متغیرها در جهان واقع است. تنها پس از ترسیم این رابطه با بهرهگیری از تمامی دادههای پیوسته در دسترس است که میتوان آستانههای تصمیم بالینی را روی خروجی اعمال کرد.[10]
تحمیل قالب دوگانه به دادهها پیش از آغاز تحلیل، تضمین میکند که مدل نهایی غیردقیق خواهد بود. یک مدل پیوسته همیشه میتواند پیشبینیهای دوگانه تولید کند، اما مدل دوگانهسازیشده هرگز نمیتواند اطلاعات از دست رفته را بازگرداند.
علاوه بر این، آستانههای بالینی ایستا نیستند. تعریف فشار خون بالا یا کلسترول غیرطبیعی طی سه دهه گذشته با شواهد جدید بارها تغییر کرده و مدلهای متکی بر آستانههای تاریخی را بلافاصله منسوخ ساخته است.
وقتی محققان تحلیل خود را به یک آستانه خاص گره میزنند، یافتههایشان را به اجماع پزشکی همان سال محدود میکنند. در مقابل، یک مدل پیوسته معادلهای پایدار ارائه میدهد که محققان آینده میتوانند آن را با دستورالعملهای نو تطبیق دهند.
رویکردهای کارآمدتر برای تحلیلهای پیچیده
نرمافزارهای آماری مدرن جایگزینهای فراوانی برای دوگانهسازی ارائه میدهند که اصالت دادههای پیوسته را حفظ میکند. اگر رابطه متغیر پیشبین با پیامد کاملاً خطی باشد، متغیر باید در شکل طبیعی خود باقی بماند.[7]
در مواردی که رابطه غیرخطی است — مانند دارویی که در دوز میانه مفید و در دوز بالا سمی است — میتوان از چندجملهایهای کسری استفاده کرد تا مدلی منطبق بر منحنی ملایم تغییرات ساخته شود.[1]
یک جایگزین کارآمد دیگر، استفاده از اسپلاینهای مکعبی محدودشده (Restricted Cubic Splines) است. در این تکنیک، متغیر پیوسته در نقاط مشخصی به نام «گره» به بخشهایی تقسیم شده و روی هر بخش منحنی ملایم مجزایی برازش میشود.
این منحنیها در محل گرهها به شکلی پیوسته و هموار به یکدیگر متصل میشوند و نقشهای دقیق از اثر متغیر در تمام دامنه آن رسم میکنند. این روش ۱۰۰ درصد اطلاعات گردآوریشده را حفظ کرده و الگوهای زیستی را بازمیتاباند.
گرچه پیادهسازی این رویکردها دانش آماری بیشتری میطلبد، اما اکنون به امکانات استاندارد بستههای نرمافزاری تحلیلی بدل شدهاند و دیگر بهانه دشواری محاسباتی قابل قبول نیست.
چشمانداز پیشروی علم داده
ریشهکن ساختن خطای تقسیم بر میانه نیازمند تحول در داوری مقالات است. داوران و سردبیران ژورنالها باید دوگانهسازی ناموجه متغیرهای پیوسته را به عنوان یک نقص روششناختی بنیادین تلقی کنند.
برخی ژورنالهای پزشکی و آماری هماکنون تصریح کردهاند که مقالات متکی بر متغیرهای پیوسته دستهبندیشده رد خواهند شد، مگر آنکه توجیه بیولوژیکی مستند و از پیش تعیینشدهای برای آستانه ارائه شود.[3][5]
سرفصلهای آموزشی در علوم اجتماعی و زیستی نیز باید بهروزرسانی شوند. بسیاری از دورههای مقدماتی آمار هنوز تقسیم بر میانه را به عنوان راهکاری برای سادهسازی آموزش میدهند و ناخواسته پژوهشگران را به نابودی دادهها ترغیب میکنند.
سرفصلهای آموزشی در علوم اجتماعی و زیستی نیز باید بهروزرسانی شوند.
بحران تکرارپذیری در روانشناسی و پزشکی، جامعه علمی را به بازنگری در عادات آماری واداشته است. با سختگیرانهتر شدن معیارهای شواهد، مدارا با خطاهایی چون تقسیم بر میانه به سرعت رو به زوال است.
در نهایت، سلامت پژوهشهای تجربی در گرو احترام به شکل واقعی دادههاست. طبیعت به ندرت با کلیدهای قطع و وصل رفتار میکند؛ پدیدهها در قالب طیفها، شیبها و منحنیهای پیوستهای رخ میدهند که نیازمند تحلیل با وضوح بالا هستند.
هر بار که متغیری بر اساس میانه تقسیم میشود، یکسوم دادهها به باد میرود و احتمال انتشار نتایج گمراهکننده اوج میگیرد. پژوهشگران دیگر نباید برای سادهتر به نظر رسیدن محاسبات، ۳۶ درصد اطلاعات خود را قربانی کنند.
این تحلیل چگونه انجام شد
- روش
- ترکیب و محاسبه جریمه ریاضی دوگانهسازی در رشتههای مختلف (پزشکی، بومشناسی، روانشناسی مصرفکننده) برای ارزیابی هزینه آماری تقسیم بر میانه بر توان مدل و نرخ خطای مثبت کاذب.
- یافته
- رویکرد تقسیم دادهها بر مبنای میانه، علاوه بر افت توان آماری معادل دور ریختن بیش از یکسوم دادهها، در تمام رشتهها بهطور سیستماتیک تعاملهای مثبت کاذب میآفریند و به گزینهای زیانبار در پژوهشهای تجربی بدل میشود.
- دادههایی که بر پایهٔ آنها کار کردیم
- میزان جریمه افت اطلاعات: 36 percent — The BMJ
- نرخ تعامل کاذب: Elevated Type I error — BMC Medical Research Methodology
- محدودیتهای این تحلیل
- این تحلیل برای متغیرهای پیوسته با روابط خطی یا یکنواخت کاربرد دارد؛ در مواردی که یک آستانه زیستی یا فیزیکی واقعی با تغییر گسسته وجود دارد، دستهبندی ممکن است موجه باشد.
اصطلاحات کلیدی
- دوگانهسازی (Dichotomization)
- فرایند تبدیل یک متغیر پیوسته به دو دسته گسسته، که معمولاً با تقسیم دادهها بر مبنای یک آستانه معین صورت میگیرد.
- تقسیم بر اساس میانه (Median Split)
- نوع خاصی از دوگانهسازی که دادهها را دقیقاً از نقطه میانه به دو گروه مساوی بالا و پایین تقسیم میکند.
- خطای نوع اول (Type I Error)
- نتیجه مثبت کاذب؛ وضعیتی که آزمون آماری به اشتباه وجود یک اثر یا تعامل معنادار را نشان میدهد که در واقعیت وجود ندارد.
- خطای نوع دوم (Type II Error)
- نتیجه منفی کاذب؛ وضعیتی که آزمون به دلیل توان آماری ناکافی مدل، از شناسایی یک اثر واقعی بازمیماند.
- واریانس (Variance)
- شاخصی ریاضی برای سنجش میزان پراکندگی نقاط داده از میانگین خود که نقشی حیاتی در آشکارسازی سیگنالهای آماری دارد.
- اسپلاین مکعبی محدودشده (Restricted Cubic Spline)
- روشی ریاضی برای برازش منحنیهای هموار روی بخشهای مختلف داده، که امکان مدلسازی روابط غیرخطی بدون دستهبندی را فراهم میآورد.
پرسشهای متداول
آیا دوگانهسازی متغیرها از نظر آماری زمانی توجیهپذیر است؟
تنها زمانی که ماهیت پدیده بنیادین واقعاً دوگانه باشد؛ مانند آستانه بیولوژیکی خاصی که اثر تنها پس از رسیدن غلظت به آن نقطه مطلق نمایان میشود.
چرا افت اطلاعات دقیقاً ۳۶ درصد است؟
این رقم حاصل افت ریاضی در اطلاعات فیشر هنگام تبدیل یک متغیر پیوسته با توزیع نرمال به دو دسته مجزا بر مبنای میانه آن است.
آیا پژوهشگران میتوانند با افزایش حجم نمونه این نقص را جبران کنند؟
افزایش حدود ۵۰ درصدی حجم نمونه توان آماری از دست رفته را برمیگرداند، اما خطر تورم تعاملهای مثبت کاذب را برطرف نمیسازد.
آیا تقسیم دادهها به سه یا چهار بخش بهتر از تقسیم بر میانه است؟
آسیب آنها به واریانس کمتر از تقسیم دوگانه است، اما در مقایسه با نگه داشتن متغیر در حالت پیوسته، همچنان بخش مهمی از اطلاعات را از بین میبرند.
بررسی عمیق دیدگاهها
روششناسان و متخصصان آمار
بر این باورند که دوگانهسازی از نظر ریاضی غیرقابل دفاع است و با تولید نتایج مثبت کاذب به اعتبار علمی آسیب میزند.
روششناسان آمار، تقسیم بر مبنای میانه را خطایی کاملاً قابل پیشگیری میدانند که بنیان پژوهشهای تجربی را تضعیف میکند. محققان با دور ریختن تعمدی ۳۶ درصد از واریانس دادهها، خطای معیار را بهطور کاذب افزایش داده و خطر خطای نوع دوم را به شدت بالا میبرند. نگرانی بزرگتر روششناسان، تورم خطای نوع اول است؛ وقتی متغیرهای همبسته پیوسته دستهبندی میشوند، واریانس پسماند به روابط تعاملی سرریز میکند و نتایج مثبت کاذبی میسازد که دیگر پژوهشگران مستقل هرگز قادر به تکرار آن نخواهند بود.
پژوهشگران بالینی و تجربی
دستهبندی دادهها را پیوندی ضروری میان مفاهیم انتزاعی ریاضی و تصمیمگیریهای درمانی در دنیای واقعی میدانند.
محققان کاربردی، بهویژه در پزشکی و سلامت عمومی، بارها استدلال کردهاند که مدلهای آماری باید با الزامات درمان عملی همخوانی داشته باشند. پزشکان بر مبنای منحنیهای پیوسته دارو تجویز نمیکنند، بلکه نیازمند آستانههای تشخیصی قطعی برای اتخاذ تصمیمهای بلادرنگ هستند. از این زاویه، دستهبندی یک نشانگر زیستی پیوسته به دو سطح خطر «بالا» و «عادی»، مدل نهایی را بلافاصله برای کادر درمان قابل استفاده میسازد، حتی اگر به قیمت از دست رفتن سطحی از دقت ریاضی تمام شود.
توسعهدهندگان نرمافزارهای آماری
بر ایجاد ابزارهای کاربردی تمرکز دارند تا محدودیتهای پردازشی گذشته که پژوهشگران را به تقسیم بر میانه وادار میکرد، برطرف شود.
دانشمندان علم داده و طراحان نرمافزار واقفند که تکیه تاریخی بر تقسیم بر میانه تا حد زیادی ناشی از محدودیتهای پردازشی گذشته و دشواری برازش مدلهای غیرخطی در نسلهای اولیه ابزارهای آماری بوده است. راهکار آنان دسترسپذیر کردن روشهای پیشرفته نظیر اسپلاینهای مکعبی محدودشده و مدلهای جمعپذیر تعمیمیافته (GAM) است. توسعهدهندگان با استانداردسازی این روشها در بستههای نرمافزاری نوین میکوشند هرگونه توجیه فنی برای دوگانهسازی را از میان بردارند و راه را برای تحلیل دقیق منحنیهای زیستی هموار سازند.
- روششناسان و متخصصان آمار
- بر این باورند که دوگانهسازی از نظر ریاضی غیرقابل دفاع است و با تولید نتایج مثبت کاذب به اعتبار علمی آسیب میزند.
- پژوهشگران بالینی و تجربی
- دستهبندی دادهها را پیوندی ضروری میان مفاهیم انتزاعی ریاضی و تصمیمگیریهای درمانی در دنیای واقعی میدانند.
- بومشناسان و روانشناسان
- تأکید دارند که مرزبندیهای ساختگی، طیفهای تدریجی پیشبرنده رفتار انسانی و انتخاب طبیعی را پنهان میسازد.
دیدگاههایی که این گزارش پوشش نداده
- داوران همتای ژورنالهای علمی
- مدرسان آمار در مقطع کارشناسی
منابع
[1]The BMJروششناسان و متخصصان آمارThe cost of dichotomising continuous variables
مطالعه در The BMJ →
[2]PubMedپژوهشگران بالینی و تجربیConsequences of dichotomization
مطالعه در PubMed →
[3]American Journal of Neuroradiologyپژوهشگران بالینی و تجربیAnalysis by Categorizing or Dichotomizing Continuous Variables Is Inadvisable: An Example from the Natural History of Unruptured Aneurysms
مطالعه در American Journal of Neuroradiology →
[4]Proceedings of the Royal Society B: Biological Sciencesبومشناسان و روانشناسانOvercoming the pitfalls of categorizing continuous variables in ecology, evolution and behaviour
مطالعه در Proceedings of the Royal Society B: Biological Sciences →
[5]BMC Medical Research Methodologyروششناسان و متخصصان آمارSpurious interaction as a result of categorization
مطالعه در BMC Medical Research Methodology →
[6]Statistical Modeling, Causal Inference, and Social Scienceروششناسان و متخصصان آمارBeyond the median split: Splitting a predictor into 3 parts
مطالعه در Statistical Modeling, Causal Inference, and Social Science →
[7]The Analysis Factorروششناسان و متخصصان آمارContinuous and Categorical Variables: The Trouble with Median Splits
مطالعه در The Analysis Factor →
[8]ScienceDirectبومشناسان و روانشناسانMedian splits, Type II errors, and false–positive consumer psychology: Don't fight the power
مطالعه در ScienceDirect →
[9]PubMedپژوهشگران بالینی و تجربیDichotomizing continuous predictors in multiple regression: a bad idea
مطالعه در PubMed →
[10]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →چشمانداز اقتصاد کلان
پیشبینیهای اقتصادی جهان برای سال ۲۰۲۶ در پی رشد ناشی از هوش مصنوعی و بازارهای نوظهور دچار اختلاف شد
5 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
مدلسازی آماری
چگونه آماره F واریانس تبیینشده را با واریانس پسماند تبییننشده مقایسه میکند
6 منبع
مدلسازی آماری
چگونه گامهای امید ریاضی و بیشینهسازی برای یافتن متغیرهای پنهان به برآورد بیشینه درنمایی همگرا میشوند
4 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





