رفتن به محتوای اصلی
کوهستان
توضیح کوهستانروش‌شناسی آماریعلم داده· 8 دقیقه مطالعه· در تحلیل داده

دوگانه‌سازی متغیرهای پیوسته ۳۶ درصد اطلاعات را دور می‌ریزد: چرا تقسیم بر اساس میانه برآوردها را مخدوش می‌کند؟

تبدیل متغیرهای پیوسته به دسته‌های دوگانه، توان آماری را از بین می‌برد و به‌طور فعال نتایج مثبت کاذب تولید می‌کند. با وجود هشدارهای روش‌شناختی چند دهه گذشته، تقسیم بر اساس میانه همچنان یک خطای تحلیلی رایج در رشته‌های مختلف علمی است.

به قلم کوروش پاکزاد

به‌طور خلاصه

  • تقسیم متغیر پیوسته از نقطه میانه، از نظر ریاضی ۳۶ درصد از واریانس و توان آماری داده‌ها را نابود می‌سازد.
  • دسته‌بندی متغیرهای همبسته به‌طور فعال تعامل‌های مثبت کاذب می‌آفریند و توهم کشف پدیده‌های ناموجود را دامن می‌زند.
  • نرم‌افزارهای آماری نوین جایگزین‌های مناسبی چون اسپلاین‌های مکعبی محدودشده دارند که روابط غیرخطی را بدون حذف داده‌ها تحلیل می‌کنند.

در یک کارآزمایی بالینی، فشار خون دقیق ۱۰٬۰۰۰ بیمار برای بررسی یک مداخله قلبی‌عروقی جدید اندازه‌گیری می‌شود. پیش از آغاز تحلیل، پژوهشگر ارشد خطی فرضی در میانه داده‌ها رسم می‌کند و بیماران را به دو گروه مساوی «بالا» و «پایین» تقسیم می‌کند.

تنها با یک حرکت، این مطالعه عملاً معادل آماری داده‌های ۳٬۶۰۰ بیمار را به سطل زباله ریخته است. این شیوه که به «دوگانه‌سازی» یا «تقسیم بر اساس میانه» مشهور است، یکی از رایج‌ترین و مخرب‌ترین عادت‌ها در تحلیل مدرن داده‌ها به شمار می‌رود.

تحلیل‌گران با تبدیل یک متغیر پیوسته به یک دسته دوگانه، تفاوت‌های ظریف و معنادار میان بیماری که کمی بالاتر از میانه قرار دارد و بیماری که در نقطه اوج طیف است را پاک می‌کنند. جریمه آماری این ساده‌سازی ظاهری، سنگین و از نظر ریاضی اجتناب‌ناپذیر است.

دهه‌ها پژوهش روش‌شناختی نشان می‌دهد که تقسیم یک متغیر پیش‌بین پیوسته از نقطه میانه، تقریباً ۳۶ درصد از کل اطلاعات نهفته در آن متغیر را نابود می‌کند. افت واریانس ناشی از این کار، اساساً توانایی مدل در شناسایی روابط واقعی میان پدیده‌ها را کاهش می‌دهد.[1][9]

پژوهشگران در یک بررسی روش‌شناختی برجسته در نشریه BMJ خاطرنشان کردند: «دوگانه‌سازی یک متغیر پیوسته معادل دور ریختن یک‌سوم از کل داده‌هاست.» این شیوه، تنوع طبیعی داده‌ها را به بلوک‌های ساختگی و یکدست بدل می‌کند.[1]

ریاضیات پشت افت اطلاعات

برای درک چرایی این افت ۳۶ درصدی، باید به سازوکار واریانس آماری نگاه کنیم. واریانس همان موتور محرکه ریاضی است که به کشف روابط می‌انجامد؛ سیگنالی بنیادین که اثر واقعی را از نوفه و خطای تصادفی پس‌زمینه در مجموعه داده‌ها جدا می‌سازد.

تقسیم بر اساس میانه از نظر محاسباتی ۳۶ درصد از اطلاعات فیشر در یک متغیر پیوسته را نابود می‌کند.

دوگانه‌سازی عمداً این واریانس را متلاشی می‌کند و تمام داده‌ها را به سمت مرکز دست‌ساز دسته جدید می‌کشاند؛ به‌طوری‌که یک فرد ۴۰ ساله و یک فرد ۸۰ ساله، اگر در دسته جمعیتی «مسن‌تر» بیفتند، در محاسبات ریاضی دقیقاً یکسان فرض می‌شوند.

وقتی واریانس فشرده می‌شود، خطای معیار برآوردها به شکل چشمگیری متورم خواهد شد. در چنین شرایطی، برای دستیابی به همان توان آماری متناظر با متغیر پیوسته، یک مطالعه مبتنی بر تقسیم بر میانه ناچار است حجم نمونه خود را نزدیک به ۵۰ درصد افزایش دهد.[1]

برای یک کارآزمایی بالینی که هزینه هر شرکت‌کننده در آن سرسام‌آور است، این افت توان یک خطای مالی و علمی سنگین است که به سادگی قابل پیشگیری بود. از دست رفتن توان آماری، مستقیماً ریسک خطای نوع دوم را بالا می‌برد و اثرات واقعی را از چشم پژوهشگران پنهان می‌کند.[2]

ساخت تعامل‌های ساختگی در داده‌ها

تخریب ناشی از دوگانه‌سازی به کاهش توان آماری و از دست رفتن اثرات محدود نمی‌شود. در شرایطی مشخص، دسته‌بندی متغیرهای پیوسته نتایج مثبت کاذب تولید می‌کند و توهمی از کشف علمی پدید می‌آورد که در دنیای واقعی وجود خارجی ندارد.[5]

این رخداد به ویژه در مدل‌های رگرسیون چندگانه که در آن‌ها دو یا چند متغیر پیش‌بین پیوسته با یکدیگر همبستگی دارند، رخ می‌نماید. هنگامی که یکی از این متغیرهای همبسته دوگانه می‌شود، واریانس پسماند به سادگی از معادله محو نمی‌شود.[9]

در عوض، اطلاعات باقیمانده به دیگر متغیرهای مدل نشت می‌کند. این نشت اطلاعات می‌تواند یک اثر تعاملی ساختگی بسازد و محققان را به این نتیجه نادرست برساند که یک پدیده خاص، تنها تحت شرایط دسته‌بندی‌شده خاصی رخ می‌دهد.[5]

روش‌شناسان حوزه روان‌شناسی مصرف‌کننده این پدیده افزایش خطای نوع اول را در مقاله‌ای در سال ۲۰۱۵ در پایگاه ScienceDirect مستند کردند. آنان نشان دادند که تقسیم بر میانه پیوسته تعامل‌های کاذب پدید می‌آورد و ادبیات پژوهشی را با نتایجی پر می‌کند که تکرارپذیر نیستند.[8]

دسته‌بندی متغیرهای همبسته، واریانس پسماند را به سایر متغیرها تحمیل کرده و تعامل‌های مثبت کاذب می‌سازد.

گروه مدل‌سازی آماری دانشگاه کلمبیا تأکید کرده است که اگر دسته‌بندی داده‌ها صرفاً برای اهداف نمایشی گریزناپذیر باشد، تقسیم داده‌ها به سه بخش مساوی بسیار کم‌ضررتر از تقسیم بر اساس میانه است.[6]

پژوهشگران با مقایسه یک‌سوم بالایی و یک‌سوم پایینی و نادیده گرفتن بخش میانی، می‌توانند بدون ایجاد همان حجم از تعامل‌های کاذب، اثرات حدی را بررسی کنند؛ هرچند حفظ متغیر در حالت پیوسته همواره انتخاب بهینه ریاضی است.[6]

پیامدهای بالینی و اکولوژیک

تبعات این اعوجاج آماری در علوم کاربردی کاملاً آشکار است. در نورورادیولوژی، پژوهشگرانی که تاریخچه طبیعی آنوریسم‌های مغزی پاره‌نشده را مطالعه می‌کردند دریافتند که دسته‌بندی متغیرهای پیوسته به ارزیابی‌های کاملاً نادرست از ریسک انجامیده است.[3]

مدل‌های بالینی با قرار دادن اندازه آنوریسم در بازه‌های بسته، نتوانستند رشد نمایی خطر پارگی همگام با افزایش اندازه فیزیکی را بازتاب دهند. مدل دوگانه گستره وسیعی از آنوریسم‌های پرخطر را صرفاً به عنوان موردی با اندازه یکسان «بزرگ» ثبت می‌کرد.[3]

نشریه آمریکایی نورورادیولوژی صراحتاً هشدار داد که تحلیل داده‌ها از طریق دسته‌بندی متغیرهای پیوسته «غیرقابل توصیه» است و متذکر شد که ممکن است یک بیمار با آنوریسم ۹ میلی‌متری در همان طبقه ریسک بیماری با آنوریسم ۵ میلی‌متری قرار گیرد.[3]

بوم‌شناسی و زیست‌شناسی فرگشتی نیز از خطاهای روش‌شناختی مشابهی رنج می‌برند. یک مرور در نشریه Proceedings of the Royal Society B نشان داد چگونه دسته‌بندی ویژگی‌های پیوسته نظیر وزن بدن یا دما، شیب‌های نامحسوسی را که رانش‌های انتخاب طبیعی هستند می‌پوشاند.[4]

وقتی بوم‌شناسان تنوع پیوسته زیستی را در طبقه‌بندی‌های گسسته حبس می‌کنند، محرک‌های اصلی بقا را نادرست تفسیر می‌کنند. پاسخ گونه‌ها به تغییر اقلیم یک کلید قطع و وصل دوگانه نیست، بلکه یک منحنی پیوسته است که دسته‌بندی از درک آن عاجز است.[4]

توهم کارایی در مصارف بالینی

مهم‌ترین توجیه طرفداران دوگانه‌سازی، کاربرد بالینی یا عملیاتی آن است. پزشکان بر مبنای یک تابع پیوسته دارو تجویز نمی‌کنند؛ آن‌ها بر پایه آستانه‌های تشخیصی تصمیم می‌گیرند بیمار را درمان کنند یا خیر.

مدل‌های دوگانه از ثبت جهش‌های نمایی خطر ناتوانند و داده‌های کاملاً متمایز را یکسان تلقی می‌کنند.

بنابراین، این استدلال مطرح می‌شود که مدل آماری نیز باید از همان ابتدا منعکس‌کننده این نقاط تصمیم‌گیری دوگانه باشد؛ فرضی که هدف بنیادین مدل‌سازی آماری را با هدف مجزای کاربرد بالینی خلط می‌کند.[10]

هدف یک مدل آماری، توصیف دقیق روابط متغیرها در جهان واقع است. تنها پس از ترسیم این رابطه با بهره‌گیری از تمامی داده‌های پیوسته در دسترس است که می‌توان آستانه‌های تصمیم بالینی را روی خروجی اعمال کرد.[10]

تحمیل قالب دوگانه به داده‌ها پیش از آغاز تحلیل، تضمین می‌کند که مدل نهایی غیردقیق خواهد بود. یک مدل پیوسته همیشه می‌تواند پیش‌بینی‌های دوگانه تولید کند، اما مدل دوگانه‌سازی‌شده هرگز نمی‌تواند اطلاعات از دست رفته را بازگرداند.

علاوه بر این، آستانه‌های بالینی ایستا نیستند. تعریف فشار خون بالا یا کلسترول غیرطبیعی طی سه دهه گذشته با شواهد جدید بارها تغییر کرده و مدل‌های متکی بر آستانه‌های تاریخی را بلافاصله منسوخ ساخته است.

وقتی محققان تحلیل خود را به یک آستانه خاص گره می‌زنند، یافته‌هایشان را به اجماع پزشکی همان سال محدود می‌کنند. در مقابل، یک مدل پیوسته معادله‌ای پایدار ارائه می‌دهد که محققان آینده می‌توانند آن را با دستورالعمل‌های نو تطبیق دهند.

رویکردهای کارآمدتر برای تحلیل‌های پیچیده

نرم‌افزارهای آماری مدرن جایگزین‌های فراوانی برای دوگانه‌سازی ارائه می‌دهند که اصالت داده‌های پیوسته را حفظ می‌کند. اگر رابطه متغیر پیش‌بین با پیامد کاملاً خطی باشد، متغیر باید در شکل طبیعی خود باقی بماند.[7]

در مواردی که رابطه غیرخطی است — مانند دارویی که در دوز میانه مفید و در دوز بالا سمی است — می‌توان از چندجمله‌ای‌های کسری استفاده کرد تا مدلی منطبق بر منحنی ملایم تغییرات ساخته شود.[1]

اسپلاین‌های مکعبی محدودشده امکان مدل‌سازی واقعیت‌های زیستی غیرخطی را بدون نابود کردن داده‌های پیوسته فراهم می‌کنند.

یک جایگزین کارآمد دیگر، استفاده از اسپلاین‌های مکعبی محدودشده (Restricted Cubic Splines) است. در این تکنیک، متغیر پیوسته در نقاط مشخصی به نام «گره» به بخش‌هایی تقسیم شده و روی هر بخش منحنی ملایم مجزایی برازش می‌شود.

این منحنی‌ها در محل گره‌ها به شکلی پیوسته و هموار به یکدیگر متصل می‌شوند و نقشه‌ای دقیق از اثر متغیر در تمام دامنه آن رسم می‌کنند. این روش ۱۰۰ درصد اطلاعات گردآوری‌شده را حفظ کرده و الگوهای زیستی را بازمی‌تاباند.

گرچه پیاده‌سازی این رویکردها دانش آماری بیشتری می‌طلبد، اما اکنون به امکانات استاندارد بسته‌های نرم‌افزاری تحلیلی بدل شده‌اند و دیگر بهانه دشواری محاسباتی قابل قبول نیست.

چشم‌انداز پیش‌روی علم داده

ریشه‌کن ساختن خطای تقسیم بر میانه نیازمند تحول در داوری مقالات است. داوران و سردبیران ژورنال‌ها باید دوگانه‌سازی ناموجه متغیرهای پیوسته را به عنوان یک نقص روش‌شناختی بنیادین تلقی کنند.

برخی ژورنال‌های پزشکی و آماری هم‌اکنون تصریح کرده‌اند که مقالات متکی بر متغیرهای پیوسته دسته‌بندی‌شده رد خواهند شد، مگر آنکه توجیه بیولوژیکی مستند و از پیش تعیین‌شده‌ای برای آستانه ارائه شود.[3][5]

سرفصل‌های آموزشی در علوم اجتماعی و زیستی نیز باید به‌روزرسانی شوند. بسیاری از دوره‌های مقدماتی آمار هنوز تقسیم بر میانه را به عنوان راهکاری برای ساده‌سازی آموزش می‌دهند و ناخواسته پژوهشگران را به نابودی داده‌ها ترغیب می‌کنند.

سرفصل‌های آموزشی در علوم اجتماعی و زیستی نیز باید به‌روزرسانی شوند.

بحران تکرارپذیری در روان‌شناسی و پزشکی، جامعه علمی را به بازنگری در عادات آماری واداشته است. با سخت‌گیرانه‌تر شدن معیارهای شواهد، مدارا با خطاهایی چون تقسیم بر میانه به سرعت رو به زوال است.

در نهایت، سلامت پژوهش‌های تجربی در گرو احترام به شکل واقعی داده‌هاست. طبیعت به ندرت با کلیدهای قطع و وصل رفتار می‌کند؛ پدیده‌ها در قالب طیف‌ها، شیب‌ها و منحنی‌های پیوسته‌ای رخ می‌دهند که نیازمند تحلیل با وضوح بالا هستند.

هر بار که متغیری بر اساس میانه تقسیم می‌شود، یک‌سوم داده‌ها به باد می‌رود و احتمال انتشار نتایج گمراه‌کننده اوج می‌گیرد. پژوهشگران دیگر نباید برای ساده‌تر به نظر رسیدن محاسبات، ۳۶ درصد اطلاعات خود را قربانی کنند.

این تحلیل چگونه انجام شد

روش
ترکیب و محاسبه جریمه ریاضی دوگانه‌سازی در رشته‌های مختلف (پزشکی، بوم‌شناسی، روان‌شناسی مصرف‌کننده) برای ارزیابی هزینه آماری تقسیم بر میانه بر توان مدل و نرخ خطای مثبت کاذب.
یافته
رویکرد تقسیم داده‌ها بر مبنای میانه، علاوه بر افت توان آماری معادل دور ریختن بیش از یک‌سوم داده‌ها، در تمام رشته‌ها به‌طور سیستماتیک تعامل‌های مثبت کاذب می‌آفریند و به گزینه‌ای زیان‌بار در پژوهش‌های تجربی بدل می‌شود.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
محدودیت‌های این تحلیل
این تحلیل برای متغیرهای پیوسته با روابط خطی یا یکنواخت کاربرد دارد؛ در مواردی که یک آستانه زیستی یا فیزیکی واقعی با تغییر گسسته وجود دارد، دسته‌بندی ممکن است موجه باشد.

اصطلاحات کلیدی

دوگانه‌سازی (Dichotomization)
فرایند تبدیل یک متغیر پیوسته به دو دسته گسسته، که معمولاً با تقسیم داده‌ها بر مبنای یک آستانه معین صورت می‌گیرد.
تقسیم بر اساس میانه (Median Split)
نوع خاصی از دوگانه‌سازی که داده‌ها را دقیقاً از نقطه میانه به دو گروه مساوی بالا و پایین تقسیم می‌کند.
خطای نوع اول (Type I Error)
نتیجه مثبت کاذب؛ وضعیتی که آزمون آماری به اشتباه وجود یک اثر یا تعامل معنادار را نشان می‌دهد که در واقعیت وجود ندارد.
خطای نوع دوم (Type II Error)
نتیجه منفی کاذب؛ وضعیتی که آزمون به دلیل توان آماری ناکافی مدل، از شناسایی یک اثر واقعی بازمی‌ماند.
واریانس (Variance)
شاخصی ریاضی برای سنجش میزان پراکندگی نقاط داده از میانگین خود که نقشی حیاتی در آشکارسازی سیگنال‌های آماری دارد.
اسپلاین مکعبی محدودشده (Restricted Cubic Spline)
روشی ریاضی برای برازش منحنی‌های هموار روی بخش‌های مختلف داده، که امکان مدل‌سازی روابط غیرخطی بدون دسته‌بندی را فراهم می‌آورد.

پرسش‌های متداول

آیا دوگانه‌سازی متغیرها از نظر آماری زمانی توجیه‌پذیر است؟

تنها زمانی که ماهیت پدیده بنیادین واقعاً دوگانه باشد؛ مانند آستانه بیولوژیکی خاصی که اثر تنها پس از رسیدن غلظت به آن نقطه مطلق نمایان می‌شود.

چرا افت اطلاعات دقیقاً ۳۶ درصد است؟

این رقم حاصل افت ریاضی در اطلاعات فیشر هنگام تبدیل یک متغیر پیوسته با توزیع نرمال به دو دسته مجزا بر مبنای میانه آن است.

آیا پژوهشگران می‌توانند با افزایش حجم نمونه این نقص را جبران کنند؟

افزایش حدود ۵۰ درصدی حجم نمونه توان آماری از دست رفته را برمی‌گرداند، اما خطر تورم تعامل‌های مثبت کاذب را برطرف نمی‌سازد.

آیا تقسیم داده‌ها به سه یا چهار بخش بهتر از تقسیم بر میانه است؟

آسیب آن‌ها به واریانس کمتر از تقسیم دوگانه است، اما در مقایسه با نگه داشتن متغیر در حالت پیوسته، همچنان بخش مهمی از اطلاعات را از بین می‌برند.

بررسی عمیق دیدگاه‌ها

روش‌شناسان و متخصصان آمار

بر این باورند که دوگانه‌سازی از نظر ریاضی غیرقابل دفاع است و با تولید نتایج مثبت کاذب به اعتبار علمی آسیب می‌زند.

روش‌شناسان آمار، تقسیم بر مبنای میانه را خطایی کاملاً قابل پیشگیری می‌دانند که بنیان پژوهش‌های تجربی را تضعیف می‌کند. محققان با دور ریختن تعمدی ۳۶ درصد از واریانس داده‌ها، خطای معیار را به‌طور کاذب افزایش داده و خطر خطای نوع دوم را به شدت بالا می‌برند. نگرانی بزرگ‌تر روش‌شناسان، تورم خطای نوع اول است؛ وقتی متغیرهای همبسته پیوسته دسته‌بندی می‌شوند، واریانس پسماند به روابط تعاملی سرریز می‌کند و نتایج مثبت کاذبی می‌سازد که دیگر پژوهشگران مستقل هرگز قادر به تکرار آن نخواهند بود.

پژوهشگران بالینی و تجربی

دسته‌بندی داده‌ها را پیوندی ضروری میان مفاهیم انتزاعی ریاضی و تصمیم‌گیری‌های درمانی در دنیای واقعی می‌دانند.

محققان کاربردی، به‌ویژه در پزشکی و سلامت عمومی، بارها استدلال کرده‌اند که مدل‌های آماری باید با الزامات درمان عملی همخوانی داشته باشند. پزشکان بر مبنای منحنی‌های پیوسته دارو تجویز نمی‌کنند، بلکه نیازمند آستانه‌های تشخیصی قطعی برای اتخاذ تصمیم‌های بلادرنگ هستند. از این زاویه، دسته‌بندی یک نشانگر زیستی پیوسته به دو سطح خطر «بالا» و «عادی»، مدل نهایی را بلافاصله برای کادر درمان قابل استفاده می‌سازد، حتی اگر به قیمت از دست رفتن سطحی از دقت ریاضی تمام شود.

توسعه‌دهندگان نرم‌افزارهای آماری

بر ایجاد ابزارهای کاربردی تمرکز دارند تا محدودیت‌های پردازشی گذشته که پژوهشگران را به تقسیم بر میانه وادار می‌کرد، برطرف شود.

دانشمندان علم داده و طراحان نرم‌افزار واقفند که تکیه تاریخی بر تقسیم بر میانه تا حد زیادی ناشی از محدودیت‌های پردازشی گذشته و دشواری برازش مدل‌های غیرخطی در نسل‌های اولیه ابزارهای آماری بوده است. راهکار آنان دسترس‌پذیر کردن روش‌های پیشرفته نظیر اسپلاین‌های مکعبی محدودشده و مدل‌های جمع‌پذیر تعمیم‌یافته (GAM) است. توسعه‌دهندگان با استانداردسازی این روش‌ها در بسته‌های نرم‌افزاری نوین می‌کوشند هرگونه توجیه فنی برای دوگانه‌سازی را از میان بردارند و راه را برای تحلیل دقیق منحنی‌های زیستی هموار سازند.

روش‌شناسان و متخصصان آمار 50%پژوهشگران بالینی و تجربی 30%بوم‌شناسان و روان‌شناسان 20%
روش‌شناسان و متخصصان آمار
بر این باورند که دوگانه‌سازی از نظر ریاضی غیرقابل دفاع است و با تولید نتایج مثبت کاذب به اعتبار علمی آسیب می‌زند.
پژوهشگران بالینی و تجربی
دسته‌بندی داده‌ها را پیوندی ضروری میان مفاهیم انتزاعی ریاضی و تصمیم‌گیری‌های درمانی در دنیای واقعی می‌دانند.
بوم‌شناسان و روان‌شناسان
تأکید دارند که مرزبندی‌های ساختگی، طیف‌های تدریجی پیش‌برنده رفتار انسانی و انتخاب طبیعی را پنهان می‌سازد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • داوران همتای ژورنال‌های علمی
  • مدرسان آمار در مقطع کارشناسی

منابع

پوشش منابع

10 منبع

3 دیدگاه شناسایی‌شده

روش‌شناسان و متخصصان آمار 50%پژوهشگران بالینی و تجربی 30%بوم‌شناسان و روان‌شناسان 20%
  1. [1]The BMJروش‌شناسان و متخصصان آمار

    The cost of dichotomising continuous variables

    مطالعه در The BMJ →
  2. [2]PubMedپژوهشگران بالینی و تجربی

    Consequences of dichotomization

    مطالعه در PubMed →
  3. [3]American Journal of Neuroradiologyپژوهشگران بالینی و تجربی

    Analysis by Categorizing or Dichotomizing Continuous Variables Is Inadvisable: An Example from the Natural History of Unruptured Aneurysms

    مطالعه در American Journal of Neuroradiology →
  4. [4]Proceedings of the Royal Society B: Biological Sciencesبوم‌شناسان و روان‌شناسان

    Overcoming the pitfalls of categorizing continuous variables in ecology, evolution and behaviour

    مطالعه در Proceedings of the Royal Society B: Biological Sciences →
  5. [5]BMC Medical Research Methodologyروش‌شناسان و متخصصان آمار

    Spurious interaction as a result of categorization

    مطالعه در BMC Medical Research Methodology →
  6. [6]Statistical Modeling, Causal Inference, and Social Scienceروش‌شناسان و متخصصان آمار

    Beyond the median split: Splitting a predictor into 3 parts

    مطالعه در Statistical Modeling, Causal Inference, and Social Science →
  7. [7]The Analysis Factorروش‌شناسان و متخصصان آمار

    Continuous and Categorical Variables: The Trouble with Median Splits

    مطالعه در The Analysis Factor →
  8. [8]ScienceDirectبوم‌شناسان و روان‌شناسان

    Median splits, Type II errors, and false–positive consumer psychology: Don't fight the power

    مطالعه در ScienceDirect →
  9. [9]PubMedپژوهشگران بالینی و تجربی

    Dichotomizing continuous predictors in multiple regression: a bad idea

    مطالعه در PubMed →
  10. [10]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.