رفتن به محتوای اصلی
Koohestun
توضیح کوهستاننظریه آماریگزارش تشریحی· 5 دقیقه مطالعه· در تحلیل داده

چرا بازه اطمینان ۹۵ درصدی به معنای احتمال ۹۵ درصدی برای یافتن میانگین واقعی در آن محدوده نیست؟

رایج‌ترین معیار در علم داده و تحقیقات پزشکی تقریباً توسط همه اشتباه درک می‌شود. بازه اطمینان ۹۵ درصدی در واقع میزان قابلیت اطمینان فرآیند اندازه‌گیری را توصیف می‌کند، نه احتمال قرار گرفتن مقدار واقعی در یک محدوده خاص را.

به قلم ندا وزیری

سنت‌گرایان فراوانی‌گرا 40%اصلاح‌طلبان بیزی 35%متخصصان کاربردی 25%
سنت‌گرایان فراوانی‌گرا
استدلال می‌کنند که دقت آماری ایجاب می‌کند پارامتر جامعه به عنوان یک ثابتِ بی‌حرکت و تغییرناپذیر در نظر گرفته شود.
اصلاح‌طلبان بیزی
استدلال می‌کنند که اگر متخصصان به طور شهودی می‌خواهند احتمال یک پارامتر را بدانند، باید بازه‌های فراوانی‌گرا را رها کرده و به سراغ بازه‌های معتبر بیزی بروند.
متخصصان کاربردی
بر کاهش آسیب‌های تجاری و بالینی ناشی از تصمیم‌گیری تیم‌ها بر اساس معیارهای اشتباه درک‌شده تمرکز دارند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • توسعه‌دهندگان نرم‌افزاری که پکیج‌های آماری را می‌سازند
  • سردبیران مجلات علمی که استانداردهای گزارش‌دهی را اعمال می‌کنند

نکات کلیدی

  • بازه اطمینان ۹۵ درصدی به این معنا نیست که ۹۵ درصد احتمال دارد میانگین واقعی درون آن محدوده خاص باشد.
  • در آمار فراوانی‌گرا (Frequentist)، میانگین واقعی یک ثابتِ تغییرناپذیر است؛ یعنی یا درون بازه محاسبه‌شده قرار دارد (احتمال ۱۰۰ درصد) یا بیرون آن است (احتمال صفر درصد).
  • عدد ۹۵ درصد نشان‌دهنده قابلیت اطمینانِ بلندمدتِ رویه آماری است، نه بازه خاصی که از یک آزمایش واحد به دست آمده است.
  • مطالعات نشان می‌دهد که ۹۷ درصد از محققان، از جمله مدرسان آمار، به طور مداوم این معیار را اشتباه تفسیر می‌کنند.

محدودیت الزام‌آور آمار فراوانی‌گرا (Frequentist) این است که پارامتر واقعی جامعه، یک هدف ثابت و بی‌حرکت در جهان است، در حالی که داده‌هایی که ما جمع‌آوری می‌کنیم تنها یک تجلی تصادفی و موقتی از آن است. اگر این شرط برقرار باشد — که در چارچوب‌های آماری استاندارد همیشه همین‌طور است — آنگاه مشهورترین معیار در علم نمی‌تواند آن معنایی را داشته باشد که تقریباً همه تصور می‌کنند.[2]

در داشبوردهای تست A/B، نتایج کارآزمایی‌های بالینی و پیش‌بینی‌های اقتصادی، بازه اطمینان ۹۵ درصدی استاندارد طلایی برای بیان عدم قطعیت است. با این حال، این معیار به طور معمول در زبان روزمره به عنوان یک تضمین ترجمه می‌شود: «۹۵ درصد احتمال دارد که میانگین واقعی در این محدوده خاص قرار گیرد.»[1][4]

این ترجمه از نظر ریاضی کاملاً غلط است. همان‌طور که سریواتسا ناراسیما (Srivatsa Narasimha) در یک بررسی روش‌شناختی در ماه مه ۲۰۲۶ نوشت: «خیر، یک بازه اطمینان ۹۵ درصدی به این معنا نیست که ۹۵ درصد احتمال دارد حق با شما باشد!» این خطا از یک ناهماهنگی بنیادین نشأت می‌گیرد؛ ناهماهنگی میان آنچه انسان‌ها به طور شهودی می‌خواهند بدانند و آنچه آمار فراوانی‌گرا واقعاً می‌تواند محاسبه کند.[3]

انسان‌ها ذاتاً به دنبال یک «بازه معتبر بیزی» (Bayesian credible interval) هستند؛ یعنی احتمال اینکه با توجه به داده‌های مشاهده‌شده، یک پارامتر در محدوده خاصی قرار گیرد. اما در عوض، یک «بازه اطمینان فراوانی‌گرا» به آن‌ها داده می‌شود که احتمالِ داده‌ها را با فرض یک پارامتر ثابت اندازه‌گیری می‌کند. در این چارچوب، میانگین واقعی حرکت نمی‌کند و هیچ توزیع احتمالی ندارد.[2]

از آنجا که میانگین واقعی یک ثابتِ تغییرناپذیر است، یا درون بازه خاصی که به تازگی محاسبه کرده‌اید قرار دارد، یا ندارد. بنابراین، احتمال واقعیِ اینکه بازه محاسبه‌شده شما حاوی میانگین واقعی باشد، دقیقاً صفر یا ۱۰۰ درصد است. ما فقط نمی‌دانیم کدام یک از این دو حالت رخ داده است.[2][4]

آنچه عدد «۹۵ درصد» در واقع توصیف می‌کند، قابلیت اطمینان بلندمدتِ رویه‌ای است که برای رسم بازه استفاده شده، نه خودِ بازه. یک بازی پرتاب حلقه را تصور کنید که در آن، میخِ هدف (که نشان‌دهنده میانگین واقعی است) به زمین پیچ شده است. شما ۱۰۰ حلقه را که نشان‌دهنده ۱۰۰ بازه اطمینان مختلف هستند، به سمت این میخ پرتاب می‌کنید.[1][5]

اگر یک آزمایش ۱۰۰ بار تکرار شود، ۹۵ مورد از بازه‌های تولیدشده حاوی میانگین واقعی خواهند بود. این ۹۵ درصد به کل فرآیند اعمال می‌شود، نه به یک بازه واحد.
آنچه عدد «۹۵ درصد» در واقع توصیف می‌کند، قابلیت اطمینان بلندمدتِ رویه‌ای است که برای رسم بازه استفاده شده، نه خودِ بازه.

سطح اطمینان ۹۵ درصدی به این معناست که فرآیند ساخت و پرتاب حلقه‌ها تضمین می‌کند که ۹۵ حلقه از ۱۰۰ حلقه با موفقیت دور میخ قرار می‌گیرند. با این حال، وقتی یک حلقه خاص روی زمین افتاد، یا میخ را در بر گرفته یا نگرفته است. شما نمی‌توانید به یک حلقه تکی که روی چمن افتاده نگاه کنید و بگویید: «۹۵ درصد احتمال دارد که میخ داخل این حلقه باشد.» این اتفاق از قبل رخ داده و تمام شده است.[1][4]

این تمایز صرفاً یک وسواس آکادمیک نیست؛ بلکه پیامدهای جدی برای نحوه ارزیابی شواهد دارد. یک مقاله اجماع برجسته در سال ۲۰۱۶ در مجله اپیدمیولوژی اروپا (European Journal of Epidemiology) توسط ساندر گرینلند (Sander Greenland) و همکارانش هشدار داد که تفسیر اشتباه این بازه‌ها منجر به خطاهای عمیقی در ادبیات پزشکی می‌شود.[7]

نویسندگان به صراحت اشاره کردند که «۹۵ درصد تنها به این موضوع اشاره دارد که اگر تمام مفروضاتِ استفاده‌شده برای محاسبه بازه‌ها درست باشد، بازه‌های اطمینان ۹۵ درصدی محاسبه‌شده از مطالعات بسیار زیاد، هر چند وقت یک‌بار اندازه واقعی را در بر می‌گیرند.» این معیار هیچ احتمالی را به اعداد خاصِ چاپ‌شده در یک مطالعه مشخص اختصاص نمی‌دهد.[7]

با وجود دهه‌ها هشدار، این تصور غلط تقریباً فراگیر است. مطالعه‌ای که توسط انجمن سایکونومیک برجسته شده، نشان داد که ۹۷ درصد از محققان — از جمله اساتیدی که فعالانه در حال تدریس آمار هستند — در زمان آزمایش، حداقل یک گزاره نادرست را در مورد بازه‌های اطمینان تایید کردند.[9]

مطالعه‌ای که توسط انجمن سایکونومیک (Psychonomic Society) برجسته شده، نشان می‌دهد که ۹۷ درصد از محققان حداقل یک گزاره نادرست را در مورد بازه‌های اطمینان تایید می‌کنند.

آژانس‌های بهداشت عمومی روزانه با این مشکلِ ترجمه و تفسیر مواجه هستند. وزارت بهداشت ایالت نیویورک که برای ردیابی بیماری‌های مزمن به این معیارها متکی است، به صراحت به تحلیلگران آموزش می‌دهد که این بازه، حاشیه خطایی را در اطراف یک برآورد نمونه‌ای ارائه می‌دهد، اما نمی‌تواند احتمالی را به خود پارامتر جامعه نسبت دهد.[6]

به طور مشابه، موسسه ملی استاندارد و فناوری (NIST) حدهای اطمینان را دقیقاً به عنوان مرزهای یک رویه تعریف می‌کند که اگر بی‌نهایت بار تکرار شود، میانگین واقعی را در درصد مشخصی از مواقع در بر می‌گیرد.[5]

در محیط‌های فناوری مدرن، پلتفرم‌هایی مانند Statsig و MetricGate باید داشبوردهای تست A/B خود را به گونه‌ای فعالانه طراحی کنند تا از این جهش احتمالیِ دقیق توسط مدیران محصول هنگام مشاهده نتایج آزمایش جلوگیری کنند. تا آوریل ۲۰۲۶، MetricGate خاطرنشان کرد که تفسیر اشتباه این بازه اغلب باعث می‌شود تیم‌ها نسخه‌های بازنده را فقط به این دلیل که بازه «عمدتاً مثبت» به نظر می‌رسید، راه‌اندازی کنند.[1][8]

هسته اصلی این سوءتفاهم از آنجا ناشی می‌شود که با یک پارامتر ثابتِ جامعه آماری، طوری رفتار می‌شود که گویی دارای توزیع احتمال است.

تداوم این خطا، شکافی را در آموزش آمار برجسته می‌کند: ما ریاضیات رویکرد فراوانی‌گرا را آموزش می‌دهیم، اما در آموزش محدودیت‌های فلسفی آن ناکام می‌مانیم. ریاضیات ایجاب می‌کند که پارامتر ثابت باشد، اما شهود انسانی می‌طلبد که سیال باشد. تا زمانی که این شکاف پر نشود، بازه اطمینان ۹۵ درصدی همچنان معیاری در علم داده باقی خواهد ماند که با بیشترین اطمینان، اشتباه درک می‌شود.[3][10]

چرا مهم است

وقتی محققان و مدیران کسب‌وکار بازه‌های اطمینان را با احتمالات اشتباه می‌گیرند، در مورد نتایج کارآزمایی‌های بالینی، تست‌های A/B و تصمیمات کلان خود بیش از حد ابراز اطمینان می‌کنند. درک سازوکار واقعی این معیار، از نتیجه‌گیری‌های مثبت کاذب و پرهزینه جلوگیری کرده و تیم‌ها را وادار می‌کند تا شواهد را با دقت و سخت‌گیری بیشتری ارزیابی کنند.

منابع

پوشش منابع

10 منبع

3 دیدگاه شناسایی‌شده

سنت‌گرایان فراوانی‌گرا 40%اصلاح‌طلبان بیزی 35%متخصصان کاربردی 25%
  1. [1]Statsigمتخصصان کاربردی

    How to interpret a 95% confidence interval: A guide for analysts

    مطالعه در Statsig
  2. [2]Cross Validatedسنت‌گرایان فراوانی‌گرا

    Why does a 95% Confidence Interval (CI) not imply a 95% chance of containing the mean?

    مطالعه در Cross Validated
  3. [3]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان
  4. [4]Statistics Solutionsمتخصصان کاربردی

    Misconceptions about Confidence Intervals

    مطالعه در Statistics Solutions
  5. [5]NIST/ITLسنت‌گرایان فراوانی‌گرا

    1.3.5.2. Confidence Limits for the Mean

    مطالعه در NIST/ITL
  6. [6]New York State Department of Healthسنت‌گرایان فراوانی‌گرا

    Confidence Intervals - Statistics Teaching Tools

    مطالعه در New York State Department of Health
  7. [7]European Journal of Epidemiologyاصلاح‌طلبان بیزی

    Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations

    مطالعه در European Journal of Epidemiology
  8. [8]MetricGateمتخصصان کاربردی

    Confidence Interval Interpretation Mistakes

    مطالعه در MetricGate
  9. [9]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان
  10. [10]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.