فرمول H = -∑ p_i log_2 p_i: میانگین تعداد بیتها چگونه عدم قطعیت یک متغیر تصادفی را اندازه میگیرد؟
فرمول آنتروپی کلود شانون در سال ۱۹۴۸ ثابت میکند که اطلاعات با طول پیام تعیین نمیشود، بلکه به احتمال ریاضیاتیِ غافلگیری بستگی دارد. این معادله با محاسبه دقیق تعداد تصمیمات باینری لازم برای رفع عدم قطعیت، یک حد فیزیکی مطلق برای فشردهسازی دادهها تعیین میکند.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
- نظریهپردازان اطلاعات
- تمرکز بر محدودیتهای ریاضیاتی فشردهسازی و انتقال دادهها.
- مهندسان یادگیری ماشین
- استفاده از آنتروپی به عنوان یک معیار بهینهسازی برای آموزش مدلهای پیشبینیکننده.
- دانشمندان علوم شناختی
- زیر سوال بردن کاربرد این فرمول در هوش بیولوژیکی و معنای مفهومی.
دیدگاههایی که این گزارش پوشش نداده
- فیزیکدانان اطلاعات کوانتومی
این یک تصور رایج است که مقدار اطلاعات موجود در یک پیام صرفاً با طول آن تعیین میشود؛ به این معنا که یک سند ۱۰۰۰ کلمهای ذاتاً اطلاعات بیشتری نسبت به یک جمله ۱۰ کلمهای دارد. اما ریاضیات بنیادین ارتباطات مستقیماً با این موضوع در تضاد است. بر اساس قضیه سال ۱۹۴۸ کلود شانون، اطلاعات معیاری از حجم نیست، بلکه معیاری از غافلگیری است. اگر یک پیام طولانی کاملاً قابل پیشبینی باشد، حاوی صفر اطلاعات است. دادههای واقعی نشان میدهند که محتوای اطلاعاتی حقیقی هر متغیر تصادفی با آنتروپی آن کمیتسنجی میشود؛ معیاری که میانگین تعداد بیتهای لازم برای رفع عدم قطعیت پیامد آن را محاسبه میکند.[1][2]
فرمولی که این محدودیت را تعریف میکند $H = -\sum p_i \log_2 p_i$ است، که در آن $H$ نشاندهنده آنتروپی شانون، $p_i$ احتمال هر پیامد ممکن، و لگاریتم در مبنای ۲ نتیجه را بر حسب ارقام باینری یا همان بیتها پایهگذاری میکند. این معادله یک کف مطلق و ریاضیاتی برای میزان فشردهسازی دادهها بدون از دست دادن دقت تعیین میکند. با ضرب احتمال یک حالت در لگاریتم همان احتمال و جمع کردن آن در تمام حالتهای ممکن، این فرمول میانگین دقیق تعداد سوالات بله یا خیری را که برای تعیین حالت واقعی متغیر نیاز است، خروجی میدهد.[3][4]
برای درک این سازوکار، سادهترین متغیر تصادفی را در نظر بگیرید: پرتاب یک سکه سالم. احتمال آمدن شیر ۰٫۵ و احتمال آمدن خط نیز ۰٫۵ است. با قرار دادن این مقادیر در فرمول، آنتروپی دقیقاً ۱٫۰ بیت به دست میآید. دادهها نشان میدهند که برای رفع عدم قطعیت یک سکه سالم، دقیقاً به یک تصمیم باینری نیاز است. از آنجا که هر دو پیامد به یک اندازه محتمل هستند، سیستم برای یک متغیر دو حالته در حداکثر عدم قطعیت قرار دارد؛ به این معنی که گیرنده با مشخص شدن نتیجه، دقیقاً یک بیت کامل اطلاعات دریافت میکند.[4][5]
با این حال، زمانی که احتمالات نامتوازن میشوند، شواهد تغییر میکنند. اگر یک سکه وزندار در ۹۹ درصد مواقع روی شیر فرود بیاید، عدم قطعیت به شدت کاهش مییابد. فرمول، آنتروپی این سکه سوگیرانه را تنها ۰٫۰۸ بیت محاسبه میکند. از آنجا که نتیجه تقریباً به طور کامل قابل پیشبینی است، میانگین میزان غافلگیری - و در نتیجه میانگین اطلاعات تولید شده توسط هر پرتاب - به صفر نزدیک میشود. گیرندهای که پرتاب این سکه سوگیرانه را تماشا میکند، از هر پرتاب اطلاعات جدید بسیار کمی میآموزد و این امر اجازه میدهد تا دادهها به شدت فشرده شوند.[1][2]
این سازوکار مستقیماً به سیستمهای پیچیدهای مانند زبان انسان و انتقال متن تعمیم مییابد. اگر ۲۶ حرف الفبای انگلیسی کاملاً تصادفی ظاهر میشدند و هر کاراکتر شانس برابر ۱ در ۲۶ برای وقوع داشت، هر حرف دارای آنتروپی ۴٫۷۰ بیت بود. اما تحلیل تجربی متن انگلیسی الگوهای آماری دقیقی را آشکار میکند: حرف 'q' تقریباً همیشه با 'u' دنبال میشود و حروف صدادار با فرکانسهای بسیار قابل پیشبینی ظاهر میشوند. این قواعد ساختاری به این معناست که خواننده پیش از آنکه حرف بعدی حتی آشکار شود، اطلاعات جزئی درباره آن دارد که این امر عدم قطعیت کلی توالی را کاهش میدهد.[4]
با در نظر گرفتن این احتمالات، شانون محاسبه کرد که آنتروپی واقعی زبان انگلیسی تنها ۲٫۶۲ بیت به ازای هر حرف است. این رقم نشان میدهد که الگوها عدم قطعیت را کاهش میدهند و به یک سیستم بسیار ساختاریافته اجازه میدهند تا پیامهای پیچیده را با استفاده از اطلاعات پایهای نسبتاً کمی منتقل کند. از آنجا که آنتروپی واقعی تقریباً نیمی از حداکثر نظری است، متن انگلیسی حاوی افزونگی قابل توجهی است. این افزونگی دقیقاً همان چیزی است که به الگوریتمهای مدرن فشردهسازی فایل، مانند ZIP یا gzip، اجازه میدهد تا فایلهای متنی را بدون از دست دادن حتی یک کاراکتر، به کسری از اندازه اصلی خود کوچک کنند.[3][4]
با در نظر گرفتن این احتمالات، شانون محاسبه کرد که آنتروپی واقعی زبان انگلیسی تنها ۲٫۶۲ بیت به ازای هر حرف است.
پیامدهای این فرمول، بستر زیرساختهای دیجیتال مدرن را تشکیل میدهد. همانطور که تارا جاویدی، نظریهپرداز اطلاعات، اشاره میکند: «شانون نشان داد که چیزی شبیه به سرعت نور وجود دارد، یک محدودیت بنیادین.» نرخ آنتروپی یک منبع داده، حداقل ظرفیت مطلق کانال مورد نیاز برای انتقال قابل اعتماد آن را دیکته میکند و تضمین میکند که «آنتروپی شانون یک محدودیت بنیادین برای میزان فشردهسازی یک منبع، بدون خطر اعوجاج یا از دست رفتن داده است.» هیچ الگوریتم فشردهسازی بدون افتی نمیتواند یک توالی را در تعداد بیتهایی کمتر از آنتروپی شانون آن رمزگذاری کند.[1][2][4]
در یادگیری ماشین، این فرمول برای ارزیابی کیفیت مدلهای پیشبینیکننده تطبیق داده شده است. درختهای تصمیم از مفهومی به نام بهره اطلاعاتی استفاده میکنند که میزان کاهش آنتروپی حاصل از تقسیم یک مجموعه داده بر اساس یک ویژگی خاص را اندازه میگیرد. الگوریتم، آنتروپی مجموعه داده را قبل از تقسیم محاسبه کرده و آنتروپی وزندار زیرمجموعههای حاصل را از آن کم میکند. با انتخاب تقسیمی که این بهره اطلاعاتی را به حداکثر میرساند، مدل عدم قطعیت باقیمانده را به حداقل رسانده و به طور موثری قابل پیشبینیترین زیرمجموعههای داده را برای بهبود دقت طبقهبندی جدا میکند.[5]
به طور مشابه، شبکههای عصبی برای کمیتسنجی واگرایی بین احتمالات پیشبینیشده خود و توزیع واقعی دادههای آموزشی، به شدت به تابع زیان آنتروپی متقاطع متکی هستند. شبکه با جریمه کردن پیشبینیهای مطمئن اما نادرست به صورت نمایی بیشتر از پیشبینیهای نامطمئن، آنتروپی داخلی خود را به حداقل میرساند. همانطور که مدل در طی هزاران دوره آموزش میبیند، به طور پیوسته وزنهای داخلی خود را تنظیم میکند تا توزیع احتمال واقعی مجموعه داده را بهتر منعکس کند و زیان آنتروپی متقاطع را به سمت حداقل نظری تعیینشده توسط معادله اصلی شانون در سال ۱۹۴۸ سوق دهد.[3][5]
با وجود کاربرد جهانی آن، شواهدِ تاییدکننده سودمندی این فرمول در برخی حوزهها همچنان ضعیف است. شانون به صراحت این معیار را برای حل مشکل مهندسی انتقال سیگنال طراحی کرد و عمداً معنای مفهومی پیام را کنار گذاشت. این فرمول با یک توالی از کاراکترهای تصادفی و یک خط از نمایشنامه شکسپیر دقیقاً یکسان برخورد میکند، به شرطی که توزیع احتمال آنها با هم مطابقت داشته باشد. این تمرکز دقیق بر احتمال نحوی به این معناست که آنتروپی شانون نمیتواند بین خرد عمیق و چرندیات محض تمایز قائل شود، تا زمانی که هر دو توالی به یک اندازه غیرقابل پیشبینی باشند.[1][2]
این کوری معنایی، توانایی فرمول را برای اندازهگیری سودمندی واقعی اطلاعات در سیستمهای بیولوژیکی یا شناختی محدود میکند. در حالی که عصبشناسان تلاش میکنند از آنتروپی شانون برای نقشهبرداری از ظرفیت پردازش اطلاعات مغز انسان استفاده کنند، دادهها پر از نویز هستند و همبستگیها ضعیفاند. مغز، اطلاعات را به عنوان توالیای از نمادهای مستقل با توزیع یکسان پردازش نمیکند. در عوض، سیستمهای شناختی به زمینه، حافظه و تجسم فیزیکی متکی هستند؛ متغیرهایی که در برابر دستهبندی تمیز در توزیعهای احتمال گسسته مقاومت میکنند.[3][6]
علاوه بر این، محاسبه آنتروپی دقیق متغیرهای پیوسته و بسیار پیچیده نیازمند انتگرالگیری روی توابع چگالی احتمال بینهایت است؛ فرآیندی که به عنوان آنتروپی تفاضلی شناخته میشود. در عمل، این امر به تقریبهای ریاضیاتی قابل توجهی نیاز دارد که عدم قطعیت را به محدودیتهای دقیق فشردهسازی برای سیگنالهای آنالوگ پیوسته مانند صدا یا ویدیوی با کیفیت بالا وارد میکند. از آنجا که یک سیگنال کاملاً پیوسته میتواند بینهایت حالت به خود بگیرد، آنتروپی مطلق آن از نظر فنی بینهایت است و مهندسان را مجبور میکند تا به جای محدودیتهای کاملاً بدون افت تعریفشده توسط فرمول گسسته، به کوانتیزهسازی و آستانههای افت قابل قبول تکیه کنند.[1][2]
این فرمول همچنین فرض میکند که توزیع احتمال منبع، ایستا است و هم برای فرستنده و هم برای گیرنده کاملاً شناخته شده است. در شبکههای ارتباطی دنیای واقعی، احتمالات به صورت پویا در نوسان هستند و به الگوریتمهای فشردهسازی تطبیقی نیاز دارند که آنتروپی را در لحظه تخمین بزنند. کف نظری تعیینشده توسط شانون به دلیل این سربار عملیاتی به ندرت در عمل به دست میآید. فشردهسازی دادهها مستلزم ارسال دیکشنری فشردهسازی در کنار پیام است که یک جریمه ساختاری اضافه میکند و نرخ انتقال در دنیای واقعی را کمی بالاتر از حد مطلق ریاضیاتی نگه میدارد.[4][5]
فرمول $H = -\sum p_i \log_2 p_i$ همچنان یک پیروزی تعیینکننده در ریاضیات قرن بیستم باقی مانده است. این معادله با اثبات اینکه اطلاعات یک ویژگی فیزیکی و قابل کمیتسنجی است که به احتمال گره خورده، ارتباطات را از یک هنر کیفی به یک علم دقیق تبدیل کرد. مرز بعدی در آشتی دادن این معیار نحوی عدم قطعیت با معنای مفهومیای است که با خود حمل میکند؛ چالشی که همچنان محرک تحقیقات در هوش مصنوعی و علوم شناختی است. تا آن زمان، هر بیت دادهای که در سراسر جهان منتقل میشود، محدود به مرزهایی است که شانون محاسبه کرده است.[1][6]
نکات کلیدی
- آنتروپی شانون ثابت میکند که اطلاعات معیاری از غافلگیری است، نه طول فیزیکی یک پیام.
- این فرمول حداقل تعداد مطلق بیتهای مورد نیاز برای فشردهسازی و انتقال دادهها بدون افت کیفیت را محاسبه میکند.
- پرتاب یک سکه سالم دقیقاً دارای ۱٫۰ بیت آنتروپی است، در حالی که رویدادهای بسیار قابل پیشبینی آنتروپی نزدیک به صفر دارند.
- یادگیری ماشین برای آموزش مدلها به آنتروپی متکی است و از آن برای اندازهگیری و به حداقل رساندن عدم قطعیت شبکه استفاده میکند.
- 1.0 bit
- آنتروپی پرتاب یک سکه سالم
- 2.62 bits
- آنتروپی محاسبهشده برای هر حرف زبان انگلیسی
- 4.70 bits
- حداکثر آنتروپی نظری یک الفبای تصادفی ۲۶ حرفی
اصطلاحات کلیدی
- آنتروپی شانون
- یک معیار ریاضیاتی برای میانگین عدم قطعیت یا محتوای اطلاعاتی در یک متغیر تصادفی که بر حسب بیت بیان میشود.
- بیت
- واحد بنیادین اطلاعات که نشاندهنده یک انتخاب باینری واحد بین دو پیامد با احتمال برابر است.
- بهره اطلاعاتی
- کاهش آنتروپی حاصل از یادگیری حالت یک متغیر مرتبط که معمولاً برای آموزش درختهای تصمیم استفاده میشود.
- زیان آنتروپی متقاطع
- معیاری که در یادگیری ماشین برای اندازهگیری تفاوت بین احتمالات پیشبینیشده مدل و توزیع واقعی دادهها استفاده میشود.
آنچه نمیدانیم
- چگونه میتوان «معنای» مفهومی یا سودمندی اطلاعات را به جای صرفاً احتمال نحوی آن، از نظر ریاضیاتی کمیتسنجی کرد.
- ظرفیت دقیق پردازش اطلاعات و محدودیتهای آنتروپی شبکههای عصبی مغز انسان.
- آیا میتوان با استفاده از درهمتنیدگی کوانتومی و نظریه اطلاعات کوانتومی، از محدودیتهای بنیادین آنتروپی شانون عبور کرد یا خیر.
منابع
[1]Bell System Technical Journalنظریهپردازان اطلاعاتA Mathematical Theory of Communication
مطالعه در Bell System Technical Journal →
[2]arXivمهندسان یادگیری ماشینUnderstanding Shannon's Entropy metric for Information
مطالعه در arXiv →
[3]Zenodoدانشمندان علوم شناختیA summary of Claude Shannon Information Theory
مطالعه در Zenodo →
[4]Quanta Magazineنظریهپردازان اطلاعاتHow Shannon Entropy Imposes Fundamental Limits on Communication
مطالعه در Quanta Magazine →
[5]Machine Learning Masteryمهندسان یادگیری ماشینA Gentle Introduction to Information Entropy
مطالعه در Machine Learning Mastery →
[6]تیم سردبیری کوهستاندانشمندان علوم شناختیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در علم
مشاهده همه →علم مواد
معادله هال-پچ: اندازه دانهها چگونه استحکام مواد بلوری را تعیین میکند
9 منبع
صفحات یخی قطبی
تصاویر ماهوارهای نشان میدهند که از سال ۱۹۷۹ تاکنون ۱۱ تریلیون تن از یخهای قطبی از دست رفته است؛ عامل اصلی: شتاب گرفتن حرکت یخچالها
3 منبع
تاخوردگی پروتئین
بشکه دو محفظهای GroEL/GroES: هیدرولیز ATP چگونه پلیپپتیدهای بدتاخورده را تا میکند
10 منبع
انتقال سیناپسی
کمپلکس سیناپتوتاگمین-اسنیر: چگونه سیگنال کلسیم باعث همجوشی میلیثانیهای وزیکولهای سیناپسی میشود
9 منبع
هر زاویه. هر روز.
دریافت علم اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





