چرا در برنامهنویسی مدرن، حاصل ۰.۱ + ۰.۲ برابر با ۰.۳ نیست؟
استاندارد IEEE 754 کامپیوترها را مجبور میکند تا اعداد حقیقی نامتناهی را در فضای محدود ۶۴ بیتی تخمین بزنند، که این امر منجر به خطاهای گرد کردن بسیار کوچکی میشود که در محاسبات مالی و علمی انباشته میگردند.
به قلم آیدا امینی
این خبر را به اشتراک بگذارید
- معماران سختافزار
- سرعت محاسباتی و کارایی سیلیکون را بر دقت مبنای ۱۰ اولویت میدهند و استدلال میکنند که تخمینها برای عملکرد ضروری هستند.
- توسعهدهندگان نرمافزار مالی
- محاسبات ممیز شناور را به طور کامل برای ارز رد میکنند و برای جلوگیری از خطاهای انباشته در دفاتر حسابداری، به کتابخانههای اعشاری با دقت دلخواه متکی هستند.
- محققان محاسبات علمی
- به دامنه دینامیکی عظیم اعداد ممیز شناور متکی هستند اما برای جلوگیری از حذف فاجعهبار در شبیهسازیها، به طور فعال مرزهای خطا را مدیریت میکنند.
اصطلاحات کلیدی
- ممیز شناور (Floating-point)
- روشی برای نمایش اعداد حقیقی در محاسبات که با معاوضه دقت با دامنه دینامیکی، طیف وسیعی از مقادیر را پشتیبانی میکند.
- مانتیس (Significand)
- بخشی از یک عدد ممیز شناور که ارقام معنیدار آن را در بر میگیرد و دقت مقدار را تعیین میکند.
- اپسیلون ماشین (Machine epsilon)
- کران بالای خطای نسبی ناشی از گرد کردن در محاسبات ممیز شناور؛ کوچکترین تفاوتی که ماشین میتواند تشخیص دهد.
- حذف فاجعهبار (Catastrophic cancellation)
- از دست دادن شدید دقت که زمانی رخ میدهد که دو عدد ممیز شناور تقریباً مساوی از هم کم میشوند و تنها خطاهای گرد کردن آنها باقی میماند.
نکات کلیدی
- پردازندههای مدرن از استاندارد IEEE 754 برای نمایش اعداد حقیقی دقیقاً در ۶۴ بیت حافظه استفاده میکنند.
- از آنجا که کامپیوترها بر مبنای دودویی (باینری) محاسبه میکنند، کسرهای اعشاری ساده مانند ۰.۱ به کسرهای تکرارشوندهای تبدیل میشوند که باید کوتاه شوند.
- حاصل جمع ۰.۱ و ۰.۲ برابر با ۰.۳۰۰۰۰۰۰۰۰۰۰۰۰۰۰۰۴ میشود، زیرا سختافزار در حال جمع کامل دو تخمین ناقص است.
- برنامههای مالی با استفاده از کتابخانههای اعشاری با دقت دلخواه (arbitrary-precision decimal) از این مشکل دوری میکنند، در حالی که مدلهای علمی به دلیل دامنه دینامیکی عظیم خود به ممیزهای شناور متکی هستند.
کمیته IEEE 754 نحوه درک سیلیکون مدرن از جهان فیزیکی را دیکته میکند. هنگامی که معماران سختافزار در شرکتهایی مانند اینتل (Intel)، اِیاِمدی (AMD) یا اپل (Apple) پردازنده جدیدی طراحی میکنند، دقیقاً ۶۴ بیت حافظه را برای نمایش هر عدد حقیقی، از جرم یک الکترون گرفته تا فاصله بین کهکشانها، اختصاص میدهند. آنها این مصالحه را در استاندارد IEEE 754، که آخرین بار در سال ۲۰۱۹ بازنگری شد، تدوین کردهاند.[2]
این محدودیت ۶۴ بیتی یک مرز ریاضی اساسی ایجاد میکند. بین ۰.۱ و ۰.۲ بینهایت عدد حقیقی وجود دارد، اما یک رجیستر ۶۴ بیتی تنها میتواند دقیقاً ۱۸٬۴۴۶٬۷۴۴٬۰۷۳٬۷۰۹٬۵۵۱٬۶۱۶ حالت منحصر به فرد را نمایش دهد. برای جا دادن بینهایت در سیلیکون محدود، سختافزار مجبور است تقریباً هر عددی را که با آن مواجه میشود، تخمین بزند و آن را به نزدیکترین مقدار دودویی موجود تبدیل کند.[1][3]
این مشکل بلافاصله با کسرهای اعشاری ساده خود را نشان میدهد. در ریاضیات مبنای ۱۰، کسر ۱/۱۰ به صورت ۰.۱ نوشته میشود. اما کامپیوترها بر مبنای ۲ (دودویی) کار میکنند. در مبنای دودویی، ۰.۱ به یک کسر تکرارشونده تبدیل میشود: ۰.۰۰۰۱۱۰۰۱۱۰۰۱۱ که تا ابد ادامه مییابد و نمیتوان آن را به طور کامل حل کرد.
از آنجا که پردازنده تنها ۵۳ بیت را برای مانتیس (significand) – بخشی از عدد ممیز شناور که ارقام معنیدار را در خود نگه میدارد – اختصاص داده است، در نهایت باید این دنباله نامتناهی را کوتاه کند. سختافزار کسر دودویی تکرارشونده را در بیت ۵۳ گرد میکند و مقدار را به طور دائمی تغییر میدهد، حتی پیش از آنکه هرگونه عملیات ریاضی انجام شود.[2][4]
دیوید گلدبرگ (David Goldberg) در مقاله بنیادی خود در سال ۱۹۹۱ در ACM Computing Surveys اشاره میکند که «محاسبات ممیز شناور از نظر بسیاری از افراد موضوعی تخصصی و پیچیده تلقی میشود»، اما پیامدهای این کوتاه کردن بسیار مشهود است. وقتی یک توسعهدهنده از برنامه میخواهد ۰.۱ را ذخیره کند، واحد پردازش مرکزی (CPU) در واقع مقدار 0.1000000000000000055511151231257827021181583404541015625 را ذخیره میکند.[1]
همین خطای کوانتیزاسیون (quantization error) در مورد ۰.۲ نیز صدق میکند، که در حافظه به صورت 0.200000000000000011102230246251565404236316680908203125 ذخیره میشود. هنگامی که واحد منطق و محاسبات (ALU) این دو تخمین را با هم جمع میکند، عملیات ریاضی را به طور کامل بر روی ورودیهای ناقص اجرا میکند.
حاصل جمع دقیق آن دو مقدار ذخیرهشده برابر است با 0.3000000000000000444089209850062616169452667236328125. هنگامی که زبان برنامهنویسی این نتیجه را برای نمایش روی صفحه کاربر به مبنای ۱۰ برمیگرداند، آن را به نزدیکترین عدد اعشاری قابل نمایش گرد میکند و نتیجه بدنام 0.30000000000000004 حاصل میشود.[6]
حاصل جمع دقیق آن دو مقدار ذخیرهشده برابر است با 0.3000000000000000444089209850062616169452667236328125.
این یک باگ در پایتون (Python)، جاوا اسکریپت (JavaScript) یا سی پلاس پلاس (++C) نیست. این رفتار مورد نظر استاندارد IEEE 754 است که در ابتدا در سال ۱۹۸۵ تحت رهبری ویلیام کاهان (William Kahan)، برنده جایزه تورینگ، تدوین شد. کمیته عمداً سرعت محاسباتی و دامنه دینامیکی عظیم را بر دقت کامل مبنای ۱۰ ترجیح داد.[1][4]
با استانداردسازی این فرمت، تولیدکنندگان سختافزار توانستند واحدهای ممیز شناور اختصاصی (FPUs) را مستقیماً در سیلیکون بسازند. این امر به پردازندههای مدرن اجازه میدهد تا میلیاردها مورد از این تخمینها را در ثانیه اجرا کنند و رندرینگ سهبعدی بیدرنگ، کدگذاری ویدئو و شبیهسازیهای پیچیده فیزیک را بدون کند کردن CPU ممکن سازند.
با این حال، این مصالحه بر سر سرعت در نرمافزارهای مالی فاجعهبار میشود. یک برنامه بانکی که از اعداد ممیز شناور برای محاسبه نرخ بهره ۵ درصدی بر روی موجودی ۱۰٬۰۰۰ دلاری استفاده میکند، در نهایت این خطاهای گرد کردن میکروسکوپی را به کسری از سنتهای مفقود انباشته میکند و دفاتر حسابداری سختگیرانه را نقض مینماید.[5]
اِوان جونز (Evan Jones)، مهندس نرمافزار، استدلال میکند: «شما میتوانید از اعداد ممیز شناور برای پول استفاده کنید»، به شرطی که توسعهدهنده مقادیر را به شدت به اعداد صحیح زیر ۲ به توان ۵۳ (دقیقاً ۹٬۰۰۷٬۱۹۹٬۲۵۴٬۷۴۰٬۹۹۲) محدود کند تا به طور کامل از کوانتیزاسیون کسری جلوگیری شود. اما اکثر مؤسسات مالی به جای آن، استفاده از کتابخانههای اعشاری با دقت دلخواه را الزامی میدانند و سرعت خام پردازنده را با قطعیت ریاضی معاوضه میکنند.[5]
در محاسبات علمی، شرایط متفاوت است. محققانی که مدلهای دینامیک سیالات یا آب و هوا را اجرا میکنند، به دلیل دامنه دینامیکی عظیم محاسبات ممیز شناور به آن متکی هستند. یک ممیز شناور ۶۴ بیتی میتواند مقادیری به کوچکی ۲.۲۲ × ۱۰ به توان منفی ۳۰۸ و به بزرگی ۱.۷۹ × ۱۰ به توان ۳۰۸ را نمایش دهد، که به یک شبیهسازی واحد اجازه میدهد هم ذرات میکروسکوپی و هم جرمهای سیارهای را ردیابی کند.
خطر در این شبیهسازیها «حذف فاجعهبار» (catastrophic cancellation) است. اگر یک مدل فیزیکی دو عدد ممیز شناور تقریباً مساوی را از هم کم کند، ارقام معنیدار حذف میشوند و تنها خطای کوانتیزاسیون باقی میماند. این خطا سپس در محاسبات بعدی منتشر میشود و به طور بالقوه کل شبیهسازی را بیاعتبار میسازد.[1]
برای کاهش این مشکل، دانشمندان داده به مفهوم اپسیلون ماشین (machine epsilon) – کران بالای خطای نسبی تخمین – متکی هستند. برای ممیزهای شناور با دقت مضاعف (double-precision)، اپسیلون ماشین ۲ به توان منفی ۵۲ یا تقریباً ۲.۲۲ × ۱۰ به توان منفی ۱۶ است. الگوریتمها باید به صراحت طوری طراحی شوند که خطاهای تجمعی را به خوبی بالاتر از این آستانه نگه دارند.[3][6]
در حالی که صنعت محاسبات به سمت هوش مصنوعی حرکت میکند، استاندارد IEEE 754 دوباره در حال انطباق است. مدلهای یادگیری ماشین به ۵۳ بیت دقت نیاز ندارند؛ آنها به توان عملیاتی عظیم نیاز دارند. این امر باعث شده است تا فرمتهای ممیز شناور ۱۶ بیتی و ۸ بیتی کوچکتر پذیرفته شوند، که دقت را با توانایی جای دادن پارامترهای بیشتر در حافظه پردازنده گرافیکی (GPU) معاوضه میکنند.[2]
عجیب بودن ۰.۱ به علاوه ۰.۲ یک ویژگی دائمی در علوم کامپیوتر باقی مانده است. این موضوع به عنوان درسی اجباری برای هر برنامهنویس تازهکار عمل میکند: ماشین ریاضیات انسانی را درک نمیکند، بلکه تنها مرزهای محدود سیلیکونی را میفهمد که برای احترام به آنها مهندسی شده است.[7]
چرا مهم است
از آنجایی که تقریباً تمام پردازندههای مرکزی مدرن و زبانهای برنامهنویسی به طور پیشفرض از این استاندارد استفاده میکنند، توسعهدهندگانی که ناآگاهانه از محاسبات ممیز شناور (floating-point) برای ارز یا مکانیک دقیق مداری استفاده میکنند، در معرض خطر خطاهای انباشته فاجعهبار قرار میگیرند.
منابع
[1]Oracleمحققان محاسبات علمیWhat Every Computer Scientist Should Know About Floating-Point Arithmetic
مطالعه در Oracle →
[2]IEEE SAمعماران سختافزارIEEE 754-2019 - IEEE Standard for Floating-Point Arithmetic
مطالعه در IEEE SA →
[3]Wolfram MathWorldFloating-Point Representation
مطالعه در Wolfram MathWorld →
[4]GeeksforGeeksIEEE Standard 754 Floating Point Numbers
مطالعه در GeeksforGeeks →
[5]evanjones.caتوسعهدهندگان نرمافزار مالیYou can use floating-point numbers for money!
مطالعه در evanjones.ca →
[6]University of Marylandمعماران سختافزارThe IEEE 754 Format
مطالعه در University of Maryland →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



