رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعماری ذخیره‌سازیمقاله آموزشی· 6 دقیقه مطالعه· در راهنماها

چگونه منطق XOR داده‌ها را در آرایه RAID 5 بازسازی می‌کند

آرایه RAID 5 با توزیع داده‌های توازن (Parity) در تمام دیسک‌ها، از حجم‌های ذخیره‌سازی در برابر خرابی درایو محافظت می‌کند. وقتی یک درایو از کار می‌افتد، کنترل‌کننده ذخیره‌سازی از عملیات باینری XOR برای استنتاج ریاضی فایل‌های از دست رفته از روی درایوهای سالم استفاده می‌کند.

به قلم کامران صادقی

متخصصان بازیابی داده 50%معماران ذخیره‌سازی سازمانی 50%
متخصصان بازیابی داده
تمرکز بر شکنندگی فرآیند بازسازی و خطرات خرابی داده‌ها در طول بازسازی XOR.
معماران ذخیره‌سازی سازمانی
تأکید بر تعادل بین کارایی ذخیره‌سازی، عملکرد خواندن و ظرافت ریاضی توازن توزیع‌شده.

دیدگاه‌هایی که این گزارش پوشش نداده

  • ارائه‌دهندگان فضای ذخیره‌سازی ابری
  • کاربران خانگی NAS

در ۲۹ مه ۲۰۲۶، StarWind Software تحلیل معماری جامعی از پیکربندی‌های ذخیره‌سازی مدرن منتشر کرد که یک آسیب‌پذیری مداوم در زیرساخت‌های سازمانی را برجسته می‌کند: پنجره بازسازی (rebuild window). وقتی یک هارد درایو در آرایه افزونه دیسک‌های مستقل (RAID) از کار می‌افتد، سیستم به سادگی فایل‌های پشتیبان را از یک دیسک یدکی کپی نمی‌کند. در عوض، باید هر بایت از داده‌های از دست رفته را در زمان واقعی به صورت ریاضی بازسازی کند. این فرآیند کاملاً به یک عملیات باینری بنیادی به نام XOR (Exclusive OR) متکی است. با عبور ظرفیت درایوهای فردی از ۲۰ ترابایت، زمان لازم برای انجام این میلیاردها محاسبه از چند ساعت به چند روز افزایش یافته است و اگر درایو دوم قبل از تکمیل بازسازی XOR از کار بیفتد، کل حجم ذخیره‌سازی در معرض خرابی کامل قرار می‌گیرد.[5]

برای درک نحوه عملکرد این بازسازی ریاضی، ابتدا باید به چیدمان فیزیکی داده‌ها نگاه کرد. یک آرایه RAID 5 به حداقل سه هارد درایو فیزیکی نیاز دارد. وقتی سرور فایلی را در این آرایه می‌نویسد، کنترل‌کننده ذخیره‌سازی فایل را به قطعات کوچک‌تر، معمولاً ۶۴ یا ۱۲۸ کیلوبایتی، تقسیم می‌کند. سپس این قطعات را در فرآیندی به نام نواربندی (striping) روی درایوها می‌نویسد. با این حال، فقط داده‌های خام را نمی‌نویسد. همان‌طور که SOS Data Recovery در مستندات فنی خود بیان می‌کند، سیستم به "نواربندی در سطح بلوک با توازن توزیع‌شده" متکی است. (از آنجا که مستندات پایه برای معماری ذخیره‌سازی به جای مصاحبه بر اثبات‌های ریاضی متکی است، هیچ‌یک از راهنماهای مهندسی ذکر شده حاوی نقل‌قول‌های مستقیم انسانی نیستند). این توازن (parity) همان شبکه ایمنی ریاضی است که به آرایه اجازه می‌دهد از خرابی سخت‌افزار جان سالم به در ببرد.[3][6]

داده‌های توازن با استفاده از گیت منطقی XOR تولید می‌شوند. در سطح پردازنده، XOR دو بیت باینری را مقایسه می‌کند. اگر دو بیت یکسان باشند—یعنی هر دو ۰ یا هر دو ۱ باشند—عملیات XOR خروجی ۰ می‌دهد. اگر دو بیت متفاوت باشند—یعنی یکی ۰ و دیگری ۱ باشد—عملیات XOR خروجی ۱ می‌دهد. تحلیل ۸ مه ۲۰۱۷ از SQLpassion درباره نحوه محاسبه این اطلاعات توازن نشان می‌دهد که این قانون ساده برای محافظت از ترابایت‌ها داده مقیاس‌پذیر است. با اجرای عملیات XOR روی بیت‌های متناظر داده در دو درایو اول، کنترل‌کننده یک بیت توازن تولید می‌کند که آن را روی درایو سوم می‌نویسد.[2]

گیت منطقی XOR تنها زمانی خروجی ۱ می‌دهد که دو بیت ورودی متفاوت باشند.

قدرت واقعی عملیات XOR در خاصیت جابه‌جایی ریاضی آن نهفته است؛ این عملیات معکوس خودش است. اگر درایو ۱ دارای مقدار ۱ و درایو ۲ دارای مقدار ۰ باشد، محاسبه XOR (۱ XOR ۰) منجر به بیت توازن ۱ می‌شود که در درایو ۳ ذخیره می‌گردد. اگر درایو ۱ ناگهان دچار خرابی مکانیکی شده و از دسترس خارج شود، کنترل‌کننده ذخیره‌سازی به داده‌های باقی‌مانده نگاه می‌کند. مقدار ۰ را از درایو ۲ و بیت توازن ۱ را از درایو ۳ می‌گیرد و عملیات XOR را روی آن‌ها اجرا می‌کند. این محاسبه (۰ XOR ۱) خروجی ۱ می‌دهد و داده‌های از دست رفته درایو ۱ را به طور کامل بازسازی می‌کند.[2]

در پیکربندی‌های ذخیره‌سازی قدیمی‌تر، مانند RAID 3 یا RAID 4، تمام این داده‌های توازن روی یک هارد درایو اختصاصی ذخیره می‌شد. این امر یک گلوگاه عملکردی عظیم ایجاد می‌کرد، زیرا هر عملیات نوشتن در کل آرایه نیازمند این بود که کنترل‌کننده، توازن را روی همان دیسک خاص به‌روزرسانی کند. بررسی ۸ مارس ۲۰۲۶ از Rossmann Repair Group درباره نحوه عملکرد واقعی توازن RAID اشاره می‌کند که RAID 5 این گلوگاه را با توزیع یکنواخت بلوک‌های توازن در تمام درایوهای آرایه حل می‌کند. در یک آرایه چهار درایوی، درایو ۱ ممکن است توازن نوار اول داده‌ها را نگه دارد، درایو ۲ توازن نوار دوم را نگه می‌دارد و به همین ترتیب.[1]

در پیکربندی‌های ذخیره‌سازی قدیمی‌تر، مانند RAID 3 یا RAID 4، تمام این داده‌های توازن روی یک هارد درایو اختصاصی ذخیره می‌شد.

از آنجا که توازن توزیع شده است، از دست دادن هر درایو به این معنی است که داده‌های مفقود ترکیبی از فایل‌های خام و بلوک‌های توازن هستند. وقتی یک درایو از کار می‌افتد، آرایه وارد حالت تنزل‌یافته (degraded) می‌شود. سرور آنلاین باقی می‌ماند و کاربران همچنان می‌توانند به فایل‌های خود دسترسی داشته باشند، اما کنترل‌کننده ذخیره‌سازی باید بسیار سخت‌تر کار کند. تحلیل بازسازی QueTek Consulting Corporation نشان می‌دهد که هر بار کاربری فایلی را درخواست می‌کند که روی درایو خراب ذخیره شده بود، کنترل‌کننده باید بلوک‌های سالم را از تمام درایوهای باقی‌مانده بخواند و نتیجه XOR را در لحظه محاسبه کند. این محاسبه درنگ‌هنگام، عملکرد خواندن و نوشتن کل حجم ذخیره‌سازی را به شدت کاهش می‌دهد.[7]

آرایه RAID 5 بلوک‌های توازن را به طور یکنواخت در تمام درایوها توزیع می‌کند تا از تبدیل شدن یک دیسک به گلوگاه نوشتن جلوگیری کند.

خطرناک‌ترین دوره برای هر آرایه RAID 5 فاز بازسازی است. وقتی مدیر سیستم یک هارد درایو ۲۰ ترابایتی جایگزین را در سرور قرار می‌دهد، کنترل‌کننده کار عظیم بازسازی داده‌های از دست رفته را آغاز می‌کند. این کنترل‌کننده باید تک‌تک سکتورها را در تمام درایوهای سالم بخواند، محاسبه XOR را برای هر بیت اجرا کند و داده‌های حاصل را روی درایو جدید بنویسد. برای یک آرایه مدرن با ظرفیت بالا، این فرآیند می‌تواند ۴۸ تا ۷۲ ساعت فعالیت مداوم و فشرده دیسک را به همراه داشته باشد. درایوها تا حداکثر سرعت خواندن خود تحت فشار قرار می‌گیرند که گرما و استرس مکانیکی قابل‌توجهی تولید می‌کند.[5][7]

این استرس مکانیکی شدید اغلب نقص‌های پنهان در درایوهای سالم را آشکار می‌کند. بررسی فنی ۱۶ ژانویه ۲۰۲۵ از ACELab درباره بازسازی‌های صحیح و ناصحیح هشدار می‌دهد که اگر یک درایو سالم حاوی سکتورهای غیرقابل خواندن باشد—که به عنوان خطای خواندن غیرقابل بازیابی (URE) شناخته می‌شود—محاسبه XOR با شکست مواجه خواهد شد. از آنجا که XOR برای استنتاج متغیر از دست رفته به تمام متغیرهای سالم نیاز دارد، یک بیت خراب در درایو ۲ به این معنی است که کنترل‌کننده نمی‌تواند بیت متناظر را برای درایو ۱ بازسازی کند. اگر کنترل‌کننده بازسازی را با وجود این خطاها ادامه دهد، داده‌های خراب و درهم‌ریخته را روی درایو جدید می‌نویسد و به سیستم فایل آسیب دائمی می‌رساند.[8]

علاوه بر این، منطق XOR یک محدودیت ریاضی سخت دارد: در هر زمان فقط می‌تواند یک متغیر از دست رفته را حل کند. اگر هارد درایو دوم در طول آن پنجره بازسازی ۷۲ ساعته از کار بیفتد، آرایه به طور کامل فرو می‌پاشد. کنترل‌کننده با دو متغیر از دست رفته در معادله خود مواجه می‌شود که استنتاج داده‌های اصلی را از نظر ریاضی غیرممکن می‌سازد. همان‌طور که RAID Recovery Guide توضیح می‌دهد، محافظت در برابر دو خرابی همزمان نیازمند ارتقا به RAID 6 است که مجموعه دوم داده‌های توازن را با استفاده از الگوریتم بسیار پیچیده‌تر Reed-Solomon محاسبه می‌کند، نه اینکه فقط به XOR متکی باشد.[4]

نکته کاربردی برای مدیران فناوری اطلاعات این است که RAID 5 زمان کارکرد سخت‌افزار (uptime) را فراهم می‌کند، نه حفظ داده‌ها را. منطق XOR تضمین می‌کند که یک درایو خراب کسب‌وکار را آفلاین نمی‌کند و به سرورها اجازه می‌دهد تا زمان تأمین قطعه جایگزین به کار خود ادامه دهند. با این حال، فشار ریاضی عظیم پردازش تریلیون‌ها عملیات XOR در طول بازسازی ایجاب می‌کند که مدیران یک نسخه پشتیبان مجزا و خارج از آرایه نگهداری کنند. ریاضیات باینری می‌تواند یک درایو از دست رفته را روی کاغذ بی‌نقص بازسازی کند، اما نمی‌تواند حجم ذخیره‌سازی را از واقعیت‌های فیزیکی فرسودگی سخت‌افزار، زمانی که دیسک دوم به ناچار از کار می‌افتد، نجات دهد.[5][9]

نکات کلیدی

  • آرایه RAID 5 با توزیع بلوک‌های توازن ریاضی در تمام درایوهای آرایه از داده‌ها محافظت می‌کند.
  • سیستم از عملیات باینری XOR برای محاسبه این توازن استفاده می‌کند.
  • از آنجا که XOR معکوس خودش است، کنترل‌کننده می‌تواند با اجرای محاسبه روی درایوهای سالم، داده‌های از دست رفته را استنتاج کند.
  • یک آرایه RAID 5 تنها می‌تواند از خرابی یک درایو جان سالم به در ببرد؛ خرابی دوم کل حجم را از بین می‌برد.
  • بازسازی یک درایو مدرن با ظرفیت بالا به تریلیون‌ها محاسبه نیاز دارد و می‌تواند تا ۷۲ ساعت طول بکشد.

بررسی عمیق دیدگاه‌ها

متخصصان بازیابی داده

تمرکز بر شکنندگی فرآیند بازسازی و خطرات خرابی داده‌ها.

مهندسان بازیابی به RAID 5 نه به عنوان یک شبکه ایمنی، بلکه به عنوان یک نقطه بالقوه برای خرابی فاجعه‌بار نگاه می‌کنند. وقتی یک درایو از کار می‌افتد، درایوهای باقی‌مانده در طول پنجره بازسازی تحت استرس مکانیکی شدیدی قرار می‌گیرند. اگر هر یک از آن درایوهای سالم دارای سکتورهای غیرقابل خواندن باشند، محاسبه XOR آن داده‌های خراب را در خود جای می‌دهد و فایل‌های بازسازی‌شده را برای همیشه درهم می‌ریزد. برای این متخصصان، ظرافت ریاضی XOR اغلب توسط محدودیت‌های فیزیکی هارد درایوهای فرسوده از بین می‌رود.

معماران ذخیره‌سازی سازمانی

تأکید بر تعادل بین کارایی ذخیره‌سازی و عملکرد خواندن.

معماران ذخیره‌سازی برای RAID 5 به دلیل استفاده بسیار کارآمد از فضای فیزیکی ارزش قائل هستند. برخلاف یک آرایه آینه‌ای (mirrored) که ۵۰ درصد از ظرفیت خود را فدای افزونگی می‌کند، یک آرایه RAID 5 تنها معادل فضای یک درایو را برای ذخیره توازن توزیع‌شده فدا می‌کند. منطق XOR به آن‌ها اجازه می‌دهد تا ترابایت به ازای هر دلار را به حداکثر برسانند و در عین حال سرعت خواندن بالایی را حفظ کنند، و سرعت نوشتن پایین‌تر و خطرات بازسازی را به عنوان یک مبادله ضروری برای مقیاس‌پذیری مقرون‌به‌صرفه می‌پذیرند.

چرا مهم است

درک محاسبات XOR نشان می‌دهد که چرا آرایه‌های RAID 5 در طول بازسازی با افت شدید عملکرد مواجه می‌شوند و چرا خرابی درایو دوم در این بازه زمانی منجر به از دست رفتن فاجعه‌بار داده‌ها می‌شود.

منابع

پوشش منابع

9 منبع

2 دیدگاه شناسایی‌شده

متخصصان بازیابی داده 50%معماران ذخیره‌سازی سازمانی 50%
  1. [1]Rossmann Repair Groupمتخصصان بازیابی داده

    How RAID Parity Actually Works

    مطالعه در Rossmann Repair Group
  2. [2]SQLpassionمعماران ذخیره‌سازی سازمانی

    How to calculate RAID 5 Parity Information

    مطالعه در SQLpassion
  3. [3]SOS Data Recoveryمتخصصان بازیابی داده

    RAID 5: block-level striping with distributed parity

    مطالعه در SOS Data Recovery
  4. [4]RAID recoveryمتخصصان بازیابی داده

    Parity functions - XOR and Reed-Solomon.

    مطالعه در RAID recovery
  5. [5]StarWindمعماران ذخیره‌سازی سازمانی

    Understanding RAID 5, RAID 6, RAID 50, and RAID 60: Comprehensive Guide to RAID Configurations (Part 2)

    مطالعه در StarWind
  6. [6]TechTargetمعماران ذخیره‌سازی سازمانی

    What is RAID 5?

    مطالعه در TechTarget
  7. [7]QueTek™ Consulting Corporationمعماران ذخیره‌سازی سازمانی

    RAID5 rebuild analysis

    مطالعه در QueTek™ Consulting Corporation
  8. [8]ACELab Blogمتخصصان بازیابی داده

    RAID technology overview: Proper and Improper Rebuild for RAID-5

    مطالعه در ACELab Blog
  9. [9]تیم سردبیری کوهستانمعماران ذخیره‌سازی سازمانی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت راهنماها اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.