تصادف ریاضیاتی که صدای دیجیتال را تعریف کرد: چرا لوح فشرده روی نرخ ۴۴.۱ کیلوهرتز کار میکند؟
استاندارد جهانی صدای دیجیتال حاصل انتخاب دانشمندان آکوستیک نبود، بلکه خطوط روبش لامپ تصویر تلویزیونهای دهه ۱۹۷۰ آن را دیکته کردند. مهندسان با سوار کردن دادههای اولیه دیجیتال روی نوارهای ویدیویی آنالوگ، موسیقی را به یک مصالحه ریاضیاتی مقید کردند که تا به امروز پابرجا مانده است.
به قلم هستی فیروزی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- استاندارد صدای دیجیتال ۴۴.۱ کیلوهرتز حاصل محدودیتهای فنی نوار ویدیویی آنالوگ در دهه ۱۹۷۰ بود، نه پژوهشهای آکوستیک.
- مهندسان دادههای صوتی دیجیتال را در قالب سیگنال ویدیویی پنهان کردند، چون هارد دیسکها و نوارهای صوتی آن دوران پهنای باند کافی نداشتند.
- این نرخ نمونهبرداری ویژه، کوچکترین مضرب مشترکی بود که بهطور دقیق با خطوط روبش دو استاندارد تلویزیونی رقیب (پال اروپا و انتیاسسی آمریکا) همخوانی داشت.
در این مطلب
در یک سوی آزمایشگاه، آکوستیکدانهای سنتگرا و طرفدار نظریههای ناب ریاضی نشسته بودند. حرفشان این بود که نرخ نمونهبرداری استاندارد صدای دیجیتال در آینده باید یک عدد رند و تمیز باشد: ۵۰ هزار نمونه در ثانیه. عددی که صرفاً برای پوشش تمام و کمال آستانه شنوایی انسان همراه با یک حاشیه امنیت دستودلبازانه انتخاب شده بود.[6]
در سوی دیگر، عملگرایان حوزه سختافزار با نگرانی به حجم سرسامآور دادههای فشردهنشده صوتی چشم دوخته بودند. آنها خوب میدانستند که در سال ۱۹۷۹ هیچ رسانه صوتی اختصاصی روی کره زمین توان ذخیره چنین حجمی از داده را نداشت. استدلالشان روشن بود: استاندارد را باید تنها دستگاههایی تعیین کنند که از پس این کار برمیآیند، یعنی دستگاههای ضبط ویدیوی تلویزیونی.[3][6]
همین تنش بنیادین میان نظریه آکوستیک و واقعیتهای بیرحم خط تولید، سنگ بنای تولد دیسک فشرده یا همان سیدی را گذاشت. نظریهپردازان خواهان استانداردی متناسب با آیندهای آرمانی و رها از زنجیرهای فناوری دهه ۱۹۷۰ بودند؛ اما اهل عمل میدانستند فرمتی که نشود با تجهیزات موجود آن روز ضبط و تکثیرش کرد، هرگز پایش به خانه مصرفکننده باز نخواهد شد.[2][6]
سازشی که در نهایت به آن تن دادند، هنوز یکی از سرسختترین یادگارهای ریاضی در صنعت الکترونیک مصرفی است. امروز میلیاردها فایل موسیقی دیجیتال، الگوریتمهای پلتفرمهای پخش آنلاین و لوحهای فشرده روی فرکانس دقیق ۴۴,۱۰۰ هرتز میچرخند؛ عددی وسواسگونه و ظاهراً تصادفی که حاصل نبوغ دانشمندان صدا نبود، بلکه شبحی بهجامانده از دوران تلویزیون آنالوگ است.[1][6]
مبنای فیزیولوژیک صدا
برای پی بردن به چرایی پیدایش نرخ ۴۴.۱ کیلوهرتز، ابتدا باید مرزهای بیولوژیکی گوش انسان را شناخت. یک انسان جوان و سالم میتواند فرکانسهایی از بمترین صداها یعنی ۲۰ هرتز تا زیرترین جیغها در ۲۰,۰۰۰ هرتز را بشنود. ثبت این پهنه کامل، نخستین شرط وفاداری به اصل صدا در سامانههای باکیفیت است.[1]
در عصر آنالوگ، ثبت این پهنه صوتی به معنای تراشیدن فیزیکی شیارها روی صفحات وینیل یا چیدمان ذرات مغناطیسی روی یک نوار ممتد بود. صدای دیجیتال اما به قطعهقطعه کردن این موج ممتد به عکسهای فوری و مجزا از هم نیاز دارد. جالب اینکه قواعد گرفتن این عکسهای فوری دههها پیش از ایده ساخت سیدی تثبیت شده بود.[2]
در سال ۱۹۴۹، کلود شانون، ریاضیدان برجسته، قضیه نمونهبرداری نایکویست-شانون را که ستون فقرات نظریه اطلاعات محسوب میشود، صورتبندی کرد. طبق این قضیه، برای بازسازی دقیق یک سیگنال پیوسته، نرخ نمونهبرداری باید دستکم دو برابر بالاترین فرکانس موجود در آن باشد. برای گوش انسان معادله ساده است: دو برابرِ ۲۰,۰۰۰ هرتز میشود ۴۰,۰۰۰ هرتز.[5]
بنابراین، یک سامانه دیجیتال باید دستکم ۴۰,۰۰۰ بار در ثانیه از سیگنال عکس بگیرد تا هر چیزی را که گوش توان شنیدنش را دارد ثبت کند. با این حال، مهندسان نمیتوانند ضبط صدا را دقیقاً روی ۲۰,۰۰۰ هرتز قطع کنند، وگرنه اعوجاج و تداخل شدیدی موسوم به الیاسینگ پیش میآید. آنها به یک باند گذار نیاز دارند؛ محدوده ضربهگیری که یک فیلتر پایینگذر بتواند به نرمی فرکانسهای بالا را مهار کند.[1][5]
همانطور که در اسناد آرشیو تاریخی انجمن مهندسی صدا درباره لوح فشرده آمده است: «برای پیادهسازی یک فیلتر ضد الیاسینگ کارآمد، فرکانس نمونهبرداری باید اندکی بالاتر از حداقل نظری نایکویست تعیین شود».[2]
ترفند نوار ویدیویی
همین واقعیت فنی، کمینه نرخ نمونهبرداری عملی را از ۴۰,۰۰۰ هرتز فرضی به حدود ۴۴,۰۰۰ هرتز کشاند. البته تعیین فرکانس هدف فقط نیمی از ماجرا بود؛ معضل اصلی، ذخیرهسازی دادههای حاصل از آن به شمار میرفت.[1][2]
در اواخر دهه ۱۹۷۰، یک سیگنال صوتی استریو با نرخ ۴۴,۰۰۰ نمونه در ثانیه و وضوح ۱۶ بیت، در هر ثانیه بیش از ۱.۴ میلیون بیت داده تولید میکرد. در آن دوران هارد دیسکها به اندازه ماشین لباسشویی بودند و چند مگابایت بیشتر ظرفیت نداشتند. نوارهای صوتی آنالوگ سنتی هم پهنای باند کافی برای ضبط این سیلاب عظیم اطلاعات دیجیتال را در چنته نداشتند.[3]
تنها رسانه مغناطیسی تجاری که توان حمل بار ترافیکی ۱.۴ مگابیت بر ثانیهای را داشت، نوار ویدیویی آنالوگ بود. به طور دقیقتر، نگاه مهندسان به سمت سونی یوماتیک کشیده شد؛ کاستهای ویدیویی ۳/۴ اینچی که اصالتاً برای پخش تلویزیونی ساخته شده بودند.[1][3]
برای ذخیره صدا روی نوار کاست ویدیویی، مهندسان ناچار شدند صفر و یکهای دیجیتال را در نقاب سیگنالهای تلویزیونی سیاهوسفید پنهان کنند. آنها مبدلی ساختند به نام مدولاسیون کد پالس (PCM). این ابزار دادههای صوتی دیجیتال را برمیداشت و آنها را به خطوط افقی قابل روبش در یک فریم ویدیویی بدل میکرد.[3]
از آنجا که صوت اکنون در کالبد تصویر ویدیویی پنهان شده بود، نرخ نمونهبرداری باید با دقت ریاضی مویهشکافانهای با خطوط روبش تصویر در استانداردهای پخش تلویزیونی همگام میشد. اگر دادههای صوتی به درستی در فریمهای ویدیویی تقسیم نمیشدند، تصویر اصطلاحاً پاره میشد و دادههای دیجیتال تباه میشدند.[1][3]
حساب و کتاب تلویزیونی
این الزام مهندسان صدا را مجبور کرد با دو استاندارد ناسازگار تلویزیونی حاکم بر دنیا کنار بیایند. در اروپا، استاندارد پال ۵۰ میدان متناوب در ثانیه نمایش میداد و هر فریم آن ۶۲۵ خط افقی داشت. در آمریکای شمالی و ژاپن، استاندارد انتیاسسی ۶۰ میدان در ثانیه با ۵۲۵ خط در هر فریم ارائه میکرد.[1]
همه این خطوط به کار ضبط داده نمیآمدند. هر دو قالب تعدادی از خطوط بالا و پایین نمایشگر را برای زمان بازگشت عمودی اشعه کاتدی خالی میگذاشتند—همان مهلتی که تفنگ الکترونی لامپ تصویر نیاز داشت تا به بالای صفحه برگردد. به این ترتیب دادههای صوتی فقط روی خطوط مرئی و فعال مینشستند.[1]
در سیستم پال اروپایی، کسر فاصله خاموشی عمودی دقیقاً ۲۹۴ خط فعال در هر میدان باقی میگذاشت. با در نظر گرفتن ۵۰ میدان در ثانیه، در هر ثانیه ۱۴,۷۰۰ خط فعال فراهم میشد. مهندسان به این نتیجه رسیدند که میتوانند بدون مشکل در هر خط افقی، سه نمونه صوتی جداگانه بگنجانند.[1][6]
حساب و کتاب سیستم پال اینگونه شد: ۱۴,۷۰۰ خط ضرب در ۳ نمونه به ازای هر خط، دقیقاً برابر با ۴۴,۱۰۰ نمونه در ثانیه. اما یک فرمت صوتی جهانی نمیتوانست متکی به تجهیزات تلویزیونی اروپا بماند. فرمول ریاضی باید بدون نقص روی استاندارد انتیاسسی آمریکا و ژاپن هم پیاده میشد.[1][6]
سیستم انتیاسسی با ۶۰ میدان در ثانیه کار میکرد ولی شمار خطوط کمتری داشت. پس از حذف زمان خاموشی تصویر، انتیاسسی دقیقاً ۲۴۵ خط فعال در هر میدان عرضه میکرد. حاصل ضرب در ۶۰ میدان در ثانیه، دوباره به رقم ۱۴,۷۰۰ خط فعال در هر ثانیه میرسید؛ رقمی کاملاً منطبق بر خروجی سیستم پال.[1][6]
ضرب کردن آن ۱۴,۷۰۰ خط انتیاسسی در ۳ نمونه در هر خط، باز هم همان نتیجه را به دست داد: دقیقاً ۴۴,۱۰۰ نمونه در ثانیه. این یک معجزه در محاسبات بود. یگانه فرکانسی که هم قضیه نایکویست را راضی نگه میداشت و هم بر خطوط هر دو سیستم تلویزیونی جهان بخشپذیر بود، چیزی نبود جز ۴۴.۱ کیلوهرتز.[1][6]
تثبیت یک مصالحه تاریخی
وقتی شرکتهای سونی و فیلیپس در سال ۱۹۷۹ گرد هم آمدند تا ویژگیهای لوح فشرده نوظهور را نهایی کنند، بر سر یک دوراهی قرار گرفتند. فیلیپس متمایل به آکوستیکدانها، ابتدا عدد رند ۴۴,۰۰۰ هرتز را پیشنهاد داد؛ اما سونی به عنوان نماینده عملگرایان سختافزار، روی ۴۴,۱۰۰ هرتز پافشاری کرد، چرا که آداپتورهای ویدیویی PCM-1600 آنها عملاً داشتند آلبومهای موسیقی را روی همین نرخ مستر میکردند.[3][4]
در نهایت استدلال سونی دست بالا را پیدا کرد. زیرساخت نوارهای ویدیویی یوماتیک پیشتر در استودیوهای ضبط سراسر جهان مستقر شده بود. تغییر نرخ نمونهبرداری میلیونها دلار تجهیزات ضبط دیجیتال نوپا را یکشبه به آهنقراضه تبدیل میکرد و عرضه لوح فشرده را سالها به تأخیر میانداخت.[3][4]
در سال ۱۹۸۰، این دو غول فناوری «کتاب سرخ» را به عنوان استاندارد فنی قطعی دیسک فشرده منتشر کردند و رسماً ۴۴.۱ کیلوهرتز را به تخت پادشاهی صدای دیجیتال نشاندند. پژوهشگران نظری عدد رند خود را از دست دادند، اما عملگرایان فرمتی را روانه بازار کردند که ساخت آن بلافاصله میسر بود.[2][4]
یادگاری که جاودانه شد
نوارهای ویدیویی یوماتیک که مسبب این مصالحه تاریخی بودند، دهههاست که به موزه پیوستهاند. حافظههای اساسدی مدرن ترابایتها داده را در کف دست ذخیره میکنند و صدای دیجیتال دیگر نیازی ندارد برای زنده ماندن خود را پشت نقاب سیگنال تلویزیون پنهان کند. با این همه، استاندارد ۴۴.۱ کیلوهرتز هنوز سنگرش را حفظ کرده است.[1][6]
وقتی شرکت اپل در سال ۲۰۰۳ فروشگاه آیتونز را افتتاح کرد، آهنگها را با نرخ ۴۴.۱ کیلوهرتز فروخت. امروز هم وقتی اسپاتیفای قطعهای را روی گوشی پخش میکند، فایل اصلی روی همین نرخ استوار است. تمامی بستر موسیقی دیجیتال امروزی روی شالودهای استوار شده که در سال ۱۹۷۹ بتنریزی شد.[6]
البته گزینههای مدرنی هم وجود دارند؛ صنعت فیلم و تلویزیون بعدها به استاندارد ۴۸ کیلوهرتز روی آورد و سرویسهای صوتی باکیفیت بالا فایلهایی با نرخ ۹۶ یا حتی ۱۹۲ کیلوهرتز عرضه میکنند. با این وجود، بخش اعظم گنجینه موسیقی ضبطشده جهان بر مبنای استاندارد کتاب سرخ دیجیتالی شده و افزایش تصنعی رزولوشن نمیتواند دادهای را که از اول ثبت نشده خلق کند.[1][2]
با این وجود، بخش اعظم گنجینه موسیقی ضبطشده جهان بر مبنای استاندارد کتاب سرخ دیجیتالی شده و افزایش تصنعی رزولوشن نمیتواند دادهای را که از اول ثبت نشده خلق کند.
نرخ نمونهبرداری ۴۴.۱ کیلوهرتز گواهی روشن بر واقعیتهای درهمتنیده و پرپیچوخم مهندسی است. این ماجرا ثابت میکند استانداردهای فناوری بهندرت از فراز قلههای انتزاعی ریاضی فرود میآیند؛ بلکه حاصل اصطکاک میان آرزوی دانشمندان و توان واقعی سختافزارهای زمانهاند.[6]
این تحلیل چگونه انجام شد
- روش
- محاسبه مجدد ریاضیاتی و همسانسازی استانداردهای پخش تلویزیونی دهه ۱۹۷۰ برای رسیدن به نقطه تلاقی مشترک آنها.
- یافته
- استاندارد ۴۴.۱ کیلوهرتز کوچکترین مضرب مشترکی است که هم شرط نایکویست برای فرکانس ۲۰ کیلوهرتز را برآورده میکند و هم بر تعداد خطوط فعال صحیح در هر دو قالب تلویزیونی رقیب بخشپذیر است، امری که آن را به تنها گزینه ممکن از منظر ریاضی در سال ۱۹۷۹ بدل ساخت.
- دادههایی که بر پایهٔ آنها کار کردیم
- محدودیتهای این تحلیل
- این تحلیل بر مشخصات مکتوب کتاب سرخ و اسناد مهندسی تاریخی متکی است و نمیتواند بحثهای ثبتنشده درون سونی یا فیلیپس درباره دیگر قالبهای نواری را پوشش دهد.
اصطلاحات کلیدی
- قضیه نمونهبرداری نایکویست-شانون
- یک قانون ریاضی که میگوید برای دیجیتالیکردن کامل یک سیگنال پیوسته، باید با نرخی حداقل دو برابر بالاترین فرکانس آن نمونهبرداری انجام شود.
- مدولاسیون کد پالس (PCM)
- روش استاندارد برای نمایش دیجیتالی سیگنالهای آنالوگ نمونهبرداریشده که پایه و اساس صدای لوح فشرده را تشکیل میدهد.
- فیلتر پایینگذر
- یک مدار الکترونیکی که اجازه عبور به فرکانسهای پایین میدهد و فرکانسهای بالا را مسدود میکند تا از اعوجاج دیجیتال جلوگیری کند.
- یوماتیک (U-matic)
- یک فرمت کاست ویدیویی آنالوگ که در سال ۱۹۷۱ توسط سونی معرفی شد و بعدها برای ذخیره مسترهای اولیه صدای دیجیتال تغییر کاربری داد.
- فاصله خاموشی عمودی
- بخش پنهان سیگنال تلویزیونی که در اصل به تفنگ الکترونی لامپ تصویر زمان میداد تا پرتو را به بالای صفحه نمایش بازگرداند.
پرسشهای متداول
چرا مهندسان برای دیسکهای فشرده مستقیماً از فرکانس ۴۸ کیلوهرتز استفاده نکردند؟
اگرچه ۴۸ کیلوهرتز بعدها به استانداردی در ویدیوهای حرفهای و صدای دیویدی بدل شد، زیرساخت نوارهای یوماتیک در سال ۱۹۷۹ توان انتقال پایدار این پهنای داده بالاتر را بدون قطعیهای شدید نداشت.
آیا گوش انسان واقعاً تفاوت میان نرخ ۴۴.۱ کیلوهرتز و نرخهای بالاتر را متوجه میشود؟
در آزمونهای دوسوکور، اکثریت قاطع شنوندگان قادر به تشخیص ۴۴.۱ کیلوهرتز از ۹۶ کیلوهرتز نیستند، چرا که نرخ ۴۴.۱ فرکانسهای صوتی را تا آستانه بیولوژیکی شنوایی یعنی ۲۰ کیلوهرتز به طور کامل و دقیق ثبت میکند.
اگر نرخ نمونهبرداری کمتر از ۴۰ کیلوهرتز باشد چه رخ میدهد؟
نمونهبرداری زیر حد آستانه نایکویست (۴۰ کیلوهرتز) باعث میشود فرکانسهای زیر به درون طیف فرکانسهای شنیداری بازگردند و اعوجاج فلزی و ناهنجاری به نام الیاسینگ ایجاد کنند.
بررسی عمیق دیدگاهها
آکوستیکدانهای سنتگرا
پژوهشگرانی که باور داشتند این استاندارد باید صرفاً بر اساس محدودیتهای بیولوژیکی گوش انسان تعیین شود.
برای دانشمندان صدا و ریاضیدانان اواخر دهه ۱۹۷۰، گذار به دیجیتال فرصتی طلایی بود تا فرمتی بینقص از پایه خلق کنند. آنها خواهان نرخهای ۵۰ کیلوهرتز یا فراتر از آن بودند و استدلال میکردند گرچه گوش بالاتر از ۲۰ کیلوهرتز را نمیشنود، اما نرخ بالاتر اجازه استفاده از فیلترهای ملایمتر و طبیعیتر را میدهد. آنها تکیه به نوار ویدیویی را ابزاری موقت میدیدند که تا مدتها بعد از پیشرفت ذخیرهسازی، به کیان صدای دیجیتال آسیب میزند.
عملگرایان سختافزار
مهندسان و مدیرانی که ورود یک فرمت کاربردی به بازار را با استفاده از زیرساختهای موجود در اولویت دیدند.
مهندسان سونی و فیلیپس دریافته بودند فرمتی که نتوان آن را ساخت، پشیزی ارزش ندارد. تا سال ۱۹۷۹، سونی سرمایهگذاری سنگینی روی مبدل PCM-1600 انجام داده بود؛ ابزاری که صدای دیجیتال را روی نوارهای ویدیویی یوماتیک ضبط میکرد. عملگرایان معتقد بودند انطباق سیدی با نرخ ۴۴.۱ کیلوهرتز به استودیوها اجازه میدهد از همان دستگاههای مسترینگ موجود استفاده کنند و پلی میان گذشته آنالوگ و آینده دیجیتال بزنند.
علاقهمندان صدای باکیفیت بالا
شنوندگان امروزی که باور دارند سازش سال ۱۹۷۹ دیگر پاسخگوی گوشهای نقاد و تجهیزات پیشرفته نیست.
امروزه طیف پرصدایی از جامعه شیفتگان صدا معتقدند استاندارد ۴۴.۱ کیلوهرتز یادگاری تاریخگذشته است. آنها از قالبهایی چون ۹۶ یا ۱۹۲ کیلوهرتز دفاع میکنند و باور دارند اگرچه فرکانسهای فراتر شنیده نمیشوند، اما نرخهای بالاتر زمانبندی صدا را دقیقتر کرده و اعوجاج فازی فیلترهای تند پایینگذر را از بین میبرند. از نگاه آنها، سلطه نرخ ۴۴.۱ کیلوهرتز تصادفی تاریخی است که کیفیت صدای دیجیتال را در تنگنا نگه داشته است.
- عملگرایان سختافزار
- قابلیت تولید انبوه و سازگاری با زیرساخت نوارهای ویدیویی موجود را در اولویت قرار دادند تا امکان عرضه واقعی این فرمت میسر شود.
- آکوستیکدانهای سنتگرا
- خواهان نرخهای نمونهبرداری بالاتر و از نظر تئوری رند و بینقص، تنها با تکیه بر مرزهای شنوایی انسان و فارغ از محدودیتهای سختافزاری دهه ۱۹۷۰ بودند.
- علاقهمندان صدای باکیفیت بالا
- شنوندگان امروزی که معتقدند نرخ ۴۴.۱ کیلوهرتز برای ثبت دقیق جزئیات ریز و پویایی ضبطهای آنالوگ کافی نیست.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان استودیوهای ضبط صدا که ناچار بودند با رابطهای پیچیده تبدیل تصویر به صدا کار کنند
- بازاریابان صنعت الکترونیک مصرفی که باید این رقم ناآشنا را به خریداران توضیح میدادند
منابع
[1]Wikipediaعلاقهمندان صدای باکیفیت بالا44,100 Hz
مطالعه در Wikipedia →
[2]Audio Engineering Societyعملگرایان سختافزارThe Compact Disc Story
مطالعه در Audio Engineering Society →
[3]Sony Corporate Historyعملگرایان سختافزارThe Dawn of the Digital Era
مطالعه در Sony Corporate History →
[4]Philips Historical Archivesآکوستیکدانهای سنتگراThe CD Family
مطالعه در Philips Historical Archives →
[5]IEEE Xploreآکوستیکدانهای سنتگراCommunication in the Presence of Noise
مطالعه در IEEE Xplore →
[6]تیم سردبیری کوهستانعلاقهمندان صدای باکیفیت بالاتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در سرگرمی
مشاهده همه →حقوق موسیقی هوش مصنوعی
یونیورسال میوزیک و ایلونلبز دست به یکی کردند: پلتفرم قانونی هوش مصنوعی برای ساخت موسیقی در راه است
6 منبع
مهندسی صدا
نمونهبرداری صدای دیجیتال واقعاً چطور کار میکند: سازوکار قضیه نایکوئیست-شنون
7 منبع
مهندسی صدا
چگونه پلتفرمهای استریمینگ با استفاده از استاندارد LUFS به «جنگ بلندی صدا» پایان دادند
4 منبع
موسیقی هوش مصنوعی
اجبار اپل موزیک برای برچسبگذاری «ساختهشده با هوش مصنوعی» روی قطعات تولیدی
7 منبع
نظرات
هر زاویه. هر روز.
اخبار سرگرمی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





