رفتن به محتوای اصلی
کوهستان
توضیح کوهستانفناوری صوتیمقاله تشریحی· 6 دقیقه مطالعه· در فناوری

چگونه پوشش شنیداری به الگوریتم‌های MP3 اجازه می‌دهد ۸۰ درصد از یک فایل صوتی را بدون تغییر در صدای آن دور بریزند

فرمت MP3 کاهش حجم انقلابی خود را نه از طریق فشرده‌سازی سنتی داده‌ها، بلکه با نقشه‌برداری از محدودیت‌های بیولوژیکی شنوایی انسان به دست آورد. این الگوریتم با شناسایی و حذف فرکانس‌هایی که گوش در حضور صداهای بلندتر از نظر فیزیکی قادر به درک آن‌ها نیست، بخش اعظم یک فایل صوتی را دور می‌ریزد، در حالی که آهنگ شنیده شده کاملاً دست‌نخورده به نظر می‌رسد.

به قلم کیان راد

به‌طور خلاصه

  1. فرمت MP3 با حذف داده‌های صوتی که گوش انسان قادر به درک آن‌ها نیست، حجم فایل‌ها را تا ۹۱ درصد کاهش می‌دهد.
  2. پوشش فرکانسی به الگوریتم اجازه می‌دهد تا صداهای ضعیفی را که در میان فرکانس‌های بلندتر و مجاور گم می‌شوند، دور بریزد.
  3. پوشش زمانی از زمان بازیابی ۵ تا ۲۰ میلی‌ثانیه‌ای گوش پس از یک صدای بلند سوءاستفاده می‌کند تا داده‌های غیرقابل درک را حذف کند.

گذار از لوح‌های فشرده فیزیکی به آرشیوهای استریم دیجیتال زمانی رخ داد که مهندسان نرم‌افزار متوجه شدند نیازی به ذخیره کل موج صوتی یک قطعه ضبط‌شده ندارند، بلکه تنها بخش‌هایی که مغز انسان قادر به پردازش آن‌هاست کافی است. فشرده‌سازی سنتی داده‌ها، مانند یک فایل ZIP، اطلاعات را بدون از دست دادن حتی یک بایت بهینه‌تر بسته‌بندی می‌کند و اجازه می‌دهد فایل اصلی دقیقاً بازسازی شود.

مهندسان صدا خیلی زود دریافتند که اعمال این روشِ بدون افت کیفیت روی امواج صوتی، صرفه‌جویی ناچیزی در فضای ذخیره‌سازی به همراه دارد؛ واقعیتی که باعث شد آن‌ها به جای یک راه‌حل کاملاً ریاضی، به سمت یک راه‌حل بیولوژیکی حرکت کنند.[3][6]

صدای غیرفشرده روی یک سی‌دی استاندارد، فرمتی که در سال ۱۹۸۲ پایه‌گذاری شد، برای ثبت ۴۴۱۰۰ نمونه در هر ثانیه به بیت‌ریتی معادل ۱۴۱۱ کیلوبیت بر ثانیه (kbps) نیاز دارد. هنگامی که موسسه فرانهوفر (Fraunhofer Society) فرمت MP3 را در سال ۱۹۹۳ منتشر کرد، این حجم داده را به ۱۲۸ کیلوبیت بر ثانیه کاهش داد و اندازه فایل‌ها را تقریباً ۹۱ درصد کوچک کرد. این کاهش عظیم با حذف دائمی بخش اعظم داده‌های صوتی از فایل به دست آمد.[2][4]

الگوریتم MP3 بر یک مدل روان‌شناختی صوتی (Psychoacoustic) متکی است که به عنوان یک نقشه ریاضی از محدودیت‌های بیولوژیکی سیستم شنوایی انسان عمل می‌کند. مهندسان به جای اینکه بپرسند چگونه می‌توان موج صوتی را فشرده کرد، این سوال را مطرح کردند که گوش انسان از نظر فیزیکی قادر به شنیدن چه بخش‌هایی از موج صوتی نیست. با شناسایی و حذف آن فرکانس‌های غیرقابل درک، الگوریتم یک اسکلت صوتی از خود به جای می‌گذارد که مغز آن را به عنوان نسخه کامل و اصلی قطعه ضبط‌شده تفسیر می‌کند.[1][5]

ترفند اصلی در این مدل، پدیده‌ای به نام پوشش فرکانسی همزمان است. وقتی دو صدا با فرکانس‌های مشابه دقیقاً در یک زمان پخش می‌شوند، گوش انسان تنها صدای بلندتر را ثبت می‌کند. صدای بلندتر غشای پایه در گوش داخلی را چنان با شدت به لرزه درمی‌آورد که سلول‌های عصبی نمی‌توانند صدای ضعیف‌تری را که در فرکانس مجاور در حال ارتعاش است، تشخیص دهند.[1][3]

پوشش فرکانسی زمانی رخ می‌دهد که یک صدای بلند آستانه شنوایی را بالا برده و فرکانس‌های ضعیف‌تر مجاور را غیرقابل درک می‌کند.

مقاله مروری آموزشی MDPI Applied Sciences در مورد کدگذاری ادراکی صدا خاطرنشان می‌کند: «اگر یک صدای بلند وجود داشته باشد، آستانه شنوایی را در همسایگی طیفی بلافصل خود بالا می‌برد.» رمزگذار MP3 این آستانه را به صورت پویا در کل طیف فرکانس محاسبه کرده، فرکانس‌های ضعیف‌تر و پوشیده‌شده را شناسایی می‌کند و پیش از ذخیره فایل، آن‌ها را برای همیشه از جریان داده‌ها حذف می‌کند.[1]

این مدل همچنین از پوشش زمانی بهره‌برداری کرده و از زمان بازیابی گوش سوءاستفاده می‌کند. یک صدای ناگهانی و بلند، مانند ضربه طبل کوچک (Snare) یا برخورد سنج، گوش را به طور موقت نسبت به صداهای ضعیف‌تری که بلافاصله قبل و بعد از آن می‌آیند، ناشنوا می‌کند. سیستم شنوایی انسان پس از یک اوج گذرای بلند، به ۵ تا ۲۰ میلی‌ثانیه زمان نیاز دارد تا حساسیت کامل خود را بازیابد.[3][5]

رمزگذار MP3 جریان صوتی را در فریم‌های ۲۶ میلی‌ثانیه‌ای تجزیه و تحلیل می‌کند و به طور خاص به دنبال این نقاط کور زمانی می‌گردد. هنگامی که یک صدای گذرای بلند را تشخیص می‌دهد، داده‌های صوتی را که در آن پنجره بازیابی ۵ تا ۲۰ میلی‌ثانیه‌ای قرار می‌گیرند، حذف می‌کند؛ چرا که می‌داند گوش شنونده از نظر بیولوژیکی قادر به ثبت غیبت آن‌ها نیست.[1][3]

پس از شناسایی و دور ریختن فرکانس‌های اضافی، الگوریتم بودجه محدود داده‌های خود (یعنی بیت‌ها) را به صداهای باقی‌مانده اختصاص می‌دهد. فرکانس‌هایی که در حساس‌ترین محدوده شنوایی انسان، یعنی بین ۲۰۰۰ تا ۵۰۰۰ هرتز قرار می‌گیرند، بالاترین تخصیص بیت را دریافت می‌کنند تا حداکثر وفاداری به صدای اصلی تضمین شود، زیرا گوش به شدت با گفتار انسان و محدوده‌های صوتی کوک شده است.[1][4]

یک فایل MP3 استاندارد با استفاده از مدل روان‌شناختی صوتی، تقریباً ۹۱ درصد از داده‌های موجود در یک لوح فشرده (CD) غیرفشرده را دور می‌ریزد.

در مقابل، فرکانس‌های بالای ۱۶۰۰۰ هرتز، که بسیاری از بزرگسالان به دلیل کاهش شنوایی ناشی از افزایش سن اصلاً قادر به شنیدن آن‌ها نیستند، به شدت فشرده شده یا به طور کامل دور ریخته می‌شوند. یک فایل MP3 استاندارد ۱۲۸ کیلوبیت بر ثانیه معمولاً یک فیلتر پایین‌گذر (Low-pass) سخت را در ۱۶ کیلوهرتز اعمال می‌کند و هرگونه داده صوتی بالاتر از آن خط را کاملاً حذف می‌کند تا فضا برای فرکانس‌های میانی که برای درک انسان بیشترین اهمیت را دارند، ذخیره شود.[3][4]

این واقعیت بیولوژیکی، کمپین‌های بازاریابی مدرن برای سطوح استریم صوتی «بدون افت کیفیت» (Lossless) و با وضوح بالا را با چالش مواجه می‌کند. شرکت‌هایی مانند اپل و تایدال (Tidal) فایل‌های ۲۴ بیتی و ۱۹۲ کیلوهرتزی را تبلیغ می‌کنند که تا ۹۲۱۶ کیلوبیت بر ثانیه پهنای باند مصرف می‌کنند و وعده یک تجربه شنیداری بی‌نقص را می‌دهند که تمام جزئیات نسخه مستر استودیویی را در بر می‌گیرد.[6]

با این حال، داده‌های حفظ‌شده در این فایل‌های حجیم عمدتاً شامل همان فرکانس‌های پوشیده‌شده و داده‌های فراصوتی است که مدل روان‌شناختی صوتی ثابت کرده ما نمی‌توانیم آن‌ها را بشنویم. فرمت MP3 نشان داد که ۸۰ تا ۹۰ درصد از یک قطعه ضبط‌شده از نظر بیولوژیکی اضافی است؛ به این معنی که مصرف‌کنندگانی که برای صدای با وضوح بالا پول پرداخت می‌کنند، در واقع در حال دانلود داده‌هایی هستند که گوششان قادر به پردازش آن‌ها نیست.[1][6]

پوشش زمانی از زمان بازیابی ۵ تا ۲۰ میلی‌ثانیه‌ای گوش پس از یک صدای گذرا و بلند بهره می‌برد و به رمزگذار اجازه می‌دهد صداهای موجود در آن بازه زمانی را حذف کند.

کتابخانه کنگره آمریکا در ارزیابی پایداری فرمت‌های دیجیتال خود، MP3 را به عنوان یک فرمت «با افت کیفیت» (Lossy) طبقه‌بندی می‌کند، زیرا موج صوتی اصلی نمی‌تواند از فایل فشرده بازسازی شود. با این وجود، این نهاد خاطرنشان می‌کند که این فرمت به طور خاص طراحی شده تا اطمینان حاصل شود که «افت کیفیت برای درک انسان به حداقل می‌رسد»؛ ویژگی‌ای که آن را برای توزیع بسیار کارآمد می‌کند، حتی اگر استانداردهای حفظ و آرشیو را برآورده نکند.[2]

این توهم صوتی تنها زمانی در هم می‌شکند که فشرده‌سازی بیش از حد اعمال شود. در بیت‌ریت‌های زیر ۱۲۸ کیلوبیت بر ثانیه، یا هنگام رمزگذاری صداهای بسیار پیچیده و متراکم مانند یک ارکستر سمفونیک یا جمعیت در حال تشویق، الگوریتم مجبور می‌شود فرکانس‌هایی را دور بریزد که به طور کامل توسط صداهای بلندتر پوشانده نشده‌اند.[3][4]

این قحطی داده منجر به ایجاد نویزهای مصنوعی قابل شنیدن (Artifacts) می‌شود. شایع‌ترین آن‌ها «پیش‌طنین» (Pre-echo) است؛ یک صدای محو و فلزی که درست قبل از صداهای گذرای تیز رخ می‌دهد. این اتفاق به این دلیل می‌افتد که رمزگذار بودجه داده کافی برای ارائه دقیق شروع ناگهانی موج صوتی را ندارد و مجبور می‌شود نویز را در کل فریم ۲۶ میلی‌ثانیه‌ای پخش کند.[1][3]

این قحطی داده منجر به ایجاد نویزهای مصنوعی قابل شنیدن (Artifacts) می‌شود.

میراث ماندگار کدگذاری ادراکی، درک این موضوع است که وفاداری صوتی یک معیار بیولوژیکی است، نه یک معیار ریاضی. این فرمت در سطح جهانی موفق شد زیرا به جای نوار مستر اصلی، گوش شنونده را به عنوان داور نهایی برای تعیین اینکه یک قطعه ضبط‌شده واقعاً چه صدایی دارد، در نظر گرفت.[6]

فرمت‌های صوتی با وضوح بالا همان فرکانس‌های پوشیده‌شده‌ای را حفظ می‌کنند که کدگذاری ادراکی آن‌ها را دور می‌ریزد، هرچند هنوز بر سر اینکه آیا شنوندگان واقعاً می‌توانند این تفاوت را درک کنند یا نه، بحث وجود دارد.

اصطلاحات کلیدی

مدل روان‌شناختی صوتی (Psychoacoustic Model)
یک الگوریتم ریاضی که محدودیت‌های بیولوژیکی شنوایی انسان را نقشه‌برداری می‌کند تا تعیین کند کدام صداها را می‌توان با خیال راحت از یک فایل صوتی حذف کرد.
پوشش فرکانسی (Frequency Masking)
یک پدیده شنوایی که در آن یک صدای بلند مانع از آن می‌شود که گوش انسان صدای ضعیف‌تری را که در همان زمان و در فرکانسی مشابه رخ می‌دهد، بشنود.
پوشش زمانی (Temporal Masking)
پنجره کوتاه ۵ تا ۲۰ میلی‌ثانیه‌ای پس از یک صدای بلند که در آن گوش به طور موقت حساسیت خود را از دست می‌دهد و نمی‌تواند صداهای ضعیف‌تر را بشنود.
بیت‌ریت (Bit Rate)
مقدار داده اختصاص یافته برای نمایش یک ثانیه از صدا، که معمولاً بر حسب کیلوبیت بر ثانیه (kbps) اندازه‌گیری می‌شود.
صدای گذرا (Transient)
یک اوج ناگهانی و پرانرژی در یک سیگنال صوتی، مانند ضربه طبل یا دست زدن، که برای رمزگذاری دقیق به داده‌های قابل توجهی نیاز دارد.

پرسش‌های متداول

آیا انسان‌ها می‌توانند تفاوت بین MP3 و صدای بدون افت کیفیت را بشنوند؟

در تست‌های شنوایی کور، بیشتر افراد نمی‌توانند تفاوتی بین یک MP3 با کیفیت بالای ۳۲۰ کیلوبیت بر ثانیه و یک فایل بدون افت کیفیت (Lossless) قائل شوند. تفاوت‌ها تنها در بیت‌ریت‌های پایین‌تر یا هنگام گوش دادن به صداهای بسیار پیچیده روی تجهیزات گران‌قیمت آشکار می‌شوند.

بیت‌ریت دقیقاً چیست؟

بیت‌ریت میزان داده پردازش شده در هر ثانیه از صدا را اندازه‌گیری می‌کند. بیت‌ریت بالاتر به این معنی است که داده‌های بیشتری از قطعه ضبط‌شده اصلی حفظ می‌شود که منجر به حجم فایل بزرگتر و به طور کلی کیفیت صدای بهتر می‌گردد.

چرا برخی از فایل‌های MP3 صدای آبکی یا فلزی دارند؟

این یک نویز مصنوعی ناشی از فشرده‌سازی است که «پیش‌طنین» (Pre-echo) یا پخش‌شدگی فاز نامیده می‌شود. این اتفاق زمانی رخ می‌دهد که بیت‌ریت برای رمزگذار بسیار پایین است تا بتواند صداهای ناگهانی و تیز را به دقت پردازش کند و در نتیجه مجبور می‌شود نویز دیجیتال را در سراسر فریم صوتی پخش کند.

آیا صدای بلوتوث از فشرده‌سازی روان‌شناختی صوتی استفاده می‌کند؟

بله. صدای استاندارد بلوتوث به کدک‌های با افت کیفیت مانند SBC یا AAC متکی است که از اصول روان‌شناختی صوتی مشابهی برای فشرده‌سازی جریان صوتی استفاده می‌کنند تا بتوان آن را به صورت بی‌سیم و بدون قطعی منتقل کرد.

بررسی عمیق دیدگاه‌ها

اجماع مهندسی

مهندسان صدا کدگذاری ادراکی را یک پیروزی در بهره‌وری می‌دانند که شفافیت صوتی را ارائه می‌دهد.

از دیدگاه مهندسی، مدل روان‌شناختی صوتی یک مسئله حل شده است. توسعه‌دهندگان در موسساتی مانند فرانهوفر ثابت کردند که شنوایی انسان یک مکانیسم بیولوژیکی ناقص و به راحتی قابل دستکاری است. مهندسان با استفاده از پوشش فرکانسی و زمانی استدلال می‌کنند که یک MP3 با کیفیت ۳۲۰ کیلوبیت بر ثانیه برای اکثریت قریب به اتفاق شنوندگان از نظر صوتی شفاف است، به این معنی که مغز انسان نمی‌تواند آن را از فایل مستر اصلی ۱۴۱۱ کیلوبیت بر ثانیه تشخیص دهد. برای این گروه، صدای بدون افت کیفیت عمدتاً هدر دادن پهنای باندی است که داده‌هایی را ذخیره می‌کند که گوش از نظر فیزیکی قادر به پردازش آن‌ها نیست.

نقد علاقه‌مندان حرفه‌ای صدا

این گروه استدلال می‌کنند که دور ریختن داده‌ها، ریزپویایی و تصویرسازی فضایی یک قطعه ضبط‌شده را تغییر می‌دهد.

جامعه علاقه‌مندان حرفه‌ای صدا معتقدند که اگرچه مدل روان‌شناختی صوتی با موفقیت آشکارترین نویزهای مصنوعی خود را پنهان می‌کند، اما اثر تجمعی دور ریختن ۸۰ تا ۹۰ درصد از یک فایل، تجربه شنیداری را کاهش می‌دهد. آن‌ها استدلال می‌کنند که حذف فرکانس‌های پوشیده‌شده، هم‌ترازی فاز و ریزپویایی موج صوتی را تغییر داده و «صحنه صوتی» (Soundstage) درک شده یا فضای سه‌بعدی قطعه ضبط‌شده را از بین می‌برد. این گروه از فرمت‌های با وضوح بالا و بدون افت کیفیت دفاع کرده و ادعا می‌کنند که تجهیزات پخش رده‌بالا داده‌های از دست رفته‌ای را که هدفون‌های استاندارد پنهان می‌کنند، آشکار می‌سازند.

استاندارد آرشیو

آرشیویست‌ها کدگذاری ادراکی را به طور کامل رد کرده و تکثیر دقیق ریاضی را بر اندازه فایل ترجیح می‌دهند.

برای نهادهایی مانند کتابخانه کنگره، محدودیت‌های بیولوژیکی شنوایی انسان در ماموریت حفظ و نگهداری بی‌ربط است. آرشیویست‌ها MP3 را به عنوان یک فرمت با افت کیفیت طبقه‌بندی می‌کنند زیرا موج صوتی اصلی در طول فرآیند رمزگذاری برای همیشه از بین می‌رود. استاندارد آن‌ها ایجاب می‌کند که یک فایل دیجیتال قادر باشد سیگنال آنالوگ اصلی را بایت به بایت به طور کامل بازسازی کند. در نتیجه، نهادهای آرشیوی فرمت‌های غیرفشرده مانند WAV یا کدک‌های بدون افت کیفیت مانند FLAC را الزامی می‌کنند تا اطمینان حاصل شود که سوابق تاریخی بدون توجه به اینکه برای گوش انسان چگونه به نظر می‌رسند، از نظر ریاضی دست‌نخورده باقی می‌مانند.

مهندسان صدا 45%علاقه‌مندان حرفه‌ای صدا 35%آرشیویست‌ها 20%
مهندسان صدا
بر کارایی ریاضی کدگذاری ادراکی تمرکز دارند و استدلال می‌کنند که فایل‌های MP3 با بیت‌ریت بالا برای شنوایی انسان از نظر صوتی کاملاً شفاف و بی‌نقص هستند.
علاقه‌مندان حرفه‌ای صدا
استدلال می‌کنند که دور ریختن هرگونه داده، فاز و ریزپویایی (Micro-dynamics) یک قطعه ضبط‌شده را تغییر می‌دهد و برای حفظ دقیق موج صوتی، از فرمت‌های بدون افت کیفیت دفاع می‌کنند.
آرشیویست‌ها
تکثیر دقیق داده‌ها را بر اندازه فایل ترجیح می‌دهند و فشرده‌سازی با افت کیفیت را برای اهداف حفظ و نگهداری تاریخی به طور کامل رد می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار
  • مدیران پلتفرم‌های استریم

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

مهندسان صدا 45%علاقه‌مندان حرفه‌ای صدا 35%آرشیویست‌ها 20%
  1. [1]MDPIمهندسان صدا

    Psychoacoustic Models for Perceptual Audio Coding—A Tutorial Review

    مطالعه در MDPI →
  2. [2]Library of Congressآرشیویست‌ها

    MP3 (MPEG Layer III Audio Encoding)

    مطالعه در Library of Congress →
  3. [3]Sound On Soundمهندسان صدا

    Perceptual Coding: How MP3 Compression Works

    مطالعه در Sound On Sound →
  4. [4]TechTargetمهندسان صدا

    What is MP3 (MPEG-1 Audio Layer 3)?

    مطالعه در TechTarget →
  5. [5]MD-SOARآرشیویست‌ها

    Audio Compression: Psychoacoustics of MP3

    مطالعه در MD-SOAR →
  6. [6]تیم سردبیری کوهستانعلاقه‌مندان حرفه‌ای صدا

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار فناوری با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.