رفتن به محتوای اصلی
Koohestun
توضیح کوهستانفناوری صوتیمقاله تشریحی· 6 دقیقه مطالعه· در فناوری

چگونه پوشش شنیداری به الگوریتم‌های MP3 اجازه می‌دهد ۸۰ درصد از یک فایل صوتی را بدون تغییر در صدای آن دور بریزند

فرمت MP3 کاهش حجم انقلابی خود را نه از طریق فشرده‌سازی سنتی داده‌ها، بلکه با نقشه‌برداری از محدودیت‌های بیولوژیکی شنوایی انسان به دست آورد. این الگوریتم با شناسایی و حذف فرکانس‌هایی که گوش در حضور صداهای بلندتر از نظر فیزیکی قادر به درک آن‌ها نیست، بخش اعظم یک فایل صوتی را دور می‌ریزد، در حالی که آهنگ شنیده شده کاملاً دست‌نخورده به نظر می‌رسد.

به قلم کیان راد

مهندسان صدا 45%علاقه‌مندان حرفه‌ای صدا 35%آرشیویست‌ها 20%
مهندسان صدا
بر کارایی ریاضی کدگذاری ادراکی تمرکز دارند و استدلال می‌کنند که فایل‌های MP3 با بیت‌ریت بالا برای شنوایی انسان از نظر صوتی کاملاً شفاف و بی‌نقص هستند.
علاقه‌مندان حرفه‌ای صدا
استدلال می‌کنند که دور ریختن هرگونه داده، فاز و ریزپویایی (Micro-dynamics) یک قطعه ضبط‌شده را تغییر می‌دهد و برای حفظ دقیق موج صوتی، از فرمت‌های بدون افت کیفیت دفاع می‌کنند.
آرشیویست‌ها
تکثیر دقیق داده‌ها را بر اندازه فایل ترجیح می‌دهند و فشرده‌سازی با افت کیفیت را برای اهداف حفظ و نگهداری تاریخی به طور کامل رد می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار
  • مدیران پلتفرم‌های استریم

گذار از لوح‌های فشرده فیزیکی به آرشیوهای استریم دیجیتال زمانی رخ داد که مهندسان نرم‌افزار متوجه شدند نیازی به ذخیره کل موج صوتی یک قطعه ضبط‌شده ندارند، بلکه تنها بخش‌هایی که مغز انسان قادر به پردازش آن‌هاست کافی است. فشرده‌سازی سنتی داده‌ها، مانند یک فایل ZIP، اطلاعات را بدون از دست دادن حتی یک بایت بهینه‌تر بسته‌بندی می‌کند و اجازه می‌دهد فایل اصلی دقیقاً بازسازی شود. مهندسان صدا خیلی زود دریافتند که اعمال این روشِ بدون افت کیفیت روی امواج صوتی، صرفه‌جویی ناچیزی در فضای ذخیره‌سازی به همراه دارد؛ واقعیتی که باعث شد آن‌ها به جای یک راه‌حل کاملاً ریاضی، به سمت یک راه‌حل بیولوژیکی حرکت کنند.[3][6]

صدای غیرفشرده روی یک سی‌دی استاندارد، فرمتی که در سال ۱۹۸۲ پایه‌گذاری شد، برای ثبت ۴۴۱۰۰ نمونه در هر ثانیه به بیت‌ریتی معادل ۱۴۱۱ کیلوبیت بر ثانیه (kbps) نیاز دارد. هنگامی که موسسه فرانهوفر (Fraunhofer Society) فرمت MP3 را در سال ۱۹۹۳ منتشر کرد، این حجم داده را به ۱۲۸ کیلوبیت بر ثانیه کاهش داد و اندازه فایل‌ها را تقریباً ۹۱ درصد کوچک کرد. این کاهش عظیم با حذف دائمی بخش اعظم داده‌های صوتی از فایل به دست آمد.[2][4]

الگوریتم MP3 بر یک مدل روان‌شناختی صوتی (Psychoacoustic) متکی است که به عنوان یک نقشه ریاضی از محدودیت‌های بیولوژیکی سیستم شنوایی انسان عمل می‌کند. مهندسان به جای اینکه بپرسند چگونه می‌توان موج صوتی را فشرده کرد، این سوال را مطرح کردند که گوش انسان از نظر فیزیکی قادر به شنیدن چه بخش‌هایی از موج صوتی نیست. با شناسایی و حذف آن فرکانس‌های غیرقابل درک، الگوریتم یک اسکلت صوتی از خود به جای می‌گذارد که مغز آن را به عنوان نسخه کامل و اصلی قطعه ضبط‌شده تفسیر می‌کند.[1][5]

ترفند اصلی در این مدل، پدیده‌ای به نام پوشش فرکانسی همزمان است. وقتی دو صدا با فرکانس‌های مشابه دقیقاً در یک زمان پخش می‌شوند، گوش انسان تنها صدای بلندتر را ثبت می‌کند. صدای بلندتر غشای پایه در گوش داخلی را چنان با شدت به لرزه درمی‌آورد که سلول‌های عصبی نمی‌توانند صدای ضعیف‌تری را که در فرکانس مجاور در حال ارتعاش است، تشخیص دهند.[1][3]

پوشش فرکانسی زمانی رخ می‌دهد که یک صدای بلند آستانه شنوایی را بالا برده و فرکانس‌های ضعیف‌تر مجاور را غیرقابل درک می‌کند.

مقاله مروری آموزشی MDPI Applied Sciences در مورد کدگذاری ادراکی صدا خاطرنشان می‌کند: «اگر یک صدای بلند وجود داشته باشد، آستانه شنوایی را در همسایگی طیفی بلافصل خود بالا می‌برد.» رمزگذار MP3 این آستانه را به صورت پویا در کل طیف فرکانس محاسبه کرده، فرکانس‌های ضعیف‌تر و پوشیده‌شده را شناسایی می‌کند و پیش از ذخیره فایل، آن‌ها را برای همیشه از جریان داده‌ها حذف می‌کند.[1]

این مدل همچنین از پوشش زمانی بهره‌برداری کرده و از زمان بازیابی گوش سوءاستفاده می‌کند. یک صدای ناگهانی و بلند، مانند ضربه طبل کوچک (Snare) یا برخورد سنج، گوش را به طور موقت نسبت به صداهای ضعیف‌تری که بلافاصله قبل و بعد از آن می‌آیند، ناشنوا می‌کند. سیستم شنوایی انسان پس از یک اوج گذرای بلند، به ۵ تا ۲۰ میلی‌ثانیه زمان نیاز دارد تا حساسیت کامل خود را بازیابد.[3][5]

رمزگذار MP3 جریان صوتی را در فریم‌های ۲۶ میلی‌ثانیه‌ای تجزیه و تحلیل می‌کند و به طور خاص به دنبال این نقاط کور زمانی می‌گردد. هنگامی که یک صدای گذرای بلند را تشخیص می‌دهد، داده‌های صوتی را که در آن پنجره بازیابی ۵ تا ۲۰ میلی‌ثانیه‌ای قرار می‌گیرند، حذف می‌کند؛ چرا که می‌داند گوش شنونده از نظر بیولوژیکی قادر به ثبت غیبت آن‌ها نیست.[1][3]

رمزگذار MP3 جریان صوتی را در فریم‌های ۲۶ میلی‌ثانیه‌ای تجزیه و تحلیل می‌کند و به طور خاص به دنبال این نقاط کور زمانی می‌گردد.

پس از شناسایی و دور ریختن فرکانس‌های اضافی، الگوریتم بودجه محدود داده‌های خود (یعنی بیت‌ها) را به صداهای باقی‌مانده اختصاص می‌دهد. فرکانس‌هایی که در حساس‌ترین محدوده شنوایی انسان، یعنی بین ۲۰۰۰ تا ۵۰۰۰ هرتز قرار می‌گیرند، بالاترین تخصیص بیت را دریافت می‌کنند تا حداکثر وفاداری به صدای اصلی تضمین شود، زیرا گوش به شدت با گفتار انسان و محدوده‌های صوتی کوک شده است.[1][4]

یک فایل MP3 استاندارد با استفاده از مدل روان‌شناختی صوتی، تقریباً ۹۱ درصد از داده‌های موجود در یک لوح فشرده (CD) غیرفشرده را دور می‌ریزد.

در مقابل، فرکانس‌های بالای ۱۶۰۰۰ هرتز، که بسیاری از بزرگسالان به دلیل کاهش شنوایی ناشی از افزایش سن اصلاً قادر به شنیدن آن‌ها نیستند، به شدت فشرده شده یا به طور کامل دور ریخته می‌شوند. یک فایل MP3 استاندارد ۱۲۸ کیلوبیت بر ثانیه معمولاً یک فیلتر پایین‌گذر (Low-pass) سخت را در ۱۶ کیلوهرتز اعمال می‌کند و هرگونه داده صوتی بالاتر از آن خط را کاملاً حذف می‌کند تا فضا برای فرکانس‌های میانی که برای درک انسان بیشترین اهمیت را دارند، ذخیره شود.[3][4]

این واقعیت بیولوژیکی، کمپین‌های بازاریابی مدرن برای سطوح استریم صوتی «بدون افت کیفیت» (Lossless) و با وضوح بالا را با چالش مواجه می‌کند. شرکت‌هایی مانند اپل و تایدال (Tidal) فایل‌های ۲۴ بیتی و ۱۹۲ کیلوهرتزی را تبلیغ می‌کنند که تا ۹۲۱۶ کیلوبیت بر ثانیه پهنای باند مصرف می‌کنند و وعده یک تجربه شنیداری بی‌نقص را می‌دهند که تمام جزئیات نسخه مستر استودیویی را در بر می‌گیرد.[6]

با این حال، داده‌های حفظ‌شده در این فایل‌های حجیم عمدتاً شامل همان فرکانس‌های پوشیده‌شده و داده‌های فراصوتی است که مدل روان‌شناختی صوتی ثابت کرده ما نمی‌توانیم آن‌ها را بشنویم. فرمت MP3 نشان داد که ۸۰ تا ۹۰ درصد از یک قطعه ضبط‌شده از نظر بیولوژیکی اضافی است؛ به این معنی که مصرف‌کنندگانی که برای صدای با وضوح بالا پول پرداخت می‌کنند، در واقع در حال دانلود داده‌هایی هستند که گوششان قادر به پردازش آن‌ها نیست.[1][6]

پوشش زمانی از زمان بازیابی ۵ تا ۲۰ میلی‌ثانیه‌ای گوش پس از یک صدای گذرا و بلند بهره می‌برد و به رمزگذار اجازه می‌دهد صداهای موجود در آن بازه زمانی را حذف کند.

کتابخانه کنگره آمریکا در ارزیابی پایداری فرمت‌های دیجیتال خود، MP3 را به عنوان یک فرمت «با افت کیفیت» (Lossy) طبقه‌بندی می‌کند، زیرا موج صوتی اصلی نمی‌تواند از فایل فشرده بازسازی شود. با این وجود، این نهاد خاطرنشان می‌کند که این فرمت به طور خاص طراحی شده تا اطمینان حاصل شود که «افت کیفیت برای درک انسان به حداقل می‌رسد»؛ ویژگی‌ای که آن را برای توزیع بسیار کارآمد می‌کند، حتی اگر استانداردهای حفظ و آرشیو را برآورده نکند.[2]

این توهم صوتی تنها زمانی در هم می‌شکند که فشرده‌سازی بیش از حد اعمال شود. در بیت‌ریت‌های زیر ۱۲۸ کیلوبیت بر ثانیه، یا هنگام رمزگذاری صداهای بسیار پیچیده و متراکم مانند یک ارکستر سمفونیک یا جمعیت در حال تشویق، الگوریتم مجبور می‌شود فرکانس‌هایی را دور بریزد که به طور کامل توسط صداهای بلندتر پوشانده نشده‌اند.[3][4]

این قحطی داده منجر به ایجاد نویزهای مصنوعی قابل شنیدن (Artifacts) می‌شود. شایع‌ترین آن‌ها «پیش‌طنین» (Pre-echo) است؛ یک صدای محو و فلزی که درست قبل از صداهای گذرای تیز رخ می‌دهد. این اتفاق به این دلیل می‌افتد که رمزگذار بودجه داده کافی برای ارائه دقیق شروع ناگهانی موج صوتی را ندارد و مجبور می‌شود نویز را در کل فریم ۲۶ میلی‌ثانیه‌ای پخش کند.[1][3]

میراث ماندگار کدگذاری ادراکی، درک این موضوع است که وفاداری صوتی یک معیار بیولوژیکی است، نه یک معیار ریاضی. این فرمت در سطح جهانی موفق شد زیرا به جای نوار مستر اصلی، گوش شنونده را به عنوان داور نهایی برای تعیین اینکه یک قطعه ضبط‌شده واقعاً چه صدایی دارد، در نظر گرفت.[6]

فرمت‌های صوتی با وضوح بالا همان فرکانس‌های پوشیده‌شده‌ای را حفظ می‌کنند که کدگذاری ادراکی آن‌ها را دور می‌ریزد، هرچند هنوز بر سر اینکه آیا شنوندگان واقعاً می‌توانند این تفاوت را درک کنند یا نه، بحث وجود دارد.

نکات کلیدی

  1. فرمت MP3 با حذف داده‌های صوتی که گوش انسان قادر به درک آن‌ها نیست، حجم فایل‌ها را تا ۹۱ درصد کاهش می‌دهد.
  2. پوشش فرکانسی به الگوریتم اجازه می‌دهد تا صداهای ضعیفی را که در میان فرکانس‌های بلندتر و مجاور گم می‌شوند، دور بریزد.
  3. پوشش زمانی از زمان بازیابی ۵ تا ۲۰ میلی‌ثانیه‌ای گوش پس از یک صدای بلند سوءاستفاده می‌کند تا داده‌های غیرقابل درک را حذف کند.
  4. این الگوریتم فرکانس‌های بین ۲۰۰۰ تا ۵۰۰۰ هرتز را که شنوایی انسان در آن‌ها بیشترین حساسیت را دارد، در اولویت قرار می‌دهد.
  5. فایل‌های صوتی با وضوح بالا و «بدون افت کیفیت»، عمدتاً همان فرکانس‌های پوشیده‌شده‌ای را حفظ می‌کنند که کدگذاری ادراکی ثابت کرده است از نظر بیولوژیکی اضافی هستند.

اصطلاحات کلیدی

مدل روان‌شناختی صوتی (Psychoacoustic Model)
یک الگوریتم ریاضی که محدودیت‌های بیولوژیکی شنوایی انسان را نقشه‌برداری می‌کند تا تعیین کند کدام صداها را می‌توان با خیال راحت از یک فایل صوتی حذف کرد.
پوشش فرکانسی (Frequency Masking)
یک پدیده شنوایی که در آن یک صدای بلند مانع از آن می‌شود که گوش انسان صدای ضعیف‌تری را که در همان زمان و در فرکانسی مشابه رخ می‌دهد، بشنود.
پوشش زمانی (Temporal Masking)
پنجره کوتاه ۵ تا ۲۰ میلی‌ثانیه‌ای پس از یک صدای بلند که در آن گوش به طور موقت حساسیت خود را از دست می‌دهد و نمی‌تواند صداهای ضعیف‌تر را بشنود.
بیت‌ریت (Bit Rate)
مقدار داده اختصاص یافته برای نمایش یک ثانیه از صدا، که معمولاً بر حسب کیلوبیت بر ثانیه (kbps) اندازه‌گیری می‌شود.
صدای گذرا (Transient)
یک اوج ناگهانی و پرانرژی در یک سیگنال صوتی، مانند ضربه طبل یا دست زدن، که برای رمزگذاری دقیق به داده‌های قابل توجهی نیاز دارد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

مهندسان صدا 45%علاقه‌مندان حرفه‌ای صدا 35%آرشیویست‌ها 20%
  1. [1]MDPIمهندسان صدا

    Psychoacoustic Models for Perceptual Audio Coding—A Tutorial Review

    مطالعه در MDPI
  2. [2]Library of Congressآرشیویست‌ها

    MP3 (MPEG Layer III Audio Encoding)

    مطالعه در Library of Congress
  3. [3]Sound On Soundمهندسان صدا

    Perceptual Coding: How MP3 Compression Works

    مطالعه در Sound On Sound
  4. [4]TechTargetمهندسان صدا

    What is MP3 (MPEG-1 Audio Layer 3)?

    مطالعه در TechTarget
  5. [5]MD-SOARآرشیویست‌ها

    Audio Compression: Psychoacoustics of MP3

    مطالعه در MD-SOAR
  6. [6]تیم سردبیری کوهستانعلاقه‌مندان حرفه‌ای صدا

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.