چگونه توابع انتقال مرتبط با سر صدای جهتدار را در بازیها خلق میکنند
فیلترهای ریاضی که به گیمرها اجازه میدهند صدای پا را در فضای سهبعدی نقطهزنی کنند، به یک مانع بزرگ برخورد کردهاند: شکل منحصربهفرد گوش انسان. در حالی که توسعهدهندگان بین پروفایلهای صوتی عمومی و آکوستیکهای شخصیسازیشده با یادگیری ماشین در کشمکش هستند، همهچیز به یک بدهبستان ختم میشود: دقت مکانیابی در برابر تاخیر پردازش.
به قلم روکسین بهرامی
این خبر را به اشتراک بگذارید
- طرفداران صدای عمومی
- حامیان پروفایلهای HRTF عمومی و به شدت بهینهشده که تاخیر پایین و عملکرد یکپارچه را در تمام سختافزارها تضمین میکنند.
- مدافعان آکوستیک سفارشی
- محققان و خورههای صدایی که برای حذف خطاهای مکانیابی فضایی، بر استفاده از HRTFهای شخصیسازیشده با یادگیری ماشین پافشاری میکنند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزاری که تراشههای اختصاصی صدای فضایی خود را تبلیغ میکنند
- گیمرهای کمشنوا که به پروفایلهای نامتقارن HRTF نیاز دارند
نکات کلیدی
- موتورهای بازیسازی از توابع انتقال مرتبط با سر (HRTF) برای شبیهسازی صدای موقعیتی سهبعدی از طریق هدفونهای استریوی استاندارد استفاده میکنند.
- بیشتر بازیها به یک پروفایل آکوستیک عمومی مبتنی بر یک سر مانکن تکیه دارند، که باعث میشود بازیکنانی با شکل گوش متفاوت، در تشخیص صدای جلو و عقب دچار اشتباه شوند.
- یادگیری ماشین میتواند با استفاده از عکسها، HRTFهای شخصیسازیشده تولید کند و خطاهای مکانیابی فضایی را تا ۴۰ درصد کاهش دهد.
- بار پردازشی سنگین برای اجرای HRTFهای سفارشی در لحظه، در حال حاضر با بودجه تاخیر به شدت محدود (زیر ۲۰ میلیثانیه) در شوترهای رقابتی در تضاد است.
- 300–400 μs
- اختلاف زمانی بین دو گوش برای صداهای جانبی
- 40%
- کاهش خطای تشخیص جلو-عقب با HRTFهای سفارشی
- 5
- سطوح شخصیسازی HRTF آزمایششده در واقعیت مجازی
- <20 ms
- بودجه تاخیر صوتی برای شوترهای رقابتی
چرا مهم است
صدای فضایی دقیق، همان مرز باریک بین پیروزی در یک دوئل نفسگیر و تیر خوردن از پشت است. درک اینکه موتورهای بازیسازی چگونه صدای سهبعدی را شبیهسازی میکنند، نشان میدهد چرا برخی بازیکنان میتوانند اهداف را از پشت دیوارها با دقت ردیابی کنند، در حالی که عدهای دیگر مدام در تشخیص صدای جلو و عقب گیج میشوند.
در داخل یک اتاق بدون پژواک در یک مرکز تحقیقاتی صدای فضایی، یک سوژه انسانی کاملاً بیحرکت نشسته است، در حالی که یک بازوی رباتیک آرایهای از میکروفونها را در یک کره ۳۶۰ درجه به دور سر او میچرخاند. این میکروفونها در حال اندازهگیری یک اثر انگشت ریاضی هستند: اینکه چگونه چینخوردگیهای خاص گوش خارجی این شخص، پهنای جمجمه و تراکم نیمتنه او، فرکانس یک موج صوتی را پیش از رسیدن به پرده گوش تغییر میدهند. این اندازهگیری، تابع انتقال مرتبط با سر (HRTF) را تولید میکند؛ همان الگوریتمی که صدای بازیهای مدرن را ممکن میسازد.[4][5]
در یک شوتر سهبعدی رقابتی، شنیدن صدای پا در ارتفاع ۴۵ درجه و زاویه افقی ۱۲۰ درجه، مسئله مرگ و زندگی دیجیتال است. برای شبیهسازی این اتفاق از طریق یک جفت هدفون استریوی استاندارد، موتورهای بازیسازی به دو نشانه آکوستیک اصلی تکیه میکنند. اولین مورد، اختلاف زمانی بین دو گوش (ITD) است. اگر صدایی از سمت چپ بازیکن تولید شود، موج صوتی تقریباً ۳۰۰ تا ۴۰۰ میکروثانیه زودتر از گوش راست، به گوش چپ او برخورد میکند.
نشانه دوم، اختلاف سطح بین دو گوش (ILD) است که سایه آکوستیک ایجادشده توسط جمجمه انسان را در نظر میگیرد و باعث میشود صدا در گوش نزدیکتر، به طور قابلتوجهی بلندتر باشد. با این حال، این دو نشانه به تنهایی نمیتوانند مشکل «مخروط ابهام» را حل کنند. اگر منبع صدا دقیقاً در جلو یا دقیقاً در پشت بازیکن باشد، تفاوتهای زمانی و سطحی کاملاً یکسان هستند. مغز برای تشخیص جلو از عقب و بالا از پایین، به مکانیزم سومی نیاز دارد.
این مکانیزم همان لاله گوش است؛ غضروف نامتقارن گوش خارجی. برجستگیهای لاله گوش مانند یک فیلتر شانهای پیچیده عمل میکنند که بسته به زاویه برخورد موج صوتی، فرکانسهای بالای خاصی را تقویت و برخی دیگر را تضعیف میکنند. یک HRTF در واقع یک فیلتر دیجیتال است که دقیقاً همین تغییرات فرکانسی را در لحظه روی یک فایل صوتی تخت اعمال میکند. همانطور که جف اتوود در تحلیل بنیادین سال ۲۰۰۶ خود در بلاگ کدینگ هارر اشاره کرد: «ما فقط دو گوش داریم، اما میتوانیم صداها را در سه بعد مکانیابی کنیم.»
مشکلی که توسعهدهندگان بازیهای مدرن با آن روبهرو هستند این است که شکل گوش انسان مانند اثر انگشت منحصربهفرد است. بیشتر بازیهای رقابتی از یک پروفایل HRTF عمومی استفاده میکنند که بر اساس اندازهگیریهای انجامشده روی یک سر مانکن به نام کمار (KEMAR) ساخته شده است. اگر شکل فیزیکی گوش و پهنای سر یک بازیکن تا حد زیادی با این مانکن مطابقت داشته باشد، صدای فضایی بازی برای او مثل جادو عمل میکند و اجازه میدهد اهداف را از پشت موانع جامد ردیابی کند.[1]
اما اگر آناتومی بازیکن تفاوت چشمگیری با مدل مانکن داشته باشد، ریاضیات شکست میخورد. نتیجه این امر، گیج شدن مزمن در تشخیص صدای جلو و عقب و خطای شدید در تشخیص ارتفاع است. بازیکن صدای دشمنی را میشنود که از درگاه روبهرو در حال نزدیک شدن است، زاویه را پیشبینی کرده و شلیک میکند، اما بلافاصله از بالکنی در پشت سرش تیر میخورد. موتور بازی فایل صوتی درستی را پخش کرده، اما فیلتر عمومی HRTF نشانههای آکوستیک اشتباهی را برای مغز آن بازیکن خاص اعمال کرده است.[1][2]
اما اگر آناتومی بازیکن تفاوت چشمگیری با مدل مانکن داشته باشد، ریاضیات شکست میخورد.
برای حل این مشکل، محققان در حال ارزیابی پروفایلهای آکوستیک سفارشی هستند. یک پیشچاپ در سال ۲۰۲۶ که در آرکایو (arXiv) منتشر شد، پنج سطح مختلف از شخصیسازی HRTF را در محیطهای واقعیت مجازی ارزیابی کرد؛ از سرهای مانکن عمومی گرفته تا اسکنهای آکوستیک کاملاً شخصیسازیشده. دادهها نشان داد که تطبیق الگوریتم با آناتومی کاربر، خطاهای مکانیابی فضایی را به شدت کاهش میدهد، به ویژه در محور عمودی.[1]
یک مطالعه موازی که در ریسرچگیت (ResearchGate) منتشر شد، این HRTFهای شخصیسازیشده را به طور خاص در محیط یک بازی شوتر سهبعدی ارزیابی کرد. محققان سرعت هدفگیری را ردیابی کردند؛ یعنی مدت زمانی که طول میکشد تا یک بازیکن یک منبع صوتی نامرئی را پیدا کرده و به سمت آن نشانه برود. دادهها یک کاهش قابلاندازهگیری و کمی در زمان هدفگیری را نشان دادند، زمانی که بازیکنان از پروفایلی مطابق با اندازهگیریهای فیزیکی خود استفاده میکردند.[2]
با این حال، قرار دادن هر گیمر در یک اتاق بدون پژواک برای نقشهبرداری از گوشهایش از نظر لجستیکی غیرممکن است. به همین دلیل، صنعت بازی به هوش مصنوعی روی آورده است. یک بررسی جامع توسط AIR Unimi نشان داد که چگونه تکنیکهای یادگیری ماشین در حال پر کردن این شکاف شخصیسازی هستند. با تغذیه یک شبکه عصبی از طریق یک عکس ساده گوشی هوشمند از گوش بازیکن، مدل میتواند ضرایب فیلتر HRTF شخصیسازیشده او را بدون نیاز به اندازهگیریهای آکوستیک فیزیکی پیشبینی و تولید کند.[3]
این موضوع یک بدهبستان پردازشی شدید ایجاد میکند. گیمینگ رقابتی به شدت محدود به تاخیر است. یک عنوان مدرن ورزشهای الکترونیک با بودجه تاخیر صوتی کمتر از ۲۰ میلیثانیه کار میکند. اعمال یک HRTF عمومی و از پیش محاسبهشده روی یک جریان صوتی، از نظر پردازشی سبک است. اما اجرای یک فیلتر HRTF شخصیسازیشده و ۱۲۸ نقطهای مبتنی بر یادگیری ماشین روی ۶۴ کانال صوتی همزمان—صدای پا، شلیک، خشابگذاری، استفاده از تجهیزات و دیالوگها—بار پردازشی عظیمی را به سیستم تحمیل میکند.[3][5]
همانطور که نشریه برودکست بریج در تحلیل خود از فرمتهای صدای فضایی اشاره کرد، ظهور فناوری HRTF در حال دگرگون کردن همهچیز است؛ از واقعیت مجازی سینمایی گرفته تا پخش زنده مسابقات ورزشی. اما گیمینگ نیازمند سطحی از تعامل در لحظه و کارایی سختافزاری است که رسانههای منفعل به آن نیازی ندارند. برای یک بیننده فیلم مهم نیست که رندر صدای فضایی ۱۵ میلیثانیه بیشتر طول بکشد؛ اما یک گیمر حرفهای به خاطر همین تاخیر، یک تورنمنت را میبازد.[4]
صنعت سختافزار در تلاش است تا با انتقال پردازش صدا به خارج از پردازنده مرکزی (CPU)، این مشکل را با قدرت خام حل کند. واحدهای پردازش صوتی اختصاصی (APU) و سیلیکونهای ویژه روی مادربردهای گیمینگ ردهبالا، دقیقاً برای مدیریت ریاضیات ماتریسی مورد نیاز برای HRTFهای شخصیسازیشده طراحی میشوند. تا زمانی که این سختافزارها فراگیر نشوند، توسعهدهندگان نرمافزار باید بین سازگاری عمومی و دقت آکوستیک یکی را انتخاب کنند.[3][5]
در حال حاضر، این مزیت رقابتی به طور نابرابر توزیع شده است. بازیکنانی که آناتومی فیزیکی آنها به طور طبیعی با سر مانکن کمار همخوانی دارد، همچنان آگاهی محیطی برتری را در مسابقات استاندارد تجربه خواهند کرد. اما کسانی که خارج از این منحنی زنگولهای آناتومیک قرار میگیرند، باید برای جبران الگوریتمی که اساساً به مغزشان دروغ میگوید، به شدت به نشانههای بصری و شناخت نقشه تکیه کنند.[1]
جهش بزرگ بعدی در طراحی بازیهای رقابتی، به شکستن این گلوگاه بستگی دارد. عامل تعیینکننده این نخواهد بود که کدام مدل آکوستیک در یک محیط آزمایشگاهی کنترلشده صدای بهتری دارد، بلکه این است که کدام مدل میتواند یک منظره صوتی ۳۶۰ درجه را در کمتر از ۲۰ میلیثانیه به دقت رندر کند، آن هم در حالی که کارت گرافیک سیستم از قبل برای حفظ ۲۴۰ فریم بر ثانیه در حال تقلا است.[2][5]
بررسی عمیق دیدگاهها
توابع انتقال مرتبط با سر (HRTF) عمومی
الگوریتمهای آکوستیک استاندارد مبتنی بر اندازهگیریهای سر مانکن که به طور یکسان برای همه بازیکنان اعمال میشوند.
موافق: HRTFهای عمومی از نظر پردازشی سبک هستند، به هیچگونه کالیبراسیون توسط کاربر نیاز ندارند و یک تجربه پایه و ثابت را برای پایگاه عظیمی از بازیکنان بدون فشار آوردن به پردازنده مرکزی تضمین میکنند. مخالف: این پروفایلها برای بازیکنانی که شکل آناتومیک گوش آنها تفاوت زیادی با مدل مانکن دارد، نرخ بالایی از خطای تشخیص جلو-عقب و عدم دقت در ارتفاع را به همراه دارند. شواهد: تحلیل سال ۲۰۰۶ در بلاگ کدینگ هارر ثابت کرد که صدای موقعیتی سهبعدی استاندارد به مدلهای تعمیمیافته متکی است که ذاتاً در موارد استثنایی شکست میخورند. مناسب برای زمانی که: بار پردازنده مرکزی به شدت محدود است، تعداد کانالهای صوتی بالاست و بازیکنان انتظار دارند بدون دردسر تنظیمات، بلافاصله وارد بازی شوند.
توابع انتقال مرتبط با سر (HRTF) شخصیسازیشده با یادگیری ماشین
فیلترهای آکوستیک سفارشی که توسط شبکههای عصبی و با تحلیل عکسهای گوش و هندسه سر یک بازیکن خاص تولید میشوند.
موافق: خطاهای مکانیابی را به شدت کاهش میدهد، به ویژه در محور عمودی و «مخروط ابهام»، و اجازه میدهد تا هدفگیری نقطهزن کاملاً بر اساس صدا انجام شود. مخالف: تاخیر پردازشی ایجاد میکند، نیازمند فرآیند آمادهسازی کاربر (اسکن یا عکسبرداری از گوش) است و برای اعمال فیلترهای پیچیده روی دهها جریان صوتی همزمان، به قدرت پردازشی اختصاصی نیاز دارد. شواهد: ارزیابی ریسرچگیت در یک شوتر سهبعدی، بهبودهای قابلاندازهگیری در سرعت هدفگیری را نشان داد، در حالی که بررسی AIR Unimi بر نیازهای پردازشی شخصیسازی مبتنی بر یادگیری ماشین تاکید کرد. مناسب برای زمانی که: برنامه به شدت غوطهورکننده است (مانند واقعیت مجازی)، سختافزار شامل سیلیکون پردازش صوتی اختصاصی است و کاربر حاضر است برای کسب یک مزیت رقابتی، فرآیند کالیبراسیون را طی کند.
منابع
[1]arXivمدافعان آکوستیک سفارشیEvaluation of Head-Related Transfer Functions Across Five Levels of Individualisation in Virtual Reality
مطالعه در arXiv →
[2]ResearchGateمدافعان آکوستیک سفارشیEvaluation of Individualized HRTFs in a 3D Shooter Game
مطالعه در ResearchGate →
[3]AIR Unimiمدافعان آکوستیک سفارشیA Survey on Machine Learning Techniques for Head-Related Transfer Function Individualization
مطالعه در AIR Unimi →
[4]The Broadcast BridgeSpatial Audio: Part 1 - Current Formats & The Rise Of HRTF
مطالعه در The Broadcast Bridge →
[5]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در بازی و ورزشهای الکترونیک
مشاهده همه →معماری نتکد
مکانیزم نتکد رولبک: بازیهای مبارزهای چگونه برای نابودی لگ، آینده را پیشبینی میکنند؟
6 منبع
حقوق مالکیت معنوی
سازوکار توافقنامه لایسنس: چگونه ناشران بازی با حق مالکیت معنوی، قوانین لیگهای ورزشهای الکترونیک و سهم درآمد را دیکته میکنند
8 منبع
نقشه راه بلیزارد
چرخش بلیزارد به سمت نقشهراههای فوقبلندمدت؛ رونمایی از دیابلو ۵ و استارکرافت جدید
6 منبع
زیرساخت هوش مصنوعی
قمار ۳.۵ میلیارد دلاری انویدیا روی مدیاتک؛ تسخیر بازار شتابدهندههای سفارشی با پلتفرم NVLink Fusion
5 منبع
هر زاویه. هر روز.
دریافت بازی و ورزشهای الکترونیک اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





