مزیت نمایی بازنمایی شبکههای عصبی عمیق و باریک نسبت به شبکههای کمعمق و پهن
اثباتهای ریاضی نشان میدهند که شبکههای عصبی عمیق میتوانند توابع پیچیده را با استفاده از پارامترهای به مراتب کمتری نسبت به شبکههای کمعمق تقریب بزنند. این کارایی هندسی، مبنای نظری معماریهای هوش مصنوعی مدرن را تشکیل میدهد.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
- دانشمندان کامپیوتر نظری
- تمرکز بر اثباتهای ریاضی دقیق که ظرفیت بازنمایی و کارایی پارامتر توپولوژیهای مختلف شبکه را محدود میکند.
- مهندسان هوش مصنوعی کاربردی
- اولویت دادن به بدهبستانهای تجربی بین عمق و عرض، متعادل کردن کارایی بازنمایی در برابر چالشهای عملی جریان گرادیان و بهینهسازی.
- معماران سختافزار
- مشاهده توپولوژی شبکه از دریچه محدودیتهای سیلیکونی، بهینهسازی پردازندهها برای بارهای کاری خاص ضرب ماتریسی تولید شده توسط معماریهای عمیق.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان علوم اعصاب که عمق شبکههای مصنوعی را با ساختارهای مغز بیولوژیکی مقایسه میکنند.
- اقتصاددانان انرژی که تفاوتهای مصرف برق بین توپولوژیهای شبکه را تحلیل میکنند.
چرا مهم است
درک کارایی ریاضی شبکههای عصبی عمیق توضیح میدهد که چرا مدلهای هوش مصنوعی مدرن میتوانند روی سختافزارهای فعلی اجرا شوند، به جای اینکه به مقادیر غیرممکنی از حافظه نیاز داشته باشند. این مزیت هندسی نحوه طراحی الگوریتمهای نرمافزاری و سیلیکون فیزیکی توسط هر شرکت بزرگ فناوری را تعیین میکند.
تصور کنید که سعی میکنید یک تکه کاغذ را تا کنید تا یک شکل اوریگامی پیچیده ایجاد شود. انجام این کار با یک تای واحد و فوقالعاده پهن، به یک ورق کاغذ به مراتب بزرگتر نیاز دارد تا انجام یک دنباله از ۱۰ یا ۲۰ تای کوچک و متوالی. در معماری هوش مصنوعی، این تفاوت هندسی اساسی بین شبکههای عصبی پهن و عمیق است. برای تقریب یک تابع ریاضی بسیار پیچیده، یک شبکه کمعمق ممکن است به میلیاردها پارامتر نیاز داشته باشد – که با نرخ Ω(۲^k) گره مقیاس میشود – در حالی که یک شبکه عمیق میتواند دقیقاً همان قدرت بازنمایی را با استفاده از کسری از آن تعداد به دست آورد، که با Θ(k^۳) لایه و تنها تعداد انگشتشماری گره در هر لایه مقیاس میشود.[1][8]
این مزیت نمایی، موتور ریاضی است که رونق هوش مصنوعی مدرن را به پیش میبرد. در حالی که قضیه تقریب جهانی مدتهاست بیان کرده است که یک شبکه عصبی تنها با یک لایه پنهان میتواند از نظر تئوری هر تابع پیوستهای را محاسبه کند، اما در مورد کارایی آن محاسبه چیزی نمیگوید. در عمل، مجبور کردن یک شبکه برای یادگیری یک مجموعه داده پیچیده و بسیار غیرخطی تنها با استفاده از عرض، از نظر محاسباتی مخرب است.[4][7]
برای درک اینکه چرا عمق بسیار کارآمدتر از عرض است، باید به نحوه پردازش اطلاعات توسط شبکههای عصبی نگاه کنیم. یک شبکه عصبی اساساً مجموعهای از تبدیلهای ریاضی است که روی دادههای ورودی اعمال میشود. هر لایه در شبکه، خروجی لایه قبلی را میگیرد، مجموعهای از وزنها و بایاسها را اعمال میکند، آن را از طریق یک تابع فعالسازی عبور میدهد و به لایه بعدی میسپارد.[4]
در یک شبکه کمعمق و پهن – که اغلب به عنوان شبکهای با تنها ۱ یا ۲ لایه پنهان تعریف میشود – هر نورون در آن لایه سعی میکند به طور همزمان بخش متفاوتی از الگوی کلی را ثبت کند. از آنجایی که شبکه فاقد توانایی ساختن بر اساس انتزاعات قبلی است، باید فضای ورودی را با زور و تکرار حفظ کند. اگر پیچیدگی کار به صورت خطی افزایش یابد، تعداد نورونهای مورد نیاز در آن لایه پنهان واحد به صورت نمایی افزایش مییابد.[1][4]
در مقابل، شبکههای عمیق از طریق ترکیب عمل میکنند. یک شبکه عصبی عمیق چندین لایه پنهان را به صورت متوالی روی هم قرار میدهد. لایه اول ممکن است لبههای ساده را در یک تصویر تشخیص دهد؛ لایه دوم آن لبهها را در بافتها ترکیب میکند؛ لایه سوم بافتها را در اشکال ترکیب میکند و الی آخر. این استخراج ویژگی سلسله مراتبی به این معنی است که هر لایه، کار محاسباتی انجام شده توسط لایههای زیرین خود را مجدداً استفاده میکند.[6]
مبنای نظری این مزیت به طور دقیق در مقالهای در فوریه ۲۰۱۶ رسمی شد، که نشان داد «شبکههای عصبی با Θ(k^۳) لایه، Θ(۱) گره در هر لایه، و Θ(۱) پارامتر متمایز وجود دارند که نمیتوانند توسط شبکههایی با O(k) لایه تقریب زده شوند، مگر اینکه به صورت نمایی بزرگ باشند.» نویسندگان اثبات کردند که شبکههای کمعمق باید دارای Ω(۲^k) گره باشند تا با خروجی شبکه عمیق مطابقت داشته باشند.[1]
این صرفاً یک کنجکاوی نظری نیست؛ بلکه یک محدودیت فیزیکی سخت بر نحوه ساخت هوش مصنوعی است. پارامترها در یک شبکه عصبی مستقیماً به الزامات حافظه و چرخههای محاسباتی روی یک GPU تبدیل میشوند. یک شبکه نمایی بزرگتر به سیلیکون، برق و زمان بیشتری برای آموزش نیاز دارد. با استفاده از عمق، مهندسان میتوانند مدلهایی بسازند که در محدودیتهای حافظه سختافزارهای مدرن جای بگیرند، در حالی که همچنان پیچیدگی عظیم زبان انسانی یا ویدیوی با وضوح بالا را ثبت میکنند.[4][8]
با این حال، رابطه بین عمق و عرض کاملاً یکطرفه نیست. در حالی که عمق یک مزیت نمایی در ظرفیت بازنمایی فراهم میکند، عرض نقش مهمی در فرآیند بهینهسازی ایفا میکند. یک مطالعه در سپتامبر ۲۰۱۷ در مورد قدرت بیانی شبکههای عصبی نشان داد که شبکههای محدود به عرض نیز تقریبزنندههای جهانی هستند، مشروط بر اینکه به یک آستانه ریاضی خاص برسند.[7]
همانطور که نویسندگان مطالعه ۲۰۱۷ اشاره میکنند، «شبکههای ReLU با عرض (ن+۴)، که در آن ن بُعد ورودی است، تقریبزنندههای جهانی هستند،» اما نکته مهم این است که «به جز مجموعهای با اندازه صفر، همه توابع را نمیتوان با شبکههای ReLU با عرض ن تقریب زد، که نشاندهنده یک انتقال فاز است.» این بدان معناست که در حالی که عمق محرک اصلی کارایی است، یک شبکه همچنان باید حداقل آستانهای از عرض را حفظ کند تا اصلاً کار کند.[7]
علاوه بر این، آموزش شبکههای فوقالعاده عمیق و باریک به طور بدنامی دشوار است. با عمیقتر شدن شبکه، گرادیانها – سیگنالهای ریاضی مورد استفاده برای بهروزرسانی وزنهای شبکه در طول آموزش – باید به عقب از طریق هر لایه منتشر شوند. در شبکههای بسیار عمیق، این گرادیانها میتوانند یا به صفر محو شوند یا به بینهایت منفجر شوند، که یادگیری مؤثر را برای شبکه غیرممکن میسازد.[5]
علاوه بر این، آموزش شبکههای فوقالعاده عمیق و باریک به طور بدنامی دشوار است.
این چالش بهینهسازی دلیلی است که معماریهای مدرن تنها به عمق متکی نیستند. موفقترین مدلها، مانند معماری ترنسفورمر که مدلهای زبان بزرگ را قدرت میبخشد، تعادل دقیقی برقرار میکنند. آنها از عمق قابل توجهی برای دستیابی به کارایی بازنمایی استفاده میکنند، اما عرض کافی در هر لایه را حفظ میکنند تا جریان گرادیان پایدار و بهینهسازی قابل اعتماد در میلیاردها پارامتر را تضمین کنند.[3][8]
جامعه نظری هنوز در حال کار برای ترسیم کامل مرزهای این بدهبستان است. در حالی که مزیت نمایی عمق برای توابع ریاضی خاص به خوبی تثبیت شده است، اثبات اینکه این مزیت به طور جهانی در مورد همه مجموعهدادههای دنیای واقعی صدق میکند، یک مسئله باز باقی مانده است. موفقیت تجربی یادگیری عمیق به شدت نشان میدهد که جهان طبیعی بسیار ترکیبی است و آن را برای معماریهای عمیق و سلسله مراتبی کاملاً مناسب میسازد.[2][5]
لایه دیگری از پیچیدگی هنگام در نظر گرفتن نقش کدگذاری هدف و یادگیری بازنمایی پدیدار میشود. تحقیقات ارائه شده در کنفرانس AAAI ۲۰۱۵ در مورد هوش مصنوعی برجسته کرد که نحوه کدگذاری برچسبهای هدف میتواند به طور قابل توجهی بر توانایی یک شبکه عمیق برای یادگیری ویژگیهای متمایز تأثیر بگذارد. مشخص شد که کدهای باینری توزیعشده با قابلیتهای تصحیح خطا، بازنماییهای ویژگی قویتری نسبت به کدگذاری استاندارد ۱-از-ک تشویق میکنند.[2]
این تلاقی توپولوژی شبکه و نظریه کدگذاری نشان میدهد که کارایی یک شبکه عصبی صرفاً تابعی از شکل آن نیست. نحوه ارائه اطلاعات به شبکه و محدودیتهای ریاضی اعمال شده بر خروجی آن، به صورت پویا با عمق و عرض آن تعامل دارند. یک شبکه عمیق یک اکوسیستم بسیار حساس است که در آن معماری، بازنمایی داده و الگوریتمهای بهینهسازی باید کاملاً همسو باشند.[2][8]
همانطور که صنعت هوش مصنوعی به سمت مدلهای بزرگتر حرکت میکند، درک مکانیسمهای دقیق این مزیت بازنمایی به طور فزایندهای حیاتی میشود. آموزش یک مدل پیشرو اکنون صدها میلیون دلار هزینه دارد و به مراکز داده عظیمی نیاز دارد. هر پارامتر باید سهم خود را ایفا کند. اگر محققان بتوانند معماریهایی را طراحی کنند که مزایای هندسی عمق را به حداکثر برسانند و در عین حال جریمههای بهینهسازی را کاهش دهند، هزینه محاسباتی هوش مصنوعی میتواند به طور چشمگیری کاهش یابد.[8]
پیامدهای این کارایی ساختاری فراتر از هزینههای آموزش است؛ آنها اساساً نحوه عملکرد مدلها در طول استنتاج (inference) را تغییر میدهند. هنگامی که یک سیستم هوش مصنوعی مستقر شده، درخواست کاربر را پردازش میکند یا یک تصویر پزشکی را تجزیه و تحلیل میکند، مسیر محاسباتی که دادهها طی میکنند توسط معماری شبکه دیکته میشود. یک شبکه عمیق و باریک اطلاعات را به صورت متوالی پردازش میکند که میتواند تأخیر (latency) ایجاد کند، در حالی که یک شبکه پهن و کمعمق میتواند بسیاری از ویژگیها را به صورت موازی پردازش کند.[4][8]
طراحان سختافزار فعالانه سیلیکون را برای بهرهبرداری از این ویژگیهای معماری بهینهسازی میکنند. واحدهای پردازش گرافیکی (GPUs) و واحدهای پردازش تانسور (TPUs) مدرن مهندسی شدهاند تا بارهای کاری خاص ضرب ماتریسی تولید شده توسط شبکههای عمیق و سلسله مراتبی را مدیریت کنند. اگر اجماع نظری به سمت معماریهای پهنتر و کمعمقتر تغییر کند، کل زنجیره تأمین نیمهرسانا باید فلسفه طراحی خود را تغییر دهد.[8]
با این حال، شواهد تجربی همچنان رویکرد «عمق در اولویت» را تأیید میکند. در بینایی کامپیوتر، انتقال از مدلهای اولیه و نسبتاً کمعمق به شبکههای کانولوشنال عمیق منجر به جهشهای بیسابقهای در دقت شد. توانایی این شبکههای عمیق برای یادگیری ویژگیهای ناوردا (invariant features) – تشخیص یک شیء صرف نظر از موقعیت، نور یا زاویه آن – نتیجه مستقیم عمق ترکیبی آنهاست.[4][6]
همانطور که محققان به بررسی مبانی ریاضی هوش مصنوعی ادامه میدهند، دوگانگی بین عمق و عرض به عنوان یک محور اصلی تحقیق عمل میکند. این حوزه در حال حرکت فراتر از مهندسی آزمون و خطا به سمت درک دقیق و فیزیکمانند از اینکه چرا این مدلها کار میکنند، است. باز کردن تصویر نظری کامل ظرفیت بازنمایی نه تنها الگوریتمهای کارآمدتری را به همراه خواهد داشت، بلکه جعبه سیاه یادگیری عمیق را نیز رمزگشایی میکند و تضمینهایی در مورد آنچه این سیستمها میتوانند و نمیتوانند یاد بگیرند، ارائه میدهد.[5][7]
پیروزی شبکههای عصبی عمیق بر شبکههای کمعمق اساساً پیروزی ساختار بر مقیاس است. با سازماندهی سلسله مراتبی محاسبات، الگوریتمهای یادگیری عمیق طبیعت ترکیبی خود جهان را منعکس میکنند – ساختن درک پیچیده از بخشهای ساده و قابل استفاده مجدد. تلاش مداوم برای ترسیم مرزهای ریاضی دقیق این مزیت، نحوه ساخت نسل بعدی معماریهای هوش مصنوعی و اینکه آیا صنعت میتواند سرعت فعلی مقیاسبندی نمایی خود را حفظ کند، دیکته خواهد کرد.[8]
آنچه نمیدانیم
- اینکه آیا مزیت نمایی عمق که برای توابع ریاضی خاص اثبات شده است، به طور جهانی در مورد انواع مجموعهدادههای واقعی و نویزی صدق میکند یا خیر.
- آستانه نظری دقیق که در آن افزودن عمق بیشتر، دیگر هیچ مزیت بازنمایی برای یک کار مشخص ایجاد نمیکند.
- اینکه معماریهای نوظهور، مانند مدلهای فضای حالت (state space models)، چگونه ممکن است بدهبستانهای ریاضی سنتی بین عمق و عرض را تغییر دهند.
نکات کلیدی
- شبکههای عصبی عمیق میتوانند توابع پیچیده را با استفاده از پارامترهای به مراتب کمتری نسبت به شبکههای کمعمق تقریب بزنند.
- شبکههای کمعمق باید تعداد گرههای خود را به صورت نمایی افزایش دهند تا با قدرت بازنمایی یک شبکه عمیق برابری کنند.
- عمق به شبکهها اجازه میدهد تا به صورت ترکیبی یاد بگیرند و ویژگیهای ساده را برای ساختن انتزاعات پیچیده مجدداً استفاده کنند.
- در حالی که عمق کارایی را فراهم میکند، شبکهها باید حداقل عرضی را حفظ کنند تا قابلیتهای تقریب خود را از دست ندهند.
- معماریهای هوش مصنوعی مدرن، عمق را برای کارایی با عرض کافی متعادل میکنند تا بهینهسازی ریاضی پایدار تضمین شود.
اصطلاحات کلیدی
- Shallow Neural Network
- یک معماری هوش مصنوعی با تنها یک یا دو لایه پنهان، که برای حفظ الگوهای پیچیده به تعداد زیادی نورون نیاز دارد.
- Deep Neural Network
- یک معماری با لایههای پنهان متوالی زیاد، که به آن اجازه میدهد تا انتزاعات پیچیده را به صورت ترکیبی با استفاده از پارامترهای کلی کمتر بسازد.
- Universal Approximation Theorem
- یک اصل ریاضی که بیان میکند یک شبکه عصبی با یک لایه پنهان میتواند از نظر تئوری هر تابع پیوستهای را محاسبه کند، اگرچه ممکن است به تعداد غیرعملی نورون نیاز داشته باشد.
- Parameter
- متغیرهای داخلی (وزنها و بایاسها) که یک شبکه عصبی در طول آموزش برای یادگیری یک کار تنظیم میکند؛ پارامترهای کمتر به معنای حافظه و محاسبات مورد نیاز کمتر است.
- Vanishing Gradient
- یک مشکل بهینهسازی در شبکههای بسیار عمیق که در آن سیگنالهای ریاضی مورد استفاده برای یادگیری برای بهروزرسانی مؤثر اولین لایهها بیش از حد کوچک میشوند.
منابع
[1]arXivدانشمندان کامپیوتر نظریBenefits of depth in neural networks
مطالعه در arXiv →
[2]AAAI Conference on Artificial Intelligenceدانشمندان کامپیوتر نظریOn the Depth of Deep Neural Networks: A Theoretical View
مطالعه در AAAI Conference on Artificial Intelligence →
[3]PMCWide and deep neural networks achieve consistency for classification
مطالعه در PMC →
[4]GeeksforGeeksمهندسان هوش مصنوعی کاربردیDifference between Shallow and Deep Neural Networks
مطالعه در GeeksforGeeks →
[5]ResearchGateمهندسان هوش مصنوعی کاربردیWhy does a Deep Neural Network work better than a Shallow Neural Network?
مطالعه در ResearchGate →
[6]Long's Blogمهندسان هوش مصنوعی کاربردیWhy Deep Representations?
مطالعه در Long's Blog →
[7]arXivدانشمندان کامپیوتر نظریThe Expressive Power of Neural Networks: A View from the Width
مطالعه در arXiv →
[8]تیم سردبیری کوهستانمعماران سختافزارتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →تقطیر دانش
چگونه انتقال لاجیت به یک مدل کوچک دانشآموز اجازه میدهد تا با عملکرد مدل بزرگ معلم برابری کند
8 منبع
معماری مدل
چگونه مقداردهی اولیه خاویر از محو شدن و انفجار گرادیانها در شبکههای عصبی عمیق جلوگیری میکند
6 منبع
سیستمهای چندعاملی
چگونه یالهای شرطی تصمیمگیریها را در جریانهای کاری هوش مصنوعی چندعاملی هدایت میکنند
7 منبع
هوش مصنوعی قانوناساسیمحور
چگونه هوش مصنوعی قانوناساسیمحور، یک کتابچه قوانین مکتوب را جایگزین بازخورد انسانی میکند
4 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





