رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعماری شبکهتوضیح و تشریح· 8 دقیقه مطالعه· در هوش مصنوعی

مزیت نمایی بازنمایی شبکه‌های عصبی عمیق و باریک نسبت به شبکه‌های کم‌عمق و پهن

اثبات‌های ریاضی نشان می‌دهند که شبکه‌های عصبی عمیق می‌توانند توابع پیچیده را با استفاده از پارامترهای به مراتب کمتری نسبت به شبکه‌های کم‌عمق تقریب بزنند. این کارایی هندسی، مبنای نظری معماری‌های هوش مصنوعی مدرن را تشکیل می‌دهد.

به قلم الوین شادمهر

دانشمندان کامپیوتر نظری 40%مهندسان هوش مصنوعی کاربردی 35%معماران سخت‌افزار 25%
دانشمندان کامپیوتر نظری
تمرکز بر اثبات‌های ریاضی دقیق که ظرفیت بازنمایی و کارایی پارامتر توپولوژی‌های مختلف شبکه را محدود می‌کند.
مهندسان هوش مصنوعی کاربردی
اولویت دادن به بده‌بستان‌های تجربی بین عمق و عرض، متعادل کردن کارایی بازنمایی در برابر چالش‌های عملی جریان گرادیان و بهینه‌سازی.
معماران سخت‌افزار
مشاهده توپولوژی شبکه از دریچه محدودیت‌های سیلیکونی، بهینه‌سازی پردازنده‌ها برای بارهای کاری خاص ضرب ماتریسی تولید شده توسط معماری‌های عمیق.

دیدگاه‌هایی که این گزارش پوشش نداده

  • متخصصان علوم اعصاب که عمق شبکه‌های مصنوعی را با ساختارهای مغز بیولوژیکی مقایسه می‌کنند.
  • اقتصاددانان انرژی که تفاوت‌های مصرف برق بین توپولوژی‌های شبکه را تحلیل می‌کنند.

چرا مهم است

درک کارایی ریاضی شبکه‌های عصبی عمیق توضیح می‌دهد که چرا مدل‌های هوش مصنوعی مدرن می‌توانند روی سخت‌افزارهای فعلی اجرا شوند، به جای اینکه به مقادیر غیرممکنی از حافظه نیاز داشته باشند. این مزیت هندسی نحوه طراحی الگوریتم‌های نرم‌افزاری و سیلیکون فیزیکی توسط هر شرکت بزرگ فناوری را تعیین می‌کند.

تصور کنید که سعی می‌کنید یک تکه کاغذ را تا کنید تا یک شکل اوریگامی پیچیده ایجاد شود. انجام این کار با یک تای واحد و فوق‌العاده پهن، به یک ورق کاغذ به مراتب بزرگتر نیاز دارد تا انجام یک دنباله از ۱۰ یا ۲۰ تای کوچک و متوالی. در معماری هوش مصنوعی، این تفاوت هندسی اساسی بین شبکه‌های عصبی پهن و عمیق است. برای تقریب یک تابع ریاضی بسیار پیچیده، یک شبکه کم‌عمق ممکن است به میلیاردها پارامتر نیاز داشته باشد – که با نرخ Ω(۲^k) گره مقیاس می‌شود – در حالی که یک شبکه عمیق می‌تواند دقیقاً همان قدرت بازنمایی را با استفاده از کسری از آن تعداد به دست آورد، که با Θ(k^۳) لایه و تنها تعداد انگشت‌شماری گره در هر لایه مقیاس می‌شود.[1][8]

این مزیت نمایی، موتور ریاضی است که رونق هوش مصنوعی مدرن را به پیش می‌برد. در حالی که قضیه تقریب جهانی مدت‌هاست بیان کرده است که یک شبکه عصبی تنها با یک لایه پنهان می‌تواند از نظر تئوری هر تابع پیوسته‌ای را محاسبه کند، اما در مورد کارایی آن محاسبه چیزی نمی‌گوید. در عمل، مجبور کردن یک شبکه برای یادگیری یک مجموعه داده پیچیده و بسیار غیرخطی تنها با استفاده از عرض، از نظر محاسباتی مخرب است.[4][7]

برای درک اینکه چرا عمق بسیار کارآمدتر از عرض است، باید به نحوه پردازش اطلاعات توسط شبکه‌های عصبی نگاه کنیم. یک شبکه عصبی اساساً مجموعه‌ای از تبدیل‌های ریاضی است که روی داده‌های ورودی اعمال می‌شود. هر لایه در شبکه، خروجی لایه قبلی را می‌گیرد، مجموعه‌ای از وزن‌ها و بایاس‌ها را اعمال می‌کند، آن را از طریق یک تابع فعال‌سازی عبور می‌دهد و به لایه بعدی می‌سپارد.[4]

در یک شبکه کم‌عمق و پهن – که اغلب به عنوان شبکه‌ای با تنها ۱ یا ۲ لایه پنهان تعریف می‌شود – هر نورون در آن لایه سعی می‌کند به طور همزمان بخش متفاوتی از الگوی کلی را ثبت کند. از آنجایی که شبکه فاقد توانایی ساختن بر اساس انتزاعات قبلی است، باید فضای ورودی را با زور و تکرار حفظ کند. اگر پیچیدگی کار به صورت خطی افزایش یابد، تعداد نورون‌های مورد نیاز در آن لایه پنهان واحد به صورت نمایی افزایش می‌یابد.[1][4]

برای تقریب توابع ریاضی پیچیده، شبکه‌های کم‌عمق به تعداد گره‌هایی نیاز دارند که به صورت نمایی مقیاس می‌شوند، در حالی که شبکه‌های عمیق به صورت چندجمله‌ای مقیاس می‌شوند.

در مقابل، شبکه‌های عمیق از طریق ترکیب عمل می‌کنند. یک شبکه عصبی عمیق چندین لایه پنهان را به صورت متوالی روی هم قرار می‌دهد. لایه اول ممکن است لبه‌های ساده را در یک تصویر تشخیص دهد؛ لایه دوم آن لبه‌ها را در بافت‌ها ترکیب می‌کند؛ لایه سوم بافت‌ها را در اشکال ترکیب می‌کند و الی آخر. این استخراج ویژگی سلسله مراتبی به این معنی است که هر لایه، کار محاسباتی انجام شده توسط لایه‌های زیرین خود را مجدداً استفاده می‌کند.[6]

مبنای نظری این مزیت به طور دقیق در مقاله‌ای در فوریه ۲۰۱۶ رسمی شد، که نشان داد «شبکه‌های عصبی با Θ(k^۳) لایه، Θ(۱) گره در هر لایه، و Θ(۱) پارامتر متمایز وجود دارند که نمی‌توانند توسط شبکه‌هایی با O(k) لایه تقریب زده شوند، مگر اینکه به صورت نمایی بزرگ باشند.» نویسندگان اثبات کردند که شبکه‌های کم‌عمق باید دارای Ω(۲^k) گره باشند تا با خروجی شبکه عمیق مطابقت داشته باشند.[1]

این صرفاً یک کنجکاوی نظری نیست؛ بلکه یک محدودیت فیزیکی سخت بر نحوه ساخت هوش مصنوعی است. پارامترها در یک شبکه عصبی مستقیماً به الزامات حافظه و چرخه‌های محاسباتی روی یک GPU تبدیل می‌شوند. یک شبکه نمایی بزرگتر به سیلیکون، برق و زمان بیشتری برای آموزش نیاز دارد. با استفاده از عمق، مهندسان می‌توانند مدل‌هایی بسازند که در محدودیت‌های حافظه سخت‌افزارهای مدرن جای بگیرند، در حالی که همچنان پیچیدگی عظیم زبان انسانی یا ویدیوی با وضوح بالا را ثبت می‌کنند.[4][8]

با این حال، رابطه بین عمق و عرض کاملاً یک‌طرفه نیست. در حالی که عمق یک مزیت نمایی در ظرفیت بازنمایی فراهم می‌کند، عرض نقش مهمی در فرآیند بهینه‌سازی ایفا می‌کند. یک مطالعه در سپتامبر ۲۰۱۷ در مورد قدرت بیانی شبکه‌های عصبی نشان داد که شبکه‌های محدود به عرض نیز تقریب‌زننده‌های جهانی هستند، مشروط بر اینکه به یک آستانه ریاضی خاص برسند.[7]

همانطور که نویسندگان مطالعه ۲۰۱۷ اشاره می‌کنند، «شبکه‌های ReLU با عرض (ن+۴)، که در آن ن بُعد ورودی است، تقریب‌زننده‌های جهانی هستند،» اما نکته مهم این است که «به جز مجموعه‌ای با اندازه صفر، همه توابع را نمی‌توان با شبکه‌های ReLU با عرض ن تقریب زد، که نشان‌دهنده یک انتقال فاز است.» این بدان معناست که در حالی که عمق محرک اصلی کارایی است، یک شبکه همچنان باید حداقل آستانه‌ای از عرض را حفظ کند تا اصلاً کار کند.[7]

تحقیقات یک انتقال فاز سخت را نشان می‌دهد: شبکه‌هایی با عرضی که اکیداً کمتر از بُعد ورودی است، توانایی تقریب توابع خاصی را به طور کامل از دست می‌دهند.

علاوه بر این، آموزش شبکه‌های فوق‌العاده عمیق و باریک به طور بدنامی دشوار است. با عمیق‌تر شدن شبکه، گرادیان‌ها – سیگنال‌های ریاضی مورد استفاده برای به‌روزرسانی وزن‌های شبکه در طول آموزش – باید به عقب از طریق هر لایه منتشر شوند. در شبکه‌های بسیار عمیق، این گرادیان‌ها می‌توانند یا به صفر محو شوند یا به بی‌نهایت منفجر شوند، که یادگیری مؤثر را برای شبکه غیرممکن می‌سازد.[5]

علاوه بر این، آموزش شبکه‌های فوق‌العاده عمیق و باریک به طور بدنامی دشوار است.

این چالش بهینه‌سازی دلیلی است که معماری‌های مدرن تنها به عمق متکی نیستند. موفق‌ترین مدل‌ها، مانند معماری ترنسفورمر که مدل‌های زبان بزرگ را قدرت می‌بخشد، تعادل دقیقی برقرار می‌کنند. آنها از عمق قابل توجهی برای دستیابی به کارایی بازنمایی استفاده می‌کنند، اما عرض کافی در هر لایه را حفظ می‌کنند تا جریان گرادیان پایدار و بهینه‌سازی قابل اعتماد در میلیاردها پارامتر را تضمین کنند.[3][8]

جامعه نظری هنوز در حال کار برای ترسیم کامل مرزهای این بده‌بستان است. در حالی که مزیت نمایی عمق برای توابع ریاضی خاص به خوبی تثبیت شده است، اثبات اینکه این مزیت به طور جهانی در مورد همه مجموعه‌داده‌های دنیای واقعی صدق می‌کند، یک مسئله باز باقی مانده است. موفقیت تجربی یادگیری عمیق به شدت نشان می‌دهد که جهان طبیعی بسیار ترکیبی است و آن را برای معماری‌های عمیق و سلسله مراتبی کاملاً مناسب می‌سازد.[2][5]

لایه دیگری از پیچیدگی هنگام در نظر گرفتن نقش کدگذاری هدف و یادگیری بازنمایی پدیدار می‌شود. تحقیقات ارائه شده در کنفرانس AAAI ۲۰۱۵ در مورد هوش مصنوعی برجسته کرد که نحوه کدگذاری برچسب‌های هدف می‌تواند به طور قابل توجهی بر توانایی یک شبکه عمیق برای یادگیری ویژگی‌های متمایز تأثیر بگذارد. مشخص شد که کدهای باینری توزیع‌شده با قابلیت‌های تصحیح خطا، بازنمایی‌های ویژگی قوی‌تری نسبت به کدگذاری استاندارد ۱-از-ک تشویق می‌کنند.[2]

این تلاقی توپولوژی شبکه و نظریه کدگذاری نشان می‌دهد که کارایی یک شبکه عصبی صرفاً تابعی از شکل آن نیست. نحوه ارائه اطلاعات به شبکه و محدودیت‌های ریاضی اعمال شده بر خروجی آن، به صورت پویا با عمق و عرض آن تعامل دارند. یک شبکه عمیق یک اکوسیستم بسیار حساس است که در آن معماری، بازنمایی داده و الگوریتم‌های بهینه‌سازی باید کاملاً همسو باشند.[2][8]

شبکه‌های عمیق به صورت ترکیبی عمل می‌کنند و به هر لایه متوالی اجازه می‌دهند تا از انتزاعاتی که توسط لایه‌های زیرین آموخته شده‌اند، مجدداً استفاده کند.

همانطور که صنعت هوش مصنوعی به سمت مدل‌های بزرگتر حرکت می‌کند، درک مکانیسم‌های دقیق این مزیت بازنمایی به طور فزاینده‌ای حیاتی می‌شود. آموزش یک مدل پیشرو اکنون صدها میلیون دلار هزینه دارد و به مراکز داده عظیمی نیاز دارد. هر پارامتر باید سهم خود را ایفا کند. اگر محققان بتوانند معماری‌هایی را طراحی کنند که مزایای هندسی عمق را به حداکثر برسانند و در عین حال جریمه‌های بهینه‌سازی را کاهش دهند، هزینه محاسباتی هوش مصنوعی می‌تواند به طور چشمگیری کاهش یابد.[8]

پیامدهای این کارایی ساختاری فراتر از هزینه‌های آموزش است؛ آنها اساساً نحوه عملکرد مدل‌ها در طول استنتاج (inference) را تغییر می‌دهند. هنگامی که یک سیستم هوش مصنوعی مستقر شده، درخواست کاربر را پردازش می‌کند یا یک تصویر پزشکی را تجزیه و تحلیل می‌کند، مسیر محاسباتی که داده‌ها طی می‌کنند توسط معماری شبکه دیکته می‌شود. یک شبکه عمیق و باریک اطلاعات را به صورت متوالی پردازش می‌کند که می‌تواند تأخیر (latency) ایجاد کند، در حالی که یک شبکه پهن و کم‌عمق می‌تواند بسیاری از ویژگی‌ها را به صورت موازی پردازش کند.[4][8]

طراحان سخت‌افزار فعالانه سیلیکون را برای بهره‌برداری از این ویژگی‌های معماری بهینه‌سازی می‌کنند. واحدهای پردازش گرافیکی (GPUs) و واحدهای پردازش تانسور (TPUs) مدرن مهندسی شده‌اند تا بارهای کاری خاص ضرب ماتریسی تولید شده توسط شبکه‌های عمیق و سلسله مراتبی را مدیریت کنند. اگر اجماع نظری به سمت معماری‌های پهن‌تر و کم‌عمق‌تر تغییر کند، کل زنجیره تأمین نیمه‌رسانا باید فلسفه طراحی خود را تغییر دهد.[8]

با این حال، شواهد تجربی همچنان رویکرد «عمق در اولویت» را تأیید می‌کند. در بینایی کامپیوتر، انتقال از مدل‌های اولیه و نسبتاً کم‌عمق به شبکه‌های کانولوشنال عمیق منجر به جهش‌های بی‌سابقه‌ای در دقت شد. توانایی این شبکه‌های عمیق برای یادگیری ویژگی‌های ناوردا (invariant features) – تشخیص یک شیء صرف نظر از موقعیت، نور یا زاویه آن – نتیجه مستقیم عمق ترکیبی آنهاست.[4][6]

همانطور که محققان به بررسی مبانی ریاضی هوش مصنوعی ادامه می‌دهند، دوگانگی بین عمق و عرض به عنوان یک محور اصلی تحقیق عمل می‌کند. این حوزه در حال حرکت فراتر از مهندسی آزمون و خطا به سمت درک دقیق و فیزیک‌مانند از اینکه چرا این مدل‌ها کار می‌کنند، است. باز کردن تصویر نظری کامل ظرفیت بازنمایی نه تنها الگوریتم‌های کارآمدتری را به همراه خواهد داشت، بلکه جعبه سیاه یادگیری عمیق را نیز رمزگشایی می‌کند و تضمین‌هایی در مورد آنچه این سیستم‌ها می‌توانند و نمی‌توانند یاد بگیرند، ارائه می‌دهد.[5][7]

پیروزی شبکه‌های عصبی عمیق بر شبکه‌های کم‌عمق اساساً پیروزی ساختار بر مقیاس است. با سازماندهی سلسله مراتبی محاسبات، الگوریتم‌های یادگیری عمیق طبیعت ترکیبی خود جهان را منعکس می‌کنند – ساختن درک پیچیده از بخش‌های ساده و قابل استفاده مجدد. تلاش مداوم برای ترسیم مرزهای ریاضی دقیق این مزیت، نحوه ساخت نسل بعدی معماری‌های هوش مصنوعی و اینکه آیا صنعت می‌تواند سرعت فعلی مقیاس‌بندی نمایی خود را حفظ کند، دیکته خواهد کرد.[8]

آنچه نمی‌دانیم

  • اینکه آیا مزیت نمایی عمق که برای توابع ریاضی خاص اثبات شده است، به طور جهانی در مورد انواع مجموعه‌داده‌های واقعی و نویزی صدق می‌کند یا خیر.
  • آستانه نظری دقیق که در آن افزودن عمق بیشتر، دیگر هیچ مزیت بازنمایی برای یک کار مشخص ایجاد نمی‌کند.
  • اینکه معماری‌های نوظهور، مانند مدل‌های فضای حالت (state space models)، چگونه ممکن است بده‌بستان‌های ریاضی سنتی بین عمق و عرض را تغییر دهند.

نکات کلیدی

  • شبکه‌های عصبی عمیق می‌توانند توابع پیچیده را با استفاده از پارامترهای به مراتب کمتری نسبت به شبکه‌های کم‌عمق تقریب بزنند.
  • شبکه‌های کم‌عمق باید تعداد گره‌های خود را به صورت نمایی افزایش دهند تا با قدرت بازنمایی یک شبکه عمیق برابری کنند.
  • عمق به شبکه‌ها اجازه می‌دهد تا به صورت ترکیبی یاد بگیرند و ویژگی‌های ساده را برای ساختن انتزاعات پیچیده مجدداً استفاده کنند.
  • در حالی که عمق کارایی را فراهم می‌کند، شبکه‌ها باید حداقل عرضی را حفظ کنند تا قابلیت‌های تقریب خود را از دست ندهند.
  • معماری‌های هوش مصنوعی مدرن، عمق را برای کارایی با عرض کافی متعادل می‌کنند تا بهینه‌سازی ریاضی پایدار تضمین شود.

اصطلاحات کلیدی

Shallow Neural Network
یک معماری هوش مصنوعی با تنها یک یا دو لایه پنهان، که برای حفظ الگوهای پیچیده به تعداد زیادی نورون نیاز دارد.
Deep Neural Network
یک معماری با لایه‌های پنهان متوالی زیاد، که به آن اجازه می‌دهد تا انتزاعات پیچیده را به صورت ترکیبی با استفاده از پارامترهای کلی کمتر بسازد.
Universal Approximation Theorem
یک اصل ریاضی که بیان می‌کند یک شبکه عصبی با یک لایه پنهان می‌تواند از نظر تئوری هر تابع پیوسته‌ای را محاسبه کند، اگرچه ممکن است به تعداد غیرعملی نورون نیاز داشته باشد.
Parameter
متغیرهای داخلی (وزن‌ها و بایاس‌ها) که یک شبکه عصبی در طول آموزش برای یادگیری یک کار تنظیم می‌کند؛ پارامترهای کمتر به معنای حافظه و محاسبات مورد نیاز کمتر است.
Vanishing Gradient
یک مشکل بهینه‌سازی در شبکه‌های بسیار عمیق که در آن سیگنال‌های ریاضی مورد استفاده برای یادگیری برای به‌روزرسانی مؤثر اولین لایه‌ها بیش از حد کوچک می‌شوند.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

دانشمندان کامپیوتر نظری 40%مهندسان هوش مصنوعی کاربردی 35%معماران سخت‌افزار 25%
  1. [1]arXivدانشمندان کامپیوتر نظری

    Benefits of depth in neural networks

    مطالعه در arXiv
  2. [2]AAAI Conference on Artificial Intelligenceدانشمندان کامپیوتر نظری

    On the Depth of Deep Neural Networks: A Theoretical View

    مطالعه در AAAI Conference on Artificial Intelligence
  3. [3]PMC

    Wide and deep neural networks achieve consistency for classification

    مطالعه در PMC
  4. [4]GeeksforGeeksمهندسان هوش مصنوعی کاربردی

    Difference between Shallow and Deep Neural Networks

    مطالعه در GeeksforGeeks
  5. [5]ResearchGateمهندسان هوش مصنوعی کاربردی

    Why does a Deep Neural Network work better than a Shallow Neural Network?

    مطالعه در ResearchGate
  6. [6]Long's Blogمهندسان هوش مصنوعی کاربردی

    Why Deep Representations?

    مطالعه در Long's Blog
  7. [7]arXivدانشمندان کامپیوتر نظری

    The Expressive Power of Neural Networks: A View from the Width

    مطالعه در arXiv
  8. [8]تیم سردبیری کوهستانمعماران سخت‌افزار

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.