رفتن به محتوای اصلی
توضیح کوهستانهوش مصنوعی فیزیکیتوضیح و تشریح۹ شهریور ۱۴۰۵، ۳:۳۵· 8 دقیقه مطالعه· در هوش مصنوعی

مکانیسم‌های اصلی انتقال از شبیه‌سازی به واقعیت: ربات‌های هوش مصنوعی چگونه در ماتریکس یاد می‌گیرند؟

مهندسان با آموزش هوش مصنوعی در شبیه‌سازی‌های دیجیتال تصادفی‌شده، رفتارهای پیچیده رباتیک را با موفقیت در دنیای فیزیکی پیاده‌سازی می‌کنند، بدون اینکه نیازی به سال‌ها آزمون و خطا در زمان واقعی باشد.

به قلم ندا وزیری

طرفداران اولویت شبیه‌سازی 40%خالص‌گرایان دنیای واقعی 30%مهندسان اتوماسیون صنعتی 30%
طرفداران اولویت شبیه‌سازی
استدلال می‌کنند که مقیاس‌دهی محاسبات و داده‌های مصنوعی، مشکل هوش مصنوعی فیزیکی را حل خواهد کرد.
خالص‌گرایان دنیای واقعی
معتقدند که دستکاری‌های غنی از تماس (Contact-rich manipulation) نیازمند تجربه فیزیکی است.
مهندسان اتوماسیون صنعتی
تمرکز بر ایمنی، قابلیت اطمینان و انعطاف‌پذیری گشتاور، به جای مقیاس‌دهی صرف هوش مصنوعی.

نکات کلیدی

  • یادگیری تقویتی (Reinforcement Learning) نیازمند میلیون‌ها تکرار آزمون و خطا است که آموزش رباتیک در دنیای واقعی را به شکلی خطرناک کُند و پرهزینه می‌کند.
  • شبیه‌سازها مشکل سرعت را حل می‌کنند اما شکاف واقعیت (Reality Gap) را بین فیزیک دیجیتال بی‌نقص و محیط‌های پرنویز دنیای واقعی ایجاد می‌کنند.
  • تصادفی‌سازی دامنه (Domain Randomization) با تغییرات شدید در نورپردازی، بافت‌ها و فیزیک شبیه‌سازی‌شده، این شکاف را پر می‌کند و هوش مصنوعی را مجبور به تعمیم‌پذیری می‌سازد.
  • صنعت در حال حرکت به سمت کنترل مبتنی بر گشتاور (Torque-based control) است، که به انعطاف‌پذیری فیزیکی ربات اجازه می‌دهد خطاهای جزئی شبیه‌سازی را جذب کند.
  • پیشرفت‌های اخیر از مدل‌های بینایی-زبان (Vision-Language Models) برای ایجاد حلقه‌های پیوسته واقعیت-به-شبیه‌سازی-به-واقعیت استفاده می‌کنند که بازیابی خودبه‌خودی خطا را ممکن می‌سازد.

چرا مهم است

آموزش ربات‌ها در دنیای فیزیکی به طرز غیرقابل قبولی کُند، پرهزینه و مستعد آسیب سخت‌افزاری است. انتقال از شبیه‌سازی به واقعیت به مهندسان این امکان را می‌دهد که هزاران سال یادگیری مبتنی بر آزمون و خطا را در چند ساعت محاسبات فشرده کنند و گلوگاه اصلی استقرار هوش مصنوعی فیزیکی عمومی در خانه‌ها و کارخانه‌ها را از بین ببرند.

تحقق وعده هوش مصنوعی فیزیکی عمومی در حال حاضر به دلیل یک محدودیت ساده و اجتناب‌ناپذیر با مشکل مواجه شده است: دنیای فیزیکی با سرعتی بسیار کُند عمل می‌کند. در حالی که مدل‌های زبان بزرگ می‌توانند کل اینترنت را در عرض چند ماه در مراکز داده عظیم هضم کنند، ربات‌های فیزیکی مقید به قوانین فیزیک زمان واقعی هستند. آن‌ها نمی‌توانند زمان را برای یادگیری سریع‌تر، شتاب دهند. اگر یک بازوی رباتیک نیاز به تمرین گرفتن یک شیء ظریف داشته باشد، باید مفاصل خود را حرکت دهد، تماس برقرار کند و دوباره تنظیم شود، و این کار را بارها و بارها تکرار کند. این محدودیت اساسی سرعت، از لحاظ تاریخی رباتیک را به جای رفتارهای هوشمند و سازگار، محدود به وظایف صنعتی سفت و سخت و از پیش برنامه‌ریزی شده نگه داشته است.[5]

برای یادگیری رفتارهای پیچیده و پویا—مانند نحوه راه رفتن در زمین ناهموار، گرفتن اشیاء نامنظم، یا مونتاژ چرخ‌دنده‌های ظریف—هوش مصنوعی مدرن به شدت به یادگیری تقویتی (Reinforcement Learning) متکی است. این رویکرد الگوریتمی مستلزم آن است که هوش مصنوعی از طریق حجم عظیمی از آزمون و خطا یاد بگیرد و برای اقدامات موفق پاداش‌های ریاضی و برای شکست‌ها جریمه دریافت کند. برای اینکه یک ربات دوپا صرفاً نحوه حفظ تعادل و انتقال بین الگوهای مختلف راه رفتن را بیاموزد، شبکه عصبی زیربنایی ممکن است به میلیون‌ها تلاش تکراری نیاز داشته باشد تا دستورات حرکتی صحیح را به ورودی‌های حسگر خود نگاشت کند.[3]

تلاش برای اجرای این حجم از یادگیری آزمون و خطا به طور مستقیم روی سخت‌افزار فیزیکی عملاً غیرممکن است. انجام این کار به معنای قرار دادن بازوهای رباتیک و شاسی‌های دوپای بسیار گران‌قیمت در معرض شکست‌های مداوم است. ربات‌ها بارها به میزها برخورد می‌کنند، اشیاء سنگین را رها می‌کنند و موتورهای داخلی خود را می‌سوزانند، زیرا هوش مصنوعی آموزش‌ندیده به طور غیرقابل پیش‌بینی دست و پا می‌زند. فراتر از آسیب فاجعه‌بار سخت‌افزاری، زمان زیادی که برای جمع‌آوری ماه‌ها یا سال‌ها داده فیزیکی در زمان واقعی لازم است، این فرآیند را از نظر اقتصادی برای توسعه هوش مصنوعی فیزیکی عمومی غیرقابل توجیه می‌کند.[2]

راه‌حل صنعت برای این گلوگاه داده، شبیه‌سازی است. با قرار دادن یک دوقلوی دیجیتال دقیق ریاضی از یک ربات در داخل یک موتور فیزیک با وفاداری بالا، توسعه‌دهندگان می‌توانند از محدودیت‌های فیزیک زمان واقعی فرار کنند. در قلمرو دیجیتال، مهندسان می‌توانند هزاران نمونه شبیه‌سازی موازی را به طور همزمان در سراسر خوشه‌های عظیم GPU راه‌اندازی کنند. این امر به هوش مصنوعی اجازه می‌دهد معادل هزاران سال یادگیری آزمون و خطا را تنها در چند ساعت زمان محاسباتی تجربه کند و به سرعت به یک سیاست رفتاری موفق همگرا شود.[5]

معیارهای کلیدی که کارایی خطوط لوله مدرن انتقال از شبیه‌سازی به واقعیت را نشان می‌دهند.

با این حال، این رویکرد مبتنی بر اولویت شبیه‌سازی، مانع بزرگ جدیدی را به نام شکاف واقعیت (Reality Gap) معرفی می‌کند. شبیه‌سازها، هر چقدر هم که پیشرفته باشند، در نهایت محیط‌هایی بی‌نقص، بدون اصطکاک و از نظر ریاضی دقیق هستند. در مقابل، دنیای واقعی به طور بی‌نهایت پرنویز و غیرقابل پیش‌بینی است. شرایط نورپردازی به صورت پویا تغییر می‌کند، حسگرهای دوربین دچار نویز و تابش خیره‌کننده می‌شوند، و چرخ‌دنده‌های فیزیکی دارای تغییرات میکروسکوپی در سایش و پارگی هستند. هنگامی که یک مدل هوش مصنوعی منحصراً در یک ماتریکس دیجیتال بکر آموزش می‌بیند، بیش از حد با آن کمال سازگار می‌شود (Overfits).[1]

در نتیجه، هنگامی که یک سیاست رفتاری آموزش‌دیده در یک شبیه‌سازی بی‌نقص در نهایت در یک ربات فیزیکی واقعی بارگذاری می‌شود، معمولاً بلافاصله شکست می‌خورد. هوش مصنوعی با نویز حسگر یا اصطکاکی مواجه می‌شود که قبلاً هرگز ندیده است، وحشت می‌کند و حرکات نامنظم اجرا می‌کند. این پدیده دهه‌هاست که حوزه رباتیک را آزار می‌دهد و یک الگوی ناامیدکننده ایجاد کرده است که در آن الگوریتم‌هایی که در صفحه کامپیوتر بی‌عیب و نقص به نظر می‌رسند، به محض اینکه از آن‌ها خواسته می‌شود با ماده فیزیکی تعامل داشته باشند، کاملاً بی‌فایده می‌شوند.[2]

مکانیسم اساسی که برای عبور از این شکاف بصری و فیزیکی توسعه یافته است، تکنیکی به نام تصادفی‌سازی دامنه (Domain Randomization) است. مهندسان به جای شروع کار غیرممکن تطبیق کامل شبیه‌سازی با پیچیدگی‌های واقعیت، رویکرد کاملاً متضادی را در پیش می‌گیرند: آن‌ها شبیه‌سازی را به شکلی شدید و تهاجمی غیرقابل پیش‌بینی می‌کنند. با تخریب عمدی کمال محیط دیجیتال، آن‌ها شبکه عصبی را مجبور می‌کنند که فقط بر مکانیسم‌های اصلی وظیفه تمرکز کند.[1]

مکانیسم اساسی که برای عبور از این شکاف بصری و فیزیکی توسعه یافته است، تکنیکی به نام تصادفی‌سازی دامنه (Domain Randomization) است.

در طول فرآیند آموزش، موتور فیزیک به طور مداوم پارامترهای محیط را تصادفی می‌کند. نورپردازی به شدت از تاریکی مطلق به روشنایی خیره‌کننده تغییر می‌کند. رنگ‌ها و بافت‌های اشیاء، میزها و خود ربات با الگوهای آشفته و انتزاعی جابه‌جا می‌شوند. گرانش شبیه‌سازی‌شده ممکن است کمی افزایش یابد و ضرایب اصطکاک کف ممکن است بین لغزندگی یخ و چسبندگی کاغذ سنباده در نوسان باشد. هوش مصنوعی در معرض رگبار بی‌امان هرج و مرج محیطی قرار می‌گیرد.[1]

تصادفی‌سازی دامنه با آموزش هوش مصنوعی در هزاران تغییرات آشفته، آن را مجبور می‌کند نویز بصری را نادیده بگیرد.

با مجبور کردن شبکه عصبی به موفقیت در هزاران محیط عجیب و تصادفی، مدل یک سیاست بسیار قوی و تعمیم‌یافته را می‌آموزد. یاد می‌گیرد جزئیات بصری نامربوط مانند سایه‌ها یا رنگ‌های میز را نادیده بگیرد و کاملاً بر ساختار هندسی اشیایی که باید دستکاری کند، تمرکز کند. هنگامی که این سیاست مقاوم‌شده سرانجام در دنیای واقعی قرار می‌گیرد، ربات به سادگی واقعیت را به عنوان یکی دیگر از تغییرات شبیه‌سازی آشفته‌ای که قبلاً بر آن مسلط شده است، در نظر می‌گیرد.[1]

اثربخشی این رویکرد در سال‌های اخیر به طور دقیق کمی‌سازی شده است. محققان با بهینه‌سازی سیستماتیک این پارامترهای تصادفی‌سازی دامنه بصری از طریق وظایف جانشین آفلاین، نرخ موفقیت قابل توجهی را نشان داده‌اند. در وظایف پیچیده دستکاری رباتیک—مانند مکان‌یابی و گرفتن اشیاء خاص در میان به‌هم‌ریختگی—سیاست‌هایی که به طور کامل در شبیه‌سازی‌های تصادفی‌شده آموزش دیده‌اند، هنگام انتقال مستقیم به سخت‌افزار واقعی، تا ۹۳ درصد نرخ موفقیت کسب کرده‌اند و از مدل‌هایی که با داده‌های محدود دنیای واقعی آموزش دیده‌اند، بهتر عمل کرده‌اند.[1]

با این حال، تصادفی‌سازی بصری تنها نیمی از نبرد در پر کردن شکاف واقعیت است. در حالی که تصادفی‌سازی دامنه در آموزش دیدن ربات در دنیای واقعی عالی عمل می‌کند، پویایی‌های فیزیکی—مانند وزن واقعی یک شیء، یا میزان مقاومت یک مفصل خاص در برابر حرکت به دلیل اصطکاک داخلی—برای انتقال بسیار دشوارتر هستند. هنگامی که یک ربات با محیط خود تماس فیزیکی برقرار می‌کند، حتی یک میلی‌متر اختلاف بین فیزیک شبیه‌سازی‌شده و فیزیک واقعی می‌تواند باعث یک شکست فاجعه‌بار شود.[2]

از لحاظ تاریخی، متخصصان رباتیک به کنترل موقعیت (Position Control) متکی بودند، رویکردی که در آن هوش مصنوعی به یک مفصل فرمان می‌دهد تا به یک زاویه هندسی دقیق برسد. اگرچه این روش در شبیه‌سازی بسیار کارآمد است، اما برای کار در واقعیت به تنظیم پارامترهای فشرده نیاز دارد. اگر میز دنیای واقعی کمی بالاتر از میز شبیه‌سازی‌شده باشد، یک بازوی کنترل‌شده با موقعیت کورکورانه تلاش می‌کند تا از طریق چوب جامد فشار بیاورد تا به مختصات هدف خود برسد و اغلب در این فرآیند به خود یا شیء آسیب می‌زند.[2]

کنترل مبتنی بر گشتاور به ربات‌های فیزیکی اجازه می‌دهد در برابر مقاومت غیرمنتظره تسلیم شوند و خطاهای شبیه‌سازی را جذب کنند.

برای کاهش این مشکل، این حوزه به طور فزاینده‌ای به سمت کنترل گشتاور (Torque Control) متمایل شده است. به جای اینکه به ربات گفته شود بازویش دقیقاً در کجا باید باشد، هوش مصنوعی فرمان می‌دهد که یک موتور خاص چقدر نیروی چرخشی—یا گشتاور—اعمال کند. این تغییر اساسی در فضای عمل، از انعطاف‌پذیری فیزیکی ذاتی ربات بهره می‌برد. اگر بازوی کنترل‌شده با گشتاور به یک مانع غیرمنتظره برخورد کند، موتورها به سادگی در برابر مقاومت تسلیم می‌شوند، نه اینکه تا حد تخریب با آن مبارزه کنند.[2]

این رویکرد مبتنی بر گشتاور برای حرکات پیچیده و پویا حیاتی بوده است. این روش، اولین انتقال‌های موفقیت‌آمیز سیاست‌های یادگیری تقویتی عمیق از شبیه‌سازی به واقعیت را برای ربات‌های دوپای به اندازه انسان ممکن ساخت. ربات‌های دوپا با تکیه بر انعطاف‌پذیری فیزیکی سخت‌افزار به جای موقعیت‌یابی هندسی سفت و سخت، توانستند خطاهای میکروسکوپی بین مدل‌های گرانش شبیه‌سازی و فیزیک دنیای واقعی را جذب کنند، و به آن‌ها اجازه دادند بدون نیاز به تنظیم دقیق گسترده در دنیای واقعی، تعادل برقرار کرده و راه بروند.[2]

اخيراً، خط لوله انتقال از شبیه‌سازی به واقعیت به یک حلقه پیوسته و تکراری واقعیت-به-شبیه‌سازی-به-واقعیت تبدیل شده است. مهندسان به جای در نظر گرفتن این انتقال به عنوان یک رویداد یک‌باره، اکنون صحنه‌های دنیای واقعی را با استفاده از نگاشت فضایی پیشرفته در داخل شبیه‌ساز بازسازی می‌کنند. سپس از مدل‌های بینایی-زبان (Vision-Language Models) استفاده می‌کنند تا به طور خودکار توابع پاداش پویا را بر اساس دستورالعمل‌های زبان طبیعی انسان تولید کنند، و به هوش مصنوعی اجازه می‌دهند وظایف پیچیده و چندمرحله‌ای را در یک کپی دیجیتال از فضای کاری واقعی خود تمرین کند.[4]

حلقه تکراری مدرن، دنیای فیزیکی را به شبیه‌سازی نگاشت می‌کند و سپس سیاست آموزش‌دیده را دوباره در واقعیت مستقر می‌سازد.

هوش مصنوعی وظیفه چندمرحله‌ای را در این کپی شبیه‌سازی‌شده تمرین می‌کند و استراتژی خود را از طریق بازخورد تکراری اصلاح می‌کند. هنگامی که سیاست قوی شد، دوباره در دنیای فیزیکی مستقر می‌شود. از آنجایی که توابع پاداش به طور پویا توسط مدل بینایی-زبان شکل گرفته‌اند، سیاست فیزیکی حاصل بسیار سازگار است و قادر به بازیابی خودبه‌خودی خطا و تنظیمات استراتژی در لحظه است، زمانی که محیط دنیای واقعی به ناچار از کپی دیجیتال منحرف می‌شود.[4]

با پیچیده‌تر شدن موتورهای شبیه‌سازی و ادامه مقیاس‌پذیری قدرت محاسباتی، شکاف واقعیت به طور پیوسته در حال بسته شدن است. توانایی آموزش رفتارهای پیچیده به طور کامل در قلمرو دیجیتال و استقرار بی‌درز آن‌ها در دنیای فیزیکی، مکانیسم اصلی است که سرانجام به رباتیک اجازه می‌دهد با سرعت نرم‌افزار مقیاس‌پذیر شود. با تسلط بر انتقال از شبیه‌سازی به واقعیت، صنعت در حال گشودن آینده‌ای است که در آن هوش مصنوعی فیزیکی می‌تواند با ایمنی و کارایی در سراسر جهان توسعه، آزمایش و مستقر شود.[5]

اصطلاحات کلیدی

انتقال از شبیه‌سازی به واقعیت (Sim-to-Real Transfer)
فرآیند آموزش یک مدل هوش مصنوعی در داخل یک شبیه‌سازی کامپیوتری و استقرار موفقیت‌آمیز آن بر روی سخت‌افزار فیزیکی.
تصادفی‌سازی دامنه (Domain Randomization)
یک تکنیک آموزشی که پارامترهای بصری و فیزیکی یک شبیه‌سازی را به شدت تغییر می‌دهد تا هوش مصنوعی را مجبور به یادگیری رفتارهای قوی و تعمیم‌یافته کند.
یادگیری تقویتی (Reinforcement Learning)
یک روش یادگیری ماشین که در آن هوش مصنوعی از طریق آزمون و خطا یاد می‌گیرد و برای اقدامات موفق پاداش و برای شکست‌ها جریمه دریافت می‌کند.
انتقال صفر-شات (Zero-Shot Transfer)
استقرار یک مدل هوش مصنوعی در یک محیط جدید که در اولین تلاش و بدون نیاز به داده‌های آموزشی اضافی موفق عمل می‌کند.
کنترل گشتاور (Torque Control)
روشی برای به کار انداختن ربات با فرمان دادن به نیروی چرخشی موتورهای آن، به جای موقعیت هندسی دقیق مفاصل آن.

آنچه نمی‌دانیم

  • اینکه آیا انتقال از شبیه‌سازی به واقعیت می‌تواند به طور قابل اعتمادی برای اشیاء بسیار تغییرشکل‌پذیر مانند لباس یا مایعات مقیاس‌پذیر باشد یا خیر.
  • اینکه موتورهای شبیه‌سازی تا چه حد می‌توانند اصطکاک پیچیده و چندتماسی را در محیط‌های نامنظم مدل‌سازی کنند.
  • آستانه دقیق تصادفی‌سازی دامنه که قبل از آن مدل به دلیل تصادفی‌سازی بیش از حد، شروع به از دست دادن عملکرد می‌کند، چقدر است.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

طرفداران اولویت شبیه‌سازی 40%خالص‌گرایان دنیای واقعی 30%مهندسان اتوماسیون صنعتی 30%
  1. [1]arXivخالص‌گرایان دنیای واقعی

    Robust Visual Sim-to-Real Transfer for Robotic Manipulation

    مطالعه در arXiv
  2. [2]IEEE Xploreمهندسان اتوماسیون صنعتی

    Torque-Based Deep Reinforcement Learning for Task-and-Robot Agnostic Learning on Bipedal Robots Using Sim-to-Real Transfer

    مطالعه در IEEE Xplore
  3. [3]IEEE Xploreمهندسان اتوماسیون صنعتی

    Sim-to-Real Reinforcement Learning for Bipedal Locomotion

    مطالعه در IEEE Xplore
  4. [4]IEEE Xploreمهندسان اتوماسیون صنعتی

    A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards

    مطالعه در IEEE Xplore
  5. [5]تیم سردبیری کوهستانطرفداران اولویت شبیه‌سازی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.