رفتن به محتوای اصلی
هوش مصنوعی تجسم‌یافتهتوضیح و تحلیل۲۱ مرداد ۱۴۰۵، ۲:۲۴· 6 دقیقه مطالعه· #3 از 3 در هوش مصنوعی

گوگل دیپ‌مایند «جمینی رباتیکس ۲» را عرضه کرد؛ هوش تمام‌بدنی برای مدل‌های هوش مصنوعی فیزیکی

گوگل دیپ‌مایند «جمینی رباتیکس ۲» را معرفی کرده است، مجموعه‌ای از مدل‌های هوش مصنوعی که به ربات‌های انسان‌نما اجازه می‌دهد تا تمام بدن خود – از پاها تا نوک انگشتان – را تحت یک سیاست یادگیری واحد هماهنگ کنند. این عرضه نشان‌دهنده گذار از رباتیک سفت و سخت و از پیش برنامه‌ریزی‌شده به سمت سیستم‌های سازگار و قادر به استدلال در مورد وظایف فیزیکی پیچیده است.

به قلم فرشید جمشیدی

طرفداران هوش مصنوعی عمومی 45%متخصصان ادغام سخت‌افزار 30%شکاکان عمل‌گرا 25%
طرفداران هوش مصنوعی عمومی
استدلال می‌کنند که یک سیاست یادگیری واحد برای کنترل تمام‌بدنی، تنها مسیر مقیاس‌پذیر برای رباتیک مفید است و جایگزین کدهای شکننده و وظیفه‌محور می‌شود.
متخصصان ادغام سخت‌افزار
تأکید می‌کنند که هوش نرم‌افزاری همچنان باید بر محدودیت‌های سخت‌افزاری فیزیکی، مانند دقت محرک‌ها و عمر باتری، غلبه کند.
شکاکان عمل‌گرا
بر شکاف بین نمایش‌های نمایشی گلچین‌شده و قابلیت اطمینان در دنیای واقعی تمرکز می‌کنند و به نرخ‌های موفقیت پایین در وظایف پویا و دارای اصطکاک بالا اشاره دارند.

در ۳۰ جولای ۲۰۲۶، یک ربات انسان‌نمای «آپترونیک آپولو ۲» (Apptronik Apollo 2) دستور شفاهی برای تمیز کردن یک اتاق به‌هم‌ریخته دریافت کرد. برای اولین بار، یک مدل هوش مصنوعی واحد محاسبه کرد که چگونه زانوهای ماشین را خم کند، مرکز ثقل خود را جابجا کند، با یک دست پنج انگشتی دراز کند و یک آب‌پاش را بگیرد. این نمایشگر، آغاز عرضه «جمینی رباتیکس ۲» (Gemini Robotics 2)، جدیدترین مجموعه مدل‌های هوش مصنوعی فیزیکی گوگل دیپ‌مایند را رقم زد. این عرضه نشان‌دهنده یک تغییر اساسی در نحوه تعامل ماشین‌ها با دنیای فیزیکی است و از روال‌های سفت و سخت و از پیش برنامه‌ریزی‌شده به سمت سیستم‌هایی حرکت می‌کند که می‌توانند در مورد محیط خود استدلال کرده و در لحظه سازگار شوند.[1][2][3][6]

برای درک اهمیت این پیشرفت، مفید است که به نحوه عملکرد سنتی ربات‌ها نگاه کنیم. اکثر ربات‌های صنعتی متخصص هستند و با دقت کدنویسی شده‌اند تا یک حرکت تکراری واحد را انجام دهند، مانند جوشکاری درب خودرو یا جابجایی یک جعبه در مسیر نقاله ثابت. اگر جعبه‌ای کمی خارج از مکان تعیین‌شده بیفتد، ربات شکست می‌خورد. حتی ویدئوهای وایرال ربات‌های انسان‌نما که پشتک می‌زنند یا پارکور انجام می‌دهند، معمولاً نتیجه برنامه‌نویسی بسیار دقیق و محدودی هستند که برای یک توالی خاص از شاهکارهای فیزیکی طراحی شده‌اند.[1][6]

نسل قبلی مدل‌های رباتیک دیپ‌مایند با معرفی قابلیت‌های بینایی-زبان-عمل (VLA) شروع به تغییر این وضعیت کردند، اما آن‌ها محدود به کنترل قسمت بالایی بدن ربات برای وظایف روی میز بودند. پاها، هسته و سیستم‌های تعادل اساساً همراهی می‌کردند و نیاز به تثبیت یا هدایت ماشین توسط انسان بود. «جمینی رباتیکس ۲» این شکاف را با معرفی آنچه محققان «هوش تمام‌بدنی» می‌نامند، پر می‌کند.[1][5]

کنترل تمام‌بدنی یک چالش عمیق ریاضی و فیزیکی است. وقتی یک انسان برای برداشتن یک شیء سنگین خم می‌شود، به طور غریزی جای پای خود را تنظیم می‌کند، هسته بدن خود را سفت می‌کند و نیروی چنگش لازم برای حفظ تعادل را محاسبه می‌کند. ترجمه این غریزه به رباتیک نیازمند یک سیستم یکپارچه است که کل بدن را به طور همزمان مدیریت کند. «جمینی رباتیکس ۲» این امر را از طریق یادگیری سرتاسری (end-to-end learning) محقق می‌سازد، به این معنی که یک سیاست یادگیری واحد، ورودی‌های دوربین و دستورات شفاهی را پردازش می‌کند و مستقیماً خروجی‌های کنترل موتور را برای پاها، تنه، بازوها و دست‌های چندانگشتی تولید می‌کند.[1][4][5]

هوش تمام‌بدنی، پاها، هسته و بازوهای یک ربات را به طور همزمان برای حفظ تعادل هماهنگ می‌کند.
هوش تمام‌بدنی، پاها، هسته و بازوهای یک ربات را به طور همزمان برای حفظ تعادل هماهنگ می‌کند.

معماری که این قابلیت را هدایت می‌کند، یک ساختار واحد نیست، بلکه مجموعه‌ای از سه مدل متمایز است که به صورت هماهنگ کار می‌کنند. موتور اصلی، مدل بینایی-زبان-عمل «جمینی رباتیکس ۲» است که ترجمه آنی نیت به حرکت فیزیکی را انجام می‌دهد. این مدل مستقل از سخت‌افزار است؛ عملکرد آن هم در کنترل کامل ربات انسان‌نمای «آپولو ۲» و هم در یک تنظیمات دو بازویی «فرانکا دوئو» (Franka Duo) مجهز به گیره‌های موازی استاندارد، نشان داده شد.[1][3][5]

بالاتر از مدل بینایی-زبان-عمل، «جمینی رباتیکس ای‌آر ۲» (Gemini Robotics ER 2) قرار دارد، یک مدل استدلال تجسم‌یافته که بر اساس معماری «جمینی ۳.۵ فلش» ساخته شده است. دیپ‌مایند این مدل را به عنوان مغز سطح بالای ربات توصیف می‌کند. «ای‌آر ۲» مسئول پردازش دستورالعمل‌های پیچیده و چندمرحله‌ای کاربر، مشاهده اتاق و تدوین یک برنامه است. این مدل می‌تواند با اپراتور انسانی گفتگو کند، پیشرفت خود را در یک کار پیگیری کند و حتی اقدامات چندین ربات را که در یک فضای مشترک کار می‌کنند، هماهنگ سازد.[1][2][3][4]

بالاتر از مدل بینایی-زبان-عمل، «جمینی رباتیکس ای‌آر ۲» (Gemini Robotics ER 2) قرار دارد، یک مدل استدلال تجسم‌یافته که بر اساس معماری «جمینی ۳.۵ فلش» ساخته شده است.

جزء سوم به یکی از مهم‌ترین تنگناهای رباتیک مدرن می‌پردازد: تأخیر و اتصال. «جمینی رباتیکس آن-دیوایس ۲» (Gemini Robotics On-Device 2) یک نسخه سبک‌وزن از سیستم است که برای اجرا به صورت محلی روی سخت‌افزار خود ربات بهینه‌سازی شده است، بدون نیاز به اتصال مداوم به سرورهای ابری. این سیستم که بر اساس مدل‌های «جما» (Gemma) گوگل ساخته شده است، می‌تواند تنها در چند ساعت و با استفاده از کمتر از ۲۰۰ نمونه نمایشی، با بدن ربات کاملاً ناآشنا سازگار شود.[2][4]

مجموعه «جمینی رباتیکس ۲» استدلال سطح بالا را از کنترل موتور آنی جدا می‌کند.
مجموعه «جمینی رباتیکس ۲» استدلال سطح بالا را از کنترل موتور آنی جدا می‌کند.

رویکرد استراتژیک گوگل با این عرضه، موقعیت آن را در صنعت گسترده‌تر رباتیک روشن می‌کند. این شرکت قصد ندارد با ساخت شاسی انسان‌نمای خود، در مسابقه سخت‌افزار پیروز شود. در عوض، دیپ‌مایند «جمینی رباتیکس» را به عنوان لایه هوش جهانی برای ماشین‌هایی که توسط تولیدکنندگان ثالث مانند «آپترونیک»، «بوستون داینامیکس» و «اجایل رباتس» ساخته می‌شوند، قرار داده است. این امر منعکس‌کننده پویایی دوران اولیه تلفن‌های هوشمند است که یک سیستم عامل استاندارد برای اکوسیستم‌های سخت‌افزاری متنوع فراهم می‌کرد.[1][4]

با وجود نمایش‌های چشمگیر، این فناوری هنوز در مراحل اولیه خود قرار دارد و قابلیت اطمینان آن بسته به پیچیدگی وظیفه به طور قابل توجهی متفاوت است. نرخ‌های موفقیت منتشر شده برای ربات «آپولو ۲» با استفاده از مدل جدید، تضاد شدیدی در قابلیت‌ها نشان می‌دهد. در حالی که این سیستم برای باز کردن یک لامپ به نرخ موفقیت ۹۲ درصد دست یافت، عملکرد آن هنگام تلاش برای بستن مجدد لامپ به ۳۶ درصد کاهش یافت و برای جارو کردن زباله‌ها به داخل خاک‌انداز به ۳۲ درصد سقوط کرد. این ارقام بر دشواری مداوم تسلط بر تعاملات پویا و دارای اصطکاک بالا تأکید می‌کنند.[4]

برای رسیدگی به خطرات ذاتی استقرار ماشین‌آلات سنگین و خودمختار در محیط‌های انسانی، دیپ‌مایند یک معیار ایمنی جدید به نام «آسیموف-ایجنتیک» (ASIMOV-Agentic) را در کنار مدل‌ها معرفی کرد. این چارچوب به طور خاص توانایی یک عامل را برای مدیریت عدم قطعیت و سازماندهی رفتار ایمن آزمایش می‌کند. این معیار اندازه‌گیری می‌کند که آیا مدل استدلال تجسم‌یافته می‌تواند با موفقیت یک فراخوانی ابزار ناامن را رد کند، یا به طور فعال یک کار را متوقف کرده و در صورت پیش‌بینی احتمال بالای شکست، درخواست مداخله انسانی کند.[1][2]

تمرکز اصلی مدل جدید بر کنترل حرکتی ظریف است، حوزه‌ای که ربات‌ها به طور تاریخی در آن مشکل داشته‌اند. «جمینی رباتیکس ۲» برای کار با دست «شارپاویو» (SharpaWave) با ۲۲ درجه آزادی آموزش داده شد و به ربات «آپولو ۲» اجازه می‌دهد تا مانورهای ظریفی مانند گره زدن یا بستن یک کیسه زیپ‌دار را انجام دهد. این سطح از مهارت برای وظایف در مراقبت‌های بهداشتی یا محیط‌های خانگی که اشیاء شکننده هستند و محیط‌ها برای دستکاری ماشین استاندارد نشده‌اند، حیاتی است.[1][2][6]

مدل‌های مهارت پیشرفته به ربات‌ها اجازه می‌دهند تا اشیاء شکننده را دستکاری کرده و وظایفی مانند گره زدن را انجام دهند.
مدل‌های مهارت پیشرفته به ربات‌ها اجازه می‌دهند تا اشیاء شکننده را دستکاری کرده و وظایفی مانند گره زدن را انجام دهند.

فراتر از قابلیت‌های فردی، مدل استدلال تجسم‌یافته، همکاری چند رباتی را معرفی می‌کند. از آنجایی که «ای‌آر ۲» می‌تواند یک پنجره متنی عظیم از متن، صدا و ویدئوی درهم‌تنیده را پردازش کند، می‌تواند به عنوان یک توزیع‌کننده مرکزی برای ناوگانی از ماشین‌ها عمل کند. اگر کاری برای یک ربات انسان‌نما بسیار پیچیده یا سنگین باشد، مدل استدلال می‌تواند کار را تقسیم کند و به یک ربات دستور دهد که شیئی را ثابت نگه دارد در حالی که ربات دیگر دستکاری لازم را انجام می‌دهد.[1][3][4]

معرفی هوش تمام‌بدنی یک آستانه حیاتی برای هوش مصنوعی تجسم‌یافته است. با فعال کردن ربات‌ها برای استدلال در مورد حرکات خود و سازگاری با محیط‌های غیرقابل پیش‌بینی، این فناوری صنعت را به استقرار دستیاران عمومی در بیمارستان‌ها، انبارها و در نهایت خانه‌ها نزدیک‌تر می‌کند. در حالی که سخت‌افزار و معیارهای قابلیت اطمینان هنوز باید به بلوغ برسند، زیربنای نرم‌افزاری برای اقدام فیزیکی خودمختار و سازگار اکنون محکم برقرار شده است.[1][6]

در نهایت، گذار از برنامه‌نویسی تخصصی به هوش مصنوعی تعمیم‌یافته و تمام‌بدنی، مهم‌ترین تنگنا در رباتیک مدرن را نشان می‌دهد. همانطور که مدل‌هایی مانند «جمینی رباتیکس ۲» به مقیاس‌پذیری ادامه می‌دهند، تمرکز به طور فزاینده‌ای از اینکه آیا یک ربات می‌تواند کاری را انجام دهد، به این سمت تغییر خواهد کرد که چقدر قابل اعتماد و ایمن می‌تواند آن کار را در محیط‌های آشفته و بدون ساختار دنیای واقعی اجرا کند.

نکات کلیدی

  1. گوگل دیپ‌مایند «جمینی رباتیکس ۲» را عرضه کرد، مجموعه‌ای از مدل‌های هوش مصنوعی که برای اعطای «هوش تمام‌بدنی» به ربات‌ها طراحی شده است.
  2. این سیستم یک ربات انسان‌نما را از پاها تا نوک انگشتان کنترل می‌کند و تعادل، خم شدن و مهارت پیچیده دست را به طور همزمان مدیریت می‌نماید.
  3. این معماری شامل سه مدل است: یک مغز استدلال سطح بالا، یک مدل بینایی-زبان-عمل، و یک نسخه سبک‌وزن روی دستگاه.
  4. دیپ‌مایند این نرم‌افزار را به عنوان یک لایه هوش جهانی برای سخت‌افزارهای تولیدکنندگان ثالث، به جای ساخت ربات‌های خود، معرفی می‌کند.
  5. در حالی که این سیستم قادر به انجام وظایف ظریفی مانند گره زدن است، همچنان با اقدامات پویا و دارای اصطکاک بالا مانند جارو کردن مشکل دارد.

اصطلاحات کلیدی

مدل بینایی-زبان-عمل (VLA)
یک سیستم هوش مصنوعی که داده‌های بصری از دوربین‌ها و دستورات متنی یا شفاهی را پردازش می‌کند و آن‌ها را مستقیماً به کنترل‌های حرکتی فیزیکی ترجمه می‌کند.
استدلال تجسم‌یافته
توانایی یک هوش مصنوعی برای درک محیط فیزیکی خود، برنامه‌ریزی وظایف چندمرحله‌ای و پیگیری پیشرفت خود در دنیای واقعی.
یادگیری سرتاسری
روشی در یادگیری ماشین که در آن یک مدل واحد کل فرآیند را از ورودی خام، مانند پیکسل‌های دوربین، تا خروجی نهایی، مانند حرکت مفصل، بدون برنامه‌نویسی میانی مدیریت می‌کند.
کنترل تمام‌بدنی
هماهنگی همزمان کل ساختار فیزیکی یک ربات – شامل پاها، هسته و بازوها – برای حفظ تعادل هنگام اجرای یک وظیفه.
آسیموف-ایجنتیک
یک معیار ایمنی که برای آزمایش اینکه آیا یک عامل هوش مصنوعی می‌تواند اقدامات ناامن را تشخیص دهد، دستورات خطرناک را رد کند، یا در صورت عدم اطمینان درخواست کمک انسانی کند، طراحی شده است.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

طرفداران هوش مصنوعی عمومی 45%متخصصان ادغام سخت‌افزار 30%شکاکان عمل‌گرا 25%
  1. [1]Google DeepMindطرفداران هوش مصنوعی عمومی

    Gemini Robotics 2 brings whole body intelligence to robots

    مطالعه در Google DeepMind
  2. [2]The Robot Reportمتخصصان ادغام سخت‌افزار

    Google DeepMind says Gemini Robotics 2 enables full body control

    مطالعه در The Robot Report
  3. [3]Robotics 247متخصصان ادغام سخت‌افزار

    Google DeepMind announces Gemini Robotics 2 with whole-body intelligence

    مطالعه در Robotics 247
  4. [4]Robozapsشکاکان عمل‌گرا

    Google DeepMind released Gemini Robotics 2

    مطالعه در Robozaps
  5. [5]Humanoid Guideشکاکان عمل‌گرا

    Gemini Robotics 2 controls Apollo 2 whole body tasks

    مطالعه در Humanoid Guide
  6. [6]MindStudioطرفداران هوش مصنوعی عمومی

    What is Gemini Robotics 2?

    مطالعه در MindStudio

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.