رفتن به محتوای اصلی
هوش مصنوعی فیزیکیبسته شواهد۳۱ مرداد ۱۴۰۵، ۸:۲۴· 5 دقیقه مطالعه· در هوش مصنوعی

گوگل دیپ‌مایند از «جمینای رباتیکز ۲» رونمایی کرد؛ ارتقای هوش مصنوعی فیزیکی به کنترل تمام بدن

مجموعه جدیدی از سه مدل هوش مصنوعی فیزیکی، ربات‌های انسان‌نما را قادر می‌سازد تا تمام بدن خود را هماهنگ کنند، اشیاء را با دست‌هایی با ۲۲ درجه آزادی حرکت دهند و در وظایف چندمرحله‌ای همکاری کنند.

به قلم ندا وزیری

محققان رباتیک 40%اپراتورهای اتوماسیون صنعتی 35%حامیان ایمنی هوش مصنوعی 25%
محققان رباتیک
جداسازی مدل‌های هوش مصنوعی از سخت‌افزار خاص را به عنوان پیشرفت ضروری برای دستیابی به هوش فیزیکی تعمیم‌یافته می‌بینند.
اپراتورهای اتوماسیون صنعتی
بر کاربرد عملی مدل‌های محلی (On-Device) تمرکز دارند که می‌توانند بدون تأخیر ابری کار کنند و به سرعت با سخت‌افزارهای جدید کارخانه سازگار شوند.
حامیان ایمنی هوش مصنوعی
بر لزوم معیارهای دقیق و پروتکل‌های حل عدم قطعیت قبل از استقرار ماشین‌آلات سنگین خودکار در نزدیکی انسان‌ها تأکید می‌کنند.

چرا مهم است

با جدا کردن هوش رباتیک از سخت‌افزار خاص، دیپ‌مایند در تلاش است تا «اندروید دنیای رباتیک» را بسازد. در صورت موفقیت، این لایه نرم‌افزاری می‌تواند هزینه و پیچیدگی استقرار ربات‌های سازگارپذیر در کارخانه‌ها، انبارها و در نهایت خانه‌ها را به شدت کاهش دهد.

یک ربات انسان‌نما به نام آپولو ۲ اکنون می‌تواند با اطمینان ۹۲ درصدی یک لامپ را باز کند، اما در جارو کردن زمین با خاک‌انداز مشکل دارد و تنها ۳۲ درصد مواقع موفق می‌شود. این شکاف عملکردی، مرزهای پیشروی هوش مصنوعی فیزیکی را نشان می‌دهد. در ۳۰ جولای، گوگل دیپ‌مایند «جمینای رباتیکز ۲» را منتشر کرد؛ مجموعه‌ای از سه مدل که طراحی شده‌اند تا به عنوان یک لایه هوش جهانی برای ماشین‌ها عمل کنند. این انتشار نشان‌دهنده یک تغییر قاطع از بازوهای رباتیک رومیزی به کنترل تمام بدن ربات‌های انسان‌نما است و هم پیشرفت سریع و هم محدودیت‌های فیزیکی پایدار رباتیک مدرن را آشکار می‌سازد.[1][2]

از لحاظ تاریخی، رباتیک صنعتی کاملاً سخت‌افزارمحور بوده است. یک بازوی رباتیک برای یک ایستگاه کاری واحد مهندسی و برنامه‌ریزی می‌شود و دنباله‌ای محدود و تکراری از حرکات را اجرا می‌کند. اگر محیط تغییر کند، ربات از کار می‌افتد. «جمینای رباتیکز ۲» تلاش می‌کند تا این «فرض رباتیک» را با جدا کردن هوش از ماشین بازنویسی کند. این سیستم به جای جاسازی منطق در یک شاسی کاملاً تعریف‌شده، محیط را درک می‌کند، دستورالعمل‌های زبان عادی را تفسیر می‌کند، در مورد وظیفه استدلال می‌کند و آن تصمیمات را به حرکات مفصلی در بدن‌های رباتیک کاملاً متفاوت ترجمه می‌کند.

این معماری بر سه مدل متمایز متکی است که به صورت هماهنگ کار می‌کنند. اولین مدل، «جمینای رباتیکز ۲»، یک مدل بینایی-زبان-عمل (VLA) است. این مدل پیکسل‌های دوربین و دستورات متنی را دریافت کرده و دستورات مستقیم کنترل موتور را خروجی می‌دهد. برخلاف تکرارهای قبلی که فقط وظایف رومیزی قسمت بالایی بدن را مدیریت می‌کردند، این VLA حرکت و دستکاری را به طور همزمان هماهنگ می‌کند. این قابلیت به یک ربات انسان‌نما اجازه می‌دهد تا راه برود، مرکز ثقل خود را تغییر دهد، خم شود، دست دراز کند و یک شیء را به عنوان یک عمل واحد و روان مدیریت کند.[1]

مدل دوم، «جمینای رباتیکز ای‌آر ۲» (Gemini Robotics ER 2)، به عنوان مغز سطح بالای سیستم عمل می‌کند. «ER» مخفف استدلال تجسم‌یافته (Embodied Reasoning) است. این مدل بینایی-زبان که بر اساس معماری «جمینای ۳.۵ فلش» ساخته شده است، مستقیماً مفاصل ربات را حرکت نمی‌دهد. در عوض، وظایف را هماهنگ می‌کند. با انسان‌ها ارتباط برقرار می‌کند، فضای فیزیکی را تفسیر می‌کند و برنامه‌های چندمرحله‌ای می‌سازد که اجرای آنها چندین دقیقه طول می‌کشد. پیشرفت را ردیابی می‌کند، تشخیص می‌دهد که یک زیروظیفه چه زمانی کامل شده است و می‌تواند با هماهنگی چندین ربات در یک فضای کاری مشترک، تقسیم کار کند.[1][2]

جزء سوم، «جمینای رباتیکز آن-دیوایس ۲» (Gemini Robotics On-Device 2)، محدودیت‌های تأخیر (Latency) و اتصال محیط‌های صنعتی واقعی را برطرف می‌کند. این یک مدل VLA سبک‌وزن است که برای اجرا به صورت محلی روی سخت‌افزار خود ربات بهینه‌سازی شده است. دیپ‌مایند گزارش می‌دهد که این مدل محلی می‌تواند با استفاده از کمتر از ۲۰۰ مثال نمایشی، خود را با یک ربات دو بازوی ندیده‌شده تطبیق دهد و تنها به چند ساعت آموزش نیاز دارد تا خروجی‌های خود را به مفاصل و حسگرهای خاص ماشین جدید نگاشت کند.[1]

جزء سوم، «جمینای رباتیکز آن-دیوایس ۲» (Gemini Robotics On-Device 2)، محدودیت‌های تأخیر (Latency) و اتصال محیط‌های صنعتی واقعی را برطرف می‌کند.

داده‌های مربوط به مهارت فیزیکی سیستم دقیقاً نشان می‌دهد که این فناوری در کجا برتری دارد و در کجا دچار مشکل می‌شود. مدل VLA با موفقیت دست «شارپاویو» (SharpaWave) با ۲۲ درجه آزادی را روی ربات انسان‌نمای آپترونیک آپولو ۲ کنترل می‌کند و وظایف ظریفی مانند گره زدن یا بستن کیسه زیپ‌دار را انجام می‌دهد. دیپ‌مایند نشان داد که یک نقطه بازرسی مدل واحد، آپولو ۲ را با دو پیکربندی دست متفاوت، و همچنین یک پلتفرم جداگانه فرانکای دوئو (Franka Duo) مجهز به یک گیره موازی استاندارد دو انگشتی هدایت می‌کند.[1][2]

با این حال، مهارت چند انگشتی ضعیف‌ترین محور در هوش مصنوعی فیزیکی باقی مانده است. در حالی که سیستم در وظایف بسیار ساختاریافته مانند باز کردن لامپ به نرخ موفقیت ۹۲ درصدی دست می‌یابد، عملکرد آن در وظایفی که نیاز به تماس پیچیده و مداوم با اشیاء تغییرشکل‌پذیر یا ابزار دارند، به شدت کاهش می‌یابد. جارو کردن با خاک‌انداز—وظیفه‌ای که نیازمند تنظیمات جزئی مداوم برای حفظ تماس کامل با زمین در حین هماهنگی دو بازو است—تنها ۳۲ درصد مواقع موفق می‌شود. شواهد نشان می‌دهد که در حالی که استدلال شناختی به سرعت پیشرفت می‌کند، ترجمه فیزیکی آن افکار به محیط‌های پویا و با اصطکاک بالا همچنان یک گلوگاه است.[2]

برای مدیریت خطرات ذاتی ماشین‌های خودکار که در نزدیکی انسان‌ها کار می‌کنند، دیپ‌مایند «ASIMOV-Agentic» را معرفی کرد، یک معیار ایمنی جدید که تحت مجوز متن‌باز منتشر شده است. مدل ER 2 طراحی شده تا عدم قطعیت خود را ارزیابی کند. اگر کاربر عملی را درخواست کند که محدودیت‌های فیزیکی را نقض می‌کند—مانند جابجایی مایعات با یک گیره ناسازگار، یا بلند کردن شیئی که از ظرفیت بار ربات فراتر است—مدل آموزش دیده است که درخواست ابزار را رد کرده و فعالانه مداخله انسانی را درخواست کند.[2]

The same VLA model that drives a full humanoid can also operate standard two-fingered parallel grippers on industrial platforms.

عرضه تجاری منعکس‌کننده ماهیت آزمایشی این سخت‌افزار است. «جمینای رباتیکز ای‌آر ۲» از طریق «گوگل ای‌آی استودیو» (Google AI Studio) برای توسعه‌دهندگان در پیش‌نمایش عمومی در دسترس است و به مهندسان نرم‌افزار اجازه می‌دهد موتور استدلال را آزمایش کنند. با این حال، مدل‌های VLA و On-Device به شدت محدود به شرکای سخت‌افزاری با دسترسی زودهنگام، از جمله بوستون داینامیکس، آپترونیک و اَجایل رباتز (Agile Robots) هستند. این دسترسی طبقه‌بندی‌شده از استقرار مدل‌های کنترل موتور تأیید نشده بر روی سخت‌افزار مصرف‌کننده جلوگیری می‌کند.[1][2]

استراتژی دیپ‌مایند واضح است: این شرکت تلاش نمی‌کند تا ربات انسان‌نمای نهایی را بسازد. در عوض، در حال رقابت برای ساخت سیستم عاملی است که روی سخت‌افزار دیگران اجرا خواهد شد. گوگل با اثبات اینکه یک لایه هوش واحد می‌تواند ربات‌های اطلس بوستون داینامیکس، آپولو آپترونیک و بازوی رباتیک فرانک را هدایت کند، «جمینای رباتیکز» را به عنوان زیرساخت اساسی برای موج قریب‌الوقوع هوش مصنوعی فیزیکی معرفی می‌کند.

نکات کلیدی

  • گوگل دیپ‌مایند «جمینای رباتیکز ۲»، مجموعه‌ای از سه مدل هوش مصنوعی فیزیکی را منتشر کرد.
  • این مدل‌ها کنترل تمام بدن را ممکن می‌سازند و به ربات‌های انسان‌نما اجازه می‌دهند راه رفتن، خم شدن و دسترسی را هماهنگ کنند.
  • این سیستم با موفقیت دست‌های رباتیک با ۲۲ درجه آزادی را برای وظایف ظریفی مانند گره زدن کنترل می‌کند.
  • مهارت چند انگشتی همچنان یک چالش است، به طوری که نرخ موفقیت در وظایف پیچیده جارو کردن به ۳۲٪ کاهش می‌یابد.
  • یک نسخه محلی (On-Device) بدون نیاز به اتصال ابری اجرا می‌شود و با حداقل داده‌های آموزشی با ربات‌های جدید سازگار می‌شود.
  • هدف دیپ‌مایند ارائه یک لایه هوش جهانی است که در سخت‌افزارهای رباتیک متنوع کار کند.

آنچه نمی‌دانیم

  • این مدل‌ها در محیط‌های بسیار پویا و غیرقابل پیش‌بینی خارج از تنظیمات آزمایشگاهی ساختاریافته چقدر قابل اعتماد عمل می‌کنند.
  • هزینه محاسباتی دقیق و میزان مصرف باتری مورد نیاز برای اجرای مدل On-Device 2 به صورت محلی بر روی ربات‌های متحرک.
  • آیا نرخ موفقیت پایین ۳۲ درصدی در وظایف تماس پیوسته پیچیده مانند جارو کردن را می‌توان صرفاً با نرم‌افزار حل کرد، یا نیاز به ارتقاء سخت‌افزاری اساسی دارد.

منابع

پوشش منابع

2 منبع

3 دیدگاه شناسایی‌شده

محققان رباتیک 40%اپراتورهای اتوماسیون صنعتی 35%حامیان ایمنی هوش مصنوعی 25%
  1. [1]Google DeepMindمحققان رباتیک

    Gemini Robotics 2 brings whole body intelligence to robots

    مطالعه در Google DeepMind
  2. [2]MarkTechPostحامیان ایمنی هوش مصنوعی

    Google DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaboration

    مطالعه در MarkTechPost

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.