رفتن به محتوای اصلی
Koohestun
توضیح کوهستانهوش مصنوعی فیزیکیگزارش تحلیلی· 6 دقیقه مطالعه· در هوش مصنوعی

شرکت Skild AI از مدل پایه S1 رونمایی کرد: یادگیری کارهای ۱۰ دقیقه‌ای توسط ربات‌ها تنها با یک ویدیو

مدل S1 یادگیری در-بافت (in-context learning) را در رباتیک فیزیکی پیاده‌سازی می‌کند و به ماشین‌ها اجازه می‌دهد کارهای پیچیده و جدیدی مانند تعویض گلدان یا دم کردن قهوه را بدون نیاز به تنظیم دقیق (fine-tuning) انجام دهند. بنچمارک‌های اولیه نشان‌دهنده موفقیت ۶۶ درصدی در مراحل انجام کارهای جدید است که می‌تواند نقطه پایانی بر روش‌های مبتنی بر داده‌های حجیم تله‌اپریشن (teleoperation) باشد.

به قلم کوروش پاکزاد

پژوهشگران رباتیک 40%یکپارچه‌سازان صنعتی 35%حامیان متن‌باز 25%
پژوهشگران رباتیک
مدل S1 را یک پیشرفت بزرگ می‌دانند که ثابت می‌کند یادگیری در-بافت برای دستکاری فیزیکی کارآمد است و به‌طور بالقوه گلوگاه کمبود داده را حل می‌کند.
یکپارچه‌سازان صنعتی
نسبت به کاهش زمان راه‌اندازی خوش‌بین هستند، اما تأکید می‌کنند که نرخ موفقیت ۶۶ درصدی همراه با مداخلات انسانی، هنوز برای خطوط تولید بدون نظارت به اندازه کافی قابل‌اعتماد نیست.
حامیان متن‌باز
از اینکه S1 همچنان یک سیستم بسته و انحصاری بدون وزن‌ها یا API عمومی است، ناامید هستند؛ چرا که این موضوع راستی‌آزمایی بنچمارک‌ها را برای جامعه گسترده‌تر غیرممکن می‌سازد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کارگران خطوط تولید که ممکن است نقش آن‌ها از مونتاژ دستی به ضبط ویدیوهای آموزشی تغییر کند.

نکات کلیدی

  • مدل پایه S1 از شرکت Skild AI به ربات‌ها اجازه می‌دهد کارهای پیچیده و جدید را تنها با تماشای یک ویدیوی آموزشی یاد بگیرند.
  • این مدل از یادگیری در-بافت استفاده می‌کند و نیازی به تنظیم دقیق برای کارهای خاص یا به‌روزرسانی وزن‌های شبکه ندارد.
  • مدل S1 می‌تواند کارهای طولانی‌مدت تا سقف ۱۰ دقیقه، مانند تعویض گلدان و دم کردن قهوه را انجام دهد.
  • در بنچمارک‌های داخلی، S1 به نرخ موفقیت ۶۶ درصدی در مراحل کارهای جدید دست یافت، در حالی که این رقم برای مدل‌های مبتنی بر پرامپت متنی تنها ۹ درصد بود.
  • این سیستم «همه‌تن‌حریف» (omni-bodied) است و برای کنترل ربات‌های چهارپا، انسان‌نما و بازوهای ثابت طراحی شده است.
  • شرکت Skild برای آموزش و اعتبارسنجی این مدل از زیرساخت‌های شبیه‌سازی و پردازشی انویدیا (NVIDIA) استفاده می‌کند.

چرا مهم است

اگر ربات‌ها بتوانند کارهای جدید را به‌جای هفته‌ها جمع‌آوری داده، تنها از طریق یک ویدیو یاد بگیرند، هزینه استقرار هوش مصنوعی فیزیکی در کارخانه‌ها، انبارها و خانه‌ها به‌شدت کاهش می‌یابد. این پیشرفت، رباتیک را به انعطاف‌پذیری مدل‌های زبانی بزرگ نزدیک‌تر می‌کند؛ جایی که یک پرامپت ساده جایگزین چرخه طولانی بازآموزی می‌شود.

وقتی یک مدل زبانی بزرگ باید کار جدیدی را یاد بگیرد، کاربران شبکه عصبی آن را بازآموزی نمی‌کنند؛ بلکه فقط یک دستور جدید در کادر پرامپت تایپ می‌کنند. مدل پایه و تازه‌معرفی‌شده S1 از شرکت Skild AI دقیقاً همین سازوکار را در رباتیک فیزیکی به کار می‌گیرد، اما با یک تفاوت اساسی: پرامپت در اینجا، یک ویدیوی تکی از انسانی است که آن کار را انجام می‌دهد. این سیستم با در نظر گرفتن ویدیوی آموزشی به‌عنوان یک دستورالعمل فوری (و نه نقطه شروعی برای یک چرخه طولانی جمع‌آوری داده)، تلاش می‌کند تا از سد اصلی اتوماسیون رباتیک عبور کند.[3]

مدل S1 که در اواخر آگوست ۲۰۲۶ معرفی شد و امروز توسط انویدیا به‌عنوان یکی از پیاده‌سازی‌های کلیدی زیرساخت هوش مصنوعی فیزیکی این شرکت مورد توجه قرار گرفت، برای اجرای کارهای دستکاری طولانی‌مدتی طراحی شده است که پیش از این هرگز ندیده است. این مدل به هیچ‌گونه تنظیم دقیق برای کارهای خاص یا به‌روزرسانی وزن‌ها نیازی ندارد. در عوض، کاملاً بر یادگیری در-بافت (in-context learning) تکیه می‌کند؛ تغییر پارادایمی که رباتیک را به انعطاف‌پذیری تولیدکنندگان متن امروزی نزدیک‌تر می‌سازد.[1][2]

از نظر تاریخی، آموزش یک مهارت جدید به ربات، تمرینی طاقت‌فرسا در جمع‌آوری داده بوده است. برای اینکه یک بازوی رباتیک بتواند پیراهنی را تا کند یا نوع جدیدی از بسته‌ها را مرتب سازد، مهندسان معمولاً ده‌ها تا صدها ساعت داده تله‌اپریشن (teleoperation) جمع‌آوری می‌کنند — جایی که یک انسان به‌صورت دستی ربات را در طول حرکات هدایت می‌کند — و سپس یک سیاست تخصصی را پس‌آموزش (post-train) می‌دهند. این بازآموزیِ کار-به-کار، گران و کند است و ربات‌ها را به محیط‌های بسیار ساختاریافته و تکراری محدود می‌کند.[2][3]

شرکت Skild AI استدلال می‌کند که همین گلوگاه داده است که رباتیک را در آزمایشگاه‌ها گرفتار کرده است. مدل S1 فاز پس‌آموزش را به‌طور کامل دور می‌زند. به ربات یک ویدیوی خودمحور (زاویه دید اول‌شخص) از انسانی که در حال انجام کار است نشان داده می‌شود. این ویدیو در پنجره بافت (context window) مدل بارگذاری می‌شود و وزن‌های ثابت شبکه عصبی، قصد انسان، تناظرهای عملکردی و حرکات فضایی را مستقیماً به کنترل‌های حرکتی ربات نگاشت می‌کنند.[2]

چگونه یادگیری در-بافت، گلوگاه سنتی داده‌های رباتیک را دور می‌زند.

دیپاک پاتاک، هم‌بنیان‌گذار و مدیرعامل Skild AI می‌گوید: «یادگیری از طریق تجربه، و نه برنامه‌نویسی از پیش تعیین‌شده، تغییر گام‌به‌گامی است که در رباتیک رخ داده است.» این شرکت خاطرنشان می‌کند که در اصطلاحات فرا-یادگیری (meta-learning)، پیش‌آموزش عظیم این مدل به‌عنوان یک حلقه بیرونی عمل می‌کند که به سیستم یاد می‌دهد چگونه از بافت یاد بگیرد. در زمان استنتاج، ویدیوی آموزشی حلقه داخلی را هدایت کرده و بدون تغییر حتی یک پارامتر در مدل، اقدامات ربات را دیکته می‌کند.[1][2]

کارهایی که S1 می‌تواند انجام دهد، حرکات کوتاه و سه‌ثانیه‌ایِ برداشتن و گذاشتن نیستند. شرکت Skild نشان داد که این مدل می‌تواند کارهایی با مدت‌زمان تا ۱۰ دقیقه را در قالب ده‌ها مرحله دستکاری اجرا کند. نمونه‌ها شامل تعویض گلدان یک گیاه، دم کردن قهوه، مونتاژ یک کیت و پختن پنکیک بود. این‌ها توالی‌هایی هستند که ربات را ملزم می‌کنند مهارت‌های اتمی را به روش‌هایی ترکیب کند که پیش از این هرگز انجام نداده است.[1][2]

کارهایی که S1 می‌تواند انجام دهد، حرکات کوتاه و سه‌ثانیه‌ایِ برداشتن و گذاشتن نیستند.

در دموی تعویض گلدان، از زمان ضبط ویدیوی آموزشی توسط انسان تا شروع اجرای خودکار ربات روی سخت‌افزار، تنها ۱۱ دقیقه زمان برد. در طول این اجرا، ربات رفتارهای بدیعی را در زمان آزمایش نشان داد که در پیش‌آموزش آن وجود نداشت؛ مانند کندن خاک برای ایجاد فضا برای گیاه و فشار دادن یک فیلتر کاغذی درون قیف قهوه.[1][2]

مدل S1 همچنین نشانه‌هایی از درک فیزیکی مبتنی بر عقل سلیم و بازیابی از خطا را نشان داد. در یک آزمایش داخلی، ویدیوی آموزشی شخصی را نشان می‌داد که با آب‌پاش به گیاهی آب می‌دهد، اما به ربات تنها یک فنجان آب داده شده بود. مدل خود را با این مغایرت تطبیق داد و با موفقیت از فنجان استفاده کرد. در مثالی دیگر، پرامپت لیوانی را نشان می‌داد که با آب‌میوه پر می‌شود، اما لیوان فیزیکی مقابل ربات از قبل تقریباً پر بود؛ S1 شرایط را سنجید و فقط مقدار کمی به آن اضافه کرد.[2]

در این پارادایم جدید، یک ویدیوی خودمحور از انسانی که در حال انجام یک کار است، به‌عنوان پرامپت دستورالعمل مستقیم برای ربات عمل می‌کند.

برای کمی‌سازی عملکرد مدل، Skild بنچمارک‌های داخلی کنترل‌شده‌ای را اجرا کرد که رویکرد مبتنی بر پرامپت ویدیویی S1 را با یک مدل استاندارد بینایی-زبان-عمل (Vision-Language-Action) مبتنی بر پرامپت متنی مقایسه می‌کرد. در ۱۰۰ هزار ساعت داده پیش‌آموزش، مدل در-بافت به میانگین موفقیت ۶۶ درصدی در مراحل کارهای جدید دست یافت، در حالی که این رقم برای مدل پایه متنی تنها ۹ درصد بود — یعنی بیش از هفت برابر بهبود.[1][2]

این شرکت تخمین می‌زند که رسیدن به عملکرد تک‌ویدیویی S1 از طریق روش‌های سنتی، به حدود ۳۸۰ نمایش تله‌اپریشن نیاز دارد که معادل ده‌ها ساعت جمع‌آوری دستی داده است. این نشان می‌دهد که یک پرامپت ویدیویی می‌تواند به‌طور مؤثری جایگزین هفته‌ها کار مهندسی شود و اقتصاد استقرار ربات‌ها در محیط‌های پویایی مانند طبقات تولید و انبارها را اساساً تغییر دهد.[1]

توسعه این مدل به‌شدت به پشته محاسباتی شتاب‌یافته انویدیا وابسته است. شرکت Skild از NVIDIA Omniverse و Isaac Lab برای شبیه‌سازی فیزیک و تولید داده‌های مصنوعی استفاده می‌کند که به مدل اجازه می‌دهد پیش از لمس سخت‌افزار فیزیکی، سناریوهای متنوعی را تجربه کند. پاتاک در این باره اشاره کرد: «فناوری‌های NVIDIA Isaac Lab و NVIDIA Cosmos به Skild کمک می‌کنند تا تجربیات مقیاس‌پذیر و متنوعی را که ربات‌هایش برای یادگیری در سناریوها و بدنه‌های مختلف نیاز دارند، ایجاد کند.»[1]

بنچمارک‌های داخلی Skild AI که پرامپت ویدیویی را با پرامپت متنی در ۱۰۰ هزار ساعت داده پیش‌آموزش مقایسه می‌کند.

این زیرساخت از رشد سریع تجاری نیز پشتیبانی کرده است. به گفته انویدیا، Skild AI تنها ۱۰ ماه پس از اولین استقرار تجاری خود، به نرخ درآمد سالانه ۱۰۰ میلیون دلاری دست یافت. این شرکت بیش از ۶۰ مشارکت استقرار در زمینه‌های تولید، لجستیک، بازرسی، امنیت و آماده‌سازی غذا ایجاد کرده است که نشان می‌دهد تقاضا برای مغزهای رباتیک سازگار و همه‌تن‌حریف بسیار بالاست.[1]

با این حال، نرخ موفقیت ۶۶ درصدی با اما و اگرهایی همراه است. این یک معیار موفقیت مرحله‌ای است که شامل مداخلات بازیابی انسانی نیز می‌شود؛ به این معنی که تضمین نمی‌کند ربات بتواند در ۶۶ درصد مواقع یک کار ۱۰ دقیقه‌ای را کاملاً بدون کمک به پایان برساند. علاوه بر این، S1 هنوز یک API باز یا مجموعه‌ای از وزن‌های قابل دانلود نیست، به این معنی که محققان مستقل هنوز نمی‌توانند بنچمارک‌ها را راستی‌آزمایی کنند. آزمون واقعی این خواهد بود که آیا یادگیری در-بافت این مدل در خارج از محیط‌های کنترل‌شده آزمایشگاهی و در مواجهه با نورپردازی آشفته، اصطکاک و استهلاک یک کارخانه واقعی نیز دوام می‌آورد یا خیر.[2][3]

اصطلاحات کلیدی

یادگیری در-بافت
توانایی یک مدل هوش مصنوعی برای یادگیری یک کار جدید از دستورالعمل‌ها یا مثال‌های ارائه‌شده در پرامپت خود، بدون تغییر وزن‌های شبکه عصبی زیربنایی آن.
مدل پایه
یک مدل هوش مصنوعی بزرگ و همه‌منظوره که روی مقادیر عظیمی از داده‌ها آموزش دیده و می‌تواند برای طیف گسترده‌ای از کارهای پایین‌دستی تطبیق داده شود.
تله‌اپریشن
فرآیندی که در آن یک انسان به‌صورت دستی ربات را کنترل می‌کند تا حرکات و داده‌های حسگر آن را ثبت کند و معمولاً برای آموزش هوش مصنوعی رباتیک استفاده می‌شود.
مدل بینایی-زبان-عمل (VLA)
یک معماری هوش مصنوعی که ورودی‌های بصری و دستورالعمل‌های متنی را دریافت می‌کند تا فرمان‌های حرکتی مستقیم برای یک ربات صادر کند.
همه‌تن‌حریف
یک سیستم کنترلی که برای کار با انواع مختلف سخت‌افزار ربات، مانند بازوها، ربات‌های چهارپا و انسان‌نماها، با استفاده از یک مغز مشترک واحد طراحی شده است.

آنچه نمی‌دانیم

  • اینکه S1 هر چند وقت یک‌بار می‌تواند یک کار ۱۰ دقیقه‌ای را کاملاً بدون کمک انجام دهد، زیرا معیار ۶۶ درصدی تنها موفقیت در مراحل را می‌سنجد و شامل مداخلات انسانی نیز می‌شود.
  • عملکرد این مدل در کارهای بسیار دقیق و میلی‌متری در مقایسه با جابه‌جایی‌های کلی که در دموها نشان داده شده است، چگونه خواهد بود.
  • چه زمانی این مدل فراتر از شرکای صنعتی اولیه Skild، در دسترس عموم یا جامعه گسترده‌تر توسعه‌دهندگان قرار خواهد گرفت.
  • نسبت دقیق داده‌های شبیه‌سازی مصنوعی به ویدیوهای واقعی انسان‌ها که در فاز پیش‌آموزش ۱۰۰ هزار ساعته مدل استفاده شده است، چقدر است.

منابع

پوشش منابع

3 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران رباتیک 40%یکپارچه‌سازان صنعتی 35%حامیان متن‌باز 25%
  1. [1]NVIDIA Blogپژوهشگران رباتیک

    Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video

    مطالعه در NVIDIA Blog
  2. [2]Skild AIپژوهشگران رباتیک

    Introducing S1: In-Context Learning for Robotics

    مطالعه در Skild AI
  3. [3]تیم سردبیری کوهستانیکپارچه‌سازان صنعتی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.