رفتن به محتوای اصلی
کوهستان
توضیح کوهستانهوش مصنوعی فیزیکیگزارش تحلیلی· 6 دقیقه مطالعه· در هوش مصنوعی

شرکت Skild AI از مدل پایه S1 رونمایی کرد: یادگیری کارهای ۱۰ دقیقه‌ای توسط ربات‌ها تنها با یک ویدیو

مدل S1 یادگیری در-بافت (in-context learning) را در رباتیک فیزیکی پیاده‌سازی می‌کند و به ماشین‌ها اجازه می‌دهد کارهای پیچیده و جدیدی مانند تعویض گلدان یا دم کردن قهوه را بدون نیاز به تنظیم دقیق (fine-tuning) انجام دهند. بنچمارک‌های اولیه نشان‌دهنده موفقیت ۶۶ درصدی در مراحل انجام کارهای جدید است که می‌تواند نقطه پایانی بر روش‌های مبتنی بر داده‌های حجیم تله‌اپریشن (teleoperation) باشد.

به قلم کوروش پاکزاد

به‌طور خلاصه

  • مدل پایه S1 از شرکت Skild AI به ربات‌ها اجازه می‌دهد کارهای پیچیده و جدید را تنها با تماشای یک ویدیوی آموزشی یاد بگیرند.
  • این مدل از یادگیری در-بافت استفاده می‌کند و نیازی به تنظیم دقیق برای کارهای خاص یا به‌روزرسانی وزن‌های شبکه ندارد.
  • مدل S1 می‌تواند کارهای طولانی‌مدت تا سقف ۱۰ دقیقه، مانند تعویض گلدان و دم کردن قهوه را انجام دهد.

وقتی یک مدل زبانی بزرگ باید کار جدیدی را یاد بگیرد، کاربران شبکه عصبی آن را بازآموزی نمی‌کنند؛ بلکه فقط یک دستور جدید در کادر پرامپت تایپ می‌کنند. مدل پایه و تازه‌معرفی‌شده S1 از شرکت Skild AI دقیقاً همین سازوکار را در رباتیک فیزیکی به کار می‌گیرد، اما با یک تفاوت اساسی: پرامپت در اینجا، یک ویدیوی تکی از انسانی است که آن کار را انجام می‌دهد.

این سیستم با در نظر گرفتن ویدیوی آموزشی به‌عنوان یک دستورالعمل فوری (و نه نقطه شروعی برای یک چرخه طولانی جمع‌آوری داده)، تلاش می‌کند تا از سد اصلی اتوماسیون رباتیک عبور کند.[3]

مدل S1 که در اواخر آگوست ۲۰۲۶ معرفی شد و امروز توسط انویدیا به‌عنوان یکی از پیاده‌سازی‌های کلیدی زیرساخت هوش مصنوعی فیزیکی این شرکت مورد توجه قرار گرفت، برای اجرای کارهای دستکاری طولانی‌مدتی طراحی شده است که پیش از این هرگز ندیده است. این مدل به هیچ‌گونه تنظیم دقیق برای کارهای خاص یا به‌روزرسانی وزن‌ها نیازی ندارد. در عوض، کاملاً بر یادگیری در-بافت (in-context learning) تکیه می‌کند؛ تغییر پارادایمی که رباتیک را به انعطاف‌پذیری تولیدکنندگان متن امروزی نزدیک‌تر می‌سازد.[1][2]

از نظر تاریخی، آموزش یک مهارت جدید به ربات، تمرینی طاقت‌فرسا در جمع‌آوری داده بوده است. برای اینکه یک بازوی رباتیک بتواند پیراهنی را تا کند یا نوع جدیدی از بسته‌ها را مرتب سازد، مهندسان معمولاً ده‌ها تا صدها ساعت داده تله‌اپریشن (teleoperation) جمع‌آوری می‌کنند — جایی که یک انسان به‌صورت دستی ربات را در طول حرکات هدایت می‌کند — و سپس یک سیاست تخصصی را پس‌آموزش (post-train) می‌دهند. این بازآموزیِ کار-به-کار، گران و کند است و ربات‌ها را به محیط‌های بسیار ساختاریافته و تکراری محدود می‌کند.[2][3]

شرکت Skild AI استدلال می‌کند که همین گلوگاه داده است که رباتیک را در آزمایشگاه‌ها گرفتار کرده است. مدل S1 فاز پس‌آموزش را به‌طور کامل دور می‌زند. به ربات یک ویدیوی خودمحور (زاویه دید اول‌شخص) از انسانی که در حال انجام کار است نشان داده می‌شود. این ویدیو در پنجره بافت (context window) مدل بارگذاری می‌شود و وزن‌های ثابت شبکه عصبی، قصد انسان، تناظرهای عملکردی و حرکات فضایی را مستقیماً به کنترل‌های حرکتی ربات نگاشت می‌کنند.[2]

چگونه یادگیری در-بافت، گلوگاه سنتی داده‌های رباتیک را دور می‌زند.

دیپاک پاتاک، هم‌بنیان‌گذار و مدیرعامل Skild AI می‌گوید: «یادگیری از طریق تجربه، و نه برنامه‌نویسی از پیش تعیین‌شده، تغییر گام‌به‌گامی است که در رباتیک رخ داده است.» این شرکت خاطرنشان می‌کند که در اصطلاحات فرا-یادگیری (meta-learning)، پیش‌آموزش عظیم این مدل به‌عنوان یک حلقه بیرونی عمل می‌کند که به سیستم یاد می‌دهد چگونه از بافت یاد بگیرد. در زمان استنتاج، ویدیوی آموزشی حلقه داخلی را هدایت کرده و بدون تغییر حتی یک پارامتر در مدل، اقدامات ربات را دیکته می‌کند.[1][2]

کارهایی که S1 می‌تواند انجام دهد، حرکات کوتاه و سه‌ثانیه‌ایِ برداشتن و گذاشتن نیستند. شرکت Skild نشان داد که این مدل می‌تواند کارهایی با مدت‌زمان تا ۱۰ دقیقه را در قالب ده‌ها مرحله دستکاری اجرا کند. نمونه‌ها شامل تعویض گلدان یک گیاه، دم کردن قهوه، مونتاژ یک کیت و پختن پنکیک بود. این‌ها توالی‌هایی هستند که ربات را ملزم می‌کنند مهارت‌های اتمی را به روش‌هایی ترکیب کند که پیش از این هرگز انجام نداده است.[1][2]

در دموی تعویض گلدان، از زمان ضبط ویدیوی آموزشی توسط انسان تا شروع اجرای خودکار ربات روی سخت‌افزار، تنها ۱۱ دقیقه زمان برد. در طول این اجرا، ربات رفتارهای بدیعی را در زمان آزمایش نشان داد که در پیش‌آموزش آن وجود نداشت؛ مانند کندن خاک برای ایجاد فضا برای گیاه و فشار دادن یک فیلتر کاغذی درون قیف قهوه.[1][2]

مدل S1 همچنین نشانه‌هایی از درک فیزیکی مبتنی بر عقل سلیم و بازیابی از خطا را نشان داد. در یک آزمایش داخلی، ویدیوی آموزشی شخصی را نشان می‌داد که با آب‌پاش به گیاهی آب می‌دهد، اما به ربات تنها یک فنجان آب داده شده بود.

مدل خود را با این مغایرت تطبیق داد و با موفقیت از فنجان استفاده کرد. در مثالی دیگر، پرامپت لیوانی را نشان می‌داد که با آب‌میوه پر می‌شود، اما لیوان فیزیکی مقابل ربات از قبل تقریباً پر بود؛ S1 شرایط را سنجید و فقط مقدار کمی به آن اضافه کرد.[2]

در این پارادایم جدید، یک ویدیوی خودمحور از انسانی که در حال انجام یک کار است، به‌عنوان پرامپت دستورالعمل مستقیم برای ربات عمل می‌کند.

برای کمی‌سازی عملکرد مدل، Skild بنچمارک‌های داخلی کنترل‌شده‌ای را اجرا کرد که رویکرد مبتنی بر پرامپت ویدیویی S1 را با یک مدل استاندارد بینایی-زبان-عمل (Vision-Language-Action) مبتنی بر پرامپت متنی مقایسه می‌کرد. در ۱۰۰ هزار ساعت داده پیش‌آموزش، مدل در-بافت به میانگین موفقیت ۶۶ درصدی در مراحل کارهای جدید دست یافت، در حالی که این رقم برای مدل پایه متنی تنها ۹ درصد بود — یعنی بیش از هفت برابر بهبود.[1][2]

این شرکت تخمین می‌زند که رسیدن به عملکرد تک‌ویدیویی S1 از طریق روش‌های سنتی، به حدود ۳۸۰ نمایش تله‌اپریشن نیاز دارد که معادل ده‌ها ساعت جمع‌آوری دستی داده است. این نشان می‌دهد که یک پرامپت ویدیویی می‌تواند به‌طور مؤثری جایگزین هفته‌ها کار مهندسی شود و اقتصاد استقرار ربات‌ها در محیط‌های پویایی مانند طبقات تولید و انبارها را اساساً تغییر دهد.[1]

توسعه این مدل به‌شدت به پشته محاسباتی شتاب‌یافته انویدیا وابسته است. شرکت Skild از NVIDIA Omniverse و Isaac Lab برای شبیه‌سازی فیزیک و تولید داده‌های مصنوعی استفاده می‌کند که به مدل اجازه می‌دهد پیش از لمس سخت‌افزار فیزیکی، سناریوهای متنوعی را تجربه کند. پاتاک در این باره اشاره کرد: «فناوری‌های NVIDIA Isaac Lab و NVIDIA Cosmos به Skild کمک می‌کنند تا تجربیات مقیاس‌پذیر و متنوعی را که ربات‌هایش برای یادگیری در سناریوها و بدنه‌های مختلف نیاز دارند، ایجاد کند.»[1]

بنچمارک‌های داخلی Skild AI که پرامپت ویدیویی را با پرامپت متنی در ۱۰۰ هزار ساعت داده پیش‌آموزش مقایسه می‌کند.

این زیرساخت از رشد سریع تجاری نیز پشتیبانی کرده است. به گفته انویدیا، Skild AI تنها ۱۰ ماه پس از اولین استقرار تجاری خود، به نرخ درآمد سالانه ۱۰۰ میلیون دلاری دست یافت. این شرکت بیش از ۶۰ مشارکت استقرار در زمینه‌های تولید، لجستیک، بازرسی، امنیت و آماده‌سازی غذا ایجاد کرده است که نشان می‌دهد تقاضا برای مغزهای رباتیک سازگار و همه‌تن‌حریف بسیار بالاست.[1]

با این حال، نرخ موفقیت ۶۶ درصدی با اما و اگرهایی همراه است. این یک معیار موفقیت مرحله‌ای است که شامل مداخلات بازیابی انسانی نیز می‌شود؛ به این معنی که تضمین نمی‌کند ربات بتواند در ۶۶ درصد مواقع یک کار ۱۰ دقیقه‌ای را کاملاً بدون کمک به پایان برساند.

علاوه بر این، S1 هنوز یک API باز یا مجموعه‌ای از وزن‌های قابل دانلود نیست، به این معنی که محققان مستقل هنوز نمی‌توانند بنچمارک‌ها را راستی‌آزمایی کنند. آزمون واقعی این خواهد بود که آیا یادگیری در-بافت این مدل در خارج از محیط‌های کنترل‌شده آزمایشگاهی و در مواجهه با نورپردازی آشفته، اصطکاک و استهلاک یک کارخانه واقعی نیز دوام می‌آورد یا خیر.[2][3]

اصطلاحات کلیدی

یادگیری در-بافت
توانایی یک مدل هوش مصنوعی برای یادگیری یک کار جدید از دستورالعمل‌ها یا مثال‌های ارائه‌شده در پرامپت خود، بدون تغییر وزن‌های شبکه عصبی زیربنایی آن.
مدل پایه
یک مدل هوش مصنوعی بزرگ و همه‌منظوره که روی مقادیر عظیمی از داده‌ها آموزش دیده و می‌تواند برای طیف گسترده‌ای از کارهای پایین‌دستی تطبیق داده شود.
تله‌اپریشن
فرآیندی که در آن یک انسان به‌صورت دستی ربات را کنترل می‌کند تا حرکات و داده‌های حسگر آن را ثبت کند و معمولاً برای آموزش هوش مصنوعی رباتیک استفاده می‌شود.
مدل بینایی-زبان-عمل (VLA)
یک معماری هوش مصنوعی که ورودی‌های بصری و دستورالعمل‌های متنی را دریافت می‌کند تا فرمان‌های حرکتی مستقیم برای یک ربات صادر کند.
همه‌تن‌حریف
یک سیستم کنترلی که برای کار با انواع مختلف سخت‌افزار ربات، مانند بازوها، ربات‌های چهارپا و انسان‌نماها، با استفاده از یک مغز مشترک واحد طراحی شده است.

پرسش‌های متداول

آیا ربات قبل از انجام کار نیاز به تمرین دارد؟

خیر. مدل S1 از یادگیری در-بافت استفاده می‌کند، به این معنی که ویدیوی آموزشی را تماشا کرده و بلافاصله با استفاده از وزن‌های ثابت و موجود خود، بدون هیچ‌گونه تمرین قبلی، برای انجام کار تلاش می‌کند.

مدل S1 به چه نوع ویدیویی نیاز دارد؟

این مدل می‌تواند از یک ویدیوی خودمحور (زاویه دید اول‌شخص) از انسانی که در حال انجام کار است یاد بگیرد و نیازی به ویدیویی از یک ربات دیگر در حال انجام آن کار ندارد.

آیا S1 می‌تواند تغییرات محیطی را مدیریت کند؟

بله. در دموها، زمانی که اشیاء در حین کار جابه‌جا شدند یا ابزار متفاوتی مانند یک فنجان به‌جای آب‌پاش ارائه شد، مدل با موفقیت خود را تطبیق داد.

آیا S1 برای خرید در دسترس است؟

هنوز نه. شرکت Skild AI در حال حاضر S1 را با گروه محدودی از شرکای صنعتی مستقر کرده است و قصد دارد در ماه‌های آینده دسترسی به آن را گسترش دهد.

بررسی عمیق دیدگاه‌ها

پژوهشگران رباتیک

تغییر پارادایم از جمع‌آوری داده به مهندسی پرامپت.

برای پژوهشگرانی که در حال ساخت مدل‌های پایه هستند، S1 نشان‌دهنده لحظه‌ای است که هوش مصنوعی فیزیکی به قابلیت‌های مبتنی بر متنِ مدل‌های زبانی بزرگ اولیه رسید. پایپ‌لاین سنتی رباتیک مهندسان را ملزم می‌کند تا صدها ساعت داده تله‌اپریشن جمع‌آوری کنند تا تنها یک حرکت جدید را به بازوی رباتیک آموزش دهند. با اثبات اینکه یک شبکه عصبی ثابت می‌تواند قصد و تناظر فضایی را از یک ویدیوی خودمحور استنتاج کند، Skild AI نشان داد که می‌توان گلوگاه داده را به‌طور کامل دور زد. پژوهشگران استدلال می‌کنند که این رویکرد یادگیری در-بافت، استقرار ربات‌های همه‌منظوره را به‌طور تصاعدی تسریع خواهد کرد، زیرا آموزش یک ماشین به سادگیِ نشان دادن کاری است که باید انجام دهد.

یکپارچه‌سازان صنعتی

هیجان‌زده از سرعت، اما در انتظار قابلیت اطمینان ۹۹٫۹ درصدی.

مدیران کارخانه‌ها و یکپارچه‌سازان لجستیک، زمان راه‌اندازی ۱۱ دقیقه‌ای را یک تغییردهنده بازی برای محیط‌هایی می‌دانند که خطوط تولید در آن‌ها روزانه تغییر می‌کنند. با این حال، آن‌ها نسبت به آمادگی واقعی این مدل برای تولید محتاط هستند. نرخ موفقیت ۶۶ درصدی در مراحل — به‌ویژه نرخی که شامل مداخلات بازیابی انسانی می‌شود — در یک محیط آزمایشگاهی چشمگیر است، اما از آپ‌تایم ۹۹٫۹ درصدی مورد نیاز در یک طبقه تولید زنده فاصله دارد. یکپارچه‌سازان خاطرنشان می‌کنند که اگرچه پرامپت ویدیویی برای نمونه‌سازی سریع و راه‌اندازی اولیه عالی است، اما کارهای بسیار تکراری و با توان عملیاتی بالا ممکن است همچنان به تنظیم دقیق سنتی و هزاران نمایش برای دستیابی به دقت و قابلیت اطمینان لازم نیاز داشته باشند.

حامیان متن‌باز

بدبین نسبت به بنچمارک‌های پشت درهای بسته و وزن‌های انحصاری.

جامعه هوش مصنوعی متن‌باز از ماهیت بسته انتشار S1 ابراز ناامیدی کرده است. از آنجا که Skild AI وزن‌های مدل را منتشر نکرده، API عمومی ارائه نداده یا مقاله داوری‌شده‌ای در مورد جزئیات معماری آن منتشر نکرده است، راستی‌آزمایی مستقل نرخ موفقیت ۶۶ درصدی غیرممکن است. حامیان استدلال می‌کنند که تکیه بر بنچمارک‌های داخلی و گزارش‌شده توسط فروشنده برای کارهای دست‌چین‌شده‌ای مانند برگرداندن پنکیک، ضعیف‌ترین سطح شواهد در یادگیری ماشین است. آن‌ها هشدار می‌دهند که تا زمانی که این مدل نتواند توسط توسعه‌دهندگان شخص ثالث روی سخت‌افزارهای متنوع آزمایش شود، ادعاهای تعمیم‌پذیری «همه‌تن‌حریف» باید بیشتر به‌عنوان سیگنال‌های جهت‌دار در نظر گرفته شوند تا حقایق علمی تثبیت‌شده.

پژوهشگران رباتیک 40%یکپارچه‌سازان صنعتی 35%حامیان متن‌باز 25%
پژوهشگران رباتیک
مدل S1 را یک پیشرفت بزرگ می‌دانند که ثابت می‌کند یادگیری در-بافت برای دستکاری فیزیکی کارآمد است و به‌طور بالقوه گلوگاه کمبود داده را حل می‌کند.
یکپارچه‌سازان صنعتی
نسبت به کاهش زمان راه‌اندازی خوش‌بین هستند، اما تأکید می‌کنند که نرخ موفقیت ۶۶ درصدی همراه با مداخلات انسانی، هنوز برای خطوط تولید بدون نظارت به اندازه کافی قابل‌اعتماد نیست.
حامیان متن‌باز
از اینکه S1 همچنان یک سیستم بسته و انحصاری بدون وزن‌ها یا API عمومی است، ناامید هستند؛ چرا که این موضوع راستی‌آزمایی بنچمارک‌ها را برای جامعه گسترده‌تر غیرممکن می‌سازد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کارگران خطوط تولید که ممکن است نقش آن‌ها از مونتاژ دستی به ضبط ویدیوهای آموزشی تغییر کند.

منابع

پوشش منابع

3 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران رباتیک 40%یکپارچه‌سازان صنعتی 35%حامیان متن‌باز 25%
  1. [1]NVIDIA Blogپژوهشگران رباتیک

    Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video

    مطالعه در NVIDIA Blog →
  2. [2]Skild AIپژوهشگران رباتیک

    Introducing S1: In-Context Learning for Robotics

    مطالعه در Skild AI →
  3. [3]تیم سردبیری کوهستانیکپارچه‌سازان صنعتی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.