شرکت Skild AI از مدل پایه S1 رونمایی کرد: یادگیری کارهای ۱۰ دقیقهای توسط رباتها تنها با یک ویدیو
مدل S1 یادگیری در-بافت (in-context learning) را در رباتیک فیزیکی پیادهسازی میکند و به ماشینها اجازه میدهد کارهای پیچیده و جدیدی مانند تعویض گلدان یا دم کردن قهوه را بدون نیاز به تنظیم دقیق (fine-tuning) انجام دهند. بنچمارکهای اولیه نشاندهنده موفقیت ۶۶ درصدی در مراحل انجام کارهای جدید است که میتواند نقطه پایانی بر روشهای مبتنی بر دادههای حجیم تلهاپریشن (teleoperation) باشد.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- مدل پایه S1 از شرکت Skild AI به رباتها اجازه میدهد کارهای پیچیده و جدید را تنها با تماشای یک ویدیوی آموزشی یاد بگیرند.
- این مدل از یادگیری در-بافت استفاده میکند و نیازی به تنظیم دقیق برای کارهای خاص یا بهروزرسانی وزنهای شبکه ندارد.
- مدل S1 میتواند کارهای طولانیمدت تا سقف ۱۰ دقیقه، مانند تعویض گلدان و دم کردن قهوه را انجام دهد.
وقتی یک مدل زبانی بزرگ باید کار جدیدی را یاد بگیرد، کاربران شبکه عصبی آن را بازآموزی نمیکنند؛ بلکه فقط یک دستور جدید در کادر پرامپت تایپ میکنند. مدل پایه و تازهمعرفیشده S1 از شرکت Skild AI دقیقاً همین سازوکار را در رباتیک فیزیکی به کار میگیرد، اما با یک تفاوت اساسی: پرامپت در اینجا، یک ویدیوی تکی از انسانی است که آن کار را انجام میدهد.
این سیستم با در نظر گرفتن ویدیوی آموزشی بهعنوان یک دستورالعمل فوری (و نه نقطه شروعی برای یک چرخه طولانی جمعآوری داده)، تلاش میکند تا از سد اصلی اتوماسیون رباتیک عبور کند.[3]
مدل S1 که در اواخر آگوست ۲۰۲۶ معرفی شد و امروز توسط انویدیا بهعنوان یکی از پیادهسازیهای کلیدی زیرساخت هوش مصنوعی فیزیکی این شرکت مورد توجه قرار گرفت، برای اجرای کارهای دستکاری طولانیمدتی طراحی شده است که پیش از این هرگز ندیده است. این مدل به هیچگونه تنظیم دقیق برای کارهای خاص یا بهروزرسانی وزنها نیازی ندارد. در عوض، کاملاً بر یادگیری در-بافت (in-context learning) تکیه میکند؛ تغییر پارادایمی که رباتیک را به انعطافپذیری تولیدکنندگان متن امروزی نزدیکتر میسازد.[1][2]
از نظر تاریخی، آموزش یک مهارت جدید به ربات، تمرینی طاقتفرسا در جمعآوری داده بوده است. برای اینکه یک بازوی رباتیک بتواند پیراهنی را تا کند یا نوع جدیدی از بستهها را مرتب سازد، مهندسان معمولاً دهها تا صدها ساعت داده تلهاپریشن (teleoperation) جمعآوری میکنند — جایی که یک انسان بهصورت دستی ربات را در طول حرکات هدایت میکند — و سپس یک سیاست تخصصی را پسآموزش (post-train) میدهند. این بازآموزیِ کار-به-کار، گران و کند است و رباتها را به محیطهای بسیار ساختاریافته و تکراری محدود میکند.[2][3]
شرکت Skild AI استدلال میکند که همین گلوگاه داده است که رباتیک را در آزمایشگاهها گرفتار کرده است. مدل S1 فاز پسآموزش را بهطور کامل دور میزند. به ربات یک ویدیوی خودمحور (زاویه دید اولشخص) از انسانی که در حال انجام کار است نشان داده میشود. این ویدیو در پنجره بافت (context window) مدل بارگذاری میشود و وزنهای ثابت شبکه عصبی، قصد انسان، تناظرهای عملکردی و حرکات فضایی را مستقیماً به کنترلهای حرکتی ربات نگاشت میکنند.[2]
دیپاک پاتاک، همبنیانگذار و مدیرعامل Skild AI میگوید: «یادگیری از طریق تجربه، و نه برنامهنویسی از پیش تعیینشده، تغییر گامبهگامی است که در رباتیک رخ داده است.» این شرکت خاطرنشان میکند که در اصطلاحات فرا-یادگیری (meta-learning)، پیشآموزش عظیم این مدل بهعنوان یک حلقه بیرونی عمل میکند که به سیستم یاد میدهد چگونه از بافت یاد بگیرد. در زمان استنتاج، ویدیوی آموزشی حلقه داخلی را هدایت کرده و بدون تغییر حتی یک پارامتر در مدل، اقدامات ربات را دیکته میکند.[1][2]
کارهایی که S1 میتواند انجام دهد، حرکات کوتاه و سهثانیهایِ برداشتن و گذاشتن نیستند. شرکت Skild نشان داد که این مدل میتواند کارهایی با مدتزمان تا ۱۰ دقیقه را در قالب دهها مرحله دستکاری اجرا کند. نمونهها شامل تعویض گلدان یک گیاه، دم کردن قهوه، مونتاژ یک کیت و پختن پنکیک بود. اینها توالیهایی هستند که ربات را ملزم میکنند مهارتهای اتمی را به روشهایی ترکیب کند که پیش از این هرگز انجام نداده است.[1][2]
در دموی تعویض گلدان، از زمان ضبط ویدیوی آموزشی توسط انسان تا شروع اجرای خودکار ربات روی سختافزار، تنها ۱۱ دقیقه زمان برد. در طول این اجرا، ربات رفتارهای بدیعی را در زمان آزمایش نشان داد که در پیشآموزش آن وجود نداشت؛ مانند کندن خاک برای ایجاد فضا برای گیاه و فشار دادن یک فیلتر کاغذی درون قیف قهوه.[1][2]
مدل S1 همچنین نشانههایی از درک فیزیکی مبتنی بر عقل سلیم و بازیابی از خطا را نشان داد. در یک آزمایش داخلی، ویدیوی آموزشی شخصی را نشان میداد که با آبپاش به گیاهی آب میدهد، اما به ربات تنها یک فنجان آب داده شده بود.
مدل خود را با این مغایرت تطبیق داد و با موفقیت از فنجان استفاده کرد. در مثالی دیگر، پرامپت لیوانی را نشان میداد که با آبمیوه پر میشود، اما لیوان فیزیکی مقابل ربات از قبل تقریباً پر بود؛ S1 شرایط را سنجید و فقط مقدار کمی به آن اضافه کرد.[2]
برای کمیسازی عملکرد مدل، Skild بنچمارکهای داخلی کنترلشدهای را اجرا کرد که رویکرد مبتنی بر پرامپت ویدیویی S1 را با یک مدل استاندارد بینایی-زبان-عمل (Vision-Language-Action) مبتنی بر پرامپت متنی مقایسه میکرد. در ۱۰۰ هزار ساعت داده پیشآموزش، مدل در-بافت به میانگین موفقیت ۶۶ درصدی در مراحل کارهای جدید دست یافت، در حالی که این رقم برای مدل پایه متنی تنها ۹ درصد بود — یعنی بیش از هفت برابر بهبود.[1][2]
این شرکت تخمین میزند که رسیدن به عملکرد تکویدیویی S1 از طریق روشهای سنتی، به حدود ۳۸۰ نمایش تلهاپریشن نیاز دارد که معادل دهها ساعت جمعآوری دستی داده است. این نشان میدهد که یک پرامپت ویدیویی میتواند بهطور مؤثری جایگزین هفتهها کار مهندسی شود و اقتصاد استقرار رباتها در محیطهای پویایی مانند طبقات تولید و انبارها را اساساً تغییر دهد.[1]
توسعه این مدل بهشدت به پشته محاسباتی شتابیافته انویدیا وابسته است. شرکت Skild از NVIDIA Omniverse و Isaac Lab برای شبیهسازی فیزیک و تولید دادههای مصنوعی استفاده میکند که به مدل اجازه میدهد پیش از لمس سختافزار فیزیکی، سناریوهای متنوعی را تجربه کند. پاتاک در این باره اشاره کرد: «فناوریهای NVIDIA Isaac Lab و NVIDIA Cosmos به Skild کمک میکنند تا تجربیات مقیاسپذیر و متنوعی را که رباتهایش برای یادگیری در سناریوها و بدنههای مختلف نیاز دارند، ایجاد کند.»[1]
این زیرساخت از رشد سریع تجاری نیز پشتیبانی کرده است. به گفته انویدیا، Skild AI تنها ۱۰ ماه پس از اولین استقرار تجاری خود، به نرخ درآمد سالانه ۱۰۰ میلیون دلاری دست یافت. این شرکت بیش از ۶۰ مشارکت استقرار در زمینههای تولید، لجستیک، بازرسی، امنیت و آمادهسازی غذا ایجاد کرده است که نشان میدهد تقاضا برای مغزهای رباتیک سازگار و همهتنحریف بسیار بالاست.[1]
با این حال، نرخ موفقیت ۶۶ درصدی با اما و اگرهایی همراه است. این یک معیار موفقیت مرحلهای است که شامل مداخلات بازیابی انسانی نیز میشود؛ به این معنی که تضمین نمیکند ربات بتواند در ۶۶ درصد مواقع یک کار ۱۰ دقیقهای را کاملاً بدون کمک به پایان برساند.
علاوه بر این، S1 هنوز یک API باز یا مجموعهای از وزنهای قابل دانلود نیست، به این معنی که محققان مستقل هنوز نمیتوانند بنچمارکها را راستیآزمایی کنند. آزمون واقعی این خواهد بود که آیا یادگیری در-بافت این مدل در خارج از محیطهای کنترلشده آزمایشگاهی و در مواجهه با نورپردازی آشفته، اصطکاک و استهلاک یک کارخانه واقعی نیز دوام میآورد یا خیر.[2][3]
اصطلاحات کلیدی
- یادگیری در-بافت
- توانایی یک مدل هوش مصنوعی برای یادگیری یک کار جدید از دستورالعملها یا مثالهای ارائهشده در پرامپت خود، بدون تغییر وزنهای شبکه عصبی زیربنایی آن.
- مدل پایه
- یک مدل هوش مصنوعی بزرگ و همهمنظوره که روی مقادیر عظیمی از دادهها آموزش دیده و میتواند برای طیف گستردهای از کارهای پاییندستی تطبیق داده شود.
- تلهاپریشن
- فرآیندی که در آن یک انسان بهصورت دستی ربات را کنترل میکند تا حرکات و دادههای حسگر آن را ثبت کند و معمولاً برای آموزش هوش مصنوعی رباتیک استفاده میشود.
- مدل بینایی-زبان-عمل (VLA)
- یک معماری هوش مصنوعی که ورودیهای بصری و دستورالعملهای متنی را دریافت میکند تا فرمانهای حرکتی مستقیم برای یک ربات صادر کند.
- همهتنحریف
- یک سیستم کنترلی که برای کار با انواع مختلف سختافزار ربات، مانند بازوها، رباتهای چهارپا و انساننماها، با استفاده از یک مغز مشترک واحد طراحی شده است.
پرسشهای متداول
آیا ربات قبل از انجام کار نیاز به تمرین دارد؟
خیر. مدل S1 از یادگیری در-بافت استفاده میکند، به این معنی که ویدیوی آموزشی را تماشا کرده و بلافاصله با استفاده از وزنهای ثابت و موجود خود، بدون هیچگونه تمرین قبلی، برای انجام کار تلاش میکند.
مدل S1 به چه نوع ویدیویی نیاز دارد؟
این مدل میتواند از یک ویدیوی خودمحور (زاویه دید اولشخص) از انسانی که در حال انجام کار است یاد بگیرد و نیازی به ویدیویی از یک ربات دیگر در حال انجام آن کار ندارد.
آیا S1 میتواند تغییرات محیطی را مدیریت کند؟
بله. در دموها، زمانی که اشیاء در حین کار جابهجا شدند یا ابزار متفاوتی مانند یک فنجان بهجای آبپاش ارائه شد، مدل با موفقیت خود را تطبیق داد.
آیا S1 برای خرید در دسترس است؟
هنوز نه. شرکت Skild AI در حال حاضر S1 را با گروه محدودی از شرکای صنعتی مستقر کرده است و قصد دارد در ماههای آینده دسترسی به آن را گسترش دهد.
بررسی عمیق دیدگاهها
پژوهشگران رباتیک
تغییر پارادایم از جمعآوری داده به مهندسی پرامپت.
برای پژوهشگرانی که در حال ساخت مدلهای پایه هستند، S1 نشاندهنده لحظهای است که هوش مصنوعی فیزیکی به قابلیتهای مبتنی بر متنِ مدلهای زبانی بزرگ اولیه رسید. پایپلاین سنتی رباتیک مهندسان را ملزم میکند تا صدها ساعت داده تلهاپریشن جمعآوری کنند تا تنها یک حرکت جدید را به بازوی رباتیک آموزش دهند. با اثبات اینکه یک شبکه عصبی ثابت میتواند قصد و تناظر فضایی را از یک ویدیوی خودمحور استنتاج کند، Skild AI نشان داد که میتوان گلوگاه داده را بهطور کامل دور زد. پژوهشگران استدلال میکنند که این رویکرد یادگیری در-بافت، استقرار رباتهای همهمنظوره را بهطور تصاعدی تسریع خواهد کرد، زیرا آموزش یک ماشین به سادگیِ نشان دادن کاری است که باید انجام دهد.
یکپارچهسازان صنعتی
هیجانزده از سرعت، اما در انتظار قابلیت اطمینان ۹۹٫۹ درصدی.
مدیران کارخانهها و یکپارچهسازان لجستیک، زمان راهاندازی ۱۱ دقیقهای را یک تغییردهنده بازی برای محیطهایی میدانند که خطوط تولید در آنها روزانه تغییر میکنند. با این حال، آنها نسبت به آمادگی واقعی این مدل برای تولید محتاط هستند. نرخ موفقیت ۶۶ درصدی در مراحل — بهویژه نرخی که شامل مداخلات بازیابی انسانی میشود — در یک محیط آزمایشگاهی چشمگیر است، اما از آپتایم ۹۹٫۹ درصدی مورد نیاز در یک طبقه تولید زنده فاصله دارد. یکپارچهسازان خاطرنشان میکنند که اگرچه پرامپت ویدیویی برای نمونهسازی سریع و راهاندازی اولیه عالی است، اما کارهای بسیار تکراری و با توان عملیاتی بالا ممکن است همچنان به تنظیم دقیق سنتی و هزاران نمایش برای دستیابی به دقت و قابلیت اطمینان لازم نیاز داشته باشند.
حامیان متنباز
بدبین نسبت به بنچمارکهای پشت درهای بسته و وزنهای انحصاری.
جامعه هوش مصنوعی متنباز از ماهیت بسته انتشار S1 ابراز ناامیدی کرده است. از آنجا که Skild AI وزنهای مدل را منتشر نکرده، API عمومی ارائه نداده یا مقاله داوریشدهای در مورد جزئیات معماری آن منتشر نکرده است، راستیآزمایی مستقل نرخ موفقیت ۶۶ درصدی غیرممکن است. حامیان استدلال میکنند که تکیه بر بنچمارکهای داخلی و گزارششده توسط فروشنده برای کارهای دستچینشدهای مانند برگرداندن پنکیک، ضعیفترین سطح شواهد در یادگیری ماشین است. آنها هشدار میدهند که تا زمانی که این مدل نتواند توسط توسعهدهندگان شخص ثالث روی سختافزارهای متنوع آزمایش شود، ادعاهای تعمیمپذیری «همهتنحریف» باید بیشتر بهعنوان سیگنالهای جهتدار در نظر گرفته شوند تا حقایق علمی تثبیتشده.
- پژوهشگران رباتیک
- مدل S1 را یک پیشرفت بزرگ میدانند که ثابت میکند یادگیری در-بافت برای دستکاری فیزیکی کارآمد است و بهطور بالقوه گلوگاه کمبود داده را حل میکند.
- یکپارچهسازان صنعتی
- نسبت به کاهش زمان راهاندازی خوشبین هستند، اما تأکید میکنند که نرخ موفقیت ۶۶ درصدی همراه با مداخلات انسانی، هنوز برای خطوط تولید بدون نظارت به اندازه کافی قابلاعتماد نیست.
- حامیان متنباز
- از اینکه S1 همچنان یک سیستم بسته و انحصاری بدون وزنها یا API عمومی است، ناامید هستند؛ چرا که این موضوع راستیآزمایی بنچمارکها را برای جامعه گستردهتر غیرممکن میسازد.
دیدگاههایی که این گزارش پوشش نداده
- کارگران خطوط تولید که ممکن است نقش آنها از مونتاژ دستی به ضبط ویدیوهای آموزشی تغییر کند.
منابع
[1]NVIDIA Blogپژوهشگران رباتیکSkild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video
مطالعه در NVIDIA Blog →
[2]Skild AIپژوهشگران رباتیکIntroducing S1: In-Context Learning for Robotics
مطالعه در Skild AI →
[3]تیم سردبیری کوهستانیکپارچهسازان صنعتیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →معماری مولد
ترفند پارامترسازی مجدد چگونه امکان پسانتشار در فضای پنهان رمزگذار خودکار متغیر را فراهم میکند؟
7 منبع
معماری هوش مصنوعی
چگونه قاعده زنجیرهای سیگنالهای خطا را برای بهروزرسانی وزنهای شبکه عصبی به عقب میراند
6 منبع
زیرساخت هوش مصنوعی
چگونه NVLink Fusion تراشههای استنتاج d-Matrix را به رکهای سرور انویدیا متصل میکند
6 منبع
یادگیری تقویتی
چگونه استراتژی اپسیلون-حریصانه تعادل میان اکتشاف و بهرهبرداری را در هوش مصنوعی برقرار میکند
7 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





