فیفی لی و یان لکون، با سرمایهگذاریهای میلیاردی، برای هوش مصنوعی «مدلهای جهان» میسازند
دو تن از برجستهترین چهرههای هوش مصنوعی، هر کدام بیش از یک میلیارد دلار سرمایه جذب کردهاند تا «مدلهای جهان» (World Models) بسازند؛ سیستمهای هوش مصنوعی که نه فقط زبان، بلکه واقعیت فیزیکی را درک میکنند.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
این تصور رایج وجود دارد که چون هوش مصنوعی میتواند کدهای بینقص بنویسد، در آزمونهای پزشکی قبول شود و تصاویر فوتورئالیستی تولید کند، پس جهان را درک میکند. اما اینطور نیست. مدلهای زبان بزرگ (LLMs) اساساً نسبت به واقعیت فیزیکی کور هستند. آنها نمیدانند که لیوان افتاده میشکند، آب به سمت پایین جریان مییابد، یا دو شیء نمیتوانند همزمان یک فضا را اشغال کنند. آنها فقط احتمال آماری کلماتی را میدانند که برای توصیف آن رویدادها استفاده میشوند.
این شکاف بین تقلید زبانی و واقعیت فیزیکی دلیلی است که نسل فعلی هوش مصنوعی در کار با رباتها یا مسیریابی در محیطهای پیچیده بدون «توهم فیزیکی» (اشتباه در قوانین فیزیک) دچار مشکل میشود. برای فراتر رفتن از متن، صنعت هوش مصنوعی در حال یک تغییر معماری عظیم به سمت «مدلهای جهان» است؛ شبیهسازهای داخلی که پیشبینی میکنند محیطهای فیزیکی چگونه در طول زمان تکامل مییابند.[1][2]
در اوایل سال ۲۰۲۶، این تغییر سرعت گرفت؛ زمانی که دو تن از برجستهترین چهرههای هوش مصنوعی، هر کدام حدود ۱ میلیارد دلار برای ساخت این شبیهسازهای فیزیکی جذب سرمایه کردند. فیفی لی، استاد دانشگاه استنفورد که با ImageNet پیشگام بینایی کامپیوتری مدرن بود، یک دور تأمین مالی ۱ میلیارد دلاری برای استارتاپ خود به نام World Labs تضمین کرد و مجموع سرمایه آن را به ۱٫۲۳ میلیارد دلار و ارزشگذاری آن را به ۵ میلیارد دلار رساند.
چند هفته بعد، یان لکون، برنده جایزه تورینگ و دانشمند ارشد هوش مصنوعی متا، ۱٫۰۳ میلیارد دلار برای سرمایهگذاری جدید خود به نام Advanced Machine Intelligence (AMI) Labs جذب کرد و ارزش آن را ۳٫۵ میلیارد دلار تعیین نمود. هر دو بنیانگذار شرط بستهاند که مرز بعدی هوش مصنوعی با تزریق متن بیشتر به مدلهای زبان به دست نمیآید، بلکه با آموزش قوانین اساسی علت و معلول به ماشینها فتح خواهد شد.[3][4][5][6][7]
اگرچه هر دو بنیانگذار از اصطلاح «مدل جهان» استفاده میکنند، اما مکانیسمهای اساساً متفاوتی برای حل یک مشکل واحد میسازند. مکانیسم اصلی هر مدل جهان، شبیهسازی پیشبینانه است: پیشبینی حالتهای آینده بر اساس اقدامات و مشاهدات فعلی. اگر یک عامل خودران تصمیم بگیرد روی یک کف خیس قدم بگذارد، مدل جهان باید پیشبینی کند که پا خواهد لغزید و به عامل اجازه دهد قبل از اقدام در دنیای واقعی، برنامه خود را تنظیم کند.
این امر مستلزم آن است که هوش مصنوعی مفاهیمی مانند گرانش، اینرسی، اصطکاک و بقای شیء (Object Permanence) را درونی کند. با این حال، نحوه نمایش این اطلاعات توسط هوش مصنوعی، این حوزه را به دو مکتب فکری متمایز تقسیم میکند: مکتب مولد (Generative) که دنیاهای سهبعدی قابل کاوش را رندر میکند، و مکتب انتزاعی (Abstract) که نتایج را در یک فضای ریاضی بدون تولید پیکسل پیشبینی میکند.[2][3]
رویکرد فیفی لی در World Labs بر «هوش فضایی» و مکتب مولد مدلسازی جهان تمرکز دارد. سیستمهای او برای رندر کردن محیطهای سهبعدی قابل کاوش طراحی شدهاند که انسانها و عوامل هوش مصنوعی میتوانند با آنها تعامل داشته باشند. World Labs اخیراً مدل Marble را منتشر کرده است؛ مدلی که نسخههای سهبعدی تعاملی از فضاها را بر اساس دستورات بصری یا نوشتاری تولید میکند.
لی با ساخت هوش مصنوعی که میتواند هندسه سهبعدی را درک و تولید کند، قصد دارد محیطهای شبیهسازیشدهای ایجاد کند که قوانین فیزیکی در آنها اعمال میشود. این فضاهای مجازی بسیار واقعگرایانه میتوانند برای طراحی معماری، بازی و مهمتر از همه، آموزش رباتها در شبیهسازی قبل از ورود به دنیای واقعی استفاده شوند. نقطه قوت این رویکرد، وفاداری بصری آن است که آن را بلافاصله برای سازندگان انسانی و کاربردهای محاسبات فضایی مفید میسازد.[1][3][6]
AMI Labs یان لکون رویکردی کاملاً متفاوت را در پیش گرفته که ریشه در معماری پیشبینانه تعبیه مشترک (JEPA) دارد. مدلهای جهان لکون به جای تولید پیکسل یا تصاویر سهبعدی، نتایج را در یک «فضای نهفته» (Latent Space) انتزاعی و ریاضیاتی پیشبینی میکنند. لکون استدلال میکند که واقعیت پیوسته، پر سر و صدا و دارای ابعاد بسیار بالایی است که نمیتوان آن را با پیشبینی هر پیکسل از یک فریم ویدئویی حل کرد.
در عوض، یک مدل JEPA جزئیات بصری نامربوط – مانند بافت دقیق یک برگ در حال سقوط یا سایههای متغیر در یک اتاق – را حذف میکند و صرفاً بر دینامیک فیزیکی و علیت زیربنایی تمرکز مینماید. این امر مدل را برای عوامل خودران و رباتهایی که باید اقدامات چند مرحلهای را در زمان واقعی برنامهریزی کنند، بسیار کارآمد میسازد، زیرا آنها انرژی محاسباتی را صرف رندر کردن تصاویری که به آنها نیاز ندارند، نمیکنند.[2][3][4][5]
اهمیت این واگرایی معماری بسیار زیاد است. هر کسی که موفق به ساخت مدل جهان بنیادی شود، احتمالاً زیرساختی را کنترل خواهد کرد که هوش مصنوعی فیزیکی دهه آینده بر اساس آن آموزش میبیند. اگر رویکرد مولد لی پیروز شود، آینده هوش مصنوعی عمیقاً بصری خواهد بود و شبیهسازی، رسانه و رباتیک را در یک پارادایم محاسبات فضایی واحد ادغام میکند که در آن عوامل در داخل دوقلوهای دیجیتال فوتورئالیستی یاد میگیرند.
اگر رویکرد انتزاعی لکون برتر ثابت شود، سیستمهای خودران بر اساس نمایشهای بسیار کارآمد و نامرئی از واقعیت عمل خواهند کرد و استدلال و برنامهریزی را بر وفاداری بصری اولویت میدهند. هر دو رویکرد به سرمایه هنگفتی نیاز دارند، که توضیح میدهد چرا غولهای سختافزاری مانند Nvidia و AMD، در کنار شرکتهای بزرگ سرمایهگذاری خطرپذیر، به شدت از هر دو طرف این رقابت حمایت میکنند.[3][4][6]
با وجود این حجم عظیم سرمایهگذاری، عدم قطعیتهای قابل توجهی در تلاش برای ساخت یک مدل جهان واقعی باقی مانده است. مقیاسپذیری و تثبیت این سیستمها به طرز چشمگیری دشوار است. در حالی که آنها میتوانند فضاهای منسجم ساختاری را از دادههای محدود تولید کنند، در حال حاضر در حفظ بقای شیء منطقی و استدلال فضایی دقیق در افقهای زمانی طولانی دچار مشکل هستند.
ممکن است یک مدل یک اتاق را کاملاً شبیهسازی کند، اما پس از چند دقیقه تعامل، «فراموش کند» که دیواری پشت در بسته وجود دارد، که منجر به توهمات فیزیکی میشود. علاوه بر این، انتقال از تحقیقات نظری به کاربرد تجاری برای این شبیهسازهای فیزیکی ممکن است سالها طول بکشد و به مقادیر عظیمی از قدرت محاسباتی و متدولوژیهای آموزشی کاملاً جدیدی نیاز دارد که فراتر از مجموعهدادههای ایستا مورد استفاده برای آموزش مدلهای زبان هستند.[1][2][5]
در نهایت، ظهور World Labs و AMI Labs نشاندهنده پایان دورانی است که مدلهای زبان به عنوان تنها مسیر دستیابی به هوش عمومی مصنوعی (AGI) تلقی میشدند. لی و لکون با تغییر هدف آموزشی از دنیای کلمات به دنیای اشیا، در تلاشند تا یک چیز را که ماشینها در حال حاضر فاقد آن هستند، به آنها بدهند: عقل سلیم.
در صورت موفقیت، این سرمایهگذاریهای میلیاردی، کلاس جدیدی از سیستمهای خودران را فعال خواهند کرد که قادرند به طور ایمن و قابل اعتماد در دنیای فیزیکی حرکت کنند. این امر صنایع مختلف از تولید و مراقبتهای بهداشتی گرفته تا حمل و نقل خودران را متحول خواهد کرد، زیرا رباتها بالاخره قادر خواهند بود عواقب اعمال خود را پیش از انجام آنها پیشبینی کنند.[2][3][4][5]
نکات کلیدی
- هوش مصنوعی در حال گذراندن یک تغییر عظیم از مدلهای مبتنی بر زبان به «مدلهای جهان» است که واقعیت فیزیکی را درک میکنند.
- پیشگامان هوش مصنوعی، فیفی لی و یان لکون، هر کدام تقریباً ۱ میلیارد دلار برای استارتاپهایی که به ساخت این شبیهسازهای فیزیکی اختصاص دارند، جذب کردهاند.
- World Labs لی بر «هوش فضایی» تمرکز دارد و محیطهای سهبعدی بسیار واقعگرایانه و قابل کاوش برای طراحی و رباتیک تولید میکند.
- AMI Labs لکون از یک معماری انتزاعی به نام JEPA استفاده میکند که نتایج فیزیکی را به صورت ریاضی و بدون رندر کردن پیکسلها پیشبینی میکند.
آنچه نمیدانیم
- هنوز مشخص نیست که رویکرد سهبعدی مولد یا رویکرد ریاضی انتزاعی برای آموزش رباتهای دنیای واقعی مؤثرتر خواهد بود.
- محققان هنوز نمیدانند چگونه «توهمات فیزیکی» را به طور کامل از بین ببرند، جایی که مدلهای جهان بقای شیء را در افقهای زمانی طولانی فراموش میکنند.
- جدول زمانی دقیق برای اینکه چه زمانی این مدلهای جهان بنیادی در وسایل نقلیه خودران تجاری و رباتیک صنعتی ادغام خواهند شد، هنوز نامشخص است.
روند رویداد
2022
یان لکون دیدگاه خود را برای JEPA منتشر میکند و معماریای را پیشنهاد میدهد که نمایشهای انتزاعی از جهان را میآموزد، نه اینکه پیکسلها را پیشبینی کند.
September 2024
World Labs فیفی لی با ۲۳۰ میلیون دلار سرمایه اولیه برای ساخت مدلهای هوش فضایی از حالت پنهان خارج میشود.
November 2025
World Labs مدل Marble، اولین مدل تجاری خود را که قادر به تولید دنیاهای مجازی سهبعدی تعاملی از طریق دستورات است، عرضه میکند.
February 2026
World Labs یک دور تأمین مالی ۱ میلیارد دلاری با حمایت Nvidia، AMD و Autodesk را به پایان میرساند و به ارزشگذاری تخمینی ۵ میلیارد دلار میرسد.
March 2026
AMI Labs یان لکون ۱٫۰۳ میلیارد دلار در یک دور سرمایهگذاری اولیه تاریخی برای ساخت هوش مصنوعی خودران مبتنی بر مدلهای جهان جذب میکند.
- حامیان مدلهای فضایی مولد
- معتقدند مدلهای جهان باید محیطهای سهبعدی با وفاداری بالا را رندر کنند تا به هوش فضایی دست یابند.
- طرفداران استدلال انتزاعی
- استدلال میکنند که پیشبینی در یک فضای نهفته و ریاضیاتی، کارآمدترین مسیر برای هوش مصنوعی فیزیکی است.
- تحلیلگران صنعت هوش مصنوعی
- بر تغییر عظیم سرمایه از مدلهای زبان بزرگ (LLMs) به سمت شبیهسازی فیزیکی تمرکز دارند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار که قدرت محاسباتی این مدلها را تأمین میکنند
- شرکتهای رباتیک که منتظر ادغام این مدلها هستند
منابع
[1]Forbesحامیان مدلهای فضایی مولدA discernible shift is occurring within AI research, moving from generative models for language and images toward the development of world models
مطالعه در Forbes →
[2]AI.ccتحلیلگران صنعت هوش مصنوعیWorld Models in 2026: Why Google, NVIDIA, LeCun & Fei-Fei Li Are Betting Billions on AI That Understands the Physical World
مطالعه در AI.cc →
[3]Mediumتحلیلگران صنعت هوش مصنوعیWhy Fei-Fei Li and Yann LeCun each raised a billion dollars to bet against language
مطالعه در Medium →
[4]Weights & Biasesطرفداران استدلال انتزاعیYann LeCun raises $1B for world model startup
مطالعه در Weights & Biases →
[5]TMVطرفداران استدلال انتزاعیYann LeCun's AMI Labs raises $1.03B to build world models
مطالعه در TMV →
[6]Silicon Republicحامیان مدلهای فضایی مولدFei-Fei Li's World Labs raises $1bn to advance spatial intelligence
مطالعه در Silicon Republic →
[7]StartupHubحامیان مدلهای فضایی مولدFei-Fei Li's World Labs: $1.23B Raised, Marble Now Shipping
مطالعه در StartupHub →
بیشتر در هوش مصنوعی
مشاهده همه →شفافیت مدل
مکانیک تفسیرپذیری مکانیکی: چگونه محققان شبکههای عصبی هوش مصنوعی را مهندسی معکوس میکنند
7 منبع
مهار هوش مصنوعی
درخواست اوپنایآی از کالیفرنیا برای سختگیری بیشتر در قوانین هوش مصنوعی پس از فرار مدلهای داخلی و هک یک شرکت ثالث
8 منبع
ایمنی هوش مصنوعی
محدودیتهای ایمنی هوش مصنوعی، مدافعان سایبری را به سمت مدلهای «وزن باز» سوق میدهد
4 منبع
امنیت زیستی هوش مصنوعی
مدلهای پیشرفته هوش مصنوعی در کارهای آزمایشگاهی از ویروسشناسان دکترا پیشی گرفتند؛ مانع توسعه سلاحهای بیولوژیکی کاهش یافت
7 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





