فیفی لی و یان لکون، با سرمایهگذاریهای میلیاردی، برای هوش مصنوعی «مدلهای جهان» میسازند
دو تن از برجستهترین چهرههای هوش مصنوعی، هر کدام بیش از یک میلیارد دلار سرمایه جذب کردهاند تا «مدلهای جهان» (World Models) بسازند؛ سیستمهای هوش مصنوعی که نه فقط زبان، بلکه واقعیت فیزیکی را درک میکنند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- حامیان مدلهای فضایی مولد
- معتقدند مدلهای جهان باید محیطهای سهبعدی با وفاداری بالا را رندر کنند تا به هوش فضایی دست یابند.
- طرفداران استدلال انتزاعی
- استدلال میکنند که پیشبینی در یک فضای نهفته و ریاضیاتی، کارآمدترین مسیر برای هوش مصنوعی فیزیکی است.
- تحلیلگران صنعت هوش مصنوعی
- بر تغییر عظیم سرمایه از مدلهای زبان بزرگ (LLMs) به سمت شبیهسازی فیزیکی تمرکز دارند.
این تصور رایج وجود دارد که چون هوش مصنوعی میتواند کدهای بینقص بنویسد، در آزمونهای پزشکی قبول شود و تصاویر فوتورئالیستی تولید کند، پس جهان را درک میکند. اما اینطور نیست. مدلهای زبان بزرگ (LLMs) اساساً نسبت به واقعیت فیزیکی کور هستند. آنها نمیدانند که لیوان افتاده میشکند، آب به سمت پایین جریان مییابد، یا دو شیء نمیتوانند همزمان یک فضا را اشغال کنند. آنها فقط احتمال آماری کلماتی را میدانند که برای توصیف آن رویدادها استفاده میشوند. این شکاف بین تقلید زبانی و واقعیت فیزیکی دلیلی است که نسل فعلی هوش مصنوعی در کار با رباتها یا مسیریابی در محیطهای پیچیده بدون «توهم فیزیکی» (اشتباه در قوانین فیزیک) دچار مشکل میشود. برای فراتر رفتن از متن، صنعت هوش مصنوعی در حال یک تغییر معماری عظیم به سمت «مدلهای جهان» است؛ شبیهسازهای داخلی که پیشبینی میکنند محیطهای فیزیکی چگونه در طول زمان تکامل مییابند.[1][2]
در اوایل سال ۲۰۲۶، این تغییر سرعت گرفت؛ زمانی که دو تن از برجستهترین چهرههای هوش مصنوعی، هر کدام حدود ۱ میلیارد دلار برای ساخت این شبیهسازهای فیزیکی جذب سرمایه کردند. فیفی لی، استاد دانشگاه استنفورد که با ImageNet پیشگام بینایی کامپیوتری مدرن بود، یک دور تأمین مالی ۱ میلیارد دلاری برای استارتاپ خود به نام World Labs تضمین کرد و مجموع سرمایه آن را به ۱٫۲۳ میلیارد دلار و ارزشگذاری آن را به ۵ میلیارد دلار رساند. چند هفته بعد، یان لکون، برنده جایزه تورینگ و دانشمند ارشد هوش مصنوعی متا، ۱٫۰۳ میلیارد دلار برای سرمایهگذاری جدید خود به نام Advanced Machine Intelligence (AMI) Labs جذب کرد و ارزش آن را ۳٫۵ میلیارد دلار تعیین نمود. هر دو بنیانگذار شرط بستهاند که مرز بعدی هوش مصنوعی با تزریق متن بیشتر به مدلهای زبان به دست نمیآید، بلکه با آموزش قوانین اساسی علت و معلول به ماشینها فتح خواهد شد.[3][4][5][6][7]
اگرچه هر دو بنیانگذار از اصطلاح «مدل جهان» استفاده میکنند، اما مکانیسمهای اساساً متفاوتی برای حل یک مشکل واحد میسازند. مکانیسم اصلی هر مدل جهان، شبیهسازی پیشبینانه است: پیشبینی حالتهای آینده بر اساس اقدامات و مشاهدات فعلی. اگر یک عامل خودران تصمیم بگیرد روی یک کف خیس قدم بگذارد، مدل جهان باید پیشبینی کند که پا خواهد لغزید و به عامل اجازه دهد قبل از اقدام در دنیای واقعی، برنامه خود را تنظیم کند. این امر مستلزم آن است که هوش مصنوعی مفاهیمی مانند گرانش، اینرسی، اصطکاک و بقای شیء (Object Permanence) را درونی کند. با این حال، نحوه نمایش این اطلاعات توسط هوش مصنوعی، این حوزه را به دو مکتب فکری متمایز تقسیم میکند: مکتب مولد (Generative) که دنیاهای سهبعدی قابل کاوش را رندر میکند، و مکتب انتزاعی (Abstract) که نتایج را در یک فضای ریاضی بدون تولید پیکسل پیشبینی میکند.[2][3]
رویکرد فیفی لی در World Labs بر «هوش فضایی» و مکتب مولد مدلسازی جهان تمرکز دارد. سیستمهای او برای رندر کردن محیطهای سهبعدی قابل کاوش طراحی شدهاند که انسانها و عوامل هوش مصنوعی میتوانند با آنها تعامل داشته باشند. World Labs اخیراً مدل Marble را منتشر کرده است؛ مدلی که نسخههای سهبعدی تعاملی از فضاها را بر اساس دستورات بصری یا نوشتاری تولید میکند. لی با ساخت هوش مصنوعی که میتواند هندسه سهبعدی را درک و تولید کند، قصد دارد محیطهای شبیهسازیشدهای ایجاد کند که قوانین فیزیکی در آنها اعمال میشود. این فضاهای مجازی بسیار واقعگرایانه میتوانند برای طراحی معماری، بازی و مهمتر از همه، آموزش رباتها در شبیهسازی قبل از ورود به دنیای واقعی استفاده شوند. نقطه قوت این رویکرد، وفاداری بصری آن است که آن را بلافاصله برای سازندگان انسانی و کاربردهای محاسبات فضایی مفید میسازد.[1][3][6]
رویکرد فیفی لی در World Labs بر «هوش فضایی» و مکتب مولد مدلسازی جهان تمرکز دارد.
AMI Labs یان لکون رویکردی کاملاً متفاوت را در پیش گرفته که ریشه در معماری پیشبینانه تعبیه مشترک (JEPA) دارد. مدلهای جهان لکون به جای تولید پیکسل یا تصاویر سهبعدی، نتایج را در یک «فضای نهفته» (Latent Space) انتزاعی و ریاضیاتی پیشبینی میکنند. لکون استدلال میکند که واقعیت پیوسته، پر سر و صدا و دارای ابعاد بسیار بالایی است که نمیتوان آن را با پیشبینی هر پیکسل از یک فریم ویدئویی حل کرد. در عوض، یک مدل JEPA جزئیات بصری نامربوط – مانند بافت دقیق یک برگ در حال سقوط یا سایههای متغیر در یک اتاق – را حذف میکند و صرفاً بر دینامیک فیزیکی و علیت زیربنایی تمرکز مینماید. این امر مدل را برای عوامل خودران و رباتهایی که باید اقدامات چند مرحلهای را در زمان واقعی برنامهریزی کنند، بسیار کارآمد میسازد، زیرا آنها انرژی محاسباتی را صرف رندر کردن تصاویری که به آنها نیاز ندارند، نمیکنند.[2][3][4][5]
اهمیت این واگرایی معماری بسیار زیاد است. هر کسی که موفق به ساخت مدل جهان بنیادی شود، احتمالاً زیرساختی را کنترل خواهد کرد که هوش مصنوعی فیزیکی دهه آینده بر اساس آن آموزش میبیند. اگر رویکرد مولد لی پیروز شود، آینده هوش مصنوعی عمیقاً بصری خواهد بود و شبیهسازی، رسانه و رباتیک را در یک پارادایم محاسبات فضایی واحد ادغام میکند که در آن عوامل در داخل دوقلوهای دیجیتال فوتورئالیستی یاد میگیرند. اگر رویکرد انتزاعی لکون برتر ثابت شود، سیستمهای خودران بر اساس نمایشهای بسیار کارآمد و نامرئی از واقعیت عمل خواهند کرد و استدلال و برنامهریزی را بر وفاداری بصری اولویت میدهند. هر دو رویکرد به سرمایه هنگفتی نیاز دارند، که توضیح میدهد چرا غولهای سختافزاری مانند Nvidia و AMD، در کنار شرکتهای بزرگ سرمایهگذاری خطرپذیر، به شدت از هر دو طرف این رقابت حمایت میکنند.[3][4][6]
با وجود این حجم عظیم سرمایهگذاری، عدم قطعیتهای قابل توجهی در تلاش برای ساخت یک مدل جهان واقعی باقی مانده است. مقیاسپذیری و تثبیت این سیستمها به طرز چشمگیری دشوار است. در حالی که آنها میتوانند فضاهای منسجم ساختاری را از دادههای محدود تولید کنند، در حال حاضر در حفظ بقای شیء منطقی و استدلال فضایی دقیق در افقهای زمانی طولانی دچار مشکل هستند. ممکن است یک مدل یک اتاق را کاملاً شبیهسازی کند، اما پس از چند دقیقه تعامل، «فراموش کند» که دیواری پشت در بسته وجود دارد، که منجر به توهمات فیزیکی میشود. علاوه بر این، انتقال از تحقیقات نظری به کاربرد تجاری برای این شبیهسازهای فیزیکی ممکن است سالها طول بکشد و به مقادیر عظیمی از قدرت محاسباتی و متدولوژیهای آموزشی کاملاً جدیدی نیاز دارد که فراتر از مجموعهدادههای ایستا مورد استفاده برای آموزش مدلهای زبان هستند.[1][2][5]
در نهایت، ظهور World Labs و AMI Labs نشاندهنده پایان دورانی است که مدلهای زبان به عنوان تنها مسیر دستیابی به هوش عمومی مصنوعی (AGI) تلقی میشدند. لی و لکون با تغییر هدف آموزشی از دنیای کلمات به دنیای اشیا، در تلاشند تا یک چیز را که ماشینها در حال حاضر فاقد آن هستند، به آنها بدهند: عقل سلیم. در صورت موفقیت، این سرمایهگذاریهای میلیاردی، کلاس جدیدی از سیستمهای خودران را فعال خواهند کرد که قادرند به طور ایمن و قابل اعتماد در دنیای فیزیکی حرکت کنند. این امر صنایع مختلف از تولید و مراقبتهای بهداشتی گرفته تا حمل و نقل خودران را متحول خواهد کرد، زیرا رباتها بالاخره قادر خواهند بود عواقب اعمال خود را پیش از انجام آنها پیشبینی کنند.[2][3][4][5]
نکات کلیدی
- هوش مصنوعی در حال گذراندن یک تغییر عظیم از مدلهای مبتنی بر زبان به «مدلهای جهان» است که واقعیت فیزیکی را درک میکنند.
- پیشگامان هوش مصنوعی، فیفی لی و یان لکون، هر کدام تقریباً ۱ میلیارد دلار برای استارتاپهایی که به ساخت این شبیهسازهای فیزیکی اختصاص دارند، جذب کردهاند.
- World Labs لی بر «هوش فضایی» تمرکز دارد و محیطهای سهبعدی بسیار واقعگرایانه و قابل کاوش برای طراحی و رباتیک تولید میکند.
- AMI Labs لکون از یک معماری انتزاعی به نام JEPA استفاده میکند که نتایج فیزیکی را به صورت ریاضی و بدون رندر کردن پیکسلها پیشبینی میکند.
- هدف هر دو سرمایهگذاری حل محدودیت حیاتی هوش مصنوعی فعلی است: ناتوانی در استدلال، برنامهریزی و عمل قابل اعتماد در دنیای فیزیکی.
اصطلاحات کلیدی
- مدل جهان
- یک معماری هوش مصنوعی که دینامیک واقعیت فیزیکی – مانند گرانش، اصطکاک و بقای شیء – را میآموزد تا حالتهای آینده یک محیط را پیشبینی کند.
- هوش فضایی
- توانایی یک سیستم هوش مصنوعی برای درک، فهم و تعامل با فضای سهبعدی و هندسه.
- فضای نهفته
- یک نمایش انتزاعی و ریاضیاتی از دادهها که در آن مدل هوش مصنوعی اطلاعات را پردازش میکند و جزئیات بصری غیرضروری را حذف کرده تا بر مفاهیم اصلی تمرکز کند.
- JEPA (معماری پیشبینانه تعبیه مشترک)
- یک معماری هوش مصنوعی که توسط یان لکون ترویج میشود و نتایج اقدامات را در یک فضای ریاضی انتزاعی پیشبینی میکند، نه اینکه پیکسلهای بصری تولید کند.
- پیشبینی توکن بعدی
- مکانیسمی که توسط مدلهای زبان بزرگ برای تولید متن استفاده میشود و محتملترین کلمه بعدی در یک دنباله را به صورت آماری حدس میزند.
منابع
[1]Forbesحامیان مدلهای فضایی مولدA discernible shift is occurring within AI research, moving from generative models for language and images toward the development of world models
مطالعه در Forbes →
[2]AI.ccتحلیلگران صنعت هوش مصنوعیWorld Models in 2026: Why Google, NVIDIA, LeCun & Fei-Fei Li Are Betting Billions on AI That Understands the Physical World
مطالعه در AI.cc →
[3]Mediumتحلیلگران صنعت هوش مصنوعیWhy Fei-Fei Li and Yann LeCun each raised a billion dollars to bet against language
مطالعه در Medium →
[4]Weights & Biasesطرفداران استدلال انتزاعیYann LeCun raises $1B for world model startup
مطالعه در Weights & Biases →
[5]TMVطرفداران استدلال انتزاعیYann LeCun's AMI Labs raises $1.03B to build world models
مطالعه در TMV →
[6]Silicon Republicحامیان مدلهای فضایی مولدFei-Fei Li's World Labs raises $1bn to advance spatial intelligence
مطالعه در Silicon Republic →
[7]StartupHubحامیان مدلهای فضایی مولدFei-Fei Li's World Labs: $1.23B Raised, Marble Now Shipping
مطالعه در StartupHub →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.
