کالبدشکافی «تفکر گسترده» در هوش مصنوعی: مدلهای جدید گوگل چگونه حین صحبت کردن فکر میکنند؟
مدل جدید Gemini 3.8 Live Extended Thinking گوگل با روایت زنده روند استدلال خود حین اجرای وظایف پیچیده، به سکوتهای طولانی دستیارهای صوتی پایان میدهد.
به قلم کاوان رامین
این خبر را به اشتراک بگذارید
- توسعهدهندگان نرمافزار
- تمرکز بر قابلیتهای فراخوانی ناهمگام توابع و ساخت عاملهای صوتی در سطح تولید.
- تحلیلگران شفافیت هوش مصنوعی
- استقبال از افشای زنجیره استدلال به عنوان ابزاری برای کاهش خطاهای هوش مصنوعی.
- طراحان تجربه کاربری
- تأکید بر حذف سکوتهای طولانی و ایجاد جریان مکالمهای طبیعیتر.
دیدگاههایی که این گزارش پوشش نداده
- کاربران نهایی با اینترنت کند
- نگرانیهای مربوط به حریم خصوصی صوتی
چرا مهم است
برای توسعهدهندگان و کاربران، این فناوری به معنای پایان یافتن انتظار در سکوت برای پاسخ دستیارهای صوتی است. با افشای زنده روند استدلال، کاربران میتوانند خطاهای هوش مصنوعی را پیش از اجرای نهایی تشخیص داده و تعاملی طبیعیتر و شفافتر با ماشین داشته باشند.
نکات کلیدی
- گوگل مدلهای صوتی Gemini 3.8 Live و نسخه Extended Thinking را با قابلیت پردازش همزمان مکالمه و وظایف پسزمینه منتشر کرد.
- مدل تفکر گسترده به جای سکوت در برابر پردازشهای سنگین، از نشانههای کلامی زنده برای توضیح روند کار خود استفاده میکند.
- این مدل در شاخص کیفیت گفتار به گفتار (Speech-to-Speech) با امتیاز ۸۲.۶ در رتبه اول قرار گرفته است.
- این سیستم هماکنون از طریق API برای توسعهدهندگان در دسترس است و به تدریج به برنامههای Workspace اضافه میشود.
در ۱۵ سپتامبر ۲۰۲۶، گوگل با انتشار دو مدل جدید «جمنای ۳.۸ لایو» (Gemini 3.8 Live) و نسخه پیچیدهتر آن یعنی «تفکر گسترده» (Extended Thinking)، ریتم بنیادین هوش مصنوعی صوتی را تغییر داد. سالهاست که استاندارد تعامل با دستیارهای صوتی، شامل یک درخواست و به دنبال آن یک تأخیر پردازشی بیصدا و مبهم بوده است. اکنون، مدل تفکر گسترده این سکوت را با روایت زنده جایگزین کرده و در حالی که وظایف پسزمینه را اجرا میکند، همزمان فکر کرده و صحبت میکند.[1][6]
این تغییر بیش از آنکه به معنای دستیابی هوش مصنوعی به «آگاهی» انسانگونه باشد، یک بازطراحی هوشمندانه در معماری سیستم است. بر اساس مستندات فنی گوگل، این مدل از فراخوانی توابع به صورت ناهمگام (Asynchronous function calling) استفاده میکند. این بدان معناست که در حالی که سیستم در حال دریافت دادهها از طریق یک رابط برنامهنویسی (API) یا جستجو در یک سند است، به طور پیوسته صدای خروجی را برای کاربر استریم میکند.[2][7]
در عمل، این قابلیت خود را به شکل نشانههای کلامی زودهنگام نشان میدهد. به جای اینکه سیستم هنگام هماهنگ کردن یک رزرو چندمرحلهای رستوران یا تحلیل یک کد برنامهنویسی متوقف شود، با عباراتی مانند «اجازه بدهید سریع آن را بررسی کنم...» مکالمه را قطع میکند یا بهروزرسانیهای مرحلهبهمرحله ارائه میدهد. این مدل میتواند یک پنجره زمینه ۱۲۸ هزار توکنی را پردازش کند و همزمان از ۹۷ زبان مختلف پشتیبانی کند، در حالی که جریان طبیعی مکالمه را حفظ میکند.[2][4]
معیارهای عملکردی نشاندهنده سیستمی هستند که برای جریانهای کاری پیچیده بهینهسازی شده است، نه فقط گپ زدنهای روزمره. گوگل گزارش داده است که مدل تفکر گسترده در شاخص کیفیت گفتار به گفتار موسسه Artificial Analysis امتیاز ۸۲.۶ را کسب کرده و در رتبه اول قرار گرفته است. این مدل همچنین در بنچمارک تکمیل وظایف عاملی (τ-Voice) به نرخ موفقیت ۶۸.۶ درصد دست یافته است که نشان میدهد این سیستم واقعاً میتواند وظایف را اجرا کند، نه اینکه فقط درباره آنها حرف بزند.[2][5]
معیارهای عملکردی نشاندهنده سیستمی هستند که برای جریانهای کاری پیچیده بهینهسازی شده است، نه فقط گپ زدنهای روزمره.
با این حال، با نگاهی شکاکانه باید محصول نهایی را از هیاهوی تبلیغاتی جدا کرد. در حالی که این مدل امروز برای توسعهدهندگان از طریق Gemini Live API و Google AI Studio با قیمت ۰.۰۰۵ دلار در دقیقه برای ورودی صوتی و ۰.۰۱۸ دلار برای خروجی در دسترس است، عرضه عمومی آن مرحلهای است. این سیستم در حال حاضر برای مشتریان سازمانی در حالت پیشنمایش خصوصی قرار دارد و به برنامههای Workspace مانند Docs و Gmail اضافه میشود، اما قرار نیست یکشبه جایگزین دستیار ساده روی تمام گوشیهای اندرویدی شود.[2][3]
برای توسعهدهندگان، این موضوع یک پارادایم جدید در طراحی اپلیکیشن معرفی میکند. نشریه TechRepublic اشاره میکند که راهنمای API گوگل صراحتاً به برنامهنویسان هشدار میدهد که فرض نکنند فقط به این دلیل که هوش مصنوعی صحبتش را متوقف کرده، وظیفهاش تمام شده است. وضعیت تعامل سیستم حتی اگر مدل روایت خود را متوقف کند، در حالت «IN_PROGRESS» باقی میماند که اساساً نحوه گوش دادن نرمافزارها به این عاملهای هوشمند را تغییر میدهد.[7]
در نهایت، این شفافیت درنگهنگام (Real-time) به عنوان یک مکانیسم جدید برای تشخیص خطا عمل میکند. با افشای زنجیره استنتاج از طریق صدای زنده، مدل به کاربران اجازه میدهد تا به ناظرانی فعال تبدیل شوند. اگر هوش مصنوعی شروع به تفسیر اشتباه یک درخواست کند یا از مسیر خارج شود، کاربر شکلگیری اشتباه را میشنود و میتواند فوراً برای اصلاح آن مداخله کند، به جای اینکه منتظر یک خروجی نهایی معیوب بماند.[2]
برای جلوگیری از سوءاستفاده در دورانی که صدای تولیدشده توسط ماشین از گفتار انسان غیرقابل تشخیص است، هر خروجی صوتی این مدلها با واترمارک SynthID گوگل نشانهگذاری میشود. در شرایطی که صنعت فناوری به سمت هوش مصنوعی عاملی حرکت میکند که به نمایندگی از ما اقداماتی انجام میدهد، توانایی شنیدن «فکر کردن» ماشین ممکن است کاربردیترین ابزار شفافیتی باشد که در اختیار داریم.[1][3]
بررسی عمیق دیدگاهها
دیدگاه توسعهدهندگان نرمافزار
تمرکز بر قابلیتهای فراخوانی ناهمگام توابع و ساخت عاملهای صوتی در سطح تولید.
برای مهندسان نرمافزار، جذابیت اصلی مدل تفکر گسترده در توانایی آن برای مدیریت جریانهای کاری پیچیده بدون مسدود کردن رابط کاربری است. با استفاده از فراخوانی ناهمگام توابع (Asynchronous function calling)، توسعهدهندگان میتوانند عاملهایی بسازند که در پسزمینه با پایگاههای داده ارتباط برقرار میکنند، در حالی که همچنان به کاربر بازخورد صوتی میدهند. این امر نیاز به ساختارهای پیچیده و چندلایه برای مدیریت تأخیر را از بین میبرد.
دیدگاه تحلیلگران شفافیت
استقبال از افشای زنجیره استدلال به عنوان ابزاری برای کاهش خطاهای هوش مصنوعی.
پژوهشگران حوزه ایمنی و شفافیت هوش مصنوعی معتقدند که مدلهای جعبهسیاه (Black-box) که تنها خروجی نهایی را نمایش میدهند، مستعد توهم و خطاهای پنهان هستند. روایت زنده فرآیند تفکر به کاربر اجازه میدهد تا منطق ماشین را در لحظه ارزیابی کند. اگر سیستم در میانه راه دچار اشتباه محاسباتی یا سوءبرداشت از دستور شود، کاربر میتواند پیش از اجرای نهایی وظیفه، آن را متوقف کرده و اصلاح کند.
دیدگاه طراحان تجربه کاربری
تأکید بر حذف سکوتهای طولانی و ایجاد جریان مکالمهای طبیعیتر.
از منظر طراحی محصول، بزرگترین نقص دستیارهای صوتی سنتی، سکوتهای طولانی و آزاردهنده هنگام پردازش درخواستهای پیچیده بوده است. طراحان تجربه کاربری بر این باورند که استفاده از نشانههای کلامی مانند «اجازه بدهید بررسی کنم» نه تنها اضطراب کاربر را کاهش میدهد، بلکه حس همکاری با یک دستیار هوشمند را تقویت میکند و تعامل انسان و ماشین را به مکالمات روزمره نزدیکتر میسازد.
منابع
[1]Google Blogطراحان تجربه کاربریIntroducing Gemini 3.8 Live and 3.8 Live Extended Thinking
مطالعه در Google Blog →
[2]Forkast Newsتحلیلگران شفافیت هوش مصنوعیGoogle's September 2026 release of Gemini 3.8 Live Extended Thinking marks a departure from the industry standard
مطالعه در Forkast News →
[3]Basic Tutorialsطراحان تجربه کاربریGemini 3.8 Live Extended Thinking: Reasoning Without Interrupting the Conversation
مطالعه در Basic Tutorials →
[4]MarkTechPostتوسعهدهندگان نرمافزارGoogle Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents
مطالعه در MarkTechPost →
[5]Testing Catalogطراحان تجربه کاربریGoogle rolled out Gemini 3.8 Live and Extended Thinking
مطالعه در Testing Catalog →
[6]9to5Googleطراحان تجربه کاربریGoogle launches Gemini 3.8 Live and 3.8 Live Extended Thinking
مطالعه در 9to5Google →
[7]TechRepublicتوسعهدهندگان نرمافزارGoogle launches Gemini 3.8 Live and Live Extended Thinking
مطالعه در TechRepublic →
نظرات
بیشتر در فناوری
مشاهده همه →معماری سیستمعامل
کالبدشکافی زمانبندی پردازنده: چگونه کامپیوتر شما هزاران کار را همزمان انجام میدهد؟
5 منبع
امنیت صنعتی
چگونه حملات سایبری ایران به کنترلکنندههای صنعتی، بازنگری امنیتی در هوش مصنوعی فیزیکی را الزامی کرده است
3 منبع
زیرساخت هوش مصنوعی
انویدیا از پردازنده «ورا» و معماری روبین رونمایی کرد؛ تغییر معیار هوش مصنوعی به «توکن در هر وات»
7 منبع
سلامت دیجیتال
بنیاد لینوکس و گوگل با کمک ۳ میلیون دلاری، پلتفرم «پشته سلامت باز» را برای زیرساخت جهانی راهاندازی کردند
6 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





