رفتن به محتوای اصلی
Koohestun
جمنای ۳.۸ لایوتحلیل محصول· 4 دقیقه مطالعه· در فناوری

کالبدشکافی «تفکر گسترده» در هوش مصنوعی: مدل‌های جدید گوگل چگونه حین صحبت کردن فکر می‌کنند؟

مدل جدید Gemini 3.8 Live Extended Thinking گوگل با روایت زنده روند استدلال خود حین اجرای وظایف پیچیده، به سکوت‌های طولانی دستیارهای صوتی پایان می‌دهد.

به قلم کاوان رامین

توسعه‌دهندگان نرم‌افزار 35%تحلیلگران شفافیت هوش مصنوعی 35%طراحان تجربه کاربری 30%
توسعه‌دهندگان نرم‌افزار
تمرکز بر قابلیت‌های فراخوانی ناهمگام توابع و ساخت عامل‌های صوتی در سطح تولید.
تحلیلگران شفافیت هوش مصنوعی
استقبال از افشای زنجیره استدلال به عنوان ابزاری برای کاهش خطاهای هوش مصنوعی.
طراحان تجربه کاربری
تأکید بر حذف سکوت‌های طولانی و ایجاد جریان مکالمه‌ای طبیعی‌تر.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کاربران نهایی با اینترنت کند
  • نگرانی‌های مربوط به حریم خصوصی صوتی

چرا مهم است

برای توسعه‌دهندگان و کاربران، این فناوری به معنای پایان یافتن انتظار در سکوت برای پاسخ دستیارهای صوتی است. با افشای زنده روند استدلال، کاربران می‌توانند خطاهای هوش مصنوعی را پیش از اجرای نهایی تشخیص داده و تعاملی طبیعی‌تر و شفاف‌تر با ماشین داشته باشند.

نکات کلیدی

  • گوگل مدل‌های صوتی Gemini 3.8 Live و نسخه Extended Thinking را با قابلیت پردازش همزمان مکالمه و وظایف پس‌زمینه منتشر کرد.
  • مدل تفکر گسترده به جای سکوت در برابر پردازش‌های سنگین، از نشانه‌های کلامی زنده برای توضیح روند کار خود استفاده می‌کند.
  • این مدل در شاخص کیفیت گفتار به گفتار (Speech-to-Speech) با امتیاز ۸۲.۶ در رتبه اول قرار گرفته است.
  • این سیستم هم‌اکنون از طریق API برای توسعه‌دهندگان در دسترس است و به تدریج به برنامه‌های Workspace اضافه می‌شود.

در ۱۵ سپتامبر ۲۰۲۶، گوگل با انتشار دو مدل جدید «جمنای ۳.۸ لایو» (Gemini 3.8 Live) و نسخه پیچیده‌تر آن یعنی «تفکر گسترده» (Extended Thinking)، ریتم بنیادین هوش مصنوعی صوتی را تغییر داد. سال‌هاست که استاندارد تعامل با دستیارهای صوتی، شامل یک درخواست و به دنبال آن یک تأخیر پردازشی بی‌صدا و مبهم بوده است. اکنون، مدل تفکر گسترده این سکوت را با روایت زنده جایگزین کرده و در حالی که وظایف پس‌زمینه را اجرا می‌کند، همزمان فکر کرده و صحبت می‌کند.[1][6]

این تغییر بیش از آنکه به معنای دستیابی هوش مصنوعی به «آگاهی» انسان‌گونه باشد، یک بازطراحی هوشمندانه در معماری سیستم است. بر اساس مستندات فنی گوگل، این مدل از فراخوانی توابع به صورت ناهمگام (Asynchronous function calling) استفاده می‌کند. این بدان معناست که در حالی که سیستم در حال دریافت داده‌ها از طریق یک رابط برنامه‌نویسی (API) یا جستجو در یک سند است، به طور پیوسته صدای خروجی را برای کاربر استریم می‌کند.[2][7]

در عمل، این قابلیت خود را به شکل نشانه‌های کلامی زودهنگام نشان می‌دهد. به جای اینکه سیستم هنگام هماهنگ کردن یک رزرو چندمرحله‌ای رستوران یا تحلیل یک کد برنامه‌نویسی متوقف شود، با عباراتی مانند «اجازه بدهید سریع آن را بررسی کنم...» مکالمه را قطع می‌کند یا به‌روزرسانی‌های مرحله‌به‌مرحله ارائه می‌دهد. این مدل می‌تواند یک پنجره زمینه ۱۲۸ هزار توکنی را پردازش کند و همزمان از ۹۷ زبان مختلف پشتیبانی کند، در حالی که جریان طبیعی مکالمه را حفظ می‌کند.[2][4]

معیارهای عملکردی نشان‌دهنده سیستمی هستند که برای جریان‌های کاری پیچیده بهینه‌سازی شده است، نه فقط گپ زدن‌های روزمره. گوگل گزارش داده است که مدل تفکر گسترده در شاخص کیفیت گفتار به گفتار موسسه Artificial Analysis امتیاز ۸۲.۶ را کسب کرده و در رتبه اول قرار گرفته است. این مدل همچنین در بنچمارک تکمیل وظایف عاملی (τ-Voice) به نرخ موفقیت ۶۸.۶ درصد دست یافته است که نشان می‌دهد این سیستم واقعاً می‌تواند وظایف را اجرا کند، نه اینکه فقط درباره آن‌ها حرف بزند.[2][5]

معیارهای عملکردی نشان‌دهنده سیستمی هستند که برای جریان‌های کاری پیچیده بهینه‌سازی شده است، نه فقط گپ زدن‌های روزمره.

با این حال، با نگاهی شکاکانه باید محصول نهایی را از هیاهوی تبلیغاتی جدا کرد. در حالی که این مدل امروز برای توسعه‌دهندگان از طریق Gemini Live API و Google AI Studio با قیمت ۰.۰۰۵ دلار در دقیقه برای ورودی صوتی و ۰.۰۱۸ دلار برای خروجی در دسترس است، عرضه عمومی آن مرحله‌ای است. این سیستم در حال حاضر برای مشتریان سازمانی در حالت پیش‌نمایش خصوصی قرار دارد و به برنامه‌های Workspace مانند Docs و Gmail اضافه می‌شود، اما قرار نیست یک‌شبه جایگزین دستیار ساده روی تمام گوشی‌های اندرویدی شود.[2][3]

برای توسعه‌دهندگان، این موضوع یک پارادایم جدید در طراحی اپلیکیشن معرفی می‌کند. نشریه TechRepublic اشاره می‌کند که راهنمای API گوگل صراحتاً به برنامه‌نویسان هشدار می‌دهد که فرض نکنند فقط به این دلیل که هوش مصنوعی صحبتش را متوقف کرده، وظیفه‌اش تمام شده است. وضعیت تعامل سیستم حتی اگر مدل روایت خود را متوقف کند، در حالت «IN_PROGRESS» باقی می‌ماند که اساساً نحوه گوش دادن نرم‌افزارها به این عامل‌های هوشمند را تغییر می‌دهد.[7]

در نهایت، این شفافیت درنگ‌هنگام (Real-time) به عنوان یک مکانیسم جدید برای تشخیص خطا عمل می‌کند. با افشای زنجیره استنتاج از طریق صدای زنده، مدل به کاربران اجازه می‌دهد تا به ناظرانی فعال تبدیل شوند. اگر هوش مصنوعی شروع به تفسیر اشتباه یک درخواست کند یا از مسیر خارج شود، کاربر شکل‌گیری اشتباه را می‌شنود و می‌تواند فوراً برای اصلاح آن مداخله کند، به جای اینکه منتظر یک خروجی نهایی معیوب بماند.[2]

برای جلوگیری از سوءاستفاده در دورانی که صدای تولیدشده توسط ماشین از گفتار انسان غیرقابل تشخیص است، هر خروجی صوتی این مدل‌ها با واترمارک SynthID گوگل نشانه‌گذاری می‌شود. در شرایطی که صنعت فناوری به سمت هوش مصنوعی عاملی حرکت می‌کند که به نمایندگی از ما اقداماتی انجام می‌دهد، توانایی شنیدن «فکر کردن» ماشین ممکن است کاربردی‌ترین ابزار شفافیتی باشد که در اختیار داریم.[1][3]

بررسی عمیق دیدگاه‌ها

دیدگاه توسعه‌دهندگان نرم‌افزار

تمرکز بر قابلیت‌های فراخوانی ناهمگام توابع و ساخت عامل‌های صوتی در سطح تولید.

برای مهندسان نرم‌افزار، جذابیت اصلی مدل تفکر گسترده در توانایی آن برای مدیریت جریان‌های کاری پیچیده بدون مسدود کردن رابط کاربری است. با استفاده از فراخوانی ناهمگام توابع (Asynchronous function calling)، توسعه‌دهندگان می‌توانند عامل‌هایی بسازند که در پس‌زمینه با پایگاه‌های داده ارتباط برقرار می‌کنند، در حالی که همچنان به کاربر بازخورد صوتی می‌دهند. این امر نیاز به ساختارهای پیچیده و چندلایه برای مدیریت تأخیر را از بین می‌برد.

دیدگاه تحلیلگران شفافیت

استقبال از افشای زنجیره استدلال به عنوان ابزاری برای کاهش خطاهای هوش مصنوعی.

پژوهشگران حوزه ایمنی و شفافیت هوش مصنوعی معتقدند که مدل‌های جعبه‌سیاه (Black-box) که تنها خروجی نهایی را نمایش می‌دهند، مستعد توهم و خطاهای پنهان هستند. روایت زنده فرآیند تفکر به کاربر اجازه می‌دهد تا منطق ماشین را در لحظه ارزیابی کند. اگر سیستم در میانه راه دچار اشتباه محاسباتی یا سوءبرداشت از دستور شود، کاربر می‌تواند پیش از اجرای نهایی وظیفه، آن را متوقف کرده و اصلاح کند.

دیدگاه طراحان تجربه کاربری

تأکید بر حذف سکوت‌های طولانی و ایجاد جریان مکالمه‌ای طبیعی‌تر.

از منظر طراحی محصول، بزرگترین نقص دستیارهای صوتی سنتی، سکوت‌های طولانی و آزاردهنده هنگام پردازش درخواست‌های پیچیده بوده است. طراحان تجربه کاربری بر این باورند که استفاده از نشانه‌های کلامی مانند «اجازه بدهید بررسی کنم» نه تنها اضطراب کاربر را کاهش می‌دهد، بلکه حس همکاری با یک دستیار هوشمند را تقویت می‌کند و تعامل انسان و ماشین را به مکالمات روزمره نزدیک‌تر می‌سازد.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان نرم‌افزار 35%تحلیلگران شفافیت هوش مصنوعی 35%طراحان تجربه کاربری 30%
  1. [1]Google Blogطراحان تجربه کاربری

    Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

    مطالعه در Google Blog
  2. [2]Forkast Newsتحلیلگران شفافیت هوش مصنوعی

    Google's September 2026 release of Gemini 3.8 Live Extended Thinking marks a departure from the industry standard

    مطالعه در Forkast News
  3. [3]Basic Tutorialsطراحان تجربه کاربری

    Gemini 3.8 Live Extended Thinking: Reasoning Without Interrupting the Conversation

    مطالعه در Basic Tutorials
  4. [4]MarkTechPostتوسعه‌دهندگان نرم‌افزار

    Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents

    مطالعه در MarkTechPost
  5. [5]Testing Catalogطراحان تجربه کاربری

    Google rolled out Gemini 3.8 Live and Extended Thinking

    مطالعه در Testing Catalog
  6. [6]9to5Googleطراحان تجربه کاربری

    Google launches Gemini 3.8 Live and 3.8 Live Extended Thinking

    مطالعه در 9to5Google
  7. [7]TechRepublicتوسعه‌دهندگان نرم‌افزار

    Google launches Gemini 3.8 Live and Live Extended Thinking

    مطالعه در TechRepublic

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.