رفتن به محتوای اصلی
هوش مصنوعی صوتیعرضه محصول۱۹ تیر ۱۴۰۵، ۰:۲۲· 8 دقیقه مطالعه· در فناوری

اوپن‌ای‌آی مدل صوتی «جی‌پی‌تی-لایو» را عرضه کرد؛ پایان تأخیرهای نوبت‌گیری هوش مصنوعی با مکالمه تمام‌دوطرفه

معماری جدید GPT-Live اوپن‌ای‌آی به ChatGPT اجازه می‌دهد همزمان گوش دهد و صحبت کند، که باعث حذف مکث‌های ناخوشایند و امکان‌پذیر شدن مکالمات طبیعی و قابل قطع شدن می‌شود.

به قلم ایمان شریعتی

محققان و توسعه‌دهندگان هوش مصنوعی 40%تحلیلگران فناوری مصرف‌کننده 35%رقبای صنعتی 25%
محققان و توسعه‌دهندگان هوش مصنوعی
تمرکز بر پیشرفت معماری در جداسازی تعامل صوتی از استدلال محاسباتی سنگین.
تحلیلگران فناوری مصرف‌کننده
تمرکز بر حذف اصطکاک در استفاده روزمره از هوش مصنوعی و پایان تعاملات رباتیک و نوبت‌محور.
رقبای صنعتی
دیدگاه به صدای تمام‌دوطرفه به عنوان استاندارد جدید برای هوش مصنوعی مصرف‌کننده، که میدان نبرد رقابتی را به سرعت رابط کاربری منتقل می‌کند.

چرا مهم است

گذار به هوش مصنوعی تمام‌دوطرفه (فول-دوبلکس) مکث‌های ناخوشایند و نوبت‌گیری‌های سخت‌گیرانه‌ای را که دستیاران صوتی را برای یک دهه آزار داده بود، از بین می‌برد و هوش مصنوعی را به ابزاری کاربردی برای ترجمه همزمان، طوفان فکری پیچیده و تعامل طبیعی انسان و کامپیوتر تبدیل می‌کند.

برای یک دهه گذشته، صحبت کردن با یک هوش مصنوعی بیشتر شبیه استفاده از یک واکی‌تاکی بود تا یک مکالمه روان. کاربران صحبت می‌کردند، در سکوت منتظر می‌ماندند تا سیستم صدا را پردازش کند، و سپس به پاسخی گوش می‌دادند که به راحتی قابل قطع کردن نبود. روز چهارشنبه، اوپن‌ای‌آی عملاً به آن دوران نوبت‌گیری سخت‌گیرانه با عرضه GPT-Live پایان داد؛ نسل جدیدی از مدل‌های صوتی که طراحی شده‌اند تا تعامل انسان و کامپیوتر را تقریباً غیرقابل تشخیص از یک تماس تلفنی واقعی کنند. این به‌روزرسانی نشان‌دهنده بازسازی اساسی تجربه صوتی ChatGPT است و پارادایم را از تبادلات گسسته و نوبت‌محور به گفتگوی پیوسته و همزمان تغییر می‌دهد.[1]

پیشرفت فنی تعیین‌کننده GPT-Live، گذار آن به معماری «تمام‌دوطرفه» (full-duplex) است. در حوزه مخابرات، تمام‌دوطرفه به این معنی است که هر دو طرف یک اتصال می‌توانند همزمان صدا را ارسال و دریافت کنند. در مورد هوش مصنوعی، این امر به ChatGPT اجازه می‌دهد تا جریان صوتی ورودی کاربر را به طور مداوم پردازش کند، حتی در حالی که مشغول تولید پاسخ گفتاری خود است. این کار نیاز هوش مصنوعی به انتظار برای یک شکاف سکوت تمیز و طولانی برای تشخیص اینکه آیا کاربر فکر خود را تمام کرده است را از بین می‌برد و یکی از پایدارترین مشکلات در طراحی رابط کاربری صوتی را حل می‌کند.[1][2]

نسخه‌های قبلی صدای ChatGPT، از جمله حالت صوتی پیشرفته که در سال ۲۰۲۴ معرفی شد، بر اساس تبادلات سخت‌گیرانه نوبت به نوبت عمل می‌کردند. از آنجا که تشخیص نوبت کاملاً به سکوت وابسته بود، مکث طبیعی کاربر برای جمع‌آوری افکارش—یا حتی یک صدای ناگهانی در یک کافی‌شاپ شلوغ—می‌توانست مدل را فریب دهد تا زودتر از موعد حرف را قطع کند. اگر کاربر سعی می‌کرد هوش مصنوعی را در میانه جمله تصحیح کند، سیستم معمولاً باید متوقف می‌شد، زمینه قطع شدن را دوباره ارزیابی می‌کرد و پاسخ خود را از ابتدا بازسازی می‌کرد، که منجر به یک تجربه خسته‌کننده و نامنظم می‌شد که کاملاً رباتیک به نظر می‌رسید.[2]

GPT-Live این پویایی را با تصمیم‌گیری‌های تعاملی چند بار در هر ثانیه، به طور اساسی بازنویسی می‌کند. این مدل به طور مداوم جریان صوتی را ارزیابی می‌کند تا تعیین کند که آیا باید به صحبت کردن ادامه دهد، گوش دادن را ادامه دهد، مکث کند، حرف کاربر را قطع کند، یا یک ابزار خارجی را فعال کند. این پردازش پیوسته به هوش مصنوعی اجازه می‌دهد تا گفتار همپوشان و تصحیحات سریع در میانه جمله را بدون از دست دادن رشته مکالمه مدیریت کند. اگر کاربر با گفتن «صبر کن، منظورم این نبود» مداخله کند، مدل فوراً خروجی خود را متوقف کرده و درک خود را تنظیم می‌کند، دقیقاً همانطور که یک شنونده انسانی انجام می‌دهد.[1]

معماری تمام‌دوپلکس به مدل اجازه می‌دهد صدای ورودی را پردازش کند و همزمان پاسخ تولید کند.

یکی از انسانی‌ترین ویژگی‌هایی که توسط این معماری جدید فعال شده، معرفی «تأییدهای ضمنی مکالمه» (back-channeling) است. در حالی که کاربر صحبت می‌کند، GPT-Live می‌تواند تأییدهای مکالمه‌ای ظریفی—مانند «اوهوم»، «بله» یا «متوجه شدم»—را برای نشان دادن گوش دادن فعال درج کند. همچنین می‌تواند تفاوت بین یک فکر تکمیل شده و یک لحظه تردید را تشخیص دهد و زمانی که کاربر در تلاش برای یافتن کلمه است، سکوت اختیار کند و به او فضا دهد تا جمله‌اش را بدون پریدن برای پر کردن سکوت تمام کند.

اوپن‌ای‌آی در وبلاگ تحقیقاتی خود که جزئیات این عرضه را شرح می‌دهد، توضیح داد: «GPT-Live به جای پردازش دنباله‌ای از پیام‌های جداگانه، ورودی را به طور مداوم در حین تولید خروجی پردازش می‌کند.» این امر به مدل اجازه می‌دهد تا زمینه مکالمه را در طول قطع شدن‌ها حفظ کند و اطمینان حاصل کند که گفتگو حتی زمانی که هر دو طرف روی صحبت یکدیگر صحبت می‌کنند، منسجم باقی می‌ماند. برخلاف پیاده‌سازی‌های صوتی قبلی که صرفاً تشخیص گفتار را روی مدل‌های متنی لایه‌بندی می‌کردند، GPT-Live یک سیستم هدفمند است. این سیستم تأخیر کم و جریان مکالمه طبیعی را در اولویت قرار می‌دهد و تضمین می‌کند که تبادلات رفت و برگشتی به جای اینکه از پیش نوشته شده باشند، ارگانیک به نظر برسند.[2]

برخلاف پیاده‌سازی‌های صوتی قبلی که صرفاً تشخیص گفتار را روی مدل‌های متنی لایه‌بندی می‌کردند، GPT-Live یک سیستم هدفمند است.

برای دستیابی به این پاسخگویی با تأخیر کم بدون قربانی کردن هوش زیربنایی مدل، اوپن‌ای‌آی لایه تعامل صوتی را از بار محاسباتی سنگین جدا کرد. GPT-Live تصمیمات فوری و با تأخیر کم مورد نیاز برای حفظ جریان طبیعی مکالمه و پردازش جریان‌های صوتی دوگانه را مدیریت می‌کند. با این حال، هنگامی که کاربر یک سؤال پیچیده می‌پرسد که نیاز به جستجوی زنده در وب، استدلال منطقی عمیق یا قابلیت‌های عاملی دارد، GPT-Live فوراً آن کار سنگین را به یک مدل پس‌زمینه قوی‌تر، که در زمان عرضه GPT-5.5 است، واگذار می‌کند. این تفکیک وظایف، تعادل سنتی بین سرعت مکالمه و عمق تحلیلی را حل می‌کند.[1]

این مکانیسم واگذاری نشان‌دهنده یک تغییر معماری مهم برای هوش مصنوعی مصرف‌کننده است. در حالی که مدل پیشرفته GPT-5.5 داده‌ها را در پس‌زمینه پردازش می‌کند، GPT-Live در کانال صوتی اصلی فعال باقی می‌ماند. می‌تواند زمان انتظار را به طور طبیعی با گفتن چیزی شبیه «اجازه بدهید آن را برای شما بررسی کنم» یا با ادامه چت با کاربر در مورد موضوعات مرتبط تا زمانی که کار پیچیده کامل شود، پر کند. هنگامی که GPT-5.5 کار خود را به پایان می‌رساند، نتایج به طور یکپارچه به GPT-Live بازگردانده می‌شوند تا با صدای بلند بیان شوند، و اطمینان حاصل می‌شود که کاربر هرگز صفحه بارگذاری با سکوت مطلق را تجربه نمی‌کند.

جی‌پی‌تی-لایو تعامل بلادرنگ را مدیریت می‌کند، در حالی که وظایف استدلال پیچیده را به یک مدل جی‌پی‌تی-۵.۵ در پس‌زمینه محول می‌نماید.

آگاهی مداوم از زمان‌بندی و توانایی پردازش جریان‌های صوتی دوگانه همچنین ترجمه زبان همزمان واقعی را فعال می‌کند، قابلیتی که مدت‌ها از دسترس فناوری مصرف‌کننده دور مانده بود. دستیاران نوبت‌محور قبلی باید منتظر می‌ماندند تا یک گوینده یک جمله یا پاراگراف کامل را به پایان برساند تا فرآیند ترجمه آغاز شود، که یک ریتم نامنظم و توقف-شروع ایجاد می‌کرد. GPT-Live می‌تواند به طور طبیعی با پیشرفت مکالمه همگام شود، ترجمه را در لحظه انجام دهد و آهنگ صدای خود را تنظیم کند بدون اینکه مکث‌های ناخوشایندی را بین گویندگان زبان‌های مختلف تحمیل کند.

فراتر از بهبودهای صوتی، اوپن‌ای‌آی عناصر بصری را در تجربه صوتی جدید ادغام کرده تا آن را به عنوان یک دستیار روزانه مفیدتر کند. هنگامی که کاربران در مورد آب و هوا، قیمت سهام یا نتایج ورزشی سؤال می‌کنند، ChatGPT اکنون کارت‌های بصری غنی را در کنار پاسخ گفتاری خود روی صفحه نمایش می‌دهد. این شرکت همچنین تمام نُه صدای متمایز هوش مصنوعی خود را بازسازی کرده تا از قابلیت‌های بیانی کامل مدل جدید بهره ببرد و اطمینان حاصل کند که لحن و آهنگ صدا با روانی معماری جدید مطابقت دارد.

عرضه GPT-Live به سرعت در اکوسیستم اوپن‌ای‌آی در حال انجام است. از روز چهارشنبه، این فناوری به تجربه صوتی پیش‌فرض برای بیش از ۱۵۰ میلیون نفری تبدیل شد که هر هفته از صدای ChatGPT و دیکته استفاده می‌کنند. اوپن‌ای‌آی در حال استقرار دو نسخه متمایز است: GPT-Live-1 برای مشترکین پولی Plus، Pro و Go، و یک مدل کوچک‌تر و کمی کم‌توان‌تر به نام GPT-Live-1 mini برای کاربران سطح رایگان. هر دو نسخه در روزهای آینده به صورت جهانی در iOS، Android و رابط وب عرضه خواهند شد.

تجربه صوتی به‌روز شده اکنون شامل کارت‌های بصری برای داده‌های همزمان مانند آب و هوا و سهام است.

در ارزیابی‌های انسانی که اوپن‌ای‌آی قبل از عرضه انجام داد، کاربران در مکالمات پنج تا ده دقیقه‌ای، GPT-Live را به شدت به مدل‌های صوتی قبلی ترجیح دادند. آزمایش‌کنندگان بهبودهای قابل توجهی در جریان مکالمه، نوبت‌گیری و مدیریت قطع شدن‌های سریع ذکر کردند. مدل‌های جدید همچنین در معیارهای داخلی که استدلال علمی در سطح تخصصی و جستجوی عاملی در وب را آزمایش می‌کنند، نمرات بالاتری کسب کردند، که ثابت می‌کند واگذاری پس‌زمینه به GPT-5.5 با موفقیت دقت تحلیلی هوش مصنوعی را حفظ می‌کند در حالی که رفتار مکالمه‌ای آن را به شدت بهبود می‌بخشد. این سیستم همچنین عملکرد برتری را در وظایف شبیه‌سازی شده پشتیبانی مخابراتی نشان داد که پتانسیل آن را برای کاربردهای خدمات مشتری سازمانی برجسته می‌کند.[1]

اوپن‌ای‌آی در مسابقه برای حذف تأخیر هوش مصنوعی و ساخت یک رابط کاربری واقعاً مکالمه‌ای تنها نیست. در ماه مه ۲۰۲۶، Thinking Machines—یک آزمایشگاه جدید هوش مصنوعی که توسط میرا موراتی، مدیر ارشد فناوری سابق اوپن‌ای‌آی، تأسیس شده است—فناوری تعامل پیوسته مشابهی را معرفی کرد. آن شرکت اظهار داشت که مدل‌های تعاملی آن برای مدیریت همزمان ورودی و خروجی در صدا، ویدئو و متن طراحی شده‌اند و از ریتم توقف-شروع چت‌بات‌های سنتی فاصله می‌گیرند. همانطور که هوش زیربنایی مدل‌های زبان بزرگ به یک کالای عمومی تبدیل می‌شود، سرعت و طبیعی بودن رابط کاربری به میدان‌های نبرد اصلی برای حفظ کاربر تبدیل می‌شوند.

در حال حاضر، GPT-Live مهم‌ترین جهش رو به جلو در فناوری صدای هوش مصنوعی از زمان معرفی مدل‌های زبان بزرگ را نشان می‌دهد. اوپن‌ای‌آی با حل اصطکاک اساسی نوبت‌گیری و تشخیص سکوت، ChatGPT را از یک موتور جستجوی فعال شده با صدا به یک شریک واقعاً مکالمه‌ای تبدیل کرده است. توانایی طوفان فکری، قطع کردن و همکاری با یک هوش مصنوعی در زمان واقعی، امکانات جدیدی را برای دسترسی، آموزش و بهره‌وری حرفه‌ای باز می‌کند. همانطور که این سیستم‌های تمام‌دوطرفه به استاندارد جدید در سراسر صنعت تبدیل می‌شوند، دوران انتظار برای اتمام صحبت کامپیوتر قبل از اینکه بتوانید فکری را به اشتراک بگذارید، رسماً به پایان می‌رسد.[2]

نکات کلیدی

  • اوپن‌ای‌آی GPT-Live، یک معماری مدل صوتی جدید را عرضه کرد که به ChatGPT اجازه می‌دهد همزمان گوش دهد و صحبت کند.
  • سیستم تمام‌دوطرفه نوبت‌گیری سخت‌گیرانه و مکث‌های ناخوشایندی را که مشخصه دستیاران صوتی هوش مصنوعی قبلی بود، حذف می‌کند.
  • GPT-Live می‌تواند وقفه‌های سریع را مدیریت کند، مکث‌های طبیعی را تشخیص دهد و تأییدهای مکالمه‌ای مانند «اوهوم» را درج کند.
  • پرسش‌های پیچیده به طور یکپارچه به یک مدل پس‌زمینه GPT-5.5 واگذار می‌شوند و رابط صوتی را سریع و پاسخگو نگه می‌دارند.
  • این فناوری به صورت جهانی برای همه کاربران ChatGPT در حال عرضه است، با یک نسخه مینی که برای حساب‌های رایگان در دسترس است.

اصطلاحات کلیدی

تمام‌دوطرفه (Full-duplex)
یک سیستم ارتباطی که در آن هر دو طرف می‌توانند همزمان صدا را ارسال و دریافت کنند، مانند یک تماس تلفنی استاندارد.
نیمه‌دوطرفه (Half-duplex)
یک سیستم ارتباطی که در آن فقط یک طرف می‌تواند در یک زمان ارسال کند و نیاز به نوبت‌گیری دارد، مانند یک واکی‌تاکی.
تأیید ضمنی مکالمه (Back-channeling)
تأییدهای مکالمه‌ای کوتاه (مانند «اوهوم» یا «بله») که توسط شنونده برای نشان دادن توجه بدون قطع کردن صحبت گوینده استفاده می‌شود.
قابلیت‌های عاملی (Agentic capabilities)
توانایی یک سیستم هوش مصنوعی برای استفاده مستقل از ابزارها، مرور وب، یا اجرای وظایف چند مرحله‌ای برای دستیابی به یک هدف.

منابع

پوشش منابع

2 منبع

3 دیدگاه شناسایی‌شده

محققان و توسعه‌دهندگان هوش مصنوعی 40%تحلیلگران فناوری مصرف‌کننده 35%رقبای صنعتی 25%
  1. [1]OpenAIمحققان و توسعه‌دهندگان هوش مصنوعی

    GPT-Live: A new generation of voice models for natural human-AI interaction

    مطالعه در OpenAI
  2. [2]VentureBeatرقبای صنعتی

    Agentic coding goes hands-free as OpenAI brings GPT-Live's full duplex voice control to Codex and ChatGPT on the desktop

    مطالعه در VentureBeat

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.