اوپنایآی مدل صوتی «جیپیتی-لایو» را عرضه کرد؛ پایان تأخیرهای نوبتگیری هوش مصنوعی با مکالمه تمامدوطرفه
معماری جدید GPT-Live اوپنایآی به ChatGPT اجازه میدهد همزمان گوش دهد و صحبت کند، که باعث حذف مکثهای ناخوشایند و امکانپذیر شدن مکالمات طبیعی و قابل قطع شدن میشود.
به قلم ایمان شریعتی
این خبر را به اشتراک بگذارید
- محققان و توسعهدهندگان هوش مصنوعی
- تمرکز بر پیشرفت معماری در جداسازی تعامل صوتی از استدلال محاسباتی سنگین.
- تحلیلگران فناوری مصرفکننده
- تمرکز بر حذف اصطکاک در استفاده روزمره از هوش مصنوعی و پایان تعاملات رباتیک و نوبتمحور.
- رقبای صنعتی
- دیدگاه به صدای تمامدوطرفه به عنوان استاندارد جدید برای هوش مصنوعی مصرفکننده، که میدان نبرد رقابتی را به سرعت رابط کاربری منتقل میکند.
چرا مهم است
گذار به هوش مصنوعی تمامدوطرفه (فول-دوبلکس) مکثهای ناخوشایند و نوبتگیریهای سختگیرانهای را که دستیاران صوتی را برای یک دهه آزار داده بود، از بین میبرد و هوش مصنوعی را به ابزاری کاربردی برای ترجمه همزمان، طوفان فکری پیچیده و تعامل طبیعی انسان و کامپیوتر تبدیل میکند.
برای یک دهه گذشته، صحبت کردن با یک هوش مصنوعی بیشتر شبیه استفاده از یک واکیتاکی بود تا یک مکالمه روان. کاربران صحبت میکردند، در سکوت منتظر میماندند تا سیستم صدا را پردازش کند، و سپس به پاسخی گوش میدادند که به راحتی قابل قطع کردن نبود. روز چهارشنبه، اوپنایآی عملاً به آن دوران نوبتگیری سختگیرانه با عرضه GPT-Live پایان داد؛ نسل جدیدی از مدلهای صوتی که طراحی شدهاند تا تعامل انسان و کامپیوتر را تقریباً غیرقابل تشخیص از یک تماس تلفنی واقعی کنند. این بهروزرسانی نشاندهنده بازسازی اساسی تجربه صوتی ChatGPT است و پارادایم را از تبادلات گسسته و نوبتمحور به گفتگوی پیوسته و همزمان تغییر میدهد.[1]
پیشرفت فنی تعیینکننده GPT-Live، گذار آن به معماری «تمامدوطرفه» (full-duplex) است. در حوزه مخابرات، تمامدوطرفه به این معنی است که هر دو طرف یک اتصال میتوانند همزمان صدا را ارسال و دریافت کنند. در مورد هوش مصنوعی، این امر به ChatGPT اجازه میدهد تا جریان صوتی ورودی کاربر را به طور مداوم پردازش کند، حتی در حالی که مشغول تولید پاسخ گفتاری خود است. این کار نیاز هوش مصنوعی به انتظار برای یک شکاف سکوت تمیز و طولانی برای تشخیص اینکه آیا کاربر فکر خود را تمام کرده است را از بین میبرد و یکی از پایدارترین مشکلات در طراحی رابط کاربری صوتی را حل میکند.[1][2]
نسخههای قبلی صدای ChatGPT، از جمله حالت صوتی پیشرفته که در سال ۲۰۲۴ معرفی شد، بر اساس تبادلات سختگیرانه نوبت به نوبت عمل میکردند. از آنجا که تشخیص نوبت کاملاً به سکوت وابسته بود، مکث طبیعی کاربر برای جمعآوری افکارش—یا حتی یک صدای ناگهانی در یک کافیشاپ شلوغ—میتوانست مدل را فریب دهد تا زودتر از موعد حرف را قطع کند. اگر کاربر سعی میکرد هوش مصنوعی را در میانه جمله تصحیح کند، سیستم معمولاً باید متوقف میشد، زمینه قطع شدن را دوباره ارزیابی میکرد و پاسخ خود را از ابتدا بازسازی میکرد، که منجر به یک تجربه خستهکننده و نامنظم میشد که کاملاً رباتیک به نظر میرسید.[2]
GPT-Live این پویایی را با تصمیمگیریهای تعاملی چند بار در هر ثانیه، به طور اساسی بازنویسی میکند. این مدل به طور مداوم جریان صوتی را ارزیابی میکند تا تعیین کند که آیا باید به صحبت کردن ادامه دهد، گوش دادن را ادامه دهد، مکث کند، حرف کاربر را قطع کند، یا یک ابزار خارجی را فعال کند. این پردازش پیوسته به هوش مصنوعی اجازه میدهد تا گفتار همپوشان و تصحیحات سریع در میانه جمله را بدون از دست دادن رشته مکالمه مدیریت کند. اگر کاربر با گفتن «صبر کن، منظورم این نبود» مداخله کند، مدل فوراً خروجی خود را متوقف کرده و درک خود را تنظیم میکند، دقیقاً همانطور که یک شنونده انسانی انجام میدهد.[1]
یکی از انسانیترین ویژگیهایی که توسط این معماری جدید فعال شده، معرفی «تأییدهای ضمنی مکالمه» (back-channeling) است. در حالی که کاربر صحبت میکند، GPT-Live میتواند تأییدهای مکالمهای ظریفی—مانند «اوهوم»، «بله» یا «متوجه شدم»—را برای نشان دادن گوش دادن فعال درج کند. همچنین میتواند تفاوت بین یک فکر تکمیل شده و یک لحظه تردید را تشخیص دهد و زمانی که کاربر در تلاش برای یافتن کلمه است، سکوت اختیار کند و به او فضا دهد تا جملهاش را بدون پریدن برای پر کردن سکوت تمام کند.
اوپنایآی در وبلاگ تحقیقاتی خود که جزئیات این عرضه را شرح میدهد، توضیح داد: «GPT-Live به جای پردازش دنبالهای از پیامهای جداگانه، ورودی را به طور مداوم در حین تولید خروجی پردازش میکند.» این امر به مدل اجازه میدهد تا زمینه مکالمه را در طول قطع شدنها حفظ کند و اطمینان حاصل کند که گفتگو حتی زمانی که هر دو طرف روی صحبت یکدیگر صحبت میکنند، منسجم باقی میماند. برخلاف پیادهسازیهای صوتی قبلی که صرفاً تشخیص گفتار را روی مدلهای متنی لایهبندی میکردند، GPT-Live یک سیستم هدفمند است. این سیستم تأخیر کم و جریان مکالمه طبیعی را در اولویت قرار میدهد و تضمین میکند که تبادلات رفت و برگشتی به جای اینکه از پیش نوشته شده باشند، ارگانیک به نظر برسند.[2]
برخلاف پیادهسازیهای صوتی قبلی که صرفاً تشخیص گفتار را روی مدلهای متنی لایهبندی میکردند، GPT-Live یک سیستم هدفمند است.
برای دستیابی به این پاسخگویی با تأخیر کم بدون قربانی کردن هوش زیربنایی مدل، اوپنایآی لایه تعامل صوتی را از بار محاسباتی سنگین جدا کرد. GPT-Live تصمیمات فوری و با تأخیر کم مورد نیاز برای حفظ جریان طبیعی مکالمه و پردازش جریانهای صوتی دوگانه را مدیریت میکند. با این حال، هنگامی که کاربر یک سؤال پیچیده میپرسد که نیاز به جستجوی زنده در وب، استدلال منطقی عمیق یا قابلیتهای عاملی دارد، GPT-Live فوراً آن کار سنگین را به یک مدل پسزمینه قویتر، که در زمان عرضه GPT-5.5 است، واگذار میکند. این تفکیک وظایف، تعادل سنتی بین سرعت مکالمه و عمق تحلیلی را حل میکند.[1]
این مکانیسم واگذاری نشاندهنده یک تغییر معماری مهم برای هوش مصنوعی مصرفکننده است. در حالی که مدل پیشرفته GPT-5.5 دادهها را در پسزمینه پردازش میکند، GPT-Live در کانال صوتی اصلی فعال باقی میماند. میتواند زمان انتظار را به طور طبیعی با گفتن چیزی شبیه «اجازه بدهید آن را برای شما بررسی کنم» یا با ادامه چت با کاربر در مورد موضوعات مرتبط تا زمانی که کار پیچیده کامل شود، پر کند. هنگامی که GPT-5.5 کار خود را به پایان میرساند، نتایج به طور یکپارچه به GPT-Live بازگردانده میشوند تا با صدای بلند بیان شوند، و اطمینان حاصل میشود که کاربر هرگز صفحه بارگذاری با سکوت مطلق را تجربه نمیکند.
آگاهی مداوم از زمانبندی و توانایی پردازش جریانهای صوتی دوگانه همچنین ترجمه زبان همزمان واقعی را فعال میکند، قابلیتی که مدتها از دسترس فناوری مصرفکننده دور مانده بود. دستیاران نوبتمحور قبلی باید منتظر میماندند تا یک گوینده یک جمله یا پاراگراف کامل را به پایان برساند تا فرآیند ترجمه آغاز شود، که یک ریتم نامنظم و توقف-شروع ایجاد میکرد. GPT-Live میتواند به طور طبیعی با پیشرفت مکالمه همگام شود، ترجمه را در لحظه انجام دهد و آهنگ صدای خود را تنظیم کند بدون اینکه مکثهای ناخوشایندی را بین گویندگان زبانهای مختلف تحمیل کند.
فراتر از بهبودهای صوتی، اوپنایآی عناصر بصری را در تجربه صوتی جدید ادغام کرده تا آن را به عنوان یک دستیار روزانه مفیدتر کند. هنگامی که کاربران در مورد آب و هوا، قیمت سهام یا نتایج ورزشی سؤال میکنند، ChatGPT اکنون کارتهای بصری غنی را در کنار پاسخ گفتاری خود روی صفحه نمایش میدهد. این شرکت همچنین تمام نُه صدای متمایز هوش مصنوعی خود را بازسازی کرده تا از قابلیتهای بیانی کامل مدل جدید بهره ببرد و اطمینان حاصل کند که لحن و آهنگ صدا با روانی معماری جدید مطابقت دارد.
عرضه GPT-Live به سرعت در اکوسیستم اوپنایآی در حال انجام است. از روز چهارشنبه، این فناوری به تجربه صوتی پیشفرض برای بیش از ۱۵۰ میلیون نفری تبدیل شد که هر هفته از صدای ChatGPT و دیکته استفاده میکنند. اوپنایآی در حال استقرار دو نسخه متمایز است: GPT-Live-1 برای مشترکین پولی Plus، Pro و Go، و یک مدل کوچکتر و کمی کمتوانتر به نام GPT-Live-1 mini برای کاربران سطح رایگان. هر دو نسخه در روزهای آینده به صورت جهانی در iOS، Android و رابط وب عرضه خواهند شد.
در ارزیابیهای انسانی که اوپنایآی قبل از عرضه انجام داد، کاربران در مکالمات پنج تا ده دقیقهای، GPT-Live را به شدت به مدلهای صوتی قبلی ترجیح دادند. آزمایشکنندگان بهبودهای قابل توجهی در جریان مکالمه، نوبتگیری و مدیریت قطع شدنهای سریع ذکر کردند. مدلهای جدید همچنین در معیارهای داخلی که استدلال علمی در سطح تخصصی و جستجوی عاملی در وب را آزمایش میکنند، نمرات بالاتری کسب کردند، که ثابت میکند واگذاری پسزمینه به GPT-5.5 با موفقیت دقت تحلیلی هوش مصنوعی را حفظ میکند در حالی که رفتار مکالمهای آن را به شدت بهبود میبخشد. این سیستم همچنین عملکرد برتری را در وظایف شبیهسازی شده پشتیبانی مخابراتی نشان داد که پتانسیل آن را برای کاربردهای خدمات مشتری سازمانی برجسته میکند.[1]
اوپنایآی در مسابقه برای حذف تأخیر هوش مصنوعی و ساخت یک رابط کاربری واقعاً مکالمهای تنها نیست. در ماه مه ۲۰۲۶، Thinking Machines—یک آزمایشگاه جدید هوش مصنوعی که توسط میرا موراتی، مدیر ارشد فناوری سابق اوپنایآی، تأسیس شده است—فناوری تعامل پیوسته مشابهی را معرفی کرد. آن شرکت اظهار داشت که مدلهای تعاملی آن برای مدیریت همزمان ورودی و خروجی در صدا، ویدئو و متن طراحی شدهاند و از ریتم توقف-شروع چتباتهای سنتی فاصله میگیرند. همانطور که هوش زیربنایی مدلهای زبان بزرگ به یک کالای عمومی تبدیل میشود، سرعت و طبیعی بودن رابط کاربری به میدانهای نبرد اصلی برای حفظ کاربر تبدیل میشوند.
در حال حاضر، GPT-Live مهمترین جهش رو به جلو در فناوری صدای هوش مصنوعی از زمان معرفی مدلهای زبان بزرگ را نشان میدهد. اوپنایآی با حل اصطکاک اساسی نوبتگیری و تشخیص سکوت، ChatGPT را از یک موتور جستجوی فعال شده با صدا به یک شریک واقعاً مکالمهای تبدیل کرده است. توانایی طوفان فکری، قطع کردن و همکاری با یک هوش مصنوعی در زمان واقعی، امکانات جدیدی را برای دسترسی، آموزش و بهرهوری حرفهای باز میکند. همانطور که این سیستمهای تمامدوطرفه به استاندارد جدید در سراسر صنعت تبدیل میشوند، دوران انتظار برای اتمام صحبت کامپیوتر قبل از اینکه بتوانید فکری را به اشتراک بگذارید، رسماً به پایان میرسد.[2]
نکات کلیدی
- اوپنایآی GPT-Live، یک معماری مدل صوتی جدید را عرضه کرد که به ChatGPT اجازه میدهد همزمان گوش دهد و صحبت کند.
- سیستم تمامدوطرفه نوبتگیری سختگیرانه و مکثهای ناخوشایندی را که مشخصه دستیاران صوتی هوش مصنوعی قبلی بود، حذف میکند.
- GPT-Live میتواند وقفههای سریع را مدیریت کند، مکثهای طبیعی را تشخیص دهد و تأییدهای مکالمهای مانند «اوهوم» را درج کند.
- پرسشهای پیچیده به طور یکپارچه به یک مدل پسزمینه GPT-5.5 واگذار میشوند و رابط صوتی را سریع و پاسخگو نگه میدارند.
- این فناوری به صورت جهانی برای همه کاربران ChatGPT در حال عرضه است، با یک نسخه مینی که برای حسابهای رایگان در دسترس است.
اصطلاحات کلیدی
- تمامدوطرفه (Full-duplex)
- یک سیستم ارتباطی که در آن هر دو طرف میتوانند همزمان صدا را ارسال و دریافت کنند، مانند یک تماس تلفنی استاندارد.
- نیمهدوطرفه (Half-duplex)
- یک سیستم ارتباطی که در آن فقط یک طرف میتواند در یک زمان ارسال کند و نیاز به نوبتگیری دارد، مانند یک واکیتاکی.
- تأیید ضمنی مکالمه (Back-channeling)
- تأییدهای مکالمهای کوتاه (مانند «اوهوم» یا «بله») که توسط شنونده برای نشان دادن توجه بدون قطع کردن صحبت گوینده استفاده میشود.
- قابلیتهای عاملی (Agentic capabilities)
- توانایی یک سیستم هوش مصنوعی برای استفاده مستقل از ابزارها، مرور وب، یا اجرای وظایف چند مرحلهای برای دستیابی به یک هدف.
منابع
[1]OpenAIمحققان و توسعهدهندگان هوش مصنوعیGPT-Live: A new generation of voice models for natural human-AI interaction
مطالعه در OpenAI →
[2]VentureBeatرقبای صنعتیAgentic coding goes hands-free as OpenAI brings GPT-Live's full duplex voice control to Codex and ChatGPT on the desktop
مطالعه در VentureBeat →
نظرات
بیشتر در فناوری
مشاهده همه →فناوری رندرینگ
مکانیک رهگیری پرتو: چگونه ردیابی مسیر، شطرنجیسازی و RT در بازیهای مدرن همزیستی میکنند
6 منبع
رصدخانههای فضایی
پرتاب تلسکوپ فضایی «رومن»: چرا اخترفیزیک مشاهده عمیق را با پیمایشهای گسترده عوض میکند؟
6 منبع
Audio Tech
کالبدشکافی حذف نویز فعال (ANC): چرا هدفون شما صدا را با یک صدای دیگر نابود میکند؟
3 منبع
فیدهای الگوریتمی
سازوکار الگوریتم صفحه «برای شما» تیکتاک: سیستم چگونه ویدئوها را رتبهبندی و پیشنهاد میکند
4 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





