🎙️ معماری جدید GPT-Live: وقتی مدل صوتی از مدل استدلال جدا میشودشرکت OpenAI بهتازگی جزئیات فنی جال…
انتشار: 2026/08/03 23:39 UTCدریافت: 2026/08/05 00:02 UTCآخرین مشاهده: 2026/08/05 00:02 UTC
🎙️ معماری جدید GPT-Live: وقتی مدل صوتی از مدل استدلال جدا میشودشرکت OpenAI بهتازگی جزئیات فنی جالبی از معماری GPT-Live منتشر کرده که نشاندهندهی یک تغییر اساسی در نحوهی تعامل صوتی با هوش مصنوعی است. دو نکتهی کلیدی در این بهروزرسانی، جدا بودن مدل صوتی از مدل استدلال و حذف تشخیصدهندهی نوبت (Turn Detector) هستند.---🧩 معماری دو لایه: یکی برای مکالمه، یکی برای فکر کردنبرخلاف نسخههای قبلی که یک مدل واحد همهی کارها را انجام میداد، GPT-Lite از دو لایه تشکیل شده است:🔹 مدل صوتی جلو (GPT-Live-1) : مسئول تعامل صوتی بلادرنگ. این مدل با معماری تمامدوپلکس، همزمان گوش میدهد و صحبت میکند و تصمیمات لحظهای مثل مکث، قطع کردن یا ادامهی صحبت را میگیرد.🔹 مدل استدلال پشت صحنه (GPT-5.5) : وقتی سؤالی نیاز به جستجو، استدلال عمیق یا فراخوانی ابزار دارد، مدل صوتی آن را به GPT-5.5 در پسزمینه واگذار میکند. در این مدت، مدل صوتی به مکالمه ادامه میدهد و کاربر هرگز منتظر نمیماند.---🛑 چرا تشخیصدهندهی نوبت حذف شد؟سیستمهای قبلی برای تشخیص پایان حرف کاربر، به یک تشخیصدهندهی نوبت متکی بودند که با تشخیص سکوت، متوجه میشد کاربر صحبتش تمام شده. اما این روش مشکلاتی داشت:- گاهی کاربر را در میان صحبت قطع میکرد (چون سکوت کوتاه را پایان مکالمه در نظر میگرفت).- گاهی مکثهای طبیعی کاربر را متوجه نمیشد و پاسخ نمیداد.در معماری جدید، تشخیصدهندهی نوبت بهکلی حذف شده است. مدل بهصورت پیوسته جریان صوتی را پردازش میکند و چندین بار در ثانیه تصمیم میگیرد که گوش کند، صحبت کند، مکث کند یا اجازهی قطع کردن بدهد. این تغییر، مکالمه را طبیعیتر و روانتر کرده است.---⚙️ نکات فنی جالب پشت صحنهبرای دستیابی به این سطح از تعامل بلادرنگ، OpenAI بهینهسازیهای مهندسی قابلتوجهی انجام داده است:🔹 پردازش بلادرنگ و مدیریت دینامیک متن: سیستم باید جریان مداوم صوتی را پردازش کرده و زمینهی مکالمههای طولانی را بهخوبی مدیریت کند.🔹 بهینهسازی پروتکل WebRTC: OpenAI پروتکل جدیدی به نام WARP و قابلیت Instant Connect توسعه داده که اتصال WebRTC را از چندین رفتوبرگشت شبکه به یک بستهی داده کاهش میدهد و مکالمههای صوتی را فوری شروع میکند.🔹 مهاجرت به زبان Go: برای پایداری بیشتر در انتقال فریمهای صوتی، بخشهایی از کد از asyncio (پایتون) به زبان Go منتقل شده است.---📱 دسترسی و نسخههامدل GPT-Live هماکنون برای کاربران در پلتفرمهای iOS، Android و وب در دسترس است. نسخهی GPT-Live-1 برای کاربران پلنهای Go، Plus و Pro و نسخهی GPT-Live-1 mini برای کاربران رایگان فعال شده است.---💡 خلاصهاین بهروزرسانی نشان میدهد که OpenAI با جداسازی مدلهای صوتی و استدلال، و حذف تشخیصدهندهی نوبت، گامی بزرگ به سمت مکالمات طبیعیتر و روانتر با هوش مصنوعی برداشته است. ترکیب پردازش پیوسته، بهینهسازیهای شبکه و معماری دو لایه، تجربهای نزدیکتر به گفتگوی انسانی ارائه میدهد.---🔗 جزئیات کامل فنی: openai.com/index/continuous-voice-interac… #OpenAI #GPTLive #هوش_مصنوعی_صوتی #پردازش_زبان_طبیعی🆔 @asrgooyeshpardaz

