🗣️ مجموعهی جامع مدلهای گفتگوی تمامدوپلکس؛ مرجعی برای پژوهشگران و توسعهدهندگانبا افزایش توجه به…
انتشار: 2026/08/06 17:27 UTCدریافت: 2026/08/09 06:01 UTCآخرین مشاهده: 2026/08/09 06:01 UTC
🗣️ مجموعهی جامع مدلهای گفتگوی تمامدوپلکس؛ مرجعی برای پژوهشگران و توسعهدهندگانبا افزایش توجه به تعاملات صوتی بلادرنگ با هوش مصنوعی، مدلهای گفتگوی تمامدوپلکس (Full-Duplex Spoken Dialogue Models) به یکی از داغترین موضوعات پژوهشی تبدیل شدهاند. این مدلها میتوانند همزمان گوش دهند و صحبت کنند و تجربهای نزدیک به گفتگوی انسانی ارائه دهند.یک مخزن عالی در گیتهاب به نام Awesome Full-Duplex SDM، مجموعهای از مدلها، بنچمارکها و مقالههای مرتبط با این حوزه را گردآوری کرده است که برای هر پژوهشگر یا توسعهدهندهای در این زمینه، یک منبع ارزشمند محسوب میشود.---🧩 انواع مدلها در این مخزنمدلهای تمامدوپلکس به چند دسته تقسیم میشوند:🔹 سرتاسری (End-to-End) : یک مدل واحد که ورودی صوتی را میگیرد و خروجی صوتی تولید میکند. رفتار تمامدوپلکس درون خود مدل آموخته میشود. برخی نسخههای (omni) نیز قابلیت پردازش تصویر را دارند.🔹 آبشاری (Cascaded) : سیستمی که از چندین جزء مجزا (تشخیص گفتار، مدل زبانی، تبدیل متن به گفتار و یک کنترلکنندهی تمامدوپلکس) ساخته شده است.🔹 جزئی (Component) : یک بخش خاص مثل تشخیص نوبت، VAD معنایی، TTS جریانی یا مدیریت دیالوگ که به یک سیستم میزبان نیاز دارد.🔹 روشی (Method) : یک دستورالعمل آموزشی، مدل پاداش یا طرح داده، نه یک سیستم قابل استقرار.🔹 چارچوب (Framework) : یک زیرساخت مهندسی برای ساخت یا سرویسدهی سیستمهای تمامدوپلکس.---📊 وضعیت دسترسی مدلهاهر مدل با یکی از برچسبهای زیر مشخص شده است:- کد + وزن: مخزن عمومی و چکپوینتهای منتشرشده- کد: مخزن عمومی، بدون چکپوینت- API/بسته: قابل استفاده بهعنوان محصول یا API- —: فقط مقاله یا گزارش فنی---🌟 برخی از مدلهای شاخص موجود در این مجموعه- DuplexOmni: مدل سرتاسری با قابلیت گوش دادن، دیدن، فکر کردن و صحبت کردن بهصورت همزمان- BayLing-Duplex: مدل سرتاسری مبتنی بر یک LLM خودبازگشتی- Lychee-FD: مدل سرتاسری با مدلسازی سلسلهمراتبی آکوستیک-معنایی- Moshi: مدل پایهای برای گفتگوی بلادرنگ (منبعباز)- Mini-Omni2: مدل سرتاسری با قابلیت دیداری، گفتاری و تمامدوپلکس- Seeduplex: مدل سرتاسری از بایتدنس (دسترسی از طریق API)- Qwen3.5-Omni: مدل سرتاسری از علیبابا (دسترسی از طریق API)---📚 بنچمارکهای ارزیابیاین مخزن شامل بنچمارکهای معتبری برای سنجش عملکرد مدلهای تمامدوپلکس است:- Full-Duplex-Bench (نسخههای ۱.۵، ۲ و ۳): ارزیابی قابلیتهای نوبتگیری، مدیریت همپوشانی و استفاده از ابزار- Game-Time: ارزیابی دینامیک زمانی در مدلهای گفتاری- Semantic-Aware Interruption Detection: تشخیص قطع مکالمه با آگاهی معنایی- Talking Turns: ارزیابی مدلهای پایهی صوتی در نوبتگیری---📄 مقالههای مروری- A Survey of Full-Duplex Spoken Dialogue Systems (۲۰۲۶): بررسی جامع معماریها، هستیشناسی تعامل و ماشین حالت تصمیمگیری- From Turn-Taking to Synchronous Dialogue (۲۰۲۵): مروری بر تحول مدلهای گفتاری تمامدوپلکس---💡 چرا این مخزن مهم است؟با افزایش علاقه به دستیارهای صوتی بلادرنگ و تعاملات طبیعی، مدلهای تمامدوپلکس به یکی از حوزههای کلیدی هوش مصنوعی تبدیل شدهاند. این مخزن یک نقطهی شروع عالی برای:- پژوهشگرانی که بهدنبال جدیدترین مقالات و مدلها هستند- توسعهدهندگانی که میخواهند سیستمهای گفتگوی تمامدوپلکس بسازند- افرادی که بهدنبال بنچمارکهای استاندارد برای ارزیابی مدلهای خود هستند---🔗 لینک مخزن در گیتهاب: github.com/Ruiqi-Yan/Awesome-Full-Duplex-… #تمام_دوپلکس #گفتگوی_صوتی #پردازش_گفتار #پژوهش_هوش_مصنوعی #منبع_باز🆔 @asrgooyeshpardaz

