🗣️ انویدیا از NemotronLabs VoiceChat-11B رونمایی کرد؛ اولین مدل متنباز تمامدوپلکس با قابلیت فراخو…
انتشار: 2026/08/06 02:46 UTCدریافت: 2026/08/09 06:01 UTCآخرین مشاهده: 2026/08/09 06:01 UTC
🗣️ انویدیا از NemotronLabs VoiceChat-11B رونمایی کرد؛ اولین مدل متنباز تمامدوپلکس با قابلیت فراخوانی ابزارانویدیا مدل جدید خود را با نام NVIDIA NemotronLabs VoiceChat-11B معرفی کرده است. این یک مدل ۱۱ میلیارد پارامتری، همراه (End-to-End) و تمامدوپلکس (Full-Duplex) است که برای مکالمات صوتی بلادرنگ طراحی شده. برخلاف سیستمهای سنتی (ASR → LLM → TTS)، این مدل همهی کارها را در یک معماری واحد انجام میدهد و نیازی به چندین مدل یا انتقال بین APIها نیست.---✨ ویژگیهای کلیدی و برجسته🔹 اولین مدل متنباز تمامدوپلکس با قابلیت فراخوانی ابزار: این مدل میتواند در حین مکالمه، ابزارها را فراخوانی کرده و بدون قطع شدن جریان گفتگو، منتظر نتیجه بماند. برای هر ابزار، یک پیام «لطفاً منتظر بمانید» قابل تعریف است که بهمحض تصمیم مدل به فراخوانی ابزار، پخش میشود.🔹 تعامل طبیعی و روان: با تأخیر حدود ۴۵۰ میلیثانیه، مدل بهخوبی میتواند نوبتگیری، مکثها و قطع کردن (Barge-in) را مدیریت کند و تجربهای نزدیک به گفتگوی انسانی ارائه دهد.🔹 معماری یکپارچه و کارآمد: مدل از یک رمزگذار صوتی Fast Conformer، یک هستهی Nemotron Nano V2 9B و یک رمزگشای TTS استفاده میکند. یک خروجی جداگانه نیز برای اسکریپتهای فراخوانی ابزار در نظر گرفته شده است.---📊 عملکرد در بنچمارکها- بنچمارک VoiceBench: رتبهی ۲ در میان مدلهای تمامدوپلکس متنباز- بنچمارک Full-Duplex-Bench: رتبهی ۲ در میان مدلهای متنباز- زمان پاسخدهی: حدود ۴۵۰ میلیثانیه- مدیریت قطع مکالمه توسط کاربر: امتیاز عالی (نرخ موفقیت ۱ و زمان پاسخ ۴۸۰ میلیثانیه)عملکرد در فراخوانی ابزار (AU Harness BFCL-v3) :- دقت متوسط: ۵۶.۱٪- بهترین عملکرد در سناریوی Irrelevance (تشخیص بیربطی): ۸۹.۶٪- عملکرد رقابتی با مدلهای پیشرو در دقت انتخاب ابزار: ۸۲.۵٪---⚙️ مشخصات فنی و نصب- مجوز: OpenMDW License 1.1- معماری: ترکیبی از Mamba و Transformer (Hybrid)- حجم دادههای آموزشی: حدود ۵۵۰ هزار ساعت دادههای صوتی و متنی- پشتیبانی از سختافزار: A100، H100، H200، B100، B200 و RTX-6000- سیستمعامل: لینوکس- موتور اجرا: vLLM---💡 نکتهی کلیدیاین مدل با ترکیب هوش بالا و تأخیر پایین، یک نقطهی عطف در حوزهی دستیارهای صوتی متنباز محسوب میشود. قابلیت فراخوانی ابزار در یک مدل تمامدوپلکس، آن را برای ساخت دستیارهای صوتی هوشمند و کارآمد ایدهآل میسازد.---🔗 لینکهای مفید🤗 مدل در Hugging Face💻 کد و مستندات در گیتهاب--- #NVIDIA #هوش_مصنوعی_صوتی #مدل_تمام_دوپلکس #پردازش_گفتار #پیشرفت_فناوری🆔 @asrgooyeshpardaz

