🎤 علیبابا از Qwen-Audio-3.0-TTS رونمایی کرد؛ مدل صوتی پیشرو با پوشش ۱۶ زبانآزمایشگاه تونگی علیباب…
انتشار: 2026/07/22 11:35 UTC
🎤 علیبابا از Qwen-Audio-3.0-TTS رونمایی کرد؛ مدل صوتی پیشرو با پوشش ۱۶ زبانآزمایشگاه تونگی علیبابا، مدل جدید تبدیل متن به گفتار (TTS) خود را با نام Qwen-Audio-3.0-TTS منتشر کرده است. این مدل در دو نسخه عرضه میشود: Flash برای تعامل بلادرنگ و Plus برای کیفیت فوقبالا. هر دو نسخه بهصورت میزبانیشده (Hosted) از طریق Alibaba Cloud Model Studio در دسترس هستند و وزن آنها منتشر نمیشود.---✨ دو نسخه، یک خانواده🔹 مدل Flash: تأخیر اولین بسته (First-Packet) در سطح ۳۰۰ میلیثانیه، مناسب برای تعاملات بلادرنگ 🔹 مدل Plus: کیفیت بالای تولید با تمرکز بر طبیعیبودن و وفاداری صدا، رتبهی اول در بنچمارک مستقل Artificial Analysis TTS---⚙️ معماری فنی و نوآوریها- رمزگذار گفتار با نرخ فریم پایین (۱۲.۵ هرتز): کاهش هزینهی رمزگشایی خودبازگشتی در عین حفظ اطلاعات محتوا و گوینده- پارادایم آموزش پیشروندهی پنجمرحلهای: هماهسازی مدل زبانی (LM) و تطبیق جریان (Flow Matching) برای بهبود طبیعیبودن، کیفیت ادراکی و استحکام- تولید یکبارهی طولانی: تا ۳ دقیقه محتوای صوتی بدون نیاز به برش- خروجی ۴۸ کیلوهرتز با کیفیت بالا---🌍 پوشش گستردهی زبانیاین مدل از ۱۶ زبان پشتیبانی میکند: عربی، چینی، انگلیسی، فرانسوی، آلمانی، اندونزیایی، ایتالیایی، ژاپنی، کرهای، مالایی، پرتغالی، روسی، اسپانیایی، تاگالوگ، تایلندی و ویتنامی. همچنین ۲۰ منطقهی گویشی چینی را پوشش میدهد.در آزمون قابلیت فهم (WER/CER)، این مدل در ۱۰ زبان از ۱۶ زبان بهترین عملکرد را داشته است:- مدل Flash: میانگین WER/CER ۳.۸۷٪- مدل Plus: میانگین WER/CER ۳.۹۶٪در آزمون شباهت گوینده، مدل Plus با میانگین ۸۲.۷۵ در همهی ۱۶ زبان رتبهی اول را کسب کرده است.---🎛️ کنترل دقیق با ۸۶ تگ درونخطیبرای کنترل دقیقتر، تیم پژوهشی ۸۶ تگ درونخطی را مستقیماً در متن هدف تعبیه کردهاند. این تگها امکان کنترل احساسات و رویدادهای غیرکلامی مانند خنده، نفسکشیدن، سرفه و آه را در سطح عبارت یا کلمه فراهم میکنند.مثال کاربردی: [excited]What a beautiful day today![laughing]Let's go out and have fun together!---🏆 جایگاه در بنچمارکهامدل Plus با امتیاز Elo حدود ۱۲۳۶ در صدر جدول Artificial Analysis Speech Arena قرار گرفته و با اختلافی اندک از Simba 3.2 (۱۲۳۴) و Gemini 3.1 Flash TTS (۱۲۱۴) پیشی گرفته است.مقایسهی سرعت و قیمت:- توان عملیاتی Plus: حدود ۱۶ کاراکتر در ثانیه- قیمت: حدود ۲۷.۵۹ دلار به ازای هر ۱ میلیون کاراکتر (حدود یکسوم قیمت ElevenLabs و MiniMax)---💡 واکنش جامعه و نکات کلیدی- استقبال اولیه مثبت بوده، بهویژه اینکه یک مدل غیرغربی در صدر جدول کیفیت قرار گرفته است.- محدودیتهای اصلی: فقط از طریق API در دسترس است، توان عملیاتی آن نسبت به رقبا پایینتر است و نام آن با مدل متنباز Qwen3-TTS همپوشانی دارد.---🔗 منابع: qwen.ai/https://artificialanalysis.ai/--- #تبدیل_متن_به_گفتار #هوش_مصنوعی #پردازش_گفتار #علی_بابا #پیشرفت_فناوری🆔 @asrgooyeshpardaz

