🎵 مدل MiDashengLM-Gen: تولید صحنههای صوتی یکپارچه با ترکیب LLM و تطبیق جریانمحققان شیائومی مدلی به…
انتشار: 2026/08/16 18:55 UTCدریافت: 2026/08/17 18:26 UTCآخرین مشاهده: 2026/08/17 18:26 UTC
🎵 مدل MiDashengLM-Gen: تولید صحنههای صوتی یکپارچه با ترکیب LLM و تطبیق جریانمحققان شیائومی مدلی به نام MiDashengLM-Gen معرفی کردهاند که میتواند صحنههای صوتی ترکیبی شامل گفتار، موسیقی، افکتهای صوتی و فضای محیطی را بهصورت همزمان و منسجم تولید کند. این مدل برخلاف رویکردهای قبلی که از چندین پاییپلاین جداگانه استفاده میکردند، همهچیز را در یک فریمورک یکپارچه انجام میدهد.---✨ ویژگیهای برجسته🔹 تولید خودبازگشتی با تطبیق جریان در سطح توکن: ترکیبی از مدلسازی دنبالهای LLM و تولید مبتنی بر جریان، با قابلیت تولید طول متغیر از طریق یک سر توقف یادگیرنده🔹 تولید بردارهای صوتی ۷۶۸ بعدی با فرکانس ۲۵ هرتز شرطشده بر وضعیتهای پنهان LLM، بدون افت کیفیت ناشی از کوانتیزاسیون🔹 پیشآموزش همترازی متن-صدا برای پر کردن شکاف بین دو مدالیته🔹 قابلیت گفتار با کیفیت بالا همراه با تولید صحنههای صوتی ترکیبی، و پشتیبانی از ۹ زبان با کنترل احساسات---⚙️ معماری فنیاین مدل از سه جزء اصلی تشکیل شده است:- رمزگشای صوتی (DashengTokenizer): بردارهای ۷۶۸ بعدی با نرخ ۲۵ هرتز تولید میکند که توسط یک پروژکتور صوتی به نرخ ۵ هرتز کاهش مییابد.- ستون فقرات LLM (Qwen3-1.7B): بهطور کامل تنظیم دقیق (Fine-Tune) شده است.- شبکه تطبیق جریان (DiT 16 لایه): با ابعاد پنهان ۲۰۴۸، ۸ هد و نسبت MLP 4.0در زمان استنتاج، از حلگر ODE اویلر با ۱۰ گام و راهنمایی بدون طبقهبندی (CFG) با مقیاس ۲.۰ استفاده میشود. خروجی نهایی، فایل صوتی مونو با کیفیت ۱۶ کیلوهرتز است.---📊 عملکرد چشمگیر در بنچمارکهاکیفیت گفتار (Seed-TTS):- نرخ خطای کلمه (WER) انگلیسی از ۱۲.۱۵٪ به ۲.۷۹٪ کاهش یافته که به عملکرد سیستمهای تخصصی تبدیل متن به گفتار (TTS) با نرخ خطای ۱.۲۴٪ بسیار نزدیک شده است.کیفیت صحنههای صوتی ترکیبی (MECAT):- مدل عملکردی رقابتی با روشهای پیشین در تولید صحنههای ترکیبی دارد.پشتیبانی چندزبانه:- مدل در ۹ زبان عملکرد رقابتی با سیستمهای پایه از خود نشان داده است.---📝 نحوهی استفادهورودی مدل، یک توضیح ساختاریافته با استفاده از توکنهای ویژه است:مثال ورودی:<|caption|> یک کمدین در حال اجرای طنز با صدای خنده جمعیت و موسیقی جاز<|asr|> و به همین دلیل است که من هرگز چمدان ارزان نمیخرم!<|speech|> صدای مرد کمدین با لحن رسا<|music|> ضربهی ناگهانی گروه جاز<|sfx|> صدای خندهی جمعیت<|env|> محیط صمیمی کلوپ کمدیبرای هر بخشی که وجود ندارد، از <|unknown|> استفاده کنید.---🔧 نصب و راهاندازی سریعpip install torch torchaudio "transformers>=4.51" einops safetensors soundfile tqdm numpy x-transformers```pythonfrom transformers import AutoModelimport soundfile as sfmodel = AutoModel.from_pretrained("mispeech/midashenglm-gen", trust_remote_code=True)model = model.cuda()result = model.generate("...") # متن ورودیsf.write("output.wav", result["audio"], result["sample_rate"])`---🔗 لینکهای مفید📄 مقاله:arxiv.org/abs/2608.11804%F0%9F%92%BB کد منبع:github.com/xiaomi-research/midashenglm-ge… مدل در Hugging Face:huggingface.co/mispeech/midashenglm-gen%F… صفحهی دمو:xiaomi-research.github.io/midashenglm-gen… #پردازش_صدا #تولید_صدا #پژوهش_هوش_مصنوعی #شیائومی🆔 @asrgooyeshpardaz