⚠️ داستان واقعی یاغی شدن هوش مصنوعی از زبان یحیی طباطبایی!از آزمایشهای امنیتی شرکتهای بزرگ تا یک…
انتشار: 2026/08/15 20:47 UTCدریافت: 2026/08/17 18:26 UTCآخرین مشاهده: 2026/08/17 18:26 UTC
⚠️ داستان واقعی یاغی شدن هوش مصنوعی از زبان یحیی طباطبایی!از آزمایشهای امنیتی شرکتهای بزرگ تا یک اتفاق عجیب در زندگی روزمره که نشون میده یک عامل هوش مصنوعی چطور برای انجام مأموریتش، تصمیماتی میگیره که برای ما انسانها غیرقابل قبوله.آیا هوش مصنوعی روزی از کنترل خارج میشه؟این ویدیو رو از دست ندید! 👇🎞youtube.com/watch?v=-sIjeXdoCxU%F0%9F%86%… @asrgooyeshpardaz
پستهای تلگرام — عصر گویش | هوش مصنوعی
❇️ مدل dots.tts بهطور کامل متنباز شدتیم Dots Studio از پلتفرم RedNote، مدل dots.tts را بهصورت کامل متنباز منتشر کرده است. این یک مدل ۲ میلیارد پارامتری، کاملاً پیوسته و خودبازگشتی برای تبدیل متن به گفتار (TTS) است.برخلاف سیستمهای رایج که از توکنهای صوتی گسسته استفاده میکنند، dots.tts گفتار را مستقیماً در یک فضای پیوستهی نهان مدلسازی میکند. این رویکرد امکان شبیهسازی صدای بدون نیاز به نمونههای زیاد، تولید گفتار چندزبانه، خروجیهای رسا و پخش جریانی بلادرنگ را فراهم میکند.---🌟 ویژگیهای برجسته:🔹 معماری کاملاً پیوسته: این مدل با ترکیب AudioVAE (با کیفیت ۴۸ کیلوهرتز)، رمزگذار معنایی، یک مدل زبانی بزرگ (LLM) و یک سر آکوستیک مبتنی بر تطبیق جریان خودبازگشتی، گفتار را بهصورت پچهای پیوسته تولید میکند و توکنهای گسسته را حذف میکند.🔹 ثبات در بازههای طولانی: با استفاده از شرطیسازی بر کل تاریخچه، مدل انحراف (Drift) را در تولید خودبازگشتی کاهش میدهد و کیفیت را در خروجیهای طولانی حفظ میکند.🔹 پخش جریانی با تأخیر بسیار کم: فناوری MeanFlow باعث شده که مدل فقط با ۲ تا ۴ مرحله ارزیابی، تأخیر اولین بسته را به ۸۵ میلیثانیه (در حالت خروجی جریانی) و ۵۴ میلیثانیه (در حالت پخش دوگانه) برساند که برای مکالمات بلادرنگ عالی است.🔹 شبیهسازی قوی صدا و چندزبانه: مدل روی ۱.۵ میلیون ساعت دادهی چندزبانه آموزش دیده و در ۲۴ زبان ارزیابی شده است.---🏆 عملکرد پیشرو در بنچمارکهامدل dots.tts در بنچمارک معروف Seed-TTS-Eval بهترین عملکرد متوسط را داشته است. روی دادههای آزمایشی چینی، نرخ خطای کلمه ۰.۹۴٪ و شباهت گوینده ۸۱.۰، روی دادههای انگلیسی نرخ خطای کلمه ۱.۳۰٪ و شباهت گوینده ۷۷.۱، و روی دادههای سخت چینی نرخ خطای کلمه ۶.۶۰٪ و شباهت گوینده ۷۹.۵ ثبت شده است. همچنین در بنچمارک چندزبانهی MiniMax، بالاترین میانگین شباهت گوینده (۸۳.۹) را کسب کرده است.---🚀 دسترسی و نصباین پروژه با مجوز Apache 2.0 منتشر شده و شامل چکپوینتهای از پیشآموزشدیده، پسآموزشدیده و تقطیرشده، بههمراه کدهای آموزش، استنتاج و تنظیم دقیق است.لینکهای مفید:- 💻 گیتهاب:github.com/studio-dots-ai/dots.tts- 🤗 مدلها در Hugging Face:huggingface.co/collections/dots-studio/do… 🎧 دموی آنلاین:studio-dots-ai.github.io/dots.tts-demo/- 📄 مقاله:arxiv.org/abs/2606.07080--- #dots.tts #تبدیل_متن_به_گفتار #هوش_مصنوعی #پردازش_گفتار🆔 @asrgooyeshpardaz
🚀 کرسر از Origin رونمایی کرد؛ رقیب جدید گیتهاب با تمرکز بر عاملهای هوش مصنوعیکرسر (Cursor)، محیط توسعه محبوب برنامهنویسی مبتنی بر هوش مصنوعی، از سرویس میزبانی کد جدید خود به نام Origin رونمایی کرده است. هدف اصلی Origin، تبدیل شدن به گیتهاب برای عاملهای هوش مصنوعی است.---🔍 تفاوت اصلی با گیتهاب چیست؟گیتهاب برای سرعت و جریان کار انسانی طراحی شده: یک توسعهدهنده، یک شاخه، و چند درخواست کشش (PR) در روز. اما عاملهای هوش مصنوعی با سرعت بسیار بالاتری کد مینویسند و کامیت میزنند. برای نمونه، Cursor نشان داده که Origin میتواند ۲۲.۶ کامیت در ثانیه را در یک مخزن پردازش کند! این تفاوت اصلی است که Origin را از گیتهاب متمایز میکند.---✨ قابلیتهای کلیدی Origin🔹 ساخت مخزن از صفر یا همگامسازی با گیتهاب: میتوانید مخازن جدید ایجاد کرده یا مخازن موجود گیتهاب را در کمتر از یک دقیقه همگامسازی کنید.🔹 مدیریت PRها: مشاهده، بررسی و ادغام درخواستهای کشش با قابلیت همگامسازی دوطرفه با گیتهاب (نظرات و واکنشها در هر دو طرف دیده میشوند).🔹 یکپارچهسازی هوش مصنوعی: عاملهای کدنویسی Cursor مستقیماً در محیط Origin کار میکنند. میتوانید از هوش مصنوعی دربارهی کد سؤال کنید، آن را تغییر دهد، PRها را بهروز کند یا شاخهها را تغییر دهد.🔹 اکوسیستم یکپارچهسازی: اتصال به Vercel برای استقرار پیشنمایش خودکار هر PR، و همچنین یکپارچهسازی با ابزارهای CI/CD مثل Depot و Buildkite.---⚡️ حالت انتشارسرویس Origin در حال حاضر بهصورت بتای اولیه برای کاربران پلنهای پولی در دسترس است. ویژگیهای پیشرفتهتر مخصوص عاملها بهزودی اضافه خواهند شد.---🔗 اطلاعات بیشتر: cursor.com/changelog/origin-code-hosting-… #Cursor #Origin #توسعه_نرمافزار #عامل_هوشمند🆔 @asrgooyeshpardaz
🔍 مدل GLM 5.3 در ۲۶۹ پروژه متنباز، ۲۴۳۶ آسیبپذیری اصلاحنشده کشف کرد!پروژهی Project Glasswing (Mythos) که برای یافتن باگها طراحی شده بود، بهتازگی توسط مدل جدید GLM 5.3 بهچالش کشیده شد. نتیجه؟ یک کشف عظیم و هشداردهنده! 🚨---📊 آمار و ارقام کلیدی:🔹 ۱۰۹۷ آسیبپذیری با درجهی بحرانی و بالا 🚨🔹 میانگین سن باگها: ۲۶ سال (قدیمیترین آنها مربوط به ۱۹۸۱، یعنی ۴۵ سال پیش است!) 📅🔹 ۲۳۸۳ مورد از این آسیبپذیریها هنوز عمومی نشدهاند 🤫🔹 این باگها در ۲۶۹ پروژهی متنباز مختلف پیدا شدهاند---🚨 چرا این خبر مهم است؟این آسیبپذیریهای «بسیار قدیمی» احتمالاً سالهاست که توسط آژانسهای اطلاعاتی و هکرها شناسایی و مخفیانه استفاده میشدهاند. وجود چنین باگهایی با قدمت چندین دهه، نشاندهندهی شکاف عمیق در امنیت نرمافزارهای متنباز است.مدل GLM 5.3 نشان داده که قدرت تحلیلی مدلهای جدید، میتواند حفرههای امنیتی را با سرعت و دقتی بیسابقه کشف کند؛ چیزی که شاید سالها از چشم پروژههای انسانی پنهان مانده بود.---🔗 منبع و اطلاعات بیشتر: cvd.z.ai/--- #امنیت_سایبری #آسیبپذیری #متنباز #پژوهش_امنیت🆔 @asrgooyeshpardaz
🎵 معرفی MiniMax Music 3؛ مدل متنباز تولید موسیقی با آوازشرکت MiniMax وزنهای مدل جدید خود را برای تولید موسیقی منتشر کرده است. این مدل میتواند قطعات کامل تا ۵ دقیقه با کیفیت ۳۲ کیلوهرتز استریو و فرمت ۱۶-bit WAV تولید کند. 🎶---🧩 نحوهی کار با مدلورودی مدل شامل دو بخش اصلی است:- متن آهنگ (با تگهایی مثل [Chorus] یا [Solo])- توضیحات موسیقی (ژانر، سرعت، گام، نوع آکورد و...)اگر حوصلهی نوشتن دستی ندارید، میتوانید از یک ابزار کمکی به نام music-caption-rewriter استفاده کنید تا پرامپت شما را بهینهسازی کند.---⚙️ معماری فنی در دو سطحسطح اول: مدل جهانی (Global LLM)- یک مدل Qwen3-8B که برای درک ساختار کلی موسیقی تنظیم شده است.- این مدل، چارچوب اصلی آهنگ را طراحی میکند و قدمبهقدم، اولین کتابکد صوتی (از ۱۶,۳۸۴ رمز) را پیشبینی میکند.سطح دوم: مدل محلی (Local LLM)- یک مدل ۰.۶ میلیارد پارامتری که در هر مرحله، ۷ کتابکد صوتی دیگر را برای جزئیات دقیق صدا تولید میکند.برخلاف روشهای معمول که صدا را مستقیماً از توکنهای گسسته کد میکنند، این مدل از روشی جدید استفاده میکند: ادغام حالات پنهان هر دو مدل و سپس عبور دادن آنها از یک زنجیرهی تولید شامل Flow Matching، Flow-VAE و در نهایت رمزگشا برای خروجی نهایی با کیفیت بالا.---💻 دسترسی و سختافزار موردنیاز- اجرا با SGLang، HuggingFace Diffusers و ComfyUI- نسخه کامل: ۲۴ گیگابایت VRAM- با فعالسازی CPU offloading: حدود ۲۲ گیگابایت- با استریمینگ لایهبهلایه: روی کارتهای ۸ گیگابایت هم اجرا میشود (اما کندتر)---⚠️ محدودیتها🔸 پشتیبانی ندارد از تولید جریانی (Streaming) – فقط خروجی کامل🔸 حداکثر طول پرامپت: ۵,۰۰۰ توکن🔸 حداکثر طول خروجی: ۹,۰۰۰ فریم صوتی (حدود ۵ دقیقه)---📌 مجوز: MiniMax-Music3 Community License---🔗 لینکهای مفید🔹 صفحهی پروژه🔹 وزنهای مدل🔹 دموی آنلاین🔹 گیتهاب--- #MiniMax #موسیقی_با_هوش_مصنوعی #تولید_موسیقی #پیشرفت_فناوری🆔 @asrgooyeshpardaz
🎵 مدل MiDashengLM-Gen: تولید صحنههای صوتی یکپارچه با ترکیب LLM و تطبیق جریانمحققان شیائومی مدلی به نام MiDashengLM-Gen معرفی کردهاند که میتواند صحنههای صوتی ترکیبی شامل گفتار، موسیقی، افکتهای صوتی و فضای محیطی را بهصورت همزمان و منسجم تولید کند. این مدل برخلاف رویکردهای قبلی که از چندین پاییپلاین جداگانه استفاده میکردند، همهچیز را در یک فریمورک یکپارچه انجام میدهد.---✨ ویژگیهای برجسته🔹 تولید خودبازگشتی با تطبیق جریان در سطح توکن: ترکیبی از مدلسازی دنبالهای LLM و تولید مبتنی بر جریان، با قابلیت تولید طول متغیر از طریق یک سر توقف یادگیرنده🔹 تولید بردارهای صوتی ۷۶۸ بعدی با فرکانس ۲۵ هرتز شرطشده بر وضعیتهای پنهان LLM، بدون افت کیفیت ناشی از کوانتیزاسیون🔹 پیشآموزش همترازی متن-صدا برای پر کردن شکاف بین دو مدالیته🔹 قابلیت گفتار با کیفیت بالا همراه با تولید صحنههای صوتی ترکیبی، و پشتیبانی از ۹ زبان با کنترل احساسات---⚙️ معماری فنیاین مدل از سه جزء اصلی تشکیل شده است:- رمزگشای صوتی (DashengTokenizer): بردارهای ۷۶۸ بعدی با نرخ ۲۵ هرتز تولید میکند که توسط یک پروژکتور صوتی به نرخ ۵ هرتز کاهش مییابد.- ستون فقرات LLM (Qwen3-1.7B): بهطور کامل تنظیم دقیق (Fine-Tune) شده است.- شبکه تطبیق جریان (DiT 16 لایه): با ابعاد پنهان ۲۰۴۸، ۸ هد و نسبت MLP 4.0در زمان استنتاج، از حلگر ODE اویلر با ۱۰ گام و راهنمایی بدون طبقهبندی (CFG) با مقیاس ۲.۰ استفاده میشود. خروجی نهایی، فایل صوتی مونو با کیفیت ۱۶ کیلوهرتز است.---📊 عملکرد چشمگیر در بنچمارکهاکیفیت گفتار (Seed-TTS):- نرخ خطای کلمه (WER) انگلیسی از ۱۲.۱۵٪ به ۲.۷۹٪ کاهش یافته که به عملکرد سیستمهای تخصصی تبدیل متن به گفتار (TTS) با نرخ خطای ۱.۲۴٪ بسیار نزدیک شده است.کیفیت صحنههای صوتی ترکیبی (MECAT):- مدل عملکردی رقابتی با روشهای پیشین در تولید صحنههای ترکیبی دارد.پشتیبانی چندزبانه:- مدل در ۹ زبان عملکرد رقابتی با سیستمهای پایه از خود نشان داده است.---📝 نحوهی استفادهورودی مدل، یک توضیح ساختاریافته با استفاده از توکنهای ویژه است:مثال ورودی:<|caption|> یک کمدین در حال اجرای طنز با صدای خنده جمعیت و موسیقی جاز<|asr|> و به همین دلیل است که من هرگز چمدان ارزان نمیخرم!<|speech|> صدای مرد کمدین با لحن رسا<|music|> ضربهی ناگهانی گروه جاز<|sfx|> صدای خندهی جمعیت<|env|> محیط صمیمی کلوپ کمدیبرای هر بخشی که وجود ندارد، از <|unknown|> استفاده کنید.---🔧 نصب و راهاندازی سریعpip install torch torchaudio "transformers>=4.51" einops safetensors soundfile tqdm numpy x-transformers```pythonfrom transformers import AutoModelimport soundfile as sfmodel = AutoModel.from_pretrained("mispeech/midashenglm-gen", trust_remote_code=True)model = model.cuda()result = model.generate("...") # متن ورودیsf.write("output.wav", result["audio"], result["sample_rate"])`---🔗 لینکهای مفید📄 مقاله:arxiv.org/abs/2608.11804%F0%9F%92%BB کد منبع:github.com/xiaomi-research/midashenglm-ge… مدل در Hugging Face:huggingface.co/mispeech/midashenglm-gen%F… صفحهی دمو:xiaomi-research.github.io/midashenglm-gen… #پردازش_صدا #تولید_صدا #پژوهش_هوش_مصنوعی #شیائومی🆔 @asrgooyeshpardaz
👂 معرفی AgenticASR: تشخیص گفتار با قابلیت اصلاح تعاملی و سنجش معناییتشخیص گفتار معمولاً یک فرایند یکباره است، اما در دنیای واقعی انسانها با پرسش و اصلاح، خطاها را برطرف میکنند. مقالهی جدید AgenticASR این روش را به تشخیص گفتار آورده و آن را به یک فرایند چندمرحلهای و تعاملی تبدیل کرده است.---🎯 مشکل کجاست؟🔹 معیار اشتباه: نرخ خطای کلمه (WER) همه کلمات را یکسان میبیند، در حالی که یک اشتباه در اسم یا عدد، بسیار مهمتر از یک حرف بیربط است.🔹 عدم تعامل: سیستمهای فعلی اجازهی اصلاح خطا را در حین کار نمیدهند.---🔄 راهحل AgenticASRتشخیص گفتار بهعنوان یک چرخهی تعاملی طراحی شده:🔹 مرحلهی اول: مدل ASR متن اولیه را تولید میکند.🔹 مرحلهی اصلاح: یک عامل نقش کاربر را بازی کرده و بازخورد انسانی (مثلاً «نه، اسم Megan است») را شبیهسازی میکند.🔹 مرحلهی بازنویسی: عامل دیگر، متن تشخیصدادهشده را بر اساس بازخورد ویرایش میکند.🔹 تکرار: این چرخه تا رسیدن به دقت مطلوب ادامه مییابد.---📊 معیار جدید S²ER بهجای WERاین معیار با استفاده از LLM-as-a-Judge، خطاها را بر اساس تأثیر بر معنی جمله میسنجد. نتایج نشان میدهد با هر دور اصلاح، خطاهای معنایی بهشدت کاهش مییابند.دستاوردهای عددی در بنچمارکهای مختلف:پس از ۱۰ دور اصلاح، نرخ خطای معنایی در بنچمارک GigaSpeech (انگلیسی) از حدود ۲۱.۵ درصد به کمتر از ۳.۵ درصد کاهش یافته است. در بنچمارک WenetSpeech (چینی) این مقدار از حدود ۱۹.۵ درصد به ۱.۸ درصد رسیده است. برای دادههای اسمخاص، خطا از ۱۷ تا ۲۰ درصد به حدود ۲ درصد کاهش پیدا کرده و در سناریوی کد-سوییچینگ (ترکیب زبانها)، خطا از ۲۸.۶ درصد به ۱.۴ درصد رسیده است. بهطور میانگین، هر دور اصلاح، خطاهای معنایی را بیش از ۵۰ درصد کاهش میدهد.---💡 اهمیت موضوع- این روش، تشخیص گفتار را به یک گفتگوی تعاملی تبدیل میکند.- خطاهای معنایی را که در WER سنتی پنهان میمانند، شناسایی و اصلاح میکند.- زمینهساز نسل جدیدی از دستیارهای صوتی هوشمند و قابلاعتماد است.---🔗 لینکهای مفید📄 مقاله:arxiv.org/abs/2604.09121%F0%9F%92%BB کد منبع:github.com/InteractiveASR/AgenticASR--- #پردازش_گفتار #بازشناسی_گفتار #عامل_هوشمند #پژوهش_هوش_مصنوعی🆔 @asrgooyeshpardaz