یه خبر فوقالعاده برای کسایی که میخوان voice agent بسازن. Hugging Face یه ریپوی رسمی منتشر کرده که…
انتشار: 2026/07/24 13:52 UTCدریافت: 2026/08/01 00:02 UTCآخرین مشاهده: 2026/08/01 00:02 UTC
یه خبر فوقالعاده برای کسایی که میخوان voice agent بسازن. Hugging Face یه ریپوی رسمی منتشر کرده که کل پایپلاین گفتگوی صوتی رو بهصورت محلی و open source در اختیارت میذاره. این پروژه یه پایپلاین ماژولار ارائه میده که از چهار مرحله اصلی تشکیل شده: VAD → STT → LLM → TTSتوضیح مراحل کارVAD: Voice Activity Detectionتشخیص فعالیت صوتی — کی کاربر داره حرف میزنهSTT :Speech-to-Textتبدیل گفتار به متنLLM : Large Language Modelمغز متفکر agentTTS: Text-to-Speechتبدیل پاسخ متنی به گفتارراه اندازی:pip install speech-to-speechspeech-to-speechبعد از اجرا، سرور بالا میاد و بهطور پیشفرض از این تنظیمات استفاده میکنه:Parakeet TDT برای تشخیص گفتارQwen3-TTS برای تولید گفتار🔗 لینک پروژهبا این استک میتونی پروژههای جالبی بسازی:۱. دستیار صوتی خانگی بدون ارسال داده به ابر۲. ربات پشتیبانی مشتری که مکالمه واقعی داره۳. اپلیکیشن آموزش زبان با مکالمه طبیعی۴. کنترل صوتی ابزارها با tool calling۵. ربات فیزیکی مثل Reachy Mini که حرف میزنه و گوش میده📍 @Ai_Tv
پستهای تلگرام — هوش مصنوعی |یادگیری ماشین| علم داده
🔥 گزیدهای از مهمترین خبرهای AI این روزها؛✅ ChatGPT بالاخره اومد رو لینوکس!OpenAI نسخه پیشنمایش اپلیکیشن دسکتاپ ChatGPT رو برای لینوکس منتشر کرد. این کلاینت، چت معمولی، Work و Codex رو تو یه پنجره جمع کرده.بستههای .deb و .rpm برای x64 و ARM64 موجوده. پشتیبانی رسمی شامل Ubuntu 24.04 و 26.04 LTS، Debian 13، Fedora 43 و 44 میشه.کاربرایی که توزیعهای دیگه دارن، تا تموم شدن دوره پیشنمایش، باید مثل قبل از مرورگر استفاده کنن یا سراغ نسخههای غیررسمی برن.🔗 x.com/OpenAI/status/2087231350134980830؛✅ Gemini به یه میلیارد کاربر ماهانه رسید!مدیرعامل شرکت، ساندار پیچای، گفت Gemini سریعترین محصول در حال رشد تاریخ گوگل و چهاردهمین سرویس این شرکته که از مرز یه میلیارد کاربر رد شده.بهمن ۷۵۰ میلیون نفر بودن، اردیبهشت ۹۰۰ میلیون، تیر ۹۵۰ میلیون. اون ۵۰ میلیون آخری فقط تو یه ماه اومدن. روی iOS هم تعداد کاربرا از ۱۰۰ میلیون گذشته.۶۳٪ کاربرا با Gemini بهصورت صوتی صحبت میکنن. تو حالت Gemini Live، از هر ۵ درخواست، یکی با دوربین یا اشتراک صفحه انجام میشه. بچههای مدرسهای هم به ۳۸٪ درخواستهاشون فایل ضمیمه میکنن. هر روز بیشتر از ۱۵۰ میلیون تصویر توسط Gemini ساخته میشه.🔗 blog.google/innovation-and-ai/products/gemini-app/one-billion-monthly-users/؛✅ Microsoft مدل MAI-Code-1.1-Flash رو برای GitHub Copilot منتشر کرد!مدل زبانی جدید، چهار برابر از نسخه ژوئن ارزونتره. ۲۵٪ توکن کمتری برای هر تسک مصرف میکنه و نرخ ماندگاری کد (یعنی چقدرش تو پروژه باقی میمونه) ۴٪ بالاتر رفته.تو تستها، MAI-Code-1.1-Flash هم نسخه قبلی خودش رو شکست میده و هم Haiku 4.5 و GPT-5.4 mini رو، ولی از DeepSeek-V4-Flash هم تو امتیاز و هم تو قیمت تولید عقبتره. مقایسه با DeepSeek رو مایکروسافت فقط توی گزارش فنی گذاشته و به بیانیه مطبوعاتی راه نداده.مایکروسافت همچنان داره مدلهای داخلیشو جایگزین مدلهای خارجی میکنه. خانواده MAI داره کمکم به گزینه پیشفرض تو سرویسهای AI این شرکت تبدیل میشه.🔗 microsoft.ai/news/mai-code-1-1-flash-br-better-faster-at-a-quarter-of-the-cost/؛✅ Alibaba مدلی منتشر کرد که شخصیتها رو همزمان انیمیت میکنه!تیم Tongyi Lab مدلهای Wan-Animate-2 رو منتشر کرد. این مدل، حرکت رو از یه ویدیو میگیره و به یه شخصیت منتقل میکنه، بعد یه صحنه آماده از زوایای مختلف میسازه. با نسبتهای بدنی غیرعادی و هر نسبت تصویری کنار میاد.از پایپلاین حذف شده: ریگ کردن اسکلتی، تخمین پوز و فشردهسازی ویژگیهای حرکت. حالا خود مدل حرکت رو به بدن شخصیت ربط میده. به گفته Alibaba، کیفیتش از Kling و Dreamina کمتر نیست.مدلها روی Hugging Face و ModelScope در دسترسه. یه نسخه Wan-Animate-2-Lite هم برای آواتارهای دیجیتال و پخش زنده منتشر شده.برای ویدیوهای 720p به هشت شتابدهنده A800 نیاز دارید. نسخه Lite روی چهار تا H100 میتونه ۲۴ فریم بر ثانیه با رزولوشن ۴۰۰×۷۲۰ تولید کنه.🔗 x.com/Alibaba_Wan/status/2087005664174657566؛✅ Mistral پلتفرمش رو به روی مدلهای دیگه هم باز میکنه!این استارتاپ فرانسوی شروع کرده به میزبانی از مدلهای شرکتهای دیگه روی سرورهای خودش. اولین مدل، GLM-5.2 هست که روی زیرساخت Mistral با همون تضمینهای ذخیرهسازی داده و کنترل محلی که محصولات خودش دارن، راهاندازی شده.در کنار این، شرکت نقاط انتهایی منطقهای تو اروپا یا آمریکا رو هم برای استفاده عمومی عرضه کرده و یه تعرفه اولویتدار با تضمین دسترسپذیری راهاندازی کرده.تعریف Mistral از AI حاکمیتی حالا فقط کنترل روی سرورها و قوانین پردازش دادهست، نه لزوماً آموزش مدل از صفر.محققهای مستقل قبلاً فهمیده بودن که معماری پرچمدار Mistral Large 3 شبیه DeepSeek V3 هست. تو فضای مجازی شوخی میکنن که اروپا دیگه لازم نیست مدلهای آسیایی رو بستهبندی مجدد کنه، فقط کافیه بهشون سرور بده.🔗 mistral.ai/news/regional-inference-open-models-new-compute/#هوش_مصنوعی #Ai🆔 @Ai_Tv
🤖 اندرو نگ یه دستیار AI ساخته که خودش همه کار میکنه!اندرو نگ، یه همکار دیجیتال متنباز برای دسکتاپ منتشر کرده به اسم OpenWorker. ولی این یه AI معمولی نیست که بشینی باهاش چت کنی.این ابزار میتونه بین فایلها، تقویم، گیتهاب و کلی ابزار دیگه بچرخه و در نهایت یه خروجی آماده، چه گزارش باشه چه فایل چه جواب نهایی، تحویلت بده. بدون اینکه هر مرحله رو دستی بهش بگی.و بهترین قسمتش؟ کاملاً رایگانه و دستت تو انتخاب مدل بازه. میخوای با OpenAI کار کنی؟ باشه. Claude؟ اوکیه. DeepSeek؟ Qwen؟ هر کدوم رو بخوای. حتی میتونی کاملاً آفلاین و لوکال با Ollama ازش استفاده کنی.🔗 OpenWorker🆔 @Ai_Tv
✍️ معرفی ۴ منبع خوب برای یادگیری LLMها 👨🏻💻 اگه نمیخوای فقط چند تا نکته سطحی از LLM بلد باشی و میخوای واقعاً به مدلهای زبانی بزرگ مسلط بشی، حتماً این منابع رو بوکمارک کن!1️⃣ ریپوی یادگیری پروژهمحور LLM از مفاهیم پایه مثل توکن و امبدینگ شروع میکنه و تا معماری ترنسفورمرها میره. کلی پروژه عملی هم داره: از طبقهبندی متن و خوشهبندی گرفته تا مهندسی پرامپت.2️⃣ ریپوی LLM Course یه دوره آموزشی سهبخشی: مبانی LLM، دانشمند LLM و مهندس LLM. از صفر تا ساخت و دیپلوی کردن LLM رو پوشش میده.3️⃣ ریپوی هندبوک هوش مصنوعی مولد یه ریپوی دستهبندیشده که همه ویدیوها و بلاگهای معتبر درباره LLM و مدلهای مولد رو یهجا جمع کرده.4️⃣ کتاب صد صفحهای مدلهای زبانی روایتی از سیر تکامل LLMها به همراه تمرینهای مهندسی پرامپت و فاینتیونینگ، پر از فرمول و کد پایتون.🆔 @Ai_Tv
💢 ۶۰۰ آموزش ۱۱۹ هزار تومنی ➕ ۸۰٪ تخفیف برای سایر آموزشهای فرادرس ✔️ در این طرح یادگیری، ۶۰۰ آموزش منتخب با قیمت ۱۱۹,۰۰۰ تومن در دسترس شماست و علاوه بر آن، سایر آموزشها با ۸۰ درصد تخفیف قابل دریافت است. 👇 دسترسی آسان به منابع آموزشی 👇 🔗 [آموزشهای هوش مصنوعی] 🔗 [تمامی آموزشهای ۱۱۹ هزار تومنی] برای مشاهده سایر آموزشها و استفاده از تخفیف ۸۰ درصدی، روی لینک زیر کلیک کنید: 🔗 [مشاهده سایر آموزشها]🔄 FaraDars - فرادرس
✨یه ابزار باحال و رایگان برای تحقیق روی فایلهای شخصی تا حالا شده یه پوشه پر از PDF و داکیومنت داشته باشی و بخوای بینشون دنبال یه موضوع خاص بگردی؟ معمولاً این کار وقتگیر و خستهکنندهست، ولی یه ابزار اوپنسورس اومده که دقیقاً همین مشکل رو حل میکنه.🔹ابزار DeepDoc یه Deep Research Agent رایگانه که میتونه روی مجموعهای از فایلهای محلی (مثل PDF، داکیومنتها و اسناد تحقیقاتی) کار کنه، اطلاعات مرتبط رو از دلشون بیرون بکشه و در نهایت یه گزارش منظم و ساختاریافته بهت تحویل بده.✔️یعنی چی؟ یعنی بهجای اینکه فقط با فایلهات چت کنی، میتونی یه مسئله یا سوال بهش بدی و بذاری خودش بره بین اسناد بگرده، ارتباطها رو پیدا کنه و نتیجه رو برات جمعبندی کنه.🔹اگه جزو اون دستهای هستی که کلی سند و PDF داری و پیدا کردن ارتباط بین اطلاعاتشون برات دردسر شده، DeepDoc میتونه تبدیل بشه به یه Research Assistant شخصی که دقیقاً روی دیتای خودت کار میکنه.🔗 github.com/Oqura-ai/deepdoc🆔 @Ai_Tv
این ابزار با یک فرمان ساده، فرایند شبیهسازی هر وبسایتی را بهطور خودکار انجام میدهد.🔹 پیش از آغاز فرایند کدنویسی، از تمامی اجزای وبسایت اسکرینشات تهیه کرده و ساختار معنایی صفحات را بهدقت تحلیل میکند🔹 کلیه Design Tokenها شامل پالتهای رنگی، خانوادههای تایپوگرافی، مقادیر فاصلهگذاری و واحدهای دقیق پیکسلی را استخراج میکند🔹 بار محاسباتی بازسازی سایت را میان چندین عامل هوش مصنوعی توزیع میکند تا عملیات بهصورت موازی بر روی بخشهای مختلف صفحه انجام شود🔹 در خروجی نهایی، یک کدبیس ساختیافته با بهرهگیری از Next.js 16 و Tailwind v4 ارائه میدهد؛ خروجیای که برخلاف روشهای سنتی Scraping، کاملاً قابل نگهداری و توسعه استاین ابزار با بیش از ۱۰ عامل کدنویسی فعالیت میکند و بالاترین کیفیت خروجی خود را در تعامل با Claude Code ارائه میدهد.کافیه نشانی وبسایت مورد نظر را بهعنوان ورودی وارد کنید؛ در ادامه، یک Codebase کاملاً کاربردی و قابل انتشار دریافت خواهید کرد 🔗 github.com/JCodesMore/ai-website-cloner-template🆔 @Ai_Tv
