👾 تیم Qwen روشی برای خودآموزی مدلها ابداع کرد؛ مدل به خودش تکلیف میدهد!تیم Qwen مقالهای با عنوان…
انتشار: 2026/08/12 06:43 UTCدریافت: 2026/08/15 10:53 UTCآخرین مشاهده: 2026/08/15 10:53 UTC
👾 تیم Qwen روشی برای خودآموزی مدلها ابداع کرد؛ مدل به خودش تکلیف میدهد!تیم Qwen مقالهای با عنوان Skill Self-Play منتشر کرده که در آن یک رویکرد نوین برای خودآموزی (Self-Play) مدلهای زبانی ارائه شده است. در این روش، مدل خودش وظایف جدید تولید میکند، آنها را حل میکند و یک کتابخانهی مهارتهای تأییدشده برای خودش میسازد.---🧩 مشکل روشهای قبلی خودآموزیدر روشهای قدیمی، مدل یا در محیطهای ساده و محدود گیر میکرد، یا وظایف متنوع اما غیرقابلاعتماد تولید میکرد که به یادگیری مؤثر منجر نمیشد.---⚙️ سه جزء کلیدی در Skill-SP🔹 پیشنهاددهنده (Proposer) : وظایف چالشبرانگیز و جدید تولید میکند.🔹 حلکننده (Solver) : برای وظایف تولیدشده، راهحل پیدا میکند.🔹 کنترلکنندهی مهارت (Skill Controller) : عملکرد مدل را تحلیل کرده و کتابخانهی مهارتها را بهروز میکند.هر مهارت شامل سناریو، قوانین تولید وظیفه و روش بررسی نتیجه است. این ساختار باعث میشود مدل روی وظایف کنترلشده و قابلاعتماد آموزش ببیند، نه روی دادههای تصادفی و بیکیفیت.---🔄 چرخهی خودتقویتشوندهمهارت 👈 تولید وظیفه جدید 👈 حل وظیفه 👈 بررسی 👈 بهبود مهارتاین چرخه بهطور مداوم تکرار میشود و کتابخانهی مهارتها را گسترش میدهد.---📊 نتایج و دستاوردهانویسندگان گزارش دادهاند که این روش باعث بهبود قابلتوجهی در وظایف استدلالی و استفاده از ابزارها شده است.---💡 نکتهی کلیدیکتابخانهی مهارتها در این روش، عمدتاً برای تولید دادههای آموزشی استفاده میشود، نه بهعنوان مجموعهای از پرامپتهای آماده برای پاسخدهی.---🔗 مطالعهی مقاله:arxiv.org/abs/2607.22529--- #Qwen #خودآموزی #پژوهش_هوش_مصنوعی #یادگیری_مستمر🆔 @asrgooyeshpardaz

