🎵 معرفی SPEAR XLarge v2 – رمزگذار متنباز پیشرفته برای گفتار و صدامدل SPEAR XLarge v2 بهعنوان پرچم…
انتشار: 2026/06/26 10:53 UTC
🎵 معرفی SPEAR XLarge v2 – رمزگذار متنباز پیشرفته برای گفتار و صدامدل SPEAR XLarge v2 بهعنوان پرچمدار رمزگذارهای متنباز SPEAR، برای یادگیری یکپارچهی بازنمایی گفتار و صداهای عمومی طراحی شده. این نسخهی پذیرفتهشده در کنفرانس ICML 2026 بوده و نسبت به نسخهی قبلی (v1)، با افزودن Token Mixing برای صحنههای آکوستیک پیچیده بهینهتر شده و عملکرد بهتری در گفتار همپوشان، صداهای نویزی و ترکیبهای صوتی دنیای واقعی ارائه میدهد.---⚙️ مشخصات فنی- پشتیبان (Backbone): Zipformer با حدود ۶۰۰ میلیون پارامتر و ۱۳ پشتهی Zipformer- خروجی: بازنماییهای سطح فریم با ابعاد ۱۲۸۰ و نرخ تقریباً ۵۰ هرتز از شکلموجهای ۱۶ کیلوهرتز---📊 دادههای پیشآموزشمدل روی ۱۹۷٬۰۰۰ ساعت دادهی ترکیبی آموزش دیده است:- ۱۸۴٬۰۰۰ ساعت دادهی گفتاری شامل دیتاستهای Libriheavy (~۵۰k ساعت)، Gigaspeech (~۱۰k)، VoxPopuli (~۲۴k) و yodas-granary (~۱۰۰k ساعت)- ۱۳٬۰۰۰ ساعت دادهی صوتی عمومی شامل AudioSet (~۵k)، Freesound (~۲.۸k)، Music4all (~۱k)، VGGSound (~۵۰۰) و MTG-Jamendo (~۳.۸k ساعت)---🏆 عملکرد درخشاناین مدل در هر دو معیار اصلی SUPERB (ارزیابی بازنمایی گفتار) و HEAR (ارزیابی بازنمایی صدای عمومی) به نتایج پیشرو (SOTA) دست یافته است.نتایج تنظیم دقیق روی LibriSpeech (تشخیص خودکار گفتار):- با دادهی LS960، نرخ خطای کلمه (WER) در مجموعهی test-clean به ۱٫۶٪ و در test-other به ۲٫۹٪ رسیده است.نتایج تنظیم دقیق روی AudioSet (برچسبگذاری صوتی):- با دادهی AudioSet Balanced، امتیاز mAP برابر ۳۹٫۴ و با دادهی Full به ۵۰٫۰ دست یافته است.---ایدهی اصلی: بیشتر مدلهای SSL موجود یا برای گفتار بهینهسازی شدهاند یا برای صداهای عمومی، اما SPEAR این شکاف را با تقطیر دانش مکمل از دو معلم SSL (یکی متمرکز بر گفتار و دیگری بر صدای عمومی) در یک مدل یکپارچه پر میکند. استفاده از کوانتیزاسیون برداری با چند کدبوک باعث تولید توکنهای گسستهای میشود که هم اطلاعات معنایی و هم آکوستیک را در بر دارند.---🔗 لینک مدل:huggingface.co/marcoyang/spear-xlarge-spe… #AI #ML #SPEAR #ICML2026 #پردازش_گفتار #صدا🆔 @asrgooyeshpardaz