🧠 مدل UniPASE: مدلی برای تقویت گفتار با کیفیت بالا و توهم پایینپژوهشگران دانشگاه نانجینگ، مدلی به ن…
انتشار: 2026/07/22 21:36 UTC
🧠 مدل UniPASE: مدلی برای تقویت گفتار با کیفیت بالا و توهم پایینپژوهشگران دانشگاه نانجینگ، مدلی به نام UniPASE را برای تقویت جهانی گفتار (Universal Speech Enhancement) معرفی کردهاند که با وجود حجم کم، عملکردی در سطح مدلهای بزرگتر دارد و در مسابقهی معتبر URGENT 2026 موفق به کسب رتبهی اول شده است.---🎯 مدلهای قبلی چه مشکلی داشتند؟مدلهای قبلی یا در کیفیت ضعیف بودند، یا توهمات زبانی (Hallucinations) بالایی داشتند (یعنی کلماتی را به اشتباه تشخیص میدادند که در صدای اصلی نبود). برخی هم نمیتوانستند با نرخهای نمونهبرداری مختلف کار کنند.---⚙️ معماری هوشمندانهی UniPASEاین مدل با ترکیب هوشمندانهای از چهار مؤلفه، این مشکلات را حل کرده است:🔹 مدل DeWavLM-Omni: هستهی اصلی مدل که از WavLM (مدلی قدرتمند برای گفتار) با تکنیک تقطیر دانش (Knowledge Distillation) روی حجم عظیمی از دادههای دارای اعوجاج مختلف، بهینهسازی شده است. این بخش، ورودیهای مخدوش را به نمایشهای فونتیک تمیز و وفادار به زبان تبدیل میکند و توهمات زبانی را به حداقل میرساند.🔹 لایه Adapter: روی نمایشهای فونتیک خروجی DeWavLM، نمایشهای آکوستیک غنی (حاوی جزئیات صوتی مانند تُن و لحن) تولید میکند.🔹 لایه Vocoder: این بخش نمایشهای آکوستیک را به شکلموج (Waveform) با کیفیت ۱۶ کیلوهرتز بازسازی میکند.🔹 لایه PostNet: برای مدیریت نرخهای نمونهبرداری مختلف، خروجی Vocoder را به ۴۸ کیلوهرتز تبدیل کرده و سپس به نرخ نمونهبرداری اصلی برمیگرداند. این کار باعث میشود مدل بدون نیاز به تنظیم مجدد، با ورودیهایی با نرخهای مختلف کار کند.---📊 عملکرد در بنچمارکها و مسابقات🔸 رتبهی اول در بخش ارزیابی عینی (Objective Evaluation) مسابقهی URGENT 2026🔸 عملکرد برتر یا رقابتی نسبت به مدلهای پیشین در مجموعههای ارزیابی مختلف (شامل وظایف فرعی و کامل)🔸 توهم زبانی بسیار پایین: بهلطف استفاده از DeWavLM-Omni که بهطور خاص برای کاهش خطاهای زبانی آموزش دیده است.---💡 نکات برجسته✅ مدیریت نرخهای نمونهبرداری مختلف: ورودیها و خروجیها را در نرخهای مختلف (تا ۴۸ کیلوهرتز) پردازش میکند.✅ مدیریت تشخیص ریزش بسته (PLC): قابلیت جبران پکتهای ازدسترفته در انتقال صدا (برای کاربردهای ارتباطی مفید است).✅ پردازش فایلهای بلند: اسکریپت اختصاصی برای پردازش فایلهای صوتی بیش از ۲۰ ثانیه.✅ آسان برای استفاده: کد و چکپوینتهای مدل بهصورت عمومی در گیتهاب منتشر شدهاند.---🔗 دسترسی و لینکهای مفید📦 مخزن گیتهاب:github.com/Xiaobin-Rong/unipase%F0%9F%93%… مقالهی فنی:arxiv.org/abs/2604.14606%F0%9F%8E%A7 نمونههای صوتی: موجود در مخزن گیتهاب (./audio)---💡 جمعبندی: UniPASE یک مدل قدرتمند و انعطافپذیر برای تقویت گفتار است که با معماری هوشمندانهی خود، هم کیفیت بالایی دارد و هم توهمات زبانی را به حداقل میرساند. این مدل یک انتخاب عالی برای کاربردهای مختلف از جمله تماسهای صوتی، پادکستها و سیستمهای گفتاری است.--- #پردازش_گفتار #تقویت_گفتار #هوش_مصنوعی #مدل_صوتی #پژوهش_هوش_مصنوعی #URGENT2026🆔 @asrgooyeshpardaz