👂 نگاهی تازه به آنتروپی در مدلهای بازشناسی گفتار مبتنی بر LLMپژوهشگران در مقالهای جدید، معماری مد…
انتشار: 2026/07/23 19:50 UTC
👂 نگاهی تازه به آنتروپی در مدلهای بازشناسی گفتار مبتنی بر LLMپژوهشگران در مقالهای جدید، معماری مدلهای بازشناسی گفتار خودکار (ASR) مبتنی بر LLM را از منظر تخصیص آنتروپی بازبینی کردهاند. این رویکرد، راهکاری برای بهبود تعادل میان کیفیت تشخیص، تأخیر و توهمات ارائه میدهد.---🎯 چالش اصلی در ASRهای مبتنی بر LLMسیستمهای فعلی با وجود عملکرد خوب روی بنچمارکها، با مشکلاتی دستوپنجه نرم میکنند:- کیفیت در برابر تأخیر: افزایش دقت معمولاً بهمعنای مصرف محاسباتی بیشتر است.- توهمات (Hallucinations): مدلها گاهی کلماتی را تشخیص میدهند که در گفتار وجود ندارند.---⚙️ راهحل پیشنهادی: تخصیص هوشمندانهی آنتروپینویسندگان سه معیار جدید معرفی کردهاند که نشان میدهد کاهش آنتروپی (ابهام) بین رمزگذار گفتار و LLM چگونه توزیع میشود. بر این اساس، یک استراتژی آموزش چندمرحلهای طراحی شده که:🔹 آگاهی از مرز توانایی (Capability-Boundary Awareness): مشخص میکند هر بخش از مدل چه مقدار باید بیاموزد و از فشار بیشازحد بر روی هر مؤلفه جلوگیری میکند.🔹 مرحلهی SFT غیرهمزمان (Iterative Asynchronous SFT): یک مرحلهی میانی بین همترازی و آموزش نهایی اضافه شده که جدایی عملکردی (Functional Decoupling) را حفظ کرده و از انحراف بیشازحد نمایشهای رمزگذار جلوگیری میکند.🔹 بازطراحی پیشآموزش: برای کاهش شکاف بین نمایشهای گفتار و متن، پیشآموزش رمزگذار دوباره طراحی شده است.---📊 نتایج و دستاوردها✅ عملکرد رقابتی با مدلهای پیشرو در بنچمارکهای چینی و انگلیسی، با تنها ۲.۳ میلیارد پارامتر (بسیار کوچکتر از مدلهای بزرگ فعلی)✅ کاهش چشمگیر توهمات بهلطف طراحی جداسازیمحور که از تأثیر مخرب آموزش روی رمزگذار جلوگیری میکند.✅ تعادل بهتر بین کیفیت، سرعت و مصرف منابع---💡 چرا این مقاله مهم است؟این پژوهش نشان میدهد که با درک عمیقتر از جریان اطلاعات (آنتروپی) بین اجزای مدل، میتوان بدون نیاز به افزایش عظیم تعداد پارامترها، عملکرد را بهبود بخشید. رویکرد ارائهشده مسیری برای ساخت سیستمهای تشخیص گفتار کارآمدتر، قابلاعتمادتر و با توهم کمتر ارائه میدهد.---🔗 مقاله:arxiv.org/abs/2604.08003v1--- #تشخیص_گفتار #پردازش_زبان_طبیعی #پژوهش_هوش_مصنوعی #بهینه_سازی_مدل🆔 @asrgooyeshpardaz