🎧 معرفی Audex؛ مدل یکپارچهی هوش صوتی و متنی بدون افت در تواناییهای زبانیپژوهشگران لابراتوارهای نم…
انتشار: 2026/07/10 21:16 UTC
🎧 معرفی Audex؛ مدل یکپارچهی هوش صوتی و متنی بدون افت در تواناییهای زبانیپژوهشگران لابراتوارهای نموترون، مدلی به نام Nemotron-Labs-Audex-30B-A3B (یا بهاختصار Audex) معرفی کردهاند. این یک مدل زبانی بزرگ (LLM) است که بهصورت همزمان متن و صدا را درک کرده، روی آن استدلال میکند و خروجی صوتی یا متنی تولید میکند. نکتهی کلیدی، حفظ کامل تواناییهای استدلال، دانش و تعامل مدلِ پایهی متنی آن است.---✨ معماری ساده و یکپارچهمدل Audex روی مدل پایهی Nemotron-Cascade-2-30B-A3B (یک MoE قوی) ساخته شده و معماری آن بسیار ساده است:🔹 ورودیهای صوتی، کدگذاری شده و به فضای توکنهای متنی فرافکنی میشوند.🔹 توکنهای متنی و توکنهای خروجی صوتیِ کوانتیزهشده، هنگام تولید، یکسان در نظر گرفته میشوند.این طراحی باعث ادغام قوی اطلاعات صوتی و متنی، تولید چندوجهی روان و سازگاری با زیرساختهای استاندارد آموزش و استنتاج LLM شده است.---📊 دادههای آموزشی عظیم و متنوعبرای آموزش Audex، یک مجموعهدادهی دقیق و گسترده جمعآوری شده که شامل:- ۱۵۷.۴ میلیارد توکن صوتی- ۳۲۰.۵ میلیارد توکن متنیاست. مدل در چند مرحلهی آموزش نظارتشده روی این دادهها و سپس یادگیری تقویتی (RL) و تقطیر برخط آموزش دیده است.---🏆 دستاوردها و عملکردمدل Audex به نتایج پیشرو (State-of-the-Art) در حوزههای مختلف صوتی دست یافته است:- درک صدا (Audio Understanding)- تشخیص و ترجمهی گفتار (Speech Recognition & Translation)- تبدیل متن به گفتار (Text-to-Speech)- تولید صدا (Audio Generation)- تبدیل گفتار به گفتار (Speech-to-Speech Generation)همهی اینها در حالی است که مدل، تواناییهای متنی خود را با افت ناچیز یا بدون افت حفظ کرده و در بنچمارکهای استدلال، همراستایی (Alignment)، دانش، زمینهی بلند و قابلیتهای عاملی (Agentic) عملکردی عالی نشان داده است.---📌 دسترسی و مجوزوزنهای مدل Audex برای پژوهش منتشر شده و از طریق Hugging Face قابل دسترسی است. این کار امکان استفاده و بررسی بیشتر توسط جامعهی پژوهشگران را فراهم میکند.---🔗 مطالعهی مقاله:arxiv.org/abs/2607.05196--- #Audex #مدل_صوتی_متنی #هوش_مصنوعی_چندوجهی #پژوهش_هوش_مصنوعی #NVIDIA🆔 @asrgooyeshpardaz