🎤 معماری ساده اما قدرتمند مدلهای صوتی مبتنی بر LLMمدلهای جدید تبدیل متن به گفتار (TTS) مانند Orph…
انتشار: 2026/08/04 11:59 UTCدریافت: 2026/08/09 06:01 UTCآخرین مشاهده: 2026/08/09 06:01 UTC
🎤 معماری ساده اما قدرتمند مدلهای صوتی مبتنی بر LLMمدلهای جدید تبدیل متن به گفتار (TTS) مانند Orpheus، Spark-TTS، Cosyvoice و Kimi-Audio با معماری سادهای از دو بخش اصلی کار میکنند و به کیفیت فوقالعادهای دست یافتهاند. این مدلها حتی میتوانند وظایف دیگری مثل تشخیص گفتار (ASR) را نیز انجام دهند.---🧩 معماری کلی: دو بخش ساده۱. کدک عصبی (Neural Codec) : صدا را به توکنهای گسسته (Discrete Tokens) تبدیل میکند و دوباره به صدا بازمیگرداند.۲. مدل زبانی بزرگ (LLM) : توکنهای صوتی را بهصورت دنبالهای (Sequential) از روی متن، توکنهای صوتی مرجع و دستورات تولید میکند.---🔊 کدک عصبی؛ فشردهسازی صدا به توکنکدکهای عصبی، صدا را به توکنهای گسسته فشرده میکنند و ویژگیهای کلیدی آنها شامل موارد زیر است:🔹 تعداد توکن در ثانیه: این عدد مشخص میکند که هر ثانیه صدا به چند توکن تبدیل میشود. هرچه این عدد کمتر باشد، مدل سریعتر عمل میکند. برای مثال، کدک XCodec2 که در مدلهای Llasa و T5GemmaTTS استفاده شده، با نرخ ۵۰ توکن در ثانیه کار میکند. کدک Snac که در مدل Orpheus به کار رفته، نرخ ۸۳ توکن در ثانیه دارد و کدک Cosyvoice با نرخ ۲۵ توکن در ثانیه، کمترین میزان را در میان این نمونهها ارائه میدهد.🔹 تعداد کتابکد (Codebook) : برخی کدکها صدا را به چند گروه توکن تبدیل میکنند. اکثر مدلهای TTS از کدکهای تککتابکدی استفاده میکنند چون کارآمدترند. برای مثال، کدک XCodec2 یک کتابکد دارد، در حالی که کدک DAC از ۸ کتابکد مجزا تشکیل شده است.🔹 نوع تولید: کدکهای مبتنی بر دیفیوژن (مانند Cosyvoice و VibeVoice) کندتر هستند اما کیفیت بالاتری ارائه میدهند، در حالی که کدکهای تکمرحلهای (مانند Snac و Zonos) بسیار سریعتر عمل میکنند اما معمولاً فشردهسازی کمتری دارند و ممکن است از نظر کیفیت کمی پایینتر باشند.🔹 اندازهی کتابکد: این عدد نشان میدهد که چند توکن مختلف میتوانند صدا را نمایش دهند. هرچه این عدد کوچکتر باشد، فرایند آموزش سریعتر انجام میشود. برای نمونه، کدک XCodec2 دارای ۶۵,۵۳۶ توکن ممکن است، در حالی که کدک Snac تنها ۸,۱۹۲ توکن دارد.🔹 نرخ نمونهبرداری: کدکها در نرخهای نمونهبرداری متفاوتی کار میکنند. نرخ بالاتر به معنای کیفیت clearer است اما معمولاً توکن بیشتری در ثانیه تولید میکند. برای مثال، کدک Snac روی ۲۴ کیلوهرتز و کدک DAC روی ۴۴.۱ کیلوهرتز کار میکنند.معرفی کدکهای معروف:کدک XCodec2 که در مدلهای Llasa و T5GemmaTTS استفاده میشود، یک کدک تککتابکدی است که صدا را با نرخ ۱۶ کیلوهرتز و سرعت ۵۰ توکن در ثانیه پردازش میکند و حجم کتابکد آن ۶۵,۵۳۶ توکن است.کدک DAC که در مدلهای Zonos و Parler-TTS به کار رفته، از ۸ کتابکد مجزا تشکیل شده و با نرخ ۴۴.۱ کیلوهرتز و سرعت ۷۷۴ توکن در ثانیه کار میکند. هر کتابکد این کدک ۱,۰۲۴ توکن دارد.کدک Cosyvoice که در مدلهای CosyVoice، GLM-TTS، Chatterbox و Qwen-Omni استفاده میشود، یک کدک تککتابکدی مبتنی بر دیفیوژن است که با نرخ ۲۴ کیلوهرتز و سرعت ۲۵ توکن در ثانیه کار میکند و حجم کتابکد آن ۸,۱۹۲ توکن است.---🧠 مدل زبانی بزرگ؛ تولید گفتار از متنچگونه صدا به زبان تبدیل میشود؟ایدهی اصلی بسیار ساده است: صدا بهعنوان یک «زبان» جدید در نظر گرفته میشود. برای این کار، دو مرحله انجام میشود:🔹 دایرهی واژگان مدل با توکنهای صوتی گسترش مییابد.🔹 مدل یاد میگیرد توکن صوتی بعدی را با توجه به توکنهای متنی یا صوتی مرجع پیشبینی کند؛ درست مثل یک مدل زبانی معمولی که کلمهی بعدی را پیشبینی میکند.این رویکرد ساده، مزایای شگفتانگیزی دارد. از جمله اینکه شبیهسازی صدا (Voice Cloning) بدون نیاز به معماری خاصی امکانپذیر میشود؛ کافی است توکنهای صوتی یک نمونهی مرجع و متن مربوط به آن در اختیار مدل قرار گیرد.---💡 نتیجه معماری مدلهای صوتی مبتنی بر LLM بهطرز شگفتآوری ساده است: یک کدک عصبی صدا را به توکن تبدیل میکند و یک مدل زبانی بزرگ این توکنها را تولید میکند. این رویکرد، امکان تولید گفتار با کیفیت بالا، شبیهسازی صدا و حتی تشخیص گفتار را در یک مدل واحد فراهم میکند. با توجه به پیشرفتهای سریع در حوزهی کدکهای عصبی و بهینهسازیهای مدلهای زبانی، انتظار میرود در آینده شاهد مدلهای صوتی حتی قدرتمندتر و کارآمدتر باشیم.---🔗 مقالهی کامل:huggingface.co/blog/YatharthS/llm-tts-mod… #پردازش_گفتار #مدل_صوتی #هوش_مصنوعی #TTS #پیشرفت_فناوری🆔 @asrgooyeshpardaz