🎤 معرفی FreyaTTS؛ مدل ۱۸۳ میلیون پارامتری ترکی استانبولی که روی لپتاپ هم اجرا میشودیک مدل جالب و…
انتشار: 2026/07/16 06:03 UTC
🎤 معرفی FreyaTTS؛ مدل ۱۸۳ میلیون پارامتری ترکی استانبولی که روی لپتاپ هم اجرا میشودیک مدل جالب و کارآمد برای تبدیل متن به گفتار (TTS) زبان ترکی با طراحی هوشمندانه منتشر شده است. FreyaTTS تنها ۱۸۳ میلیون پارامتر دارد و با معماری غیرخودبازگشتی (Non-Autoregressive) مبتنی بر Diffusion Transformer (DiT) و فضای نهان AudioVAE2 (با نرخ ۲۵ هرتز و ۶۴ بُعد) کار میکند.---✨ نکات برجسته و طراحی جالب🔹 کوچک و سریع: با ۱۸۳.۲ میلیون پارامتر، روی RTX 4090 به نرخ زمان واقعی (RTF) حدود ۰.۱۰ تا ۰.۱۱ و زمان تا اولین توکن صوتی (TTFT) حدود نیم ثانیه میرسد. این یعنی ۳.۲ برابر سریعتر و ۳.۷ برابر حافظهی کممصرفتر نسبت به مدل ۲ میلیاردی VoxCPM2.🔹 بدون رمزگذار و آواساز (Tokenizer‑Free): ورودی مدل، مستقیماً سطح کاراکترهای ترکی استانبولی با الفبای ۹۲ سمبلی است و نیازی به فونمساز یا تبدیل گرافم به فونم (G2P) ندارد.🔹 خروجی ۴۸ کیلوهرتز: رمزگشا (Decoder) صوتی VAE، دادههای ۲۵ هرتزی را مستقیماً به صدای ۴۸ کیلوهرتز تبدیل میکند.🔹 قابل اجرا روی CPU: بهصورت لحظهای روی پردازندهی لپتاپ Apple M3 (با RTF ۰.۷۰) و حتی سریعتر (RTF ~۰.۱۲) از طریق Core ML روی تراشههای Apple Silicon اجرا میشود.🔹 حداقل سختافزار: تنها به ۱.۵ گیگابایت VRAM روی کارت گرافیک نیاز دارد.---📊 عملکرد و کیفیتدر مجموعهی ارزیابی Freya-TR-Eval، این مدل با وجود حجم کم، نرخ خطای کلمه (WER) ۸.۰٪ را ثبت کرده است که از مدلهای بزرگتری مثل XTTS-v2 (با ۱۱.۱٪) و F5-TTS (با ۲۴.۳٪) بهتر عمل میکند. همچنین از نظر نرخ خطای کاراکتر (CER) به ۳.۰٪ رسیده است.---🎮 نصب و راهاندازی آساننصب با چند خط کد ساده انجام میشود:git clone github.com/freyavoiceai/FreyaTTS.gitcd FreyaTTSpip install -r requirements.txtو استفادهی عملی با یک خط فرمان:python infer.py --text "Merhaba, size nasıl yardımcı olabilirim?" --out output.wavبرای پردازش دستهای (Batch) نیز میتوانید از اسکریپت batch_infer.py استفاده کنید.---🔗 لینکهای مفید📦 گیتهاب پروژه: github.com/freyavoiceai/FreyaTTS📄 مقالهی فنی: arxiv.org/abs/2607.09530---💡 جمعبندی: FreyaTTS یک مدل TTS بسیار کارآمد، سریع و کممصرف برای زبان ترکی است که با معماری مبتنی بر دیفیوژن، بدون نیاز به فونمساز و با کیفیت قابلقبول، روی سختافزارهای معمولی (حتی پردازندهی لپتاپ) اجرا میشود. این طراحی میتواند الهامبخش ساخت مدلهای مشابه برای زبانهای دیگر، از جمله فارسی باشد.---#FreyaTTS #تبدیل_متن_به_گفتار #پردازش_زبان_طبیعی #هوش_مصنوعی #مدل_صوتی #TTS🆔 @asrgooyeshpardaz