🍒 معرفی Lychee-FD؛ مدل زبانی گفتاری تمامدوپلکس بومی برندهی مقالهی برجستهی ACL 2026پژوهشگران دان…
انتشار: 2026/07/17 19:06 UTC
🍒 معرفی Lychee-FD؛ مدل زبانی گفتاری تمامدوپلکس بومی برندهی مقالهی برجستهی ACL 2026پژوهشگران دانشگاه هاربین با مدل Lychee-FD، گامی بزرگ در حوزهی تعامل صوتی بلادرنگ با هوش مصنوعی برداشتهاند. این مدل که بهعنوان مقالهی برجسته (Outstanding Paper) در کنفرانس معتبر ACL 2026 انتخاب شده، یک مدل زبانی گفتاری (SLM) بومی و تمامدوپلکس است.---🎯 چالش اصلی در مدلهای گفتاری تمامدوپلکس چیست؟مدلهای قبلی یا از نوع نوبتی (Turn-Based) بودند (مثل دستیارهای صوتی معمولی که پس از پایان صحبت کاربر پاسخ میدهند) یا اگر تمامدوپلکس بودند، از ترکیب چندین سیستم مجزا (ASR + LLM + TTS) ساخته میشدند که باعث تأخیر و افت کیفیت میشد. مشکل اصلی این سیستمها، تداخل مدالیته (Modality Interference) و رقیقشدن اطلاعات معنایی (Semantic Dilution) در لایههای عمیق شبکه بود؛ بهطوری که تولید گفتار و استدلال معنایی با هم تداخل پیدا میکردند و کیفیت هر دو کاهش مییافت.---🌟 راهحل نوآورانهی Lychee-FDمعماری این مدل بر اساس مدلسازی سلسلهمراتبی آکوستیک-معنایی طراحی شده است:🔹 لایههای پایینی مشترک: برای یادگیری بازنماییهای مشترک گفتار-زبان از جریانهای صوتی پیوسته استفاده میکنند.🔹 لایههای بالایی جداگانه: به سه جریان مستقل تقسیم میشوند:- جریان معنایی (Semantic): مسئول درک زبان و دانش- جریان آکوستیک (Acoustic): مسئول تولید توکنهای گفتار طبیعی- جریان کنترل دیالوگ (Dialogue-Control): تصمیمگیری دربارهی زمان صحبت، سکوت، گوش دادن یا قطع کردن🔹 کانال همراستایی معنایی: برای حفظ انسجام معنایی در حین تولید گفتار تعبیه شده است.---⚙️ پیادهسازی مهندسی کارآمدبرای اجرای بلادرنگ، تیم توسعه از vLLM سفارشیشده استفاده کرده است:- پس از محاسبات لایههای مشترک، وضعیتهای میانی به سه کانال تخصصی ارسال میشوند.- مسیر خروج زودهنگام (Early-Exit) در کنترلکنندهی دیالوگ، امکان تصمیمگیری دربارهی قطع یا توقف گفتار را قبل از پایان کامل تولید صدا فراهم میکند.نتایج بهینهسازی:- ۲.۹۶ برابر سرعت بیشتر در دورهای مکالمه- کاهش ۲۳٪ در رشد حافظهی GPU در جلسات طولانی---🚀 استقرار و اجرامدل بهصورت متنباز و با مجوز Apache 2.0 در دسترس است و میتوان آن را با Docker بهراحتی اجرا کرد:git clone github.com/HITsz-TMG/Lychee-FD.gitcd Lychee-FDdocker compose pulldocker compose upسپس با باز کردن 127.0.0.1 در مرورگر، میتوانید یک دموی تعاملی بلادرنگ را تجربه کنید.نیازمندیهای سختافزاری: مدل روی کارتهای گرافیک با حداقل ۱۶ گیگابایت VRAM قابل اجراست و وزنهای آن از Hugging Face قابل دانلود است.---📊 دستاوردهای کلیدی✅ اولین مدل زبانی گفتاری بومی و تمامدوپلکس با قابلیت گوشدادن و صحبت همزمان ✅ معماری سلسلهمراتبی برای حل مشکل تداخل آکوستیک-معنایی ✅ پیادهسازی بهینهشده با vLLM برای تأخیر پایین و تعامل روان ✅ منبعباز و قابل استقرار روی سختافزار معمولی ✅ دریافت جایزهی مقالهی برجسته از ACL 2026 ---🔗 لینکهای مفید📦 گیتهاب پروژه:github.com/HITsz-TMG/Lychee-FD%F0%9F%A4%97 وزنهای مدل:huggingface.co/HIT-TMG/Lychee-FD%F0%9F%93… مقالهی علمی:aclanthology.org/2026.acl-long.419/---%F0… جمعبندی: Lychee-FD یک نقطهعطف در تعامل صوتی با هوش مصنوعی محسوب میشود. این مدل نشان میدهد که با معماری مناسب و جداسازی هوشمندانهی جریانهای معنایی و آکوستیک، میتوان به تعاملات صوتی طبیعی، روان و کمتأخیر دست یافت که تجربهای نزدیک به مکالمهی انسانی ارائه میدهد.--- #پردازش_گفتار #مدل_زبانی_گفتاری #تعامل_صوتی #پژوهش_هوش_مصنوعی #ACL2026 #LycheeFD🆔 @asrgooyeshpardaz