پارت ۱تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل…
انتشار: 2026/07/09 15:41 UTCدریافت: 2026/08/12 10:45 UTCآخرین مشاهده: 2026/08/12 10:45 UTC
پارت ۱تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه.اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن:1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک): مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logitهای معلم match میکنن (soft label) یا مستقیم روی متن تولیدشدهی معلم fine-tune میشن.


