Model damıtma (knowledge distillation), büyük ve güçlü bir “öğretmen” modelin bilgisini, çok daha küçük bir “öğrenci” modele aktarma tekniğidir. Öğrenci, ham eğitim verisinden sıfırdan öğrenmek yerine öğretmenin çıktılarını taklit ederek eğitilir. Kritik incelik şudur: öğrenci yalnızca öğretmenin son cevabını değil, olasılık dağılımının tamamını — “bu token yüzde 70, şu yüzde 20” gibi “yumuşak” bilgiyi — öğrenir. Bu dağılım, doğru cevabın ötesinde öğretmenin “neyi neye benzettiğini” de taşır.
Benzetme: usta bir şefin yanında yetişen çırak, sadece tarifleri değil, ustanın hangi hatayı neden yaptığını, neyi neyle ikame ettiğini de görür; kitaptan öğrenen birinden çok daha hızlı ustalaşır. Pratikte damıtma çoğu zaman öğretmene milyonlarca soru üretip cevaplarıyla öğrenciyi fine-tune etmek şeklinde uygulanır.
Neden önemli?
Damıtma, “büyük modelin zekâsı, küçük modelin fiyatına” denkleminin anahtarıdır: telefonda çalışan asistanlar ve API’lerdeki hızlı/ucuz model katmanları (mini, flash, haiku gibi isimlerle) genellikle damıtmayla üretilir. Küçük model daha az parametre taşıdığı için çıkarımı kat kat ucuzdur. Nicemlemeden farkı şudur: nicemleme aynı modelin sayılarını inceltir, damıtma ise baştan küçük bir model eğitir; en sıkı sıkıştırma ikisinin birlikte kullanımıyla elde edilir. 2025’te DeepSeek’in damıtılmış modelleri, tekniğin sınır performansı ne kadar ucuza taşıyabildiğini dünyaya gösterdi.