Uzman karışımı (Mixture of Experts, MoE), bir modelin her girdi için tüm parametrelerini değil, yalnızca ilgili alt bölümlerini çalıştırdığı mimari yaklaşımdır. Model, “uzman” adı verilen çok sayıda paralel alt ağa bölünür; “yönlendirici” (router) adlı küçük bir ağ, her token için hangi uzmanların devreye gireceğine anlık karar verir. Örneğin toplam 700 milyar parametreli bir MoE model, her token için bunların yalnızca 40 milyarını aktive edebilir.
Benzetme: dev bir hastane düşünün. Her hastayı bütün doktorlar muayene etmez; triyaj hemşiresi (yönlendirici) hastayı ilgili iki-üç uzmana sevk eder. Hastanenin toplam bilgisi devasadır ama her vakanın maliyeti yalnızca birkaç doktorun mesaisidir. Yoğun (dense) modellerde ise her “hasta” tüm doktorlardan geçer.
Neden önemli?
MoE, “daha akıllı model = daha pahalı çıkarım” denklemini kırar: bilgi kapasitesi toplam parametreyle büyürken, hesap maliyeti yalnızca aktif parametreyle artar. Mixtral, DeepSeek-V3 ve birçok sınır model bu yüzden MoE mimarisi kullanır; Transformer bloklarındaki ileri besleme katmanları uzman gruplarıyla değiştirilir. Bedeli de vardır: tüm uzmanlar bellekte tutulmak zorundadır (bellek ihtiyacı toplam parametreye göredir) ve yönlendiriciyi dengeli eğitmek zordur — bazı uzmanlar aşırı yüklenirken bazıları atıl kalabilir. Yine de büyük laboratuvarların ölçekleme stratejisinde MoE bugün standart araçlardan biridir.