Parametre, bir yapay sinir ağının eğitim sırasında ayarlanan sayısal değerleridir — çoğunlukla nöronlar arasındaki bağlantıların “ağırlıkları”. Modelin öğrendiği her şey, bu sayıların aldığı değerlerde saklanır. Eğitim dediğimiz süreç, aslında bu milyonlarca ya da milyarlarca sayının, model doğru tahminler yapana kadar adım adım güncellenmesidir.
Bir benzetme: Devasa bir ses mikserindeki düğmeleri düşünün. Her düğme bir parametredir. Eğitim, teknisyenin (öğrenme algoritmasının) her yanlış sesten sonra düğmeleri azar azar çevirmesidir; eğitim verisi bittiğinde düğmelerin son konumu, modelin “bilgisi” olur. GPT-3’ün 175 milyar parametresi olduğu açıklanmıştı; günümüz modelleri bu ölçeğin de üzerine çıkmıştır. “7B model” gibi ifadelerdeki B, milyar (billion) parametre anlamına gelir.
Parametre sayısı = zekâ mı?
Hayır — kaba bir gösterge olsa da tek başına belirleyici değildir. Daha fazla parametre modele daha fazla örüntü saklama kapasitesi verir, ama veri kalitesi, eğitim yöntemi ve mimari en az onun kadar önemlidir. Nitekim iyi eğitilmiş küçük modeller, kötü eğitilmiş büyüklerini geçebilmektedir. Bir diğer karışıklık: parametre, prompt içinde verdiğiniz ayarlar (ör. sıcaklık/temperature) demek değildir; onlar çalışma zamanı ayarlarıdır, modelin öğrenilmiş parametreleri ise fine-tuning yapılmadıkça değişmez.