Eğitim verisi (training data), bir makine öğrenmesi modelinin öğrenmek için üzerinde çalıştığı örnekler bütünüdür. Model, parametrelerini bu örneklere bakarak ayarlar; dolayısıyla modelin ne bildiği, neyi bilmediği ve hangi önyargıları taşıdığı büyük ölçüde eğitim verisiyle belirlenir. “Çöp girerse çöp çıkar” (garbage in, garbage out) ilkesi bu yüzden alanın en temel kuralıdır.
Somut örnekler: Spam filtresi için eğitim verisi, “spam / değil” diye etiketlenmiş yüz binlerce e-postadır. Bir büyük dil modeli içinse web sayfaları, kitaplar, makaleler ve kod depolarından oluşan trilyonlarca tokenlik metindir. Veri toplandıktan sonra genellikle temizlenir, tekrarlar ayıklanır ve bir bölümü “test verisi” olarak ayrılır — model hiç görmediği bu bölümle sınanarak gerçekten öğrenip öğrenmediği ölçülür.
Neden bu kadar kritik?
Modelin sınırları verisinin sınırlarıdır. Eğitim verisi belirli bir tarihte kesildiği için model sonrasını bilemez (“bilgi kesim tarihi” kavramı buradan gelir); veride az temsil edilen diller ve konularda model zayıf kalır; verideki toplumsal önyargılar modele aynen taşınabilir. Modeli eğitimden sonra belirli bir alana uyarlamak için daha küçük ve hedefli veriyle fine-tuning yapılır; güncel bilgiye erişim içinse veriyi yeniden toplamak yerine RAG gibi yöntemler tercih edilir.