Token, bir büyük dil modelinin metni okurken ve yazarken kullandığı en küçük parçadır. Bir token her zaman bir kelime değildir — kısa yaygın kelimeler tek token olabilirken, uzun veya nadir kelimeler birden fazla parçaya bölünebilir. Türkçede eklerin bolluğu yüzünden bu bölünme İngilizceye göre daha sık gerçekleşir; bu da aynı anlamı taşıyan bir Türkçe metnin genellikle daha fazla token’a mal olması demektir.
Model, cümleyi anlamadan önce metni bu token’lara ayırır, her birini sayısal bir vektöre (embedding) çevirir ve işlemleri bu sayılar üzerinden yürütür. Token saymak iki nedenle önemlidir. Birincisi, her modelin bir seferde görebileceği azami metin miktarı (girdi + çıktı) sınırlıdır; buna bağlam penceresi denir ve token cinsinden ölçülür — pencere dolduğunda model konuşmanın başını “unutmaya” başlar. İkincisi, çoğu ticari API, kullanımı token başına ücretlendirir; bu yüzden uzun promptlar ve uzun cevaplar doğrudan maliyete yansır.
Pratik sonucu: gereksiz uzun talimatlar veya tekrar eden bağlam, hem yanıt kalitesini (pencere doluyorsa) hem de maliyeti etkiler. Bu yüzden üretim sistemlerinde (RAG gibi) sadece ilgili bilgi bağlama eklenir, tüm arşiv değil.
Token, dil modellerinin “gördüğü” en küçük birim olduğu için, model kapasitesini, hızını ve fiyatlandırmasını anlamanın anahtarı budur — “kelime sayısı” değil, “token sayısı” konuşulur.