Attention (dikkat mekanizması), bir modelin metindeki bir öğeyi işlerken diğer öğelere ne kadar “önem” vereceğini sayısal olarak hesaplayan mekanizmadır. Her token için model, dizideki diğer tüm tokenlerle bir ilgililik puanı üretir ve bilgiyi bu puanlara göre ağırlıklandırarak toplar. Transformer mimarisinin kalbi budur; mimariyi tanıtan makalenin adı bile “Attention Is All You Need”dir.
Bir benzetme: Kalabalık bir toplantıda “bütçe” kararını dinlerken kulağınız doğal olarak finans müdürüne odaklanır, diğer konuşmaları arka plana atarsınız. Attention da aynısını yapar: “Bankaya gittim, hesabımdaki parayı çektim” cümlesinde “hesap” kelimesini işlerken model, dikkat puanlarının büyük kısmını “banka” ve “para” kelimelerine verir — böylece buradaki “hesabın” matematik ödevi değil banka hesabı olduğunu anlar. Modern modellerde bu işlem “çok başlı” (multi-head) yapılır: her baş, dilbilgisi bağları, anlam ilişkileri gibi farklı türde ilişkileri aynı anda takip eder.
Neden önemli?
Attention’dan önceki mimariler metni sırayla işler, uzayan cümlelerde baştaki bilgiyi unuturdu. Attention her token çiftini doğrudan ilişkilendirdiği için uzun mesafeli bağları korur ve hesaplamalar GPU’da paralel yürütülebilir. Bedeli ise maliyettir: klasik attention’da hesap yükü metin uzunluğunun karesiyle büyür — bağlam penceresini büyütmenin zor olmasının başlıca sebebi budur.