Transformer, 2017’de Google araştırmacılarının “Attention Is All You Need” makalesiyle tanıttığı bir yapay sinir ağı mimarisidir. Devrimi şudur: metni kelime kelime sırayla işlemek yerine, attention (dikkat) mekanizması sayesinde cümledeki tüm kelimeleri aynı anda ele alır ve her kelimenin diğerleriyle ilişkisini doğrudan hesaplar. GPT, Claude, Gemini ve BERT dâhil neredeyse tüm modern büyük dil modelleri Transformer üzerine kuruludur — GPT’deki “T” de zaten Transformer demektir.

Farkı bir örnekle görelim: “Kutuyu masaya koydum çünkü o daha genişti” cümlesinde “o” kelimesi masaya işaret eder. Eski mimariler (RNN’ler) cümleyi baştan sona tek tek okuduğu için uzun cümlelerde bu tür bağları unutabiliyordu. Transformer ise “o” kelimesini işlerken cümledeki her kelimeye aynı anda “bakar” ve en güçlü bağın “masa” ile olduğunu öğrenir; mesafe fark etmez.

Neden çığır açtı?

İki nedenle. Birincisi, uzun metinlerdeki bağlamı çok daha iyi yakalar — modelin bir kerede işleyebildiği metin miktarına bağlam penceresi denir. İkincisi, hesaplamaları sıraya bağlı olmadığı için GPU’larda paralel çalıştırılabilir; bu da devasa modellerin makul sürede eğitilmesini mümkün kıldı. Bugün Transformer yalnızca dilde değil, görüntü, ses ve protein yapısı tahmini gibi alanlarda da kullanılmaktadır — multimodal modellerin çoğu da bu mimarinin türevleridir.