Büyük dil modeli (Large Language Model, LLM), internet ölçeğinde metin verisiyle eğitilmiş ve temel işi “bu metnin devamında hangi kelime gelir?” sorusuna cevap vermek olan bir derin öğrenme modelidir. ChatGPT, Claude ve Gemini’nin arkasındaki teknoloji budur. “Büyük” sıfatı hem eğitim verisinin hem de modelin parametre sayısının milyarlarla ölçülmesinden gelir.

Çalışma mantığı şaşırtıcı derecede sadedir: Model, metni token adı verilen küçük parçalara böler ve her adımda bir sonraki token için olasılık hesaplar. “Türkiye’nin başkenti” ifadesinden sonra “Ankara” tokenine yüksek olasılık vermesi, milyarlarca cümleden öğrendiği istatistiksel örüntülerin sonucudur. Bu basit tahmin mekanizması yeterince büyük ölçekte, çeviri yapma, kod yazma, özetleme ve soru cevaplama gibi hiç doğrudan öğretilmemiş becerileri de ortaya çıkarır.

Bilgi deposu değil, dil motoru

LLM’ler sık sık arama motoruyla karıştırılır; oysa model bir veritabanına bakmaz, eğitimde öğrendiği örüntülerden üretim yapar. Bu yüzden güncel olayları bilemeyebilir ve bazen kendinden emin biçimde yanlış bilgi üretebilir — buna halüsinasyon denir. Modeli güncel ve doğrulanmış bilgiyle beslemek için RAG gibi yöntemler kullanılır. Neredeyse tüm modern LLM’lerin temelinde Transformer mimarisi yatar; modelle konuşurken yazdığınız her şey ise prompt olarak adlandırılır.