Büyük dil modeli (LLM, Large Language Model), internetten, kitaplardan ve kodlardan toplanan milyarlarca kelimelik metinle eğitilmiş, dev boyutlu bir transformer tabanlı yapay sinir ağıdır. Temel yeteneği basittir: verilen bir metin parçasının (bağlamının) ardından hangi token’ın gelme olasılığının en yüksek olduğunu hesaplamak. Bu basit görev, yeterince büyük veri ve model boyutunda, sohbet etme, özetleme, çeviri, kod yazma gibi karmaşık davranışları kendiliğinden doğurur.
“Büyük” sıfatı iki şeyi işaret eder: eğitim verisinin hacmi (genellikle trilyonlarca kelime) ve modelin parametre sayısı — yüz milyarları bulan, modelin öğrendiği bilgiyi tuttuğu sayısal ağırlıklar. Bu ölçek, modele “genişleme” (scaling) dediğimiz bir özellik kazandırır: model büyüdükçe, özellikle eğitilmediği görevlerde bile şaşırtıcı yetenekler ortaya çıkabilir.
LLM’lerin tipik kullanım aşamaları şöyledir: önce ham metinle geniş çaplı ön eğitim, sonra istenen davranışa yaklaştırmak için ince ayar ve insan geri bildirimiyle hizalama (RLHF). Üretimde ise model dondurulur ve sadece çıkarım yapar — yani öğrenmeye değil, önceden öğrendiğini uygulamaya devam eder.
ChatGPT (OpenAI), Claude (Anthropic) ve Gemini (Google) gibi ürünlerin hepsinin merkezinde bir LLM vardır; kullanıcı arayüzü, güvenlik katmanları ve ek araçlar (arama, kod çalıştırma) bu çekirdek modelin etrafına eklenir.