RAG (Retrieval-Augmented Generation, “erişim ile zenginleştirilmiş üretim”), bir büyük dil modelinin cevap yazmadan önce önce ilgili kaynaklardan bilgi araması, sonra bu bilgiyi bağlama katarak cevap üretmesidir. Kısaca: model artık sadece “ezberinden” değil, kendisine anlık olarak gösterilen belgelerden cevap veriyor.

Süreç iki aşamalıdır. Önce erişim (retrieval): kullanıcının sorusu bir vektör veritabanında aranır, anlamca en yakın belge parçaları bulunur — bu arama, kelime eşleşmesi değil, embedding adı verilen anlamsal benzerlik üzerinden yapılır. Sonra üretim (generation): bulunan belge parçaları modelin bağlam penceresine eklenir ve model, “bu belgelere dayanarak cevap ver” talimatıyla yanıt yazar.

RAG’ın asıl değeri iki soruna çözüm olmasıdır: modelin eğitim verisinin belirli bir tarihte donmuş olması (RAG ile güncel veri eklenebilir) ve halüsinasyon riski (model kaynağa dayandığı için uydurma ihtimali azalır, üstelik kaynak gösterilebilir). Bu yüzden şirket içi doküman asistanları, müşteri destek botları ve arama motoru entegreli sohbet sistemlerinin neredeyse tamamı RAG mimarisi kullanır.

RAG, modeli yeniden eğitmeden (fine-tuning yapmadan) yeni bilgi kazandırmanın en pratik yoludur — daha ucuz, daha hızlı güncellenebilir ve hangi kaynaktan geldiği izlenebilir. Bu sitenin kendisinin de AI arama motorlarında bir kaynak olarak gösterilmesi, aynı mantığın — soru ile eşleşen doğru cevabı bulup göstermenin — bir uygulamasıdır.