RLHF (Reinforcement Learning from Human Feedback — İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme), bir büyük dil modelini insanların tercihleriyle hizalamak için kullanılan eğitim yöntemidir. Pretraining aşamasından çıkan model bilgilidir ama kaba, gereksiz uzun ya da zararlı cevaplar verebilir; RLHF ona “insanlar hangi cevabı daha iyi bulur” duygusunu kazandırır.

Süreç üç adımda işler. Önce model aynı soruya birden fazla cevap üretir. Sonra insan değerlendiriciler bu cevapları karşılaştırır: “A cevabı B’den daha yararlı” gibi tercihler bildirir. Bu tercihlerden bir “ödül modeli” eğitilir — cevaplara puan veren ayrı bir model. Son adımda asıl dil modeli, pekiştirmeli öğrenmeyle bu ödül modelinden yüksek puan alacak cevaplar üretmeye yönlendirilir. Benzetmeyle: öğrenci (pretraining mezunu) sınava girmez; bir editörün beğendiği yazı tarzını, editörün geri bildirimlerinden öğrenir.

Neden önemli?

ChatGPT’yi 2022’de bir anda kullanılabilir kılan büyük ölçüde RLHF’ti: aynı temel model, hizalama sonrası talimat dinleyen, kibar ve odaklı bir asistana dönüştü. RLHF ayrıca halüsinasyonu ve zararlı çıktıları azaltmanın ana araçlarından biridir. Fine-tuning ile karıştırılmamalı: fine-tuning modele doğru cevap örnekleri gösterir, RLHF ise cevaplar arasında tercih öğretir.