Pekiştirmeli öğrenme (reinforcement learning), bir ajanın bir ortamla etkileşime girip eylemler denediği, bu eylemlerin sonucunda aldığı ödül veya ceza sinyaline göre hangi davranışı tekrarlayacağını öğrendiği makine öğrenmesi türüdür. Denetimli öğrenmeden farkı, doğru cevabın önceden verilmemesidir; ajan yalnızca “bu iyi gitti” ya da “bu kötü gitti” sinyalinden, deneme yanılmayla kendi stratejisini geliştirir.
Benzetme: bir köpeğe yeni bir numara öğretmek gibidir. Komutu tam anlamadığı hâlde köpek çeşitli hareketler dener; doğru harekette ikramiye alır, yanlışında hiçbir şey olmaz. Zamanla köpek, ikramiyeye götüren hareketleri tekrar etmeye başlar — kimse ona adım adım “önce şunu yap” diye öğretmemiştir. Ajan da aynı şekilde, uzun vadede toplam ödülü en üst düzeye çıkaracak bir strateji (politika) geliştirir.
Neden önemli?
Pekiştirmeli öğrenme, satranç ve Go’da insan üstü oyuncular üreten sistemlerin, robot kontrolünün ve oyun oynayan yapay zekâların temelidir. Dil modelleri dünyasındaki en somut kullanımı RLHF’tir: bir modelin çıktıları, insan tercihlerinden eğitilen bir ödül modeline göre pekiştirmeli öğrenmeyle iyileştirilir. Daha yeni akıl yürütme odaklı modellerde ise ödül, doğru cevaba ulaşıp ulaşmadığı otomatik kontrol edilebilen matematik ve kod gibi görevlerden gelir — bu da modelin düşünce zincirini kendi kendine güçlendirmesini sağlar. Zorluğu, ödülün seyrek geldiği veya yanlış tasarlandığı durumlarda ajanın istenmeyen kestirmeler bulabilmesidir.