Akıl Yürüten Modeller: Yapay Zeka Cevaptan Önce Neden 'Düşünüyor'?
Reasoning modelleri ve test-time compute: modelin cevap vermeden önce düşünmesi neden yeni bir ölçekleme ekseni oldu, sınırları neler?
akıl yürütmetest-time computereasoning modelpekiştirmeli öğrenmeAI mimarisi
Bir soruya cevap vermeden önce “düşünmek” ne demek?
2022’ye kadar bir büyük dil modelinden matematik problemi çözmesini istediğinizde, model doğrudan cevaba atlardı — ara adım yok, sadece bir sayı. Wei ve ekibinin o yıl yayımladığı çalışma, basit ama etkili bir gözlem sundu: modele soruyla birlikte birkaç örnek çözüm de gösterirseniz, ve bu örnekler cevaba varmadan önceki akıl yürütme adımlarını da içeriyorsa, model kendi cevabını üretirken de benzer bir ara adım dizisi kurmaya başlıyor. Buna “chain-of-thought” (düşünce zinciri) denildi. Sonuç şaşırtıcıydı: aritmetik, sağduyu ve sembolik akıl yürütme testlerinde doğruluk belirgin şekilde arttı — üstelik modelin ağırlıklarında hiçbir değişiklik yapılmadan, sadece istemin (prompt) biçimi değiştirilerek. Wei ve ekibinin de not ettiği gibi bu etki esas olarak büyük modellerde ortaya çıkıyordu; küçük modellerde düşünce zinciri çoğu zaman fayda sağlamıyor, hatta bazen zarar veriyordu.
Chain-of-thought başlangıçta bir istem mühendisliği tekniğiydi — kullanıcının modele “adım adım düşün” demesi. Ama arkasında daha büyük bir fikir yatıyordu: modelin cevaptan önce ürettiği ara metin, sadece bir açıklama değil, hesaplamanın kendisinin bir parçası olabilirdi. Bu fikir, sonraki birkaç yıl içinde ayrı bir ölçekleme ekseni haline geldi.
Yeni eksen: çıkarım sırasında daha fazla hesap
Bir dil modelinin gücü geleneksel olarak iki şeyle ölçeklenir: daha fazla parametre, daha fazla eğitim verisi. Bu, modelin eğitilme maliyetini büyütür ama bir kere eğitildikten sonra her soruya verdiği cevabın maliyeti sabittir. Snell ve ekibinin 2024’te yayımladığı çalışma, üçüncü bir ekseni sistematik olarak inceledi: modelin çıkarım anında — yani soruyu cevaplarken — daha fazla hesaplama bütçesi harcamasına izin vermek. Bu bütçe; birden fazla aday cevap üretip en iyisini seçmek, bir cevabı adım adım revize etmek ya da arama benzeri stratejilerle çözüm uzayını daha geniş taramak gibi yollarla kullanılabilir.
Çalışmanın bulduğu şey ilginç: bu bütçeyi doğru harcamak, ne kadar harcandığından daha önemli. Soru zorluğuna göre uyarlanan bir dağıtım stratejisiyle, standart örnekleme yöntemlerine kıyasla dört kattan fazla verimlilik kazanılabiliyor; bazı problem kategorilerinde, test zamanında daha fazla hesap kullanan küçük bir model, eşit hesaplama bütçesiyle kıyaslandığında kendisinden ondört kat büyük bir modeli geride bırakabiliyor. Kısacası: bazı durumlarda “daha büyük model eğit” yerine “aynı modele daha çok düşünme süresi ver” daha ucuz bir performans kazancı sağlıyor.
o1 ve DeepSeek-R1: düşünmeyi pekiştirmeli öğrenmeyle terbiye etmek
Chain-of-thought bir istem tekniği olarak başladı, ama OpenAI’ın Eylül 2024’te tanıttığı o1 modeliyle bambaşka bir şeye dönüştü: modelin kendisine, cevap vermeden önce uzun bir içsel düşünce zinciri üretmeyi pekiştirmeli öğrenme ile öğretmek. OpenAI’ın kendi duyurusuna göre o1, hatalarını fark edip düzeltmeyi, zor adımları daha basit parçalara bölmeyi ve bir yöntem işe yaramadığında başka bir yöntem denemeyi eğitim sürecinde kendiliğinden öğreniyor. Kritik gözlem şu: modelin performansı hem eğitim sırasında harcanan pekiştirmeli öğrenme hesabıyla hem de test sırasında harcanan düşünme süresiyle istikrarlı biçimde artıyor — ve bu ikinci eksenin ölçeklenme kısıtları, klasik ön eğitiminkinden oldukça farklı. o1, rekabetçi matematik ve programlama benchmarklarında, GPT-4o gibi “düşünmeyen” öncüllerine kıyasla büyük farkla önde performans gösterdi.
Ocak 2025’te DeepSeek-AI’nin yayımladığı ve daha sonra Nature’da da basılan DeepSeek-R1 çalışması, benzer bir sonucu farklı bir yoldan gösterdi: akıl yürütme yeteneği, insan tarafından etiketlenmiş akıl yürütme örneklerine ihtiyaç duymadan, saf pekiştirmeli öğrenmeyle de teşvik edilebiliyor. Araştırmacılar, modelin ödüllendirme sinyaliyle kendi kendine öz-yansıma (self-reflection) ve doğrulama gibi davranışları geliştirdiğini gözlemlediler — bu, önceden elle yazılmış talimatlarla değil, “doğru cevaba ulaşırsan ödül al” gibi görece basit bir hedefin yan ürünü olarak ortaya çıktı. Bu, AI nasıl eğitilir yazısında anlattığım RLHF’ten farklı bir pekiştirmeli öğrenme kullanımı: orada insan tercihi ödüllendiriliyordu, burada doğru cevaba ulaşmanın kendisi.
Maliyet ve gecikme takası
Bu yeni eksenin bedavaya gelmediğini vurgulamak gerekir. Test-time compute’un mantığı, her soruya daha fazla hesaplama harcamaktır — ve bu hesaplama, klasik bir modelin tek seferlik ileri geçişine kıyasla katbekat daha fazla token üretmek, dolayısıyla daha fazla süre ve enerji tüketmek anlamına gelir. Snell ve ekibinin gösterdiği “küçük model + fazla düşünme, büyük modelden ucuza gelebilir” denklemi genel değil, koşullara bağlı: FLOP başına verimlilik kazanılabilir, ama kullanıcı için gecikme (yanıtın ne kadar sürede geldiği) artar. Bu yüzden reasoning modelleri pratikte iki kategoriye ayrılıyor: her soruda derin düşünen, yavaş ama daha isabetli modeller; ve hızlı ama daha az derin düşünen modeller. Hangisinin kullanılacağı, sorunun zorluğuna ve gecikme toleransına göre bir mühendislik kararı haline geldi — tıpkı Snell’in çalışmasının önerdiği gibi, hesaplama bütçesini soruya göre uyarlamak.
Sınırları: düşünce zinciri her zaman gerçeği yansıtmıyor
Reasoning modellerinin en çekici vaadi, düşünce zincirinin modelin “aklından geçenleri” şeffaf biçimde göstermesiydi — hatta OpenAI, o1 duyurusunda bunu güvenlik ve uyumluluk açısından bir fırsat olarak sundu. Ama bu vaadin sınırları var. Turpin ve ekibinin 2023’te NeurIPS’te sunduğu çalışma, modelin cevabına gizlice etki eden bir yanlılık eklendiğinde (örneğin sorunun sunuluş sırası), modelin ürettiği düşünce zincirinin bu etkiden hiç bahsetmediğini, buna rağmen tamamen makul görünen ama yanlış bir gerekçe uydurduğunu gösterdi. Bazı deneylerde bu yanlılık, doğruluğu yüzde 36’ya varan oranda düşürebiliyordu — model yanlış cevaba yönlendiriliyor, ama düşünce zinciri bunu hiç itiraf etmiyordu. Yazarların vurguladığı gibi, bu tür açıklamalar “makul ama yanıltıcı” olabiliyor ve modele haksız bir güven duymamıza yol açabiliyor.
Bir diğer pratik sorun “aşırı düşünme”: reasoning modelleri, kolay bir soruda bile gereğinden uzun bir düşünce zinciri üretip gereksiz yere hesaplama ve süre tüketebiliyor — Snell’in çalışmasının asıl önerdiği şey de zaten bunun tersini yapmak, yani hesaplama bütçesini soruya göre uyarlamak, her soruya körü körüne aynı miktarda “düşünme” dayatmamak. Bu iki sınırlama bir araya geldiğinde ortaya çıkan pratik ders şu: uzun bir düşünce zinciri görmek, ne modelin doğru akıl yürüttüğünün ne de o akıl yürütmenin gerçekten o cevaba götürdüğünün garantisi. Düşünce zinciri faydalı bir araç, ama şeffaf bir pencere değil — arkasında ne olduğunu doğrulamak için hâlâ bağımsız değerlendirme gerekiyor.
Aklınızda kalsın
- Test-time compute, üçüncü bir ölçekleme eksenidir. Daha büyük model ya da daha çok veri yerine, modele cevap vermeden önce daha fazla hesaplama bütçesi (düşünme süresi) vermek de performansı artırabiliyor — bazen daha ucuza.
- o1 ve DeepSeek-R1, düşünce zincirini pekiştirmeli öğrenmeyle içselleştirdi. Chain-of-thought artık sadece bir istem tekniği değil; modelin kendi kendine geliştirdiği, ödül sinyaliyle şekillenen bir davranış.
- Düşünce zinciri şeffaf bir pencere değil. Hem “aşırı düşünme” hem de zincirin gerçek nedeni yansıtmama riski var — uzun ve makul görünen bir gerekçe, doğru ya da dürüst olduğu anlamına gelmiyor.
Kaynaklar
- Wei, J. vd. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv. Düşünce zinciri örnekleriyle istemlemenin büyük modellerde akıl yürütme performansını nasıl artırdığını gösteren temel çalışma. arxiv.org/abs/2201.11903
- Snell, C., Lee, J., Xu, K. & Kumar, A. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv. Çıkarım anındaki hesaplama bütçesinin soruya göre uyarlanmasının, model boyutunu büyütmekten daha verimli olabileceğini gösteren çalışma. arxiv.org/abs/2408.03314
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Nature, cilt 645. Akıl yürütme yeteneğinin insan etiketli örnekler olmadan, saf pekiştirmeli öğrenmeyle teşvik edilebildiğini gösteren çalışma. arxiv.org/abs/2501.12948
- OpenAI (2024). LLM’lerle akıl yürütmeyi öğrenmek. Resmî duyuru. o1 modelinin pekiştirmeli öğrenmeyle eğitilen düşünce zinciri yaklaşımını, eğitim ve test zamanı hesaplama ölçeklemesini tanıtan yayın. openai.com/index/learning-to-reason-with-llms
- Turpin, M., Michael, J., Perez, E. & Bowman, S. R. (2023). Language Models Don’t Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting. NeurIPS 2023. Düşünce zincirinin, modelin cevabını gerçekte etkileyen faktörleri her zaman yansıtmadığını deneysel olarak gösteren çalışma. arxiv.org/abs/2305.04388
Teoriyi anladın — şimdi uygula
Bu sitedeki her şey ücretsiz. Yapay zekâyı işinde gerçekten çalıştırmak istiyorsan — reklam, içerik, otomasyon — beAgents AI tam bunun için var.
beAgents AI'ı keşfet ↗