Aynı model, farklı kurgu

Bir büyük dil modeline “yarın İzmir’e iş seyahati planla” yazın. Klasik bir chatbot size genel bir tavsiye listesi döktürür: “uçak biletlerine bakın, otel karşılaştırın, hava durumunu kontrol edin.” Faydalı ama sizin yapmanız gereken hâlâ her şey.

Şimdi aynı isteği bir AI ajanına verin. Ajan önce takviminize bakar, uçuş sitelerini gerçekten sorgular, fiyatları karşılaştırır, uygun bir otel bulur ve size onaya hazır somut bir plan çıkarır. İkisinin arkasındaki dil modeli aynı olabilir. Fark modelde değil, modeli çevreleyen kurguda: ajan, tek seferlik bir cevap yerine çok adımlı bir döngüye girer.

Bu yazı, o döngünün içini açıyor.

Chatbot’un sınırı: tek adım, sıfır doğrulama

Klasik bir sohbet botu şu döngüyü çalıştırır: girdi al, cevap üret, dur. Cevap iyi de olsa kötü de olsa, model bir daha geri dönüp kontrol etmez — çünkü kontrol edecek bir mekanizması yoktur. Modelin en olası devamı üretme mantığını ilgili yazıda anlattığım gibi, chatbot bu tahmini bir kere yapar ve teslim eder.

Ajan mimarisinin temel katkısı şudur: modele sadece “cevap yaz” değil, “bir hedefe ulaş” görevi verilir ve model bu hedefe ulaşana kadar kendi adımlarını kendisi planlar.

Döngü: algıla, planla, araç kullan, gözlemle

Ajan mimarilerinin çoğu, kabaca aynı dört fazlı döngüyü tekrar eder.

1. Algı (bağlamı oku). Ajan, mevcut durumu değerlendirir: kullanıcının isteği ne, şu ana kadar hangi adımlar atıldı, hangi araçlardan hangi sonuçlar döndü.

2. Plan (sıradaki adımı seç). Model, hedefe ulaşmak için bir sonraki adımın ne olması gerektiğine karar verir — bir araç mı çağıracak, yoksa elindeki bilgiyle doğrudan cevap mı verecek.

3. Eylem (aracı çağır). Bu aşamaya “tool use” (araç kullanımı) deniyor. Model, dil üretmenin ötesine geçip gerçek bir işlev çağırır: bir arama motorunu sorgular, bir API’yi çağırır, bir dosyayı okur, bir hesaplama yaptırır. Model kelime tahmin etmeye devam eder — ama artık ürettiği kelimeler, dış dünyada bir eylemi tetikleyen yapılandırılmış bir çağrıya dönüşür. Bu araçların bugün nasıl standart bir protokolle sunulduğunu MCP yazısında ayrıca ele aldım.

4. Gözlem (sonucu değerlendir, döngüyü tekrarla). Aracın döndürdüğü sonuç modele geri verilir; model bu yeni bilgiyle güncellenmiş bağlamda tekrar düşünür — hedefe ulaşıldı mı, yoksa bir adım daha mı gerekiyor?

Bu dört fazlı döngünün akademik literatürdeki en etkili formülasyonlarından biri, 2022’de Shunyu Yao ve ekibinin önerdiği ReAct yaklaşımıdır. ReAct, modelin “akıl yürütme izleri” (reasoning traces) ile “göreve özgü eylemleri” iç içe geçmiş biçimde ürettiği bir yöntem tanımlar: model önce yüksek sesle düşünür (“şu an bilmediğim şey X, onu bulmak için Y aracını çağırmalıyım”), sonra eylemi gerçekleştirir, sonra sonucu değerlendirip yeniden düşünür. Yazarların gösterdiği kritik bulgu şu: akıl yürütme adımları, eylem planlamasını yönlendiriyor; eylemlerden gelen sonuçlar da akıl yürütmeyi güncelliyor — ikisi birbirini besliyor.

Modelin araç kullanmayı nereden “bildiği”

Burada doğal bir soru çıkıyor: model bu araçları çağırmayı nasıl öğreniyor? Kimse ona “önce takvime bak, sonra uçuşları sorgula” diye elle kural yazmıyor.

Cevap iki katmanlı. Bir kısmı eğitim sırasında öğrenilir: model, hangi tür isteğin hangi tür araç çağrısını gerektirdiğine dair örüntüleri, tıpkı dil örüntülerini öğrendiği gibi veriden öğrenir. Timo Schick ve ekibinin 2023’te önerdiği Toolformer yaklaşımı bunu doğrudan gösterdi: model kendi kendine hangi API’yi ne zaman çağıracağını, denetimli örnek verilmeden, kendi ürettiği örneklerle öğrenebiliyor — aritmetik ya da güncel olgu gerektiren sorularda modelin kendi zayıflıklarını aracı çağırarak telafi etmesi bu şekilde mümkün oluyor.

İkinci katman ise ajanı çalıştıran uygulamanın sağladığı araç tanımlarıdır: hangi araçların var olduğu, ne işe yaradığı, hangi parametreleri beklediği. Model, elindeki araç listesine bakıp isteğe en uygun olanı seçer — tıpkı bir zanaatkarın elindeki alet çantasına bakıp işine uygun aleti seçmesi gibi.

Tek ajan yetmediğinde: çoklu-ajan mimarileri

Karmaşık görevlerde tek bir ajanın tüm döngüyü tek başına yürütmesi verimsizleşir — bağlam penceresi dolar, görev çok fazla farklı beceri gerektirir, ya da paralel çalışmak zaman kazandırır. Bu noktada devreye çoklu-ajan mimarileri girer: bir “lider” ajan görevi alt görevlere böler, her alt görevi ayrı bir uzman ajana devreder, sonuçları toplayıp birleştirir.

Lei Wang ve ekibinin 2023’te yayımladığı geniş kapsamlı bir tarama, büyük dil modeli tabanlı otonom ajanlar üzerine yapılan araştırmaları üç eksende topluyor: ajanların nasıl inşa edildiği (ortak bir çerçeve önerilerek), sosyal bilim, doğa bilimi ve mühendislik gibi alanlardaki çeşitli uygulamaları ve bu ajanların nasıl değerlendirildiği. Yazarların altını çizdiği fark önemli: önceki ajan araştırmaları izole ortamlarda sınırlı bilgiyle eğitilen ajanlara odaklanıyordu; büyük dil modeli tabanlı ajanlar ise web ölçeğinde bilgiyi kullanarak çok daha insana benzer karar verme kapasitesine ulaşıyor.

Pratikte çoklu-ajan kurguları şöyle görünür: bir kodlama görevinde bir ajan kodu okur, bir başkası testleri yazar, bir üçüncüsü sonucu bağımsız olarak denetler. Her ajanın kendi bağlam penceresi, kendi araç kümesi ve kendi dar görevi vardır — bu da tek bir devasa ajanın altından kalkamayacağı ölçekte işleri mümkün kılar.

Agentic workflow: döngü tek tip değil

“Agentic workflow” terimi, bu döngünün belirli bir görev için nasıl kalıba döküldüğünü ifade eder — ve her görev aynı kalıba girmez. Basit bir sınıflandırma görevinde döngü tek turda biter: algıla, bir aracı çağır, cevapla. Araştırma gerektiren bir görevde döngü onlarca tur sürebilir: ajan bir arama yapar, sonucu okur, eksik gördüğü noktayı fark edip yeni bir arama başlatır, bulduklarını birleştirip nihayet bir sonuca varır. Bazı akışlarda ajan görevi doğrudan yürütür; bazılarında ise önce bir plan çıkarıp insana onaylatır, onaydan sonra yürütmeye geçer. Ortak payda hep aynı: döngü, hedefe ulaşıldığı ya da bir dur koşuluna varıldığı ana kadar devam eder.

Risk özerklikle birlikte büyür

Ajan mimarisinin gücü aynı zamanda riskidir: özerklik arttıkça hatanın maliyeti de artar. Model bir halüsinasyon görürse, chatbot’ta bu yanlış bir cümle olarak kalır; ajanda ise yanlış bir eylem olarak gerçekleşir — yanlış dosya silinir, yanlış e-posta gönderilir, yanlış sipariş verilir. Bu yüzden olgun ajan tasarımlarında kritik adımlar (ödeme, silme, dışa gönderme) insan onayına bağlanır ve ajanın hareket alanı net biçimde sınırlandırılır.

Aklınızda kalsın

  1. Ajanı chatbot’tan ayıran şey model değil kurgudur — algıla, planla, araç kullan, gözlemle döngüsü, hedefe ulaşana kadar tekrarlanır.
  2. Araç kullanımı (tool use), modelin dil üretmenin ötesine geçip dış dünyada gerçek bir eylem tetiklemesidir — akıl yürütme ve eylem birbirini besler.
  3. Özerklik arttıkça risk artar — çoklu-ajan mimarileri ölçeği büyütür ama kritik adımlarda insan onayı hâlâ gereklidir.

Kaynaklar

  • Yao, S. vd. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv. Akıl yürütme izleri ile araç eylemlerini iç içe ürettiren, ajan mimarilerinin temel referanslarından biri olan yöntem. arxiv.org/abs/2210.03629
  • Schick, T. vd. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv. Modelin hangi API’yi ne zaman çağıracağını kendi kendine, öz-denetimli biçimde öğrenebildiğini gösteren çalışma. arxiv.org/abs/2302.04761
  • Wang, L. vd. (2023). A Survey on Large Language Model based Autonomous Agents. arXiv. Ajanların inşası, uygulama alanları ve değerlendirme yöntemlerini derleyen kapsamlı tarama. arxiv.org/abs/2308.11432