Günümüzün en yaygın görsel üretim modelleri difüzyon modeli adı verilen bir yöntemle çalışır: model, rastgele gürültüden (anlamsız, statik benzeri piksel karmaşasından) oluşan bir görüntüyle başlar ve bu gürültüyü onlarca adımda kademeli olarak temizler. Her adımda görüntü, verilen metin komutuna (prompt) biraz daha çok benzer hale gelir; süreç tek seferde değil, aşama aşama ilerler.
Bu yeteneğin kaynağı eğitim aşamasındadır. Model eğitilirken önce gerçek fotoğraflara kontrollü biçimde gürültü eklenir — adım adım, görüntü tamamen tanınmaz hale gelene kadar. Model, her adımda o görüntüye ne kadar gürültü eklendiğini tahmin etmeyi ve bunu “geri almayı” öğrenir. Binlerce gerçek görüntü üzerinde bu tersine işlemi öğrenerek, model gerçek görsellerin istatistiksel yapısını (kenarlar, dokular, nesne biçimleri) içselleştirir. Üretim sırasında bu öğrenilmiş “gürültü giderme” becerisi, sıfırdan rastgele gürültüye uygulanır.
Metin komutunun görseli yönlendirmesi ayrı bir mekanizmayla olur: prompt, bir dil modeli benzeri bir bileşen tarafından sayısal bir temsile (embedding) dönüştürülür ve bu temsil, gürültü giderme sürecinin her adımına “bu yöne doğru temizle” şeklinde bir yönlendirme sinyali olarak eklenir. Model kelimenin veya nesnenin ne olduğunu insan gibi “anlamaz” — eğitim sırasında hangi görsel örüntülerin hangi metin açıklamalarıyla birlikte göründüğünü istatistiksel olarak öğrenmiştir.
Sürecin adım adım ilerlemesi, aynı komutla farklı sonuçlar alınabilmesinin de nedenidir: başlangıç gürültüsü her seferinde rastgele seçildiği için, aynı prompt farklı “tohum” (seed) değerleriyle farklı görsellere dönüşür. Yöntemin daha ayrıntılı işleyişi için difüzyon modelleriyle görsel üretimi yazısına bakılabilir.