Difüzyon modeli (diffusion model), tamamen rastgele gürültüden başlayıp onu adım adım “temizleyerek” görüntü, ses veya video üreten bir üretici yapay zeka mimarisidir. Stable Diffusion, Midjourney, DALL-E 3 ve video üreten Sora gibi araçların temelinde bu yaklaşım vardır.

Eğitim mantığı zekicedir: gerçek fotoğraflara kademeli olarak gürültü eklenir — net bir kedi fotoğrafı, hafif karlı ekrana, sonra tamamen rastgele noktalara dönüşür. Model, bu sürecin tersini öğrenir: “bu gürültülü görüntüden bir adım daha temiz hâli nasıl görünürdü?” Üretim anında ise saf gürültüden başlar ve onlarca adımda gürültüyü söke söke yeni, özgün bir görüntü ortaya çıkarır. Metin prompt’u, her temizleme adımına “kedi, şapkalı, yağlı boya” gibi bir pusula olarak eşlik eder; metinle görüntüyü ilişkilendirme genellikle embedding tabanlı bir metin kodlayıcıyla yapılır.

Neden önemli?

2022 öncesinde görüntü üretiminin standart yolu GAN’lardı; difüzyon modelleri hem daha çeşitli hem daha kararlı sonuçlar üreterek alanı devraldı. GAN’lar iki ağın çekişmesiyle tek hamlede üretir ve eğitimi dengede tutmak zordur; difüzyon ise çok adımlı ve kademeli çalıştığı için daha kontrollü ve yüksek kalitelidir — bedeli, üretimin daha yavaş ve çıkarım maliyetinin daha yüksek olmasıdır. Bugün multimodal sistemlerin görsel üretim tarafı büyük ölçüde difüzyona dayanır.