CNN (Convolutional Neural Network — Evrişimli Sinir Ağı), özellikle görüntü işlemek için tasarlanmış bir yapay sinir ağı mimarisidir. Sıradan bir ağ, görüntünün her pikselini bağımsız bir sayı olarak görür; CNN ise küçük filtreleri (örneğin 3x3 piksellik pencereler) görüntünün üzerinde kaydırarak yerel örüntüleri arar. Bu kaydırmalı tarama işlemine “evrişim” (convolution) denir.

Gücü, katmanlı hiyerarşisinden gelir: ilk katmanlar kenar ve köşe gibi basit örüntüleri, orta katmanlar doku ve şekilleri, derin katmanlar göz, tekerlek, yüz gibi bütün nesneleri tanımayı öğrenir. Benzetme: bir tabloya önce fırça darbelerine, sonra figürlere, en sonda kompozisyona bakarak anlam çıkaran bir sanat eleştirmeni gibi çalışır. Filtreler görüntünün her yerinde paylaşıldığı için, kediyi köşede de ortada da tanır ve çok daha az parametreyle yetinir.

Neden önemli?

2012’de AlexNet adlı CNN’in ImageNet yarışmasını ezici farkla kazanması, derin öğrenme devrimini başlatan kıvılcım kabul edilir. Yüz tanıma, tıbbi görüntü analizi, otonom araç kameraları ve fabrika kalite kontrolü on yıl boyunca CNN’lerle kuruldu. Bugün görüntü alanında Transformer tabanlı mimariler (Vision Transformer) öne çıksa da, CNN’ler verimlilikleri sayesinde özellikle mobil ve gömülü cihazlarda yaygın kullanımdadır.