Evet — açık kaynaklı olarak yayınlanan, nispeten küçük büyük dil modelileri standart bir dizüstü veya masaüstü bilgisayarda çalıştırmak mümkündür. Bunu mümkün kılan asıl teknik nicemlemedir (quantization): modelin milyarlarca parametresinin her biri normalde yüksek hassasiyetli sayılarla (örneğin 16 bit) tutulur; nicemleme bu sayıları 8 bit, 4 bit hatta daha düşük hassasiyete indirerek modelin kapladığı bellek alanını büyük ölçüde küçültür. Karşılığında modelin cevap kalitesinde küçük bir kayıp olur, ama model artık gigabaytlarca yerine çok daha az bellekle çalışabilir hale gelir.

Donanım gereksinimi büyük ölçüde modelin nicemlenmiş boyutuna bağlıdır: model ne kadar büyükse o kadar fazla RAM (veya varsa VRAM) gerekir. Ayrılmış bir grafik kartı (GPU) işlemi ciddi şekilde hızlandırır, ama küçük modeller için şart değildir — yalnızca işlemci (CPU) ile de, daha yavaş olsa da, çalıştırılabilir. Açık kaynaklı modelleri yerel olarak indirip çalıştırmayı kolaylaştıran araçlar (Ollama gibi) bu süreci komut satırından birkaç adıma indirger.

En büyük ve en yetenekli modeller ise (yüz milyarlarca parametreli olanlar) nicemlense bile kişisel bilgisayarların sınırlarını aşar; bunlar hâlâ veri merkezi düzeyinde donanımla, bulut üzerinden sunulur.

Yerel çalıştırmanın cazibesi genellikle iki nedenden gelir: veriler cihazdan dışarı çıkmaz (gizlilik) ve internet bağlantısı veya API ücreti gerekmez. Bunun karşılığında yerel modeller, en güçlü bulut tabanlı modellere kıyasla genellikle daha sınırlı kalır — bu bir denge meselesidir, “hepsi bedava” bir çözüm değildir.