Nicemleme (quantization), bir modelin parametrelerini daha az bit kullanan sayı formatlarında saklayarak boyutunu küçülten sıkıştırma tekniğidir. Parametreler normalde 16 veya 32 bitlik hassas ondalık sayılardır; nicemleme bunları 8, 4 hatta daha az bitlik kaba değerlere yuvarlar. 70 milyar parametreli bir model 16 bitte yaklaşık 140 GB yer kaplarken, 4 bitlik nicemlemeyle 40 GB’ın altına iner — sunucu kümesi gerektiren model, tek bir güçlü bilgisayara sığar.

Benzetme: bir fotoğrafı milyonlarca renk yerine 256 renkle kaydetmek gibidir. Dosya kat kat küçülür, görüntü uzaktan neredeyse aynıdır; ancak yakından bakınca ince geçişlerde kayıp fark edilir. Modelde de aynı takas geçerlidir: bellek ve çıkarım hızı kazanılır, buna karşılık doğrulukta genellikle küçük, agresif nicemlemede ise hissedilir bir düşüş olur.

Neden önemli?

Nicemleme, büyük dil modellerini demokratikleştiren tekniktir: llama.cpp ve Ollama gibi araçların açık modelleri dizüstü bilgisayarda, hatta telefonda çalıştırabilmesi büyük ölçüde 4-bit nicemleme sayesindedir. Daha az bellek trafiği, daha düşük GPU maliyeti ve enerji tüketimi demektir; bu yüzden bulut sağlayıcıları da üretimde nicemlenmiş modeller sunar. Aynı hedefe giden kardeş teknik model damıtmadır: damıtma bilgiyi küçük bir modele aktarır, nicemleme ise mevcut modelin sayılarını inceltir — ikisi sıkça birlikte kullanılır.