Как един модел от камара числа се свива, за да се побере на по-малка машина и да върви по-бързо, и какво точно губиш, когато го направиш. Струва си да го знаеш, защото решава дали локалният модел на твоя компютър изобщо е практичен.
Същата снимка, по-малко цветове
Представи си снимка, записана с милиони цветови оттенъци, и после същата снимка, записана само с няколкостотин. Разпознаваш всичко на нея, лицето, фона, кучето в ъгъла, но детайлът е загрубял и преходите между сенките са по-остри. Точно това е квантуването на модел. Числата, с които той смята, обикновено се пазят с 16 бита точност. Квантуването ги смъква до 8 бита или дори до 4. Същото знание, записано по-грубо.
Печалбата е директна. Модел на 16 бита тежи двойно повече от същия модел на 8 бита и четворно повече от версията на 4 бита. По-малкото тегло значи по-малко заета памет, а по-малко заета памет значи по-бърза работа, защото машината не се рови през толкова данни за всяка дума от отговора.
Загубата е по-хитра. Точността пада съвсем малко средно, но понякога точно на границата, при рядка дума или сложно смятане, разликата излиза на показ. Затова свитите модели се пробват, не се приемат на доверие.
Числото зад твърдението
JetBrains свиха до 4 бита точно модела, който подкара локалния им Junie, Qwen 3.6-27B. По техни данни генерирането излезе около два пъти по-бързо спрямо версията на 8 бита, на същата машина. Затова свитата версия стана тази, която реално пуснаха: на локална машина скоростта решава дали изобщо ще го ползваш.