we_are_coded.by CODE · Светът, декодиран
EN
Понятие

Латентност и пропускливост

ОсновитеОбновено на 16 август 2026we are coded

Колко чакаш ти срещу колко минават общо - две различни числа, които компаниите разменят зад гърба ти.

Проверено на16 август 2026
Накратко: латентност е колко чакаш ти за първата дума на отговора. Пропускливост е колко отговора системата успява да събере за секунда, докато обслужва хиляди хора едновременно. Компаниите постоянно ги разменят една за друга - жертват твоето чакане, за да съберат повече хора накуп. Ти усещаш само едното от двете: секундите преди буквите да се появят.

Латентността е простото нещо, което усещаш физически, докато гледаш точките да пулсират. Тя е времето от момента, в който натискаш "Изпрати", до момента, в който на екрана изскочи първата буква от отговора. Не целият отговор - първата дума. Компаниите мерят точно това число, защото то решава дали ще останеш в чата или ще затвориш таба. Затова повечето системи "стриймват" отговора - streaming, изпращане дума по дума вместо накуп наведнъж - за да скъсят усещането за чакане, дори когато реалната работа отзад продължава невидимо.

Пропускливостта е съвсем различно нещо, и никога не я виждаш пряко. Тя е броят пълни отговори, които цялата система произвежда за секунда, докато хиляди хора я питат едновременно. Мери се в токени в секунда - token, най-малкото парче текст, с което моделът смята, част от дума, знак или символ. Един GPU, графичният процесор, чипът, върху който реално тече изчислението, смила определен обем работа за секунда, без значение колко хора чакат на опашката пред него. Колкото повече хора питат едновременно, толкова повече се дели този обем между тях.

Тук е размяната, която никой не ти показва в интерфейса. За да качат пропускливостта, инженерите групират заявки на "партиди" - batching, събиране на няколко чужди питания в едно общо изчисление, защото чипът смила група по-евтино, отколкото питане по питане. Партидата пести пари и електричество на компанията. Но всеки вътре в нея чака малко по-дълго, защото чипът трябва първо да събере достатъчно хора, преди изобщо да тръгне да смята. Твоята латентност пада жертва на нечия чужда пропускливост - и никой не те пита.

Затова един и същ модел ти се струва пъргав в шест сутринта и муден в девет вечерта, без нито ред код да се е променил междувременно. Моделът не "мисли по-бавно" в пиков час. Опашката пред него е по-дълга, партидите по-натоварени, чиповете разпределени между повече хора наведнъж. Скоростта, която усещаш в момента, е снимка на натоварването точно сега, не свойство на интелигентността отсреща.

Скоростта на отговора не мери колко умен е модела - мери колко хора чакат зад теб в невидима опашка, която никога няма да видиш.

Звучи добре, ама

Държа сървър, който върти собствени модели, и точно затова тази разлика не ми е абстракция. Виждам я на екрана всеки път, когато пусна няколко агента едновременно вместо един. Латентността на всеки скача, макар хардуерът да е абсолютно същият отпреди пет минути. Не е повреда. Хардуерът просто дели вниманието си между повече задачи наведнъж, и всяка чака своя ред в опашката.

Затова не вярвам на маркетингово число "най-бърз модел". То е измерено в лабораторна тишина, с един въпрос и празна опашка зад него. Истинската скорост е тази, която получаваш в четвъртък вечер, когато всички питат едновременно и партидите са пълни до горе. Там личи кой наистина е построил система за реален товар, а кой е построил демо за скрийншот.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→MDN Web Docs: Understanding latency (Mozilla)