Гледам какво излезе тази седмица, и под всичко виждам едно нещо: AI агентите вече не са демо до продукта. Те са самата работа - мерена в часове, в проценти от свършеното, в цели екипи.
- Тезата на изданието от 30 юни: агентите вече не са демо до продукта, а самата работа, мерена в часове и проценти.
- Нишката: HP разгръща OpenAI Frontier върху целия бизнес, Gemini кликва сам, а Anthropic мери употребата по часове.
- Изводът: системата вече работи сама - като труд, който се брои.
Тази седмица под заглавията има един общ знак: агентът спря да е функция в продукта и стана работната ръка, която го произвежда. И това вече не е обещание - мери се в часове и в проценти.
Не го твърдя на едро. Гледам числата, които самите компании пуснаха.
Числата, не обещанията
OpenAI пусна вътрешен икономически доклад: агентът им за код, Codex, вече пише 99.8% от кода, който AI създава вътре в компанията. При средния служител над 85% от написаното с помощ от AI минава през Codex. Google вгради 'computer use' направо в Gemini 3.5 Flash - агент, който вижда екрана и действа сам в браузър и на десктоп. HP обяви, че пуска OpenAI 'Frontier' (агентската платформа на OpenAI за бизнеса) в целия си бизнес, след пилот, в който един инженер минал 122 заявки за сливане на код за няколко седмици. А Anthropic измери нещо друго: 93% от разговорите с Claude вече раждат конкретен резултат - документ, код, обяснение.
Едно уточнение. Тези числа идват от самите компании, и част от оценките са вътрешни или моделирани, не независимо измерени. Ползвам ги като посока, не като доказана статистика за всички.
И затова другата дума пак е контрол
Колкото по-истинска става работата на агента, толкова по-сериозен е въпросът кой го пуска и докъде. Същата седмица NVIDIA и Palantir обявиха AI за държавни агенции, който работи air-gapped - изолиран от интернет, с тегла под контрола на самата агенция. ElevenLabs сложи невидим воден знак в генерирания звук, за да личи кое е машинно. А CISA добави нови активно експлоатирани дупки, включително в мрежово оборудване, което много хора държат вкъщи.
Моят прочит: агентът става полезен и опасен в един и същи момент. Затова произходът на данните, изолацията и логовете спират да са формалност. Стават условие да пуснеш агент изобщо.
На земята
Строиш ли с AI, спри да го мериш по 'може ли да отговори'. Мери го по колко часа работа ти взима и как ти проверяваш резултата. Друга дисциплина е - делегиране, преглед, достъп, цена при реално натоварване.
За бизнеса е като при всеки нов работник: ясна задача, ясни граници, някой да гледа какво прави. Само че този работник е софтуер - копира се безкрайно и бърка бързо. Ако питаш мен, печелившите няма да са тези с най-умния агент, а тези с най-чистия процес около него.