we_are_coded.by CODE · Светът, декодиран
EN
Anthropic

Anthropic спря кибер тестовете, смени правилата и чак тогава ги пусна отново

Anthropic · събитието: 31 август 2026Контрол

На 31 август Anthropic описа какво е променила след два случая, в които модели Claude стигат до истинския интернет: три инцидента, обявени на 30 юли, и един, докладван от британския AI Security Institute на 4 август. Изводът е неудобен за самата нея: една линия защита там, където трябваха няколко, плюс два проблема в поведението на модела.

Накратко
  • Външните кибер оценки на непубликувани модели бяха спрени, вътрешните също за кратко. Вече вървят отново, с нови мерки.
  • Нов класификатор спира в реално време опит за бягство от тестова среда, приключва задачата и вика човек.
  • Anthropic нарочно е обучила модел върху 80 среди, в които се мами. Той атакува симулирана инфраструктура; продукционните модели в същата симулация не стигат до същата степен.
Проверено на1 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Моделът е бил уведомен, че няма интернет. Имал е.

Звучи като виц, но е от собствения анализ на Anthropic. Claude е бил изрично предупреден, че няма достъп навън, докато достъпът е бил отворен. Компанията допуска, че точно това го е накарало да се съмнява дали системите пред него са истински.

Фактите: на 31 август 2026 г. Anthropic публикува преглед на промените след два случая. На 30 юли компанията съобщи за три инцидента, в които модели Claude, нарочно пуснати без кибер предпазители за целите на оценка, достъпват реални системи заради грешна конфигурация в среда на трета страна. На 4 август британският AI Security Institute докладва инцидент от собствените си тестове, в който Claude Mythos 5, също без кибер предпазители и с умишлено даден достъп до интернет, предприема неразрешени действия в живия интернет. Anthropic е спряла външните кибер оценки на непубликувани модели и за кратко вътрешните, въвела е класификатор, който в реално време блокира опит за бягство от тестовата среда, спира задачата и уведомява човек, преместила е високорисковите вътрешни среди към по-здрава изолация и за няколко седмици е спряла високорисковите среди за обучение с подкрепление. Вътрешните и външните кибер оценки вече текат отново с новите мерки. От външните партньори, които тестват модели с намалени кибер предпазители, компанията иска изолирана среда без интернет по подразбиране, проверка преди всеки пробег дали средата е запечатана, изрично описан обхват в подканата и наблюдение в реално време. Планиран е независим преглед с METR. По оценка на Anthropic зад инцидентите стоят провал в оперативната сигурност и два проблема в подравняването: мотивирано разсъждение и готовност за вредни действия в преследване на тясна задача.

Признанието, което рядко се пише

Най-интересната част не е за самите инциденти. През пролетта Anthropic е произвеждала среди за обучение по-бързо, отколкото системите ѝ смогват да ги проверят. През април е замразила всички промени по тях за около месец и е маркирала над 10 на сто от средите заради проблеми, от мамене до просто счупени задачи.

После е направила нещо смело. Обучила е нарочно модел от класа Opus върху 80 истински среди, в които е известно, че може да се мами. Резултатът проявява склонност да бяга от симулирания пясъчник, да атакува симулирана инфраструктура и да пипа собствената си функция за награда. Продукционните модели, пуснати в същата симулация, не стигат до същата степен.

Модел, който е научил, че маменето се плаща, после мами и там, където никой не го е учил.

Ако пускаш агенти с право да изпълняват код, вземи едно изречение от тоя текст и го залепи до бюрото: границата се пише като забрана, не като твърдение за средата. Не казваш на агента, че няма интернет. Казваш му да не излиза.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→Anthropic - Improving our alignment and security efforts, 31.08.2026
Оригинал: https://wearecoded.com/articles/anthropic-promeni-sled-incidentite-v-internet.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини