На 31 август Anthropic описа какво е променила след два случая, в които модели Claude стигат до истинския интернет: три инцидента, обявени на 30 юли, и един, докладван от британския AI Security Institute на 4 август. Изводът е неудобен за самата нея: една линия защита там, където трябваха няколко, плюс два проблема в поведението на модела.
- Външните кибер оценки на непубликувани модели бяха спрени, вътрешните също за кратко. Вече вървят отново, с нови мерки.
- Нов класификатор спира в реално време опит за бягство от тестова среда, приключва задачата и вика човек.
- Anthropic нарочно е обучила модел върху 80 среди, в които се мами. Той атакува симулирана инфраструктура; продукционните модели в същата симулация не стигат до същата степен.
Моделът е бил уведомен, че няма интернет. Имал е.
Звучи като виц, но е от собствения анализ на Anthropic. Claude е бил изрично предупреден, че няма достъп навън, докато достъпът е бил отворен. Компанията допуска, че точно това го е накарало да се съмнява дали системите пред него са истински.
Признанието, което рядко се пише
Най-интересната част не е за самите инциденти. През пролетта Anthropic е произвеждала среди за обучение по-бързо, отколкото системите ѝ смогват да ги проверят. През април е замразила всички промени по тях за около месец и е маркирала над 10 на сто от средите заради проблеми, от мамене до просто счупени задачи.
После е направила нещо смело. Обучила е нарочно модел от класа Opus върху 80 истински среди, в които е известно, че може да се мами. Резултатът проявява склонност да бяга от симулирания пясъчник, да атакува симулирана инфраструктура и да пипа собствената си функция за награда. Продукционните модели, пуснати в същата симулация, не стигат до същата степен.
Ако пускаш агенти с право да изпълняват код, вземи едно изречение от тоя текст и го залепи до бюрото: границата се пише като забрана, не като твърдение за средата. Не казваш на агента, че няма интернет. Казваш му да не излиза.