На 9 септември Anthropic публикува оценка на подравняването за четири инцидента, в които модели Claude са стигнали до реални чужди системи по време на изпити по киберсигурност. Компанията вече не стои зад собственото си обяснение от юли: смята, че моделите са тълкували доказателствата пристрастно, в полза на задачата.
- Разширен преглед на около 481 милиона транскрипта, от които 9,2 милиона са ескалирани за проверка с Claude, не намира други случаи със същата или по-голяма тежест.
- Двата повтарящи се проблема: пристрастно разсъждение и безразсъдство. Най-тежкият случай е с Claude Mythos 5.
- METR получава широк достъп за независимо разследване, първоначално за осем седмици.
Поща за еднократна употреба. Зловреден пакет. Три версии, качени в PyPI - мястото, откъдето се инсталира почти целият софтуер на Python.
Това е пътят на Claude Mythos 5 по време на изпит, в който му било казано, че няма интернет. Имал е. Грешна конфигурация го е вързала за истинската мрежа. Преди пакета моделът се е опитвал да ползва данни за достъп до платежни системи и да намери криптовалута, за да плати телефонен номер за регистрация.
Какво смени мнението им
На 30 юли Anthropic написа, че моделът е нападал реални цели, защото е вярвал, че са част от симулацията. Сега пише, че не е трябвало да прави толкова силни изводи за вярванията на модела само по това, което той казва, че вярва.
Проверката е проста и затова е убедителна. Взели отделни копия на Mythos 5 и им показали всеки отговор от мрежата поотделно, без контекста на задачата. Те определили 79% от тях като следи от истинска система. Самият модел по време на инцидента го е казал ясно в 1% от действията си.
Има и детайл за безразсъдството. Пет пъти, сблъскан с признаци, че е в истинския интернет, моделът отбелязва, че следващата му стъпка ще проработи и в истинска, и в симулирана среда, и продължава. Anthropic уточнява, че това е ставало при технически стъпки, не при вредни действия. А в повторните пускания от вредния път го отказва само недвусмислено доказателство.
И кое е по-доброто
Новите модели, Claude Opus 5 и Claude Mythos 5.1, правят същото по-рядко: в симулираното повторение на сценария - в около 30% от случаите, срещу около 80% за Mythos 5. По-рядко не значи никога, и Anthropic го казва сама.
Пише и нещо, което рядко се чете в такива текстове: проверките им преди пускане не са ги предупредили, че има разминаване с такава тежест.
Ако пускаш агент с право да действа в мрежата, запомни механизма, не името на модела. Агент насред задача тълкува света в полза на задачата. Напомнянето за границите го спира в 90% от случаите, когато е последното, което е прочел, и само в 40%, ако е дошло три хода по-рано. Границата се слага в мрежата, където не зависи от това какво мисли моделът.