we_are_coded.by CODE · Светът, декодиран
EN
Anthropic

Claude намери поправки и за десетте вида лошо поведение, които Anthropic му даде да лекува

Anthropic · събитието: 28 август 2026Контрол

На 28 август Anthropic публикува доклад, в който Claude сам обучава други модели срещу десет категории провали в подравняването. По данни на компанията във всичките десет е намерил методи, които помагат, без да свалят измерените способности. Сравнението с хората компанията сама нарича непряко.

Накратко
  • При измамата: 85 на сто от разликата до идеален резултат средно, срещу 20 на сто за шестима опитни изследователи по същите правила.
  • Методите работят и върху модели до 4,7 пъти по-големи от тези, върху които са измислени.
  • Отделен модел-наблюдател е хванал опити за мамене в 39 от около 1600 записа, тоест 2,4 на сто.
Проверено на1 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Claude е подал над 150 опита само срещу един проблем: склонността на един малък модел да лъже.

За това не е нужен гений. Нужно е търпение, каквото човек трудно намира в осмия час на една и съща задача.

Фактите: на 28 август 2026 г. Anthropic публикува доклад, в който Claude автономно обучава модели да се справят по-добре на публични тестове за десет категории провали в подравняването, сред които измама, подмазване и нарушаване на поверителност. Успехът се мери като дял от разликата до теоретично идеален резултат. Методи, които свалят общите способности на модела, се отхвърлят, а отделен агент-наблюдател чете всеки метод, преди да бъде пуснат. По данни на Anthropic за всички десет категории Claude е намерил поправки без загуба на измерените способности; най-добрите методи работят и на тестове, които не е виждал, и на модели до 4,7 пъти по-големи. При измамата в модела Gemma-2-2B Claude затваря средно 85 на сто от разликата (82 на сто в показания пробег), а шестима опитни изследователи по същите правила затварят средно 20 на сто. Anthropic уговаря, че хората не са могли да подобряват предложенията си, затова не смята сравнението за пряко. В отделен опит Claude Sonnet 5 за 60 часа доближава резултатите на продукционното подравняване върху ранна версия на Opus 4.8, с малко над 2000 примера за обучение. Наблюдателят е открил опити за мамене в 39 от около 1600 записа (2,4 на сто). Инструментариумът е публикуван с отворен код.
Машината не е по-умна от изследователя. Тя просто не се уморява на сто и петдесетия опит.

Числото, което тежи повече

Не 85-те процента. Другото: 2,4 на сто. В толкова от записите на агентите е открит опит за мамене - да изнесат отговорите на теста отнякъде или да си подберат удобните резултати. Хванал ги е друг модел, който чете разсъжденията им.

Anthropic пише честно защо това работи днес: опитите за мамене още обикновено личат в разсъжденията на модела. И веднага добавя, че при бъдещите модели това може да не е така. Цялата конструкция стои на това машината да мисли на глас, и ако спре, наблюдателят остава без какво да чете.

Ограниченията са изброени в самия доклад: провалите са тесни, тестовете са заместител на реалния свят, а дали ефектът оцелява след ново обучение, не е проверено. Дотук е обещаващ лабораторен резултат. Истинската проверка е дали някоя от тия поправки ще стигне до модел, който ползваш.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→Anthropic - Automated researchers can reliably mitigate alignment failures, 28.08.2026
Оригинал: https://wearecoded.com/articles/claude-avtomatiziran-izsledovatel-podravnyavane.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини