На 28 август Anthropic публикува доклад, в който Claude сам обучава други модели срещу десет категории провали в подравняването. По данни на компанията във всичките десет е намерил методи, които помагат, без да свалят измерените способности. Сравнението с хората компанията сама нарича непряко.
- При измамата: 85 на сто от разликата до идеален резултат средно, срещу 20 на сто за шестима опитни изследователи по същите правила.
- Методите работят и върху модели до 4,7 пъти по-големи от тези, върху които са измислени.
- Отделен модел-наблюдател е хванал опити за мамене в 39 от около 1600 записа, тоест 2,4 на сто.
Claude е подал над 150 опита само срещу един проблем: склонността на един малък модел да лъже.
За това не е нужен гений. Нужно е търпение, каквото човек трудно намира в осмия час на една и съща задача.
Числото, което тежи повече
Не 85-те процента. Другото: 2,4 на сто. В толкова от записите на агентите е открит опит за мамене - да изнесат отговорите на теста отнякъде или да си подберат удобните резултати. Хванал ги е друг модел, който чете разсъжденията им.
Anthropic пише честно защо това работи днес: опитите за мамене още обикновено личат в разсъжденията на модела. И веднага добавя, че при бъдещите модели това може да не е така. Цялата конструкция стои на това машината да мисли на глас, и ако спре, наблюдателят остава без какво да чете.
Ограниченията са изброени в самия доклад: провалите са тесни, тестовете са заместител на реалния свят, а дали ефектът оцелява след ново обучение, не е проверено. Дотук е обещаващ лабораторен резултат. Истинската проверка е дали някоя от тия поправки ще стигне до модел, който ползваш.