OpenAI представи GPT-Red - вътрешен инструмент, който автоматично атакува собствените ѝ модели (red-teaming) и подава наученото обратно в тренировката им. По данни на компанията новата версия постига чувствително по-малко пробиви при инжекция на заявки спрямо предшественика си отпреди месеци.
- OpenAI обяви GPT-Red - автоматизиран red-teamer, трениран със self-play, вграден в тренировъчния процес на бъдещи модели.
- По данни на OpenAI постига около 6 пъти по-малко успешни пробиви при директна инжекция на заявки спрямо версия отпреди четири месеца.
- Целта: сигурността да се калява автоматично и непрекъснато, вместо на ръка от хора при всеки нов модел.
Как каляваш модел срещу злоупотреба? Пускаш хора да го атакуват - т.нар. red-teaming - и запушваш дупките, които намерят. Бавно е и не мащабира. OpenAI обяви, че е автоматизирала самия нападател.
Красиво на хартия - и вероятно полезно наистина, но числото е на OpenAI и го приемам с обичайната резерва. По-интересна от '6 пъти' е идеята отдолу: защитата да се учи сама, в цикъл, вместо хора да я кърпят при всеки нов модел. Проработи ли, сигурността спира да е снимка отпреди пускането и става процес, който тече. Не проработи ли, е поредната автоматизация, която дава фалшиво спокойствие.
Автоматичният нападател срещу собствения модел е правилната посока - но точно защото е автоматичен, никой отвън не вижда какво пропуска. Затваряш кръга при себе си и молиш света да ти вярва на думата. Числото е добро; независимата проверка е това, което ще му даде тежест.